Wie vergleicht man die Qualität verschiedener Embedding-Modelle? Was ist MTEB?
Machine Learning / AI
Wie ist die Asymptotik bei mehreren Durchläufen durch die Liste?
Wie funktioniert ein Random Forest und wie wird er in einer Klassifikationsaufgabe trainiert?
Wie misst man die Qualität eines binären Klassifikationsmodells? Welche Metriken kennen Sie?
Sollte der Bias-Term (w0) reguliert werden? Warum ist w0 überhaupt notwendig?
Kann man ein neues Modell mit einem F1-Score von 0,81 als besser ansehen als ein Modell mit 0,8 und es sofort in die Produktion bringen?
Kann man das Problem der Modulnutzung im Gradientenabstieg kostengünstig beheben?
Was ist H(X) im Kontext der Klassifikation, zum Beispiel die Entropie?
Wie vergleicht man Gleitkommazahlenkoordinaten unter Berücksichtigung der Besonderheiten von float in verschiedenen Sprachen?
Wenn der AUC eines neuen Modells 0,82 im Vergleich zu 0,80 beim alten Modell beträgt, kann man dann mit Sicherheit sagen, dass das neue besser ist? Wie überprüft man die statistische Signifikanz?
Was ist die ROC-Kurve?
Was ist das Verzweigungskriterium in Bäumen?
Wie verhalten sich Precision und Recall bei Klassenungleichgewicht? Beispiel: 95 Einheiten und 5 Nullen, das Modell sagt immer 1 voraus.
Womit beschäftigen Sie sich in Ihrer Freizeit?
Wie beschreibt man die Architektur des Random-Forest-Modells mit einem hinzugefügten linearen Modell zur Extrapolation?
Was ist das Unigram-Sprachmodell bei der Tokenisierung (wie bei SentencePiece)?
Wie implementiert man die Überprüfung von Schlüsseln mit negativen und übereinstimmenden Werten für Spiegelpunkte?