Wie funktioniert die Tokenisierung? Warum werden Subword-Tokens anstelle ganzer Wörter verwendet?
Machine Learning / AI
Erzählen Sie mir von BGE-M3: drei Darstellungen — dicht, spärlich, Multi-Vektor.
Was sind Recall und Precision? Aufgabe: 50 Früchte, 30 Äpfel und 20 Birnen, ein Roboter hat 20 Äpfel richtig gefunden, aber 15 Birnen fälschlicherweise als Äpfel erkannt. Berechnen Sie die Metriken.
Sind Sie mit LoRA und Feinabstimmungsmethoden vertraut?
Wie wurden die Koeffizienten für die hybride Suche ausgewählt?
Warum brauchten Sie 12.000 Frage-Antwort-Paare, wenn es nur 15 Vorlagen gab?
Warum haben Sie die Dokumente als Bilder erkannt und keinen Parser erstellt?
Wie haben Sie den Testdatensatz erstellt – aus den gleichen 12.000 Paaren oder aus neuen Daten?
Erzählen Sie uns von der Clusterbildung: Welches Problem haben Sie gelöst, welche Methode verwendet, wie haben Sie die Qualität gemessen?
Was ist ein dichter Vektor (dichte Einbettung)? Wie wird er erzeugt? Wie groß ist er?
Wie funktioniert ein Transformer? Erzählen Sie mir von BERT und GPT.
Welche Modelle wurden in jeder Phase verwendet? Für die Entitätsextraktion, für die Vektorisierung, für die Generierung?
Was ist ein Cross-Encoder und wo haben Sie ihn verwendet?
Wie haben Sie die Qualität des RAG-Systems bewertet? Welche Metriken haben Sie verwendet?
Warum muss die Größe des Wörterbuchs reduziert werden? Was ist schlecht an einem großen Wörterbuch? In welcher Funktion erfolgt die Belastung?
Was wurde an den Endbenutzer in Ihrem System gesendet?
Was ist der Unterschied zwischen GET- und POST-Anfragen?
Was ist ein Sparse-Vektor? Worin unterscheidet er sich von einem dichten Vektor?
Erklären Sie in einfachen Worten, wie Ihr System für einen Benutzer funktioniert, ohne Asynchronität.
Für eine Anfrage passt eine der 12.000 Antworten oder mehrere?