Wenn das Tool (Backend) selbst einen Fehler machte (z.B. Timeout beim Zugriff auf das System), wurden die Tracebacks der Fehler an die Modelle weitergegeben?
Machine Learning / AI
Worauf wurden die Metriken zur Modellauswahl gemessen (welcher Datensatz)?
Haben Sie andere Embedding-Modelle getestet?
Gab es eine Überprüfung auf Duplikate im System bei einem Fehler nach erfolgreicher Speicherung (Idempotenz)?
Wie groß war die Chunk-Größe und gab es Überlappung?
Womit wurden die Retrive-Metriken gemessen (welcher Datensatz und welches Tool)?
Warum wurde in dem Multi-Agenten-System nur bei ReAct Human-in-the-Loop verwendet?
Beschreiben Sie den ReAct-Agentenzyklus: Welche Schritte gab es und wie endete der Zyklus?
Wie haben Sie das gesamte Multi-Agent-System verfolgt – an welchen Stellen treten Fehler, Latenz usw. auf?
Welche Arten von Markierungen für die NER-Aufgabe kennst du? Womit hast du gearbeitet?
Was ist schneller in Bezug auf die Geschwindigkeit — ein einfacher Agent mit Tools oder ein Multi-Agenten-System?
War das Toolcalling nativ oder über Prompt (Parsing)?
In welchem Teil (BM25 oder dense) sind die Werte nicht normalisiert?
Was ist VLM (Vision Language Model)?
Verwendeten Sie ein Modell für alle Agenten oder unterschiedliche?
Was ist der Unterschied zwischen Fine-Tuning und Few-Shot Prompting? Was und wann wählen?
Und was haben Sie gemacht, wenn das Modell ein ungültiges Argument geliefert hat?
Wie haben die Modelle gemeldet, dass das Argument ungültig ist?
Was ist BERT und auf welchen Aufgaben wurde es trainiert?
Gab es Parallelität bei der Ausführung der Agenten oder war alles sequenziell?