Wie kann die Qualität der Arbeit des Überwachungs-/Untersuchungssystems für Vorfälle bewertet werden?
Machine Learning / AI
Wie man im LangGraph-Zustand große Mengen an Informationen speichert, die über die API erhalten wurden, sie innerhalb des Tools verwendet, aber keine unnötigen Daten in den LLM-Kontext überträgt? Zum Beispiel sieht das LLM nur die ID und die Namen der Spezialisten, während das Tool deren Zeitplan und zusätzliche Daten erhält.
Wie trainiert man ein LLM, um nicht zu antworten, wenn keine Informationen im Kontext vorhanden sind?
Wie man in der Praxis ein Modell in einem bestimmten Feld dazu bringt, nur Werte aus einer kurzen Liste von String-ID's und keine anderen Symbole zu generieren?
Was möchtest du im Allgemeinen machen?
Wie übergibt man auf Code-Ebene ein Modellschema für strukturierte Ausgabe?
Erzählen Sie mehr über den KV-Cache: wie er funktioniert und woher er stammt, beginnend mit der Transformer-Architektur.
Was kann man tun, wenn ein bereitgestellter Agent zu lange antwortet oder nicht genug Speicher für die Unterbringung eines LLM hat?
Wie haben Sie den Dienst zur Verarbeitung von Pull Requests implementiert und bereitgestellt?
Sieht der Orchestrator die Ergebnisse der Aufrufe der Subagent-Tools oder nur die endgültige Ausgabe des Subagents selbst?
Welche weiteren Optimierungsmethoden können verwendet werden, um die Inferenz zu beschleunigen oder zumindest das Modell in 12 GB VRAM auf einer RTX 3090 unterzubringen?
Wie überprüft man, ob LLM-as-a-Judge die Qualität korrekt bewertet, und wie kalibriert man sie?
Wie ist der Orchestrator aufgebaut: Welches Framework und welche Architektur werden verwendet, was macht er, ist er einstufig oder kann er mehrmals nachdenken, bevor er antwortet?
Wie erhält man eine formalisierte, strukturierte Antwort, zum Beispiel bei Verwendung von strukturiertem Output?
Warum hast du dich entschieden, deinen aktuellen Job zu verlassen?
Wer war an der Feinabstimmung der Modelle beteiligt?
Wie ist deine aktuelle Teamzusammensetzung?
Wie wirkt sich das Wachstum des Dialogs und des Kontexts auf die Geschwindigkeit der Antwortverarbeitung aus?