Come conservare nello stato di LangGraph una grande quantità di informazioni ottenute tramite API, usarle all'interno dello strumento, ma senza trasmettere dati superflui al contesto LLM? Ad esempio, LLM vede solo l'ID e i nomi degli specialisti, mentre lo strumento riceve il loro orario e dati aggiuntivi.
Machine Learning / AI
In quale progetto hai lavorato sulla distribuzione dei servizi e lo sviluppo di servizi FastAPI: l'hai realizzato tu stesso o ti sei limitato a mantenere e supervisionare?
Come far sì che in pratica un modello in un campo specifico generi solo valori da una breve lista di ID di stringhe e nessun altro simbolo?
Come addestrare un LLM a non rispondere in assenza di informazioni nel contesto?
Come passare uno schema di modello per output strutturato a livello di codice?
Qual è il tuo stato attuale come candidato? Stai lavorando o hai lasciato il lavoro?
Cosa si può fare se un agente distribuito risponde troppo lentamente o non c'è abbastanza memoria per ospitare un LLM?
L'orchestratore vede i risultati delle chiamate agli strumenti del subagente o solo l'output finale del subagente stesso?
Come hai implementato e distribuito il servizio per l'elaborazione delle pull request?
Parliamo più dettagliatamente della cache KV: come funziona e da dove proviene, partendo dall'architettura Transformer.
Quali altri metodi di ottimizzazione possono essere utilizzati per accelerare l'inferenza o almeno collocare il modello in 12 GB di VRAM sulla RTX 3090?
Come verificare che LLM-as-a-Judge valuta correttamente la qualità e come calibrarla?
Come ottenere una risposta formalizzata e strutturata, ad esempio utilizzando l'output strutturato?
Come è costruito l'orchestratore: quale framework e architettura vengono utilizzati, cosa fa, è a un solo passaggio o può ragionare più volte prima di rispondere?
Come influisce la crescita del dialogo e del contesto sulla velocità di elaborazione delle risposte?
Quali sono le opzioni di campionamento dei nuovi token in LLM?
Qual è la differenza tra modelli dense e MoE, ad esempio Qwen3-27B e Qwen3-30B-A3B?
Cosa bisogna fare dopo il retrieval per formare la risposta all'utente e come valutare la qualità della generazione in RAG?
Chi ha partecipato alla messa a punto dei modelli?