Machine Learning / AI
Kas kasutate LangGraphis olekut ja edastate kogu oleku konteksti?
Kuidas salvestada LangGraph'i olekusse suur hulk teavet, mis on saadud API kaudu, kasutada seda tööriistas sees, kuid mitte edastada liigseid andmeid LLM-i konteksti? Näiteks näeb LLM ainult spetsialistide ID-d ja nimesid, samas kui tööriist saab nende ajakava ja täiendavaid andmeid.
Mida saab teha, kui pikaajalise töö ajal agendi kontekst järk-järgult täitub?
Kuidas saab hinnata intsidentide jälgimise/uurimise süsteemi töö kvaliteeti?
Kuidas praktikas tasandil tagada, et mudel genereerib konkreets välja ainult lühikesest stringi ID-de nimekirjast ja mitte ühtegi muud sümbolit?
Kuidas treenida LLM-i mitte vastama, kui kontekstis teavet pole?
Mida saab teha, kui juurutatud agent vastab liiga aeglaselt või mälu LLM paigutamiseks ei ole piisavalt?
Rääkige meile rohkem KV-vahemälust: kuidas see töötab ja kust see tuleb, alustades Transformer arhitektuurist.
Kuidas edastada mudeli skeem struktureeritud väljundi jaoks kooditasandil?
Kuidas te rakendasite ja juurutate teenust pull requestide töötlemiseks?
Kas orkestrator näeb subagendi tööriistade kõnede tulemusi või ainult subagendi enda lõpptulemust?
Millised teised optimeerimismeetodid võivad olla kasutatavad inferentsi kiirendamiseks või vähemalt mudeli paigutamiseks 12 GB VRAM RTX 3090-sse?
Kuidas on üles ehitatud orkestrator: millist raamistikku ja arhitektuuri kasutatakse, mida ta teeb, kas on ühe sammu või võib mitu korda mõelda enne vastamist?
Kuidas saavutada formaliseeritud ja struktureeritud vastus, näiteks kasutades struktureeritud väljundit?
Kuidas kontrollida, et LLM-as-a-Judge hindab kvaliteeti õigesti ja kuidas seda kalibreerida?
Millised on uute tokenite proovivõtmise võimalused LLM-is?
Mis on teie praegune meeskonna koosseis?