Machine Learning / AI
Vai jūs izmantojat stāvokli LangGraph un nododat visu stāvokli kontekstā?
Kā saglabāt LangGraph stāvoklī lielu daudzumu informācijas, kas iegūta caur API, to izmantot iekļautajā rīkā, bet nepārsūtīt liekus datus LLM kontekstā? Piemēram, LLM redz tikai speciālistu ID un vārdus, bet rīks saņem viņu grafiku un papildu datus.
Ko var darīt, ja ilgstošas darba laikā aģenta konteksts pakāpeniski piepildās?
Kā var novērtēt incidentu uzraudzības/izmeklēšanas sistēmas darba kvalitāti?
Kā praksē nodrošināt, lai modelis konkrētā laukā ģenerē tikai īsa saraksta virknes ID vērtības un nekādas citas zīmes?
Kā apmācīt LLM, lai tas neatbildētu, ja kontekstā nav informācijas?
Ko var darīt, ja izvietotais aģents pārāk ilgi atbild vai nav pietiekami daudz atmiņas LLM izvietošanai?
Pastāstiet vairāk par KV kešatmiņu: kā tā darbojas un no kurienes tā nāk, sākot ar Transformer arhitektūru.
Kā nodot modeļa shēmu strukturētai izvadei līmeņa kodā?
Kā jūs īstenojāt un izvietojāt pakalpojumu pull pieprasījumu apstrādei?
Vai orkestrators redz subaģenta rīku izsaukumu rezultātus vai tikai paša subaģenta galīgo izvadi?
Kādi citi optimizācijas veidi var tikt izmantoti, lai paātrinātu inferenci vai vismaz novietotu modeli 12 GB VRAM RTX 3090?
Kā ir uzbūvēts orkestrators: kāds ir izmantotais ietvars un arhitektūra, ko tas dara, vai tas ir vienas solis vai var vairākas reizes domāt pirms atbildes?
Kā panākt formalizētu, strukturētu atbildi, piemēram, izmantojot strukturētu izvadi?
Kā pārbaudīt, vai LLM-as-a-Judge pareizi novērtē kvalitāti un kā to kalibrēt?
Kādi ir jaunu tokenu paraušanas varianti LLM?
Kāda ir jūsu pašreizējā komandas sastāvs?