Als het hulpmiddel (backend) zelf een fout maakte (bijvoorbeeld een time-out bij het benaderen van het systeem), werden de traceback-fouten dan doorgegeven aan de modellen?
Machine Learning / AI
Op welke dataset werden de metrics voor modelkeuze gemeten?
Hebben andere embedding-modellen getest?
Was er een controle op duplicaten in het systeem bij een storing na een succesvolle registratie (idempotentie)?
Wat was de grootte van de chunk en was er overlap?
Waarop werden de retrive-metrics gemeten (welke dataset en welk hulpmiddel)?
Hoe hebben ze het hele multi-agent systeem getraceerd — op welke stappen ontstaan fouten, latentie, etc.?
Waarom werd in het multi-agent systeem geen Human-in-the-Loop gebruikt, alleen in ReAct?
Beschrijf de ReAct-agentcyclus: wat waren de stappen en hoe eindigde de cyclus?
Welke soorten annotaties voor de NER-taak ken je? Waarmee heb je gewerkt?
Wat is sneller qua snelheid — een eenvoudige agent met tools of een multi-agent systeem?
Wat is BERT en op welke taken is het getraind?
Was de toolcalling: native of via prompt (parsing)?
In welk deel (BM25 of dense) zijn de waarden niet genormaliseerd?
Wat is VLM (Vision Language Model)?
Heeft u één model voor alle agenten gebruikt of verschillende?
En wat deden jullie als het model een ongeldig argument gaf?
Wat is het verschil tussen fine-tuning en few-shot prompting? Wat en wanneer kiezen?
Hoe hebben de modellen gemeld dat het argument ongeldig is?
Was er paralleliteit in de uitvoering van de agenten of was alles sequentieel?