Jeśli narzędzie (backend) popełniało błąd (np. timeout podczas dostępu do systemu), czy ścieżki błędów były przekazywane modelom?
Machine Learning / AI
Czy w systemie przeprowadzano sprawdzenie duplikatów w przypadku awarii po pomyślnym zapisaniu (idempotencja)?
Na czym mierzono metryki wyboru modelu (jaki zbiór danych)?
Jak śledziliście cały system wieloagentowy — na jakich etapach pojawiają się błędy, opóźnienia itp.?
Czy testowałeś inne modele embedding?
Na czym mierzono metryki retrive (jaki zestaw danych i narzędzie)?
Dlaczego w systemie wieloagentowym nie używano Human-in-the-Loop, tylko w ReAct?
Jaki był rozmiar kawałka i czy było nakładanie się?
Czym jest BERT i na jakich zadaniach był szkolony?
Opisz cykl agenta ReAct: jakie były kroki i jak kończył się cykl?
Jakie rodzaje oznaczeń do zadania NER znasz? Z czym pracowałeś?
Czym jest VLM (Model Języka Wizualnego)?
Pod względem szybkości, co będzie szybsze — prosty agent z narzędziami czy system wieloagentowy?
W której części (BM25 lub dense) wartości nie są znormalizowane?
Czy toolcalling był natywny czy przez prompt (parsowanie)?
A co robiliście, gdy model podawał nieprawidłowy argument?
Czy używali jednego modelu dla wszystkich agentów, czy różnych?
Jak modele zgłosiły, że argument jest nieprawidłowy?
Jaka jest różnica między fine-tuningiem a few-shot promptingiem? Co i kiedy wybierać?
Czy w wykonywaniu agentów występowało równoległe działanie, czy wszystko było sekwencyjne?