Αν το εργαλείο (backend) έκανε λάθος (π.χ., timeout κατά την πρόσβαση στο σύστημα), μεταδίδονταν τα traceback σφάλματος στα μοντέλα;
Machine Learning / AI
Σε ποια δεδομένα μετρήθηκαν τα κριτήρια επιλογής μοντέλου;
Έχετε δοκιμάσει άλλα μοντέλα embedding;
Υπήρξε έλεγχος για διπλότυπα στο σύστημα σε περίπτωση σφάλματος μετά από επιτυχημένη εγγραφή (idempotency);
Ποιο ήταν το μέγεθος του κομματιού και έγινε overlap (επικάλυψη);
Με τι μετρήθηκαν τα metrics του retrive (ποιο dataset και εργαλείο);
Γιατί στο πολυ-πράκτορα σύστημα δεν χρησιμοποιήθηκε Human-in-the-Loop, μόνο στο ReAct;
Περιγράψτε τον κύκλο του πράκτορα ReAct: ποια ήταν τα βήματα και πώς τελείωνε ο κύκλος;
Πώς παρακολουθήσατε ολόκληρο το πολυ-πρακτορικό σύστημα — σε ποια στάδια εμφανίζονται σφάλματα, καθυστερήσεις κ.λπ.;
Ποιοι τύποι επισήμανσης για την εργασία NER γνωρίζεις; Με τι έχεις δουλέψει;
Σε όρους ταχύτητας, τι θα είναι πιο γρήγορο — ένας απλός πράκτορας με εργαλεία ή ένα σύστημα πολλαπλών πρακτόρων;
Ποιο ήταν το toolcalling: εγγενές ή μέσω prompt (parsing);
Σε ποιο μέρος (BM25 ή dense) οι τιμές δεν είναι κανονικοποιημένες;
Τι είναι το VLM (Μοντέλο Οπτικής Γλώσσας);
Χρησιμοποιήσατε ένα μοντέλο για όλους τους πράκτορες ή διαφορετικά;
Ποια είναι η διαφορά μεταξύ fine-tuning και few-shot prompting; Τι και πότε να επιλέξετε;
Πώς ανέφεραν τα μοντέλα ότι το επιχείρημα δεν είναι έγκυρο;
Και τι κάνατε αν το μοντέλο έδινε μια μη έγκυρη παράμετρο;
Υπήρχε παράλληλη εκτέλεση των πρακτόρων ή όλα ήταν διαδοχικά;
Πώς περιγράφατε τα εργαλεία; Ποιο είναι το γενικό φορμάτ και οι βασικές απαιτήσεις για την περιγραφή;