თუ ინსტრუმენტი (backend) თვითონ შეცდომას უშვებდა (მაგალითად, სისტემასთან დაკავშირების დროს დროის გასვლისას), გადაეცემოდა თუ არა შეცდომის traceback-ები მოდელებს?
Machine Learning / AI
რას უყურებდნენ მოდელის არჩევის მეტრიკებს (რომელ მონაცემთა ბაზა)?
სხვა embedding მოდელებს თუ ტესტავდით?
შესაძლებელია სისტემაში დუბლიკატის შემოწმება წარმატებული ჩანაწერის შემდეგ შეცდომის დროს (idempotency)?
რა იყო ხერხის ზომა და იყო თუ არა overlap (გადაკვეთა)?
რასზე ითვლებოდა retrive-ის მეტრიკები (რომელ მონაცემთა ნაკრები და ინსტრუმენტი)?
რატომ არ გამოიყენეს ჰუმან-ინ-თი-ლუპი მულტიაგენტურ სისტემაში, მხოლოდ ReAct-ში?
ReAct აგენტის ციკლის აღწერა: რა ნაბიჯები იყო და როგორ დასრულდებოდა ციკლი?
როგორ აკვირდით მთელ მულტიაგენტურ სისტემას — რომელ ეტაპებზე წარმოიქმნება შეცდომები, ლატენტობა და ა.შ.؟
რისთვის ნიშანდობლივია NER-ის დავალება? რა მუშაობდი?
სწრაფობის თვალსაზრისით, რა იქნება უფრო სწრაფი — უბრალო აგენტი ხელსაწყოებით თუ მულტაგენტული სისტემა?
რა იყო toolcalling: ნატიური თუ prompt-ის საშუალებით (parsing)?
რომელ ნაწილში (BM25 ან dense) მნიშვნელობები ნორმალიზებული არაა?
რა არის VLM (ვიზუალური ენის მოდელი)?
ყველა აგენტისთვის ერთი მოდელი იყენებდით თუ სხვადასხვა?
რა არის fine-tuning და few-shot prompting შორის განსხვავება? რა და როდის უნდა ავირჩიოთ?
და თუ მოდელი არავალიდურ არგუმენტს აძლევდა — რა გეკეთებოდათ?
როგორ აცნობეს მოდელებმა, რომ არგუმენტი არასწორია?
რა არის BERT და რომელ დავალებებზე ის სწავლობდა?
არის თუ არა პარალელობა აგენტების შესრულებაში, თუ ყველაფერი თანმიმდევრობით იყო?