Araç (backend) kendisi hata yapmışsa (örneğin, sisteme erişimde zaman aşımı), hata izleri modellere iletildi mi?
Machine Learning / AI
Model seçim metrikleri hangi veri seti kullanılarak ölçüldü?
Başka embedding modelleri test ettiniz mi?
Başarılı kayıttan sonra sistemde yinelenen kayıt kontrolü yapıldı mı (idempotency)?
Parça boyutu neydi ve örtüşme (çakışma) yapıldı mı?
Retrive metrikleri ne kullanılarak ölçüldü (hangi veri seti ve araç)?
Neden çok ajanlı sistemde Human-in-the-Loop kullanılmadı, sadece ReAct'ta mı?
ReAct ajan döngüsünü tanımlayın: adımlar nelerdi ve döngü nasıl sona eriyordu?
Tüm çok ajanlı sistemi nasıl izlediniz — hangi aşamalarda hatalar, gecikmeler vb. ortaya çıkıyor?
NER görevi için hangi tür işaretleme yöntemlerini biliyorsun? Hangi yöntemlerle çalıştın?
Hız açısından, hangisi daha hızlı olur — araçlara sahip basit bir ajan mı yoksa çok ajanlı sistem mi?
Toolcalling neydi: yerel mi yoksa prompt aracılığıyla mı (parsing)?
Hangi bölümde (BM25 veya dense) değerler normalize edilmemiştir?
VLM (Görsel Dil Modeli) nedir?
Tüm ajanlar için tek bir model mi kullandınız yoksa farklı mı?
Fine-tuning ile few-shot prompting arasındaki fark nedir? Ne zaman ve neyi seçmeli?
Model geçersiz bir argüman verdiğinde ne yapardınız?
Modeller argümanın geçersiz olduğunu nasıl bildirdi?
BERT nedir ve hangi görevlerde eğitildi?
Ajansların yürütülmesinde paralellik vardı mı yoksa her şey sıralı mıydı?