Uzun süreli çalışmadan sonra ajanın bağlamı yavaş yavaş dolmaya başlarsa, ne yapılabilir?
Machine Learning / AI
LangGraph'ta API üzerinden alınan büyük bilgileri nasıl saklarım, arayüzde kullanırım ama LLM bağlamına gereksiz veriler aktarmadan? Örneğin, LLM sadece uzmanların ID ve isimlerini görür, araç ise onların takvimini ve ek verileri alır.
Olay izleme/araştırma sisteminin çalışma kalitesi nasıl değerlendirilebilir?
Genel olarak ne yapmak istersin?
Pratikte belirli bir alanda bir modelin sadece kısa bir dizi dize kimliği değerleri ve başka semboller olmadan nasıl üreteceği?
Bağlamda bilgi yoksa yanıtlamaması için LLM nasıl eğitilir?
Dağıtılmış bir ajan çok yavaş yanıt veriyorsa veya LLM'yi barındırmak için yeterli bellek yoksa ne yapılabilir?
Kod seviyesinde yapılandırılmış çıktı için model şemasını nasıl iletebilirsiniz?
KV önbelleği hakkında daha fazla bilgi verin: nasıl çalıştığı ve nereden geldiği, Transformer mimarisinden başlayarak.
Pull isteği işleme servisini nasıl uyguladınız ve dağıttınız?
Orkestratör, alt ajans araçlarının çağrı sonuçlarını mı yoksa sadece alt ajansın kendisinin nihai çıktılarını mı görüyor?
Modellerin ayarında kimler yer aldı?
İnferansı hızlandırmak veya en azından modeli 12 GB VRAM'li RTX 3090'da barındırmak için kullanılabilecek başka hangi optimizasyon yöntemleri var?
LLM-as-a-Judge'nin kalitenin doğru değerlendirdiğini nasıl kontrol edilir ve nasıl kalibre edilir?
Orkestratör nasıl yapılandırılmıştır: hangi çerçeve ve mimari kullanılıyor, ne yapıyor, tek aşamalı mı yoksa cevap vermeden önce birkaç kez düşünebiliyor mu?
Örneğin, yapılandırılmış çıktı kullanırken nasıl yapılandırılmış, formalize edilmiş bir yanıt alınır?
LLM'de yeni token örnekleme seçenekleri nelerdir?
Mevcut ekibinizin yapısı nedir?