Poți explica diferența dintre cross-encoder și bi-encoder?
Machine Learning / AI
Există o metodă de a verifica dacă textul generat nu conține erori factuale în raport cu originalul?
Cum se determină dacă modelul de embedding funcționează bine? Ce metrici au fost utilizate?
Cum a fost aleasă strategia de chunking pentru sistemul RAG?
Vorbește-mi despre metricile de performanță ale serviciului ML: latență, RPS, cum a fost organizat în proiectul tău?
Cum testezi un serviciu implementat pe FastAPI?
Cum au fost extrase datele din documentele PDF pentru sistemul RAG?
Vorbește-mi despre bazele de date vectoriale, care există, în ce diferă, de ce ați ales pgvector?
Vorbește despre parametrii de generare LLM: temperatură, top-k, top-p și altele.
Vorbește-mi despre cuantizarea modelelor: ce este, la ce folosește, ce tipuri există?
Cum se corelează Recall și Precision, se poate crește unul fără a reduce celălalt? Oferiți exemple de sarcini.
Cum au fost organizate datele pentru sumarizarea dialogurilor și cum a avut loc antrenamentul?
Ce metodă de cuantizare (int8 sau float) va afecta mai puțin calitatea modelului?
Cum se evaluează calitatea rezumatului?
Cum ai aborda sarcina de a rezuma un dialog între mai multe persoane dintr-o conferință (de exemplu, 10 dezvoltatori pe Slack)?
Vorbește despre cea mai dificilă sarcină sau dificultate din unul dintre proiecte.
Ce model și abordare să aleg pentru procesarea audio dintr-o conferință (speech-to-text, diarizare)?
Vorbește-mi despre LoRA: ce este, la ce folosește?
Cum să lucrați cu date private în timpul implementării locale a sistemului?
De ce ați ales căutarea hibridă BM25 + embeddings în loc de doar distanța cosinus?