Cum funcționează tokenizarea? De ce se folosesc subword-tokens în loc de cuvinte întregi?
Machine Learning / AI
Vorbește despre BGE-M3: trei reprezentări — dens, rar, multi-vector.
Ce sunt Recall și Precision? Problema: 50 de fructe, 30 de mere și 20 de pere, un robot a găsit corect 20 de mere, dar a recunoscut greșit 15 pere ca mere. Calculează metricile.
Cunoașteți LoRA și metodele de fine-tuning?
Cum au fost selectați coeficienții pentru căutarea hibridă?
De ce ai avut nevoie de 12.000 de perechi întrebare-răspuns dacă existau doar 15 modele?
De ce ai recunoscut documentele ca imagini în loc să creezi un parser?
Cum ai format setul de date de test: din aceleași 12.000 de pere sau din date noi?
Povesti-ne despre clustering: ce problemă ați rezolvat, ce metodă ați folosit, cum ați măsurat calitatea?
Ce este un vector dens (embedding dens)? Cum se obține? Care este dimensiunea sa?
Cum funcționează un transformator? Vorbește-mi despre BERT și GPT.
Ce modele au fost utilizate în fiecare etapă? Pentru extragerea entităților, pentru vectorizare, pentru generare?
Cum ați evaluat calitatea sistemului RAG? Ce metrici ați folosit?
Ce este un cross-encoder și unde l-ați folosit?
Ce se trimitea către utilizatorul final în sistemul dumneavoastră?
De ce este necesar să reducem dimensiunea dicționarului? De ce este rău un dicționar mare? În ce funcție are loc încărcarea?
Care este diferența dintre cererile GET și POST?
Ce este un vector dispersat? Cum diferă de unul dens?
Explicați în cuvinte simple cum funcționează sistemul tău pentru un utilizator, fără asincronie.
Pentru o solicitare, se potrivește una dintre cele 12.000 de răspunsuri sau mai multe?