Come funziona la tokenizzazione? Perché si usano subword token invece di parole intere?
Machine Learning / AI
Parla di BGE-M3: tre rappresentazioni — denso, sparso, multi-vettore.
Cosa sono Recall e Precision? Problema: 50 frutti, 30 mele e 20 pere, un robot ha trovato correttamente 20 mele, ma ha riconosciuto erroneamente 15 pere come mele. Calcola le metriche.
Conosci LoRA e i metodi di fine-tuning?
Come sono stati scelti i coefficienti per la ricerca ibrida?
Perché ti servivano 12.000 coppie domanda-risposta se c'erano solo 15 modelli?
Perché hai riconosciuto i documenti come immagini invece di creare un parser?
Come hai formato il set di dati di test: dagli stessi 12.000 coppie o da nuovi dati?
Parlaci della clustering: quale problema avete risolto, quale metodo avete usato, come avete misurato la qualità?
Cos'è un vettore denso (embedding denso)? Come si ottiene? Qual è la sua dimensione?
Come funziona un trasformatore? Raccontami di BERT e GPT.
Quali modelli sono stati utilizzati in ogni fase? Per l'estrazione di entità, per la vettorizzazione, per la generazione?
Cos'è un cross-encoder e dove l'hai usato?
Come hai valutato la qualità del sistema RAG? Quali metriche hai usato?
Cosa veniva inviato all'utente finale nel vostro sistema?
Perché è necessario ridurre la dimensione del dizionario? Perché un dizionario grande è un problema? In quale funzione avviene il carico?
Qual è la differenza tra richieste GET e POST?
Cos'è un vettore sparso? In cosa si differenzia da uno denso?
Spiega in parole semplici come funziona il tuo sistema per un utente, senza asincronia.
Per una richiesta, ne basta una tra le 12.000 risposte o molte?