Puoi spiegare la differenza tra cross-encoder e bi-encoder?
Machine Learning / AI
Come determinare se un modello di embedding funziona bene? Quali metriche sono state utilizzate?
C'è un modo per verificare che il testo generato non contenga errori fattuali rispetto all'originale?
Come sono stati estratti i dati dai documenti PDF per il sistema RAG?
Come testare un servizio implementato su FastAPI?
Come è stata scelta la strategia di chunking per il sistema RAG?
Parlami delle metriche di performance del servizio ML: latenza, RPS, come è stato organizzato nel tuo progetto?
Parlami della quantizzazione dei modelli: cos'è, a cosa serve, quali tipi ci sono?
Parla dei parametri di generazione di LLM: temperatura, top-k, top-p e altri.
Parlami dei database vettoriali, quali ci sono, come si differenziano, perché avete scelto pgvector?
Parlami del compito più difficile o della difficoltà in uno dei progetti.
Come sono stati organizzati i dati per la sintesi dei dialoghi e come è avvenuto l'addestramento?
Come si relazionano Recall e Precision, è possibile aumentare uno senza ridurre l'altro? Fornisci esempi di compiti.
Quale metodo di quantizzazione (int8 o float) compromette meno la qualità del modello?
Come valutare la qualità della sintesi?
Come affronteresti il compito di riassumere un dialogo di più persone in una conferenza (ad esempio, 10 sviluppatori su Slack)?
Quale modello e approccio scegliere per elaborare l'audio di una conferenza (riconoscimento vocale, diarizzazione)?
Parlami di LoRA: cos'è, a cosa serve?
Come lavorare con i dati privati durante il deployment locale del sistema?
Perché avete scelto la ricerca ibrida BM25 + embeddings invece della sola distanza coseno?