Machine Learning / AI
Quante persone hanno partecipato allo stage?
Il campione viene formato in base a specifici intervalli di tempo o viene preso in tutto il periodo?
Quanto ti si adatta il ruolo, considerando che il progetto combina NLP, LLM e ML classico, mentre tu cercavi una posizione nel ML classico?
Cos'è MoE (Mix di Esperti) e perché questa architettura può essere vantaggiosa per l'inferenza?
Come hanno misurato la riduzione del tempo di ricerca delle informazioni (metrica in minuti)?
Parliamo più dettagliatamente della cache KV: come funziona e da dove proviene, partendo dall'architettura Transformer.
Parla dei parametri di generazione: temperatura, Top-P e Top-K.
Come è avvenuto il processo di transizione in ML/Data Science? C'erano corsi o era autoapprendimento?
Cos'è il metodo delle componenti principali (PCA) e come viene utilizzato?
In generale, raccontami come hai lavorato nell'ultimo posto di lavoro (DOM.RF), di cosa eri responsabile, come si svolgeva la giornata lavorativa, quali sono le attuali attività del progetto CorpGPT (RAG aziendale)?
Perché un compito in Spark può bloccarsi e richiedere molto tempo?
Parlami dei decoratori: cosa sono e come si possono fare?
Come gestire i valori mancanti nei dati, comprese le serie temporali?
Ci è sembrato che a metà colloquio tu abbia usato un assistente per rispondere alla domanda teorica su LangGraph. È vero o no?
Esercizio pratico La query SQL su 80 milioni di messaggi crea duplicati dopo il JOIN. Qual è l'azione migliore da iniziare per prima? - Verificare la cardinalità del JOIN, le chiavi e il piano di esecuzione prima dell'ottimizzazione. - Creare un indice su un campo di join. - Esportare il risultato in CSV e rimuovere i duplicati in Python. - Aggiungere sempre DISTINCT a tutte le colonne. - Aggiungere DISTINCT dopo aver verificato il risultato sull'estratto. - Verificare le chiavi di join e l'unicità di entrambe le tabelle.
Perché è necessaria la normalizzazione (Layer Norm) — perché stabilizzare l'addestramento?
Progetta un sistema per un cinema online: per ogni film ci sono diversi poster, è necessario scegliere il miglior poster affinché le persone guardino più contenuti. Descrivi un piano di soluzione e i dati necessari per l'addestramento (può essere senza ML).
Cosa si è rivelato più difficile di quanto si aspettasse inizialmente?
Come lavorare con i dati privati durante il deployment locale del sistema?
Cosa sono gli item? Come si pronunciano correttamente?