Machine Learning / AI
Dal punto di vista delle attività analitiche, cos'è stato? Hai affrontato test A/B? Quali metriche hai usato?
C'è stato un ulteriore addestramento del modello per questo compito (non LLM)?
Hai avuto contatti con i clienti? In quale formato?
Compito in Python: trovare l'indice del primo carattere unico nella stringa (First Unique Character)
Parla dell'algoritmo K-means e delle sue varianti avanzate (K-means++).
Parlami più dettagliatamente dei risultati concreti e dei progetti nell'azienda attuale.
Hai lavorato con Spark? Qual è la tua idea generale di cosa sia?
Se parliamo del minimo salariale?
Come scalare il sistema sotto un carico elevato?
Ci sono domande sulle condizioni di lavoro e sul progetto?
Cos'è MVCC?
Qual è l'ordine di esecuzione degli operatori in una query SQL?
Quali modelli sono stati utilizzati in ogni fase? Per l'estrazione di entità, per la vettorizzazione, per la generazione?
Cos'è il metodo delle componenti principali (PCA) e come viene utilizzato?
Perché un compito in Spark può bloccarsi e richiedere molto tempo?
Cosa intendi per errore (nell'approccio prompt)?
Esercizio pratico La query SQL su 80 milioni di messaggi crea duplicati dopo il JOIN. Qual è l'azione migliore da iniziare per prima? - Verificare la cardinalità del JOIN, le chiavi e il piano di esecuzione prima dell'ottimizzazione. - Creare un indice su un campo di join. - Esportare il risultato in CSV e rimuovere i duplicati in Python. - Aggiungere sempre DISTINCT a tutte le colonne. - Aggiungere DISTINCT dopo aver verificato il risultato sull'estratto. - Verificare le chiavi di join e l'unicità di entrambe le tabelle.
Perché è necessaria la normalizzazione (Layer Norm) — perché stabilizzare l'addestramento?
Come venivano gestiti i picchi di carico nel sistema RAG? Cosa succedeva sotto carico elevato?
Come avete valutato la qualità dell'agente Text-to-SQL?