Quali sono i parametri principali che di solito impostiamo per i compiti DAG e perché il grafico deve essere esattamente così (logica di alto livello del DAG)?
Machine Learning / AI
Quali sono le metriche adeguate e quali no quando parliamo di squilibrio delle classi?
Cosa succede in Python quando si concatenano le stringhe (ad esempio, current += char)? Perché questo approccio può essere problematico in questo compito e come ottimizzare il codice evitando frequenti concatenazioni di stringhe?
Data una stringa che contiene lettere e numeri. Trova il numero massimo che appare nella stringa (considerando le cifre consecutive come un unico numero).
Hai lavorato con Spark? Qual è la tua idea generale di cosa sia?
Hai mai lavorato con una foresta casuale (al lavoro o a scuola)? Quali sono le principali differenze tra una foresta casuale e il boosting?
Come risolveresti lo stesso problema di ricerca dell'ultimo clic senza usare JOIN?
Hai lavorato con Airflow o Spark? Raccontami, cos'è un DAG in Airflow, puoi fare un esempio della tua esperienza? Hai scritto DAG tu stesso o li hai solo usati/avviati?
Hai esperienza con le serie temporali? Quali metriche vengono utilizzate per valutare la qualità dei modelli di previsione delle serie temporali?
Perché la precisione in presenza di squilibrio delle classi mostra un valore di qualità inadeguato?
Dato il tavolo logs con eventi degli utenti (user_id, item_id, action_type, timestamp). Scrivi una query SQL per trovare l'ID dell'ultimo articolo cliccato da ogni utente.
Ci sono 100 monete, una delle quali è falsa — con due aquile su entrambi i lati. Scegliamo una moneta a caso, la lanciamo e compare l'aquila. Qual è la probabilità che la moneta sia falsa? Spiega la soluzione (usando la formula di Bayes).
Se il numero ottimale di alberi per il modello è 500, ma abbiamo accidentalmente addestrato sia una foresta casuale che un boosting con 1000 alberi, quale dei due modelli è più probabile che overfitti e perché?
Perché un compito in Spark può bloccarsi e richiedere molto tempo?