Come progetteresti un caricamento di dati scalabile da più API REST: dall'acquisizione dei dati a S3, con un'interfaccia per un analista?
Data Engineer
Cos'è SQL procedurale?
Parlaci di te e della tua esperienza in ingegneria dei dati.
Ci sono 101 oggetti: 100 zeri e 1 uno. Dopo aver ordinato per punteggio, ci sono 50 zeri, poi uno, poi altri 50 zeri. Qual è il ROC AUC e la forma della curva ROC?
Quali sono gli svantaggi degli indici oltre allo spazio che occupano?
Nel boosting del gradiente, è già stata costruita una composizione di N algoritmi di base. Quale sarà l'obiettivo per il nuovo, N+1-esimo algoritmo?
Perché le valutazioni pigre sono utili?
Cos'è il spill di dati in Spark e come evitarlo se non è possibile aggiungere risorse facilmente?
Come gestiresti le trasformazioni di dati ad alto carico?
Come si differenziano le modalità di avvio di Spark: cluster, client e local?
Quali sono i pro e i contro di implementare un caricatore API come operatore/hook personalizzato di Airflow rispetto a una libreria o servizio container separato?
2. C'è una tabella t che elenca la somma delle transazioni dei clienti per giorno: - Scrivi una query che per ogni riga mostra le transazioni del cliente per il giorno corrente e quello precedente La tabella finale è sotto:
Cosa sono le valutazioni pigre e come capirle?
Quali compiti tipici hai risolto in Airflow?
Data, numero d'ordine, importo select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3
Cosa sono i modelli a stella e Data Vault?
Parlaci di te: dove hai lavorato recentemente, cosa facevi, cosa stai cercando e perché?
Dove si trovano Driver e Executors in modalità cluster e perché viene usato in produzione?
Dove esattamente si verifica il gradiente nell'algoritmo di boosting del gradiente se l'algoritmo di base è un semplice albero decisionale?
Di quali componenti sono costituiti Greenplum e Hadoop HDFS?