A cosa servono cache e persist in Spark?
Data Engineer
Come evitare/rimuovere il bias dei dati in Spark?
Cos'è la normalizzazione e il modello ER, a cosa servono?
Qual è l'algoritmo di diagnosi e cosa fare se la query è ancora lenta dopo aver aggiunto più indici?
In quali casi si applica la normalizzazione e in quali la denormalizzazione?
Parla dei concetti di base di Kafka (gruppo di consumatori, partizioni, argomenti).
Quali sono le cause tipiche del fatto che una query in un DBMS relazionale funzioni lentamente?
Quali problemi non evidenti possono verificarsi durante il caricamento di grandi tabelle (oltre alle prestazioni)?
Proponi una soluzione per il caricamento incrementale regolare di una grande tabella con una frequenza di aggiornamento flessibile (mutabile) da Postgres a Data Lake.
Come sono collegati l'ordinamento all'interno della funzione finestra e l'ordinamento finale ORDER BY nella query?
Come gestire le risorse di un'applicazione Spark per non esaurire la memoria durante la modifica del volume dei dati di input?
Come lavorare con le partizioni tramite coalesce e repartition?
Quali immagini Docker hai dovuto costruire e perché?
Ci sono altri meccanismi di gestione dello shuffle oltre a coalesce/repartition?
Quali parametri di Spark JDBC sono stati utilizzati per parallelizzare la lettura?