Data Engineer
Come esattamente leggevi Parquet?
Hai dovuto lavorare direttamente con Spark? Qual è il suo svantaggio?
In quali progetti Scala hai lavorato in passato? Condividi compiti specifici e risultati in questa tecnologia.
Come hai scritto il DAG di Airflow e i job: a mano o usando modelli?
Ci sono stati casi di interazione con database relazionali?
Cos'è la versioning semantico? Quando aumentare major, minor, patch?
Quali metodi magici di Python devono essere considerati?
Con dipendenze tra lavori, tra DAG — hai usato sensori affinché vengano eseguiti uno dopo l'altro?
Come organizzi i tuoi progetti? Scrivi un README o qualcos'altro?
Quando è appropriato usare ThreadPoolExecutor?
Con Kafka, non c'è niente di difficile, l'importante è elaborare i dati — quali sono i dettagli da considerare?
Hai ricevuto un compito con il numero ABC. Qual è il tuo ordine di azioni in Git all'inizio del lavoro?
Hai mai avuto compiti ad-hoc nonostante un brief chiaro, e come ti comporti rispetto alle richieste ad-hoc e ai cambi di priorità?
Qual è la complessità algoritmica per ottenere un elemento tramite chiave da un dizionario (dict) in Python?
Come hai risolto i problemi di ottimizzazione quando la query richiede molto tempo e esegue una scansione completa? Come affronteresti un nuovo compito simile?
Come sono correlate le partizioni di Spark e le partizioni nelle tabelle (ad esempio, in Iceberg)?
Cosa puoi dirmi sull'API SOAP?
Quando si può usare la famiglia di formati CSV?
Come applicare una funzione a tutte le righe o elementi in pandas?
In PostgreSQL, è necessario ottimizzare le prestazioni delle transazioni con un livello di isolamento minimo, in cui: • le transazioni parallele possono vedere modifiche non finalizzate tra loro; • sono possibili "dirty read" (letture sporche). Quale livello di isolamento deve essere specificato per la transazione per raggiungere questo obiettivo? dirty read non è possibile in PostgreSQL repeatable read read uncommitted read committed serializable