Data Engineer
Cos'è un decoratore in Python?
Come distribuire in modo non uniforme i dati di questa vetrina su tre shard: 50% sul primo e 25% sugli altri due?
In quale situazione la ricerca in un dizionario può degradarsi fino al caso peggiore?
Come combattere l'incoerenza dei dati?
Come monitoravi la qualità dei dati?
Con quali database hai lavorato? Come funziona MongoDB e come si scala?
Come aprire e chiudere correttamente i file in Python usando il gestore di contesto?
Se la pianificazione del DAG è @daily, a che ora viene effettivamente avviato?
Come è stata implementata tecnicamente la scarica parallela di una grande tabella da PostgreSQL a Spark nel caso [contesto]?
Qual è la differenza tra una comprensione di lista e un ciclo normale in Python?
Come gestivi di solito gli errori e gli avvisi nei pipeline?
Quali tipi di JOIN ci sono in SQL (logici) e come si differenziano?
Come sono state create le tabelle nel cluster e come avete risolto il problema quando, a causa di ZooKeeper, mancava una replica su uno shard?
Da quali fasi è composta una transazione?
Cosa fai nel tempo libero? Hai qualche progetto personale?