Data Engineer
Hai due tabelle correlate: first_table e second_table. Vuoi eseguire il comando TRUNCATE TABLE second_table CASCADE;, per eliminare tutte le righe di second_table e tutti i dati dipendenti da essa. Quali sono le possibili conseguenze dell'esecuzione di questo comando? create table first_table ( id integer primary key ); create table second_table ( id serial primary key, first_table_fk integer references first_table(id) ); - La sequenza second_table_id_seq verrà reimpostata al valore iniziale. - Verranno eliminate tutte le voci di first_table collegate tramite chiave esterna a second_table. - Gli indici esistenti per second_table verranno eliminati e ricreati automaticamente. - In successive inserzioni in second_table, il valore predefinito per id potrebbe iniziare da un valore errato. - Si verificherà un errore, poiché il comando CASCADE è vietato per le tabelle con chiavi esterne.
Supponi che Data Vault non sia disponibile e ci siano due tabelle ampie da unire. Come ottimizzeresti questo in Greenplum? E se fosse in ClickHouse?
Come avviare il secondo DAG di Airflow subito dopo il completamento con successo del primo?
Cosa ti ha attirato esattamente della nostra offerta di lavoro, perché hai deciso di candidarti?
Perché si è usato Parquet invece di ORC?
Con quali strumenti di visualizzazione hai lavorato e quanto strettamente hai collaborato con Power BI?
Come verrà gestito il lavoro con i rischi di divergenza dei dati e la responsabilità dei dati?
# cosa stampa s = 'Abracadabra' print(s[5][0][0]) b = 'a' print(b[0][0]) print(s[::-2]) #Arcd s = [1, 2, 3] print(s ** 2) def foo(*args, **kwargs): print(args) print(kwargs)
I 3 criteri principali per scegliere un'offerta, se ci sono più proposte.
Cos'è un "tupla morta" (dead tuple)?
Come evitare/rimuovere il bias dei dati in Spark?
Qual è la differenza tra multithreading e multiprocessing? Per quali compiti usare i thread e per quali processi?
Hai esperienza con motori come Trino o con formati tabellari (Iceberg, Parquet) in Spark?
Qual è il rapporto ideale tra le attività aziendali e le attività infrastrutturali per te?
Ci sono altri meccanismi di gestione dello shuffle oltre a coalesce/repartition?
Quali sono le cause tipiche del fatto che una query in un DBMS relazionale funzioni lentamente?
Parla dei tipi di dati mutabili e immutabili in Python e fornisci esempi.
Usa l'IA nel suo lavoro attuale? Quali strumenti e come esattamente?
Su quali tecnologie si basa il tuo lakehouse e quali problemi si incontrano lavorando con Apache Iceberg?
Come implementeresti il filtro prima del join nella query?