Data Engineer
Come hai corretto il bias dei dati per client_id quando un cliente era significativamente più grande degli altri? Quali sono le opzioni?
È possibile creare e applicare un decoratore senza la sintassi @?
Perché hai deciso di mettere il ranking in una CTE separata? Perché non poteva essere usato direttamente nella prima CTE?
Quali campi tecnici sono stati utilizzati in satellites, links e hubs Data Vault?
Domanda #1 Quante record restituirà la query con inner, left, right, full join di due tabelle unite sull’attributo id t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Hai archiviato i risultati delle viste tabellari in Parquet o in altro modo in S3?
Cosa sono i decoratori in Python?
Quali tipi di JOIN fisici esistono in Spark?
Conosci ReplicatedQueue? Hai esperienza di lavoro con essa?
Quanto tempo hai lavorato in totale con Spark e quanto profondamente ti sei immerso in esso?
Cosa sono le operazioni lazy in Spark e a cosa servono?
Tipi di JOIN e le loro differenze
Come lavorare con le partizioni tramite coalesce e repartition?
Come avete determinato che la registrazione esiste già e non è necessario registrarla di nuovo?
NULL più 5 — quanto sarà?
È possibile leggere i dati in parallelo da un singolo file Parquet in Spark, o solo con un core in un task?
Con quali formati di file hai lavorato?
Parlami di te: esperienza, compiti, funzionalità o risultati di cui sei orgoglioso.
Hai esperienza con FastAPI?
Hai fatto controlli statistici?