Data Engineer
Pracoval ste s feature store-ami?
Čo vieš o spill v Spark?
Predstavljajte si, da Data Vault ni na voljo in obstajata dve široki tabeli, ki ju je treba združiti. Kako bi to optimiziral v Greenplum? In če bi bilo v ClickHouse?
Ako by si implementoval filtrovanie pred join v samotnom dopyte?
Si z Moskvy? Ako dlho tu žiješ? Prečo si sa presťahoval do Moskvy?
Ako fyzicky prebieha mechanizmus broadcast — ako sa časti malej tabuľky dostanú na executor s veľkou tabuľkou?
Prečo sme použili Parquet namiesto ORC?
Ako bude riešená práca s rizikami odchýlok dát a zodpovednosť za dáta?
Ako ste pracovali s datotekami pri znova zagonu DAG po njegovem padcu, da ne bi prepisali podatke u S3 nepotpunim podatkov?
Top 3 kritériá pre výber ponuky, ak je viacero návrhov.
Čo je "mŕtva n-tica" (dead tuple)?
Čo je Spark JDBC a ako efektívne načítať veľkú tabuľu cez neho?
Funkcia okna SUM() OVER (PARTITION BY user_id) — v enem primeru dodajemo ORDER BY datum nakupa, v drugem ne. Kakšna je razlika?
Ako sú vaše dbt modely štruktúrované a ako zbierate vitrínu z viacerých zdrojov cez Trino?
Aký je ideálny pomer medzi obchodnými úlohami a infraštruktúrnymi úlohami pre vás?
Aký typ ukladania má Parquet: riadkový alebo stĺpcový?
Povedzte nám o úlohe s nastavením replikácie, ktorú ste riešili.
Čo sa stane, keď použijete `s ** 2` na zoznam `s = [1, 2, 3]`?
Existujú iné mechanizmy riadenia shuffle okrem coalesce/repartition?
Čo ťa priťahuje v oblasti travel? Možno rád cestuješ sám, alebo ťa zaujal travel-tech nejako?