Data Engineer
Pracoval ste niekedy s dekorátormi v Pythone? Čo sú a kde sa používajú?
Ako optimalizovali tabuľky a dotazy: partície, indexy, logika výberu?
Aké je nebezpečenstvo shuffle v Spark?
Aká je algoritmická zložitosť získania prvku podľa kľúča zo slovníka (dict) v Pythone?
Ako pridať kĺzavý priemer súčtu objednávok za aktuálny a predchádzajúce dva dni na používateľa?
Čo je shuffle v Spark a na čo je potrebný?
Podrobne opíšte algoritmus zachytenia inkrementu zo zdroja, aby nič nebolo stratené pri zmene frekvencie načítania.
V akom tíme a pod akým vedením sa cítite najpohodlnejšie pri práci?
Mal si skúsenosti s Docker obrázkami, nastavovaním prostredia na virtuálnom stroji?
Ako rešite problem, keď čítací proces môže vidieť medzičasový (nesúladný) stav tabuľky počas viacstupňového ETL (delete+insert) v Iceberg?
Úložisko bolo postavené podľa schémy Data Vault — ty si ho tiež rozvíjal, udržiaval? Ručne pridával huby, linky?
Kontroly kvality dát ste vykonával sami, alebo požiadavky prichádzali od biznisu/klientov?
Prosím, povedzte nám, prečo vás zaujala táto pozícia.
V ktorých prípadoch môže Materialized View v ClickHouse vynechať údaje alebo ich naopak zdvojnásobiť?
Čo je Materialized View a čím sa líši od bežného pohľadu?
Čo je normalizácia a denormalizácia, kedy sú potrebné?
Čo sa ti momentálne na tvojej práci nepáči?
Povedzte nám o svojej skúsenosti s Airflow (orchestrátorom). Čím ste používali?
Uveďte príklad typickej úlohy na písanie DAG v Airflow.
Čo sa stalo a ako obnoviť prácu?