Data Engineer
Čím sa líši RANK od DENSE_RANK?
Čo je to semantické verzionovanie? Kedy zvyšovať major, minor, patch?
Aké skupiny SQL operátorov poznáš? Čo k nim patrí?
LEFT JOIN: tabuľka s 10 záznamami LEFT JOIN tabuľka s 100 záznamami. Aké je minimálne a maximálne množstvo riadkov, ktoré je možné získať?
Pracoval si s inkrementálnym a úplným načítaním? Ako si sa vysporiadal s duplikátmi?
Čo je shuffle v Spark a prečo je dôležité ho minimalizovať?
Máte skúsenosti s optimalizáciou úloh Spark? Môžete uviesť konkrétny príklad?
Úlohy z dbt v Airflow — ste ich písali ručne alebo ste ich nejak automatizovali, boli tam šablóny?
Poznáš OLAP kostky? Keď pracujeme s viacrozmernými údajmi, podobnými kontingenčnej tabuľke v Exceli, ale pre rýchlejšiu interakciu s veľkými objemami údajov.
Povedz mi viac o sieti: čo to je a prečo je to dôležité?
CREATE TABLE core.localUserMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = ReplikovanýReplacingMergeTree() ORDER BY (UserId); CREATE TABLE core.userMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = Distribuovaný('cluster_4x2', 'core', 'localUserMetadata', cityHash64(LastLoginDate));
Ako funguje JOIN v ClickHouse?
Aké motory tabuliek v ClickHouse poznáte a používali ste?
Ako sa vyhnúť/odstrániť skreslenie údajov v Spark?
Museli ste priamo komunikovať s Data Scientists a zbierať od nich požiadavky?
Ako Spark určuje, že tabuľka je dostatočne 'malá' pre broadcast join (horná hranica)?
Museli ste niekedy písať balíky v Oracle?
Povedaj mi, česa se rad razen kodiranja raduješ v prostem času? Kakšni so tvoji hobiji?
Ktorý zdroj sa najviac spotrebúva pri Nested Loop Join?
Poznáte spoločné výrazy tabuliek (CTE)? Uveďte príklad použitia.