Data Engineer
Dolgozott már feature store-okon?
Mit tudsz a spillről a Sparkban?
Tegyük fel, hogy a Data Vault nem elérhető, és két széles táblát kell összekapcsolni. Hogyan optimalizálnád ezt Greenplumban? És ha ez ClickHouse-ban lenne?
Hogyan valósítanád meg a szűrést a join előtt a lekérdezésben?
Moszkvából való vagy? Rég itt élsz? Miért költöztél Moszkvába?
Hogyan történik fizikailag a broadcast mechanizmus — hogyan kerülnek a kis tábla partíciói a nagy tábla végrehajtóira?
Miért a Parquet-ot használták az ORC helyett?
Hogyan fog megoldódni az adatok eltérésének kockázataival kapcsolatos munka és az adatokért való felelősség?
Hogyan dolgozott a fájlokkal a DAG újraindításakor a bukás után, hogy ne írja felül az S3-ban lévő adatokat hiányos adatokkal?
A három legfontosabb kritérium az ajánlat kiválasztásához, ha több ajánlat van.
Mi az a "halott tuple" (dead tuple)?
Mi az a Spark JDBC és hogyan töltsünk hatékonyan be egy nagy táblát rajta keresztül?
A SUM() OVER (PARTITION BY user_id) ablakfüggvény — egyik esetben hozzáadjuk az ORDER BY vásárlási dátumot, másikban nem. Mi a különbség?
Hogyan épülnek fel a dbt modelljeid, és hogyan gyűjtöd össze a vitrint több forrásból a Trino segítségével?
Mi az ideális arány az üzleti feladatok és az infrastruktúra feladatok között az Ön számára?
Milyen tárolási típusú a Parquet: soros vagy oszlopos?
Meséljen a replikáció beállítási feladatról, amit megoldott.
Mi történik, ha alkalmazod a `s ** 2`-t a `s = [1, 2, 3]` listára?
Vannak más shuffle-kezelési mechanizmusok a coalesce/repartition mellett?
Mit vonz a travel területen? Talán szeretsz utazni, vagy a travel-tech valamilyen módon felkeltette az érdeklődésedet?