Data Engineer
A Python szótár módosítható vagy nem módosítható típus? Milyen követelmények vannak a kulcsaira és értékeire?
Mik a Spark UDF-ok hátrányai, és mi a legnagyobb hátrányuk?
Meséljen a legnehezebb vagy legérdekesebb feladatról, amit meg kellett oldania
Milyen Airflow verzióval dolgozott?
Írja le az Oracle-ból Parquet (HDFS) felé történő adatarchiválás folyamatát partíciók szerint és az adat-helyreállítási pipeline fordítottját. Hogyan oldja meg az újraarchiválási problémát a helyreállított adatok esetében?
Összesen hány letöltés volt — magas szintű feladatok, szálak?
Mi a különbség az is és == operátorok között Pythonban?
Van kérdése a csapatról és a szerepről?
[név] kérdezte: Hogyan valósítható meg az adatok tárolása csak 2 évig a ClickHouse-ban?
Hogyan látja a fejlődését az új csapatban, és mely feladatokat szeretné a leginkább végezni?
Mire használják a dekorátorokat az Apache Airflow-ban?
Milyen feladatokra nem alkalmas a ClickHouse, és mit választanál helyette?
git submodule update --init
Mindig megfelel az EXPLAIN végrehajtási terve annak, ami valójában végrehajtódik?
Van egy kérdésed, ami rosszul működik, lassú vagy összeomlik — hogyan optimalizáld?
Hozzon létre raw.local_transactions táblát a cluster_4x2 klaszteren ( transaction_id String, user_id String, amount Float64, created_at DateTime ) MOTOR = ReplicatedMergeTree() PARTÍCIONÁLÁS amount szerint RENDEZÉS (transaction_id) szerint; Hozzon létre raw.transactions táblát a cluster_4x2 klaszteren ( transaction_id String, user_id String, amount Float64, created_at DateTime ) MOTOR = Distributed('cluster_4x2', 'raw', 'local_transactions', cityHash64(user_id));
Sose kellett már jelentéseket, irányítópultokat, vizualizációkat (BI) készítened?
Hogyan juttatod el a DAG-kódokat a productionbe?
Mesélj néhány legfontosabb adatminőséggel kapcsolatos feladatodról.
Milyen sorrendet vagy tömörítési típust használ a Parquet?