Data Engineer
Írtál ingestion folyamatokat az OpenMetadata számára, amelyek forrásokat szkennelnek?
Mi történik, ha létrehozol egy DAG-t start_date = 2024. január 1-jével?
Lehet-e valami mást kitalálni a szokásos CTE helyett, figyelembe véve, hogy a szűrés továbbra is a memória egész területén történik a teljes táblán?
Milyen fő Linux parancsokat használsz a terminálban?
Mi az a tranzakciós napló (WAL) egy adatbázis-kezelő rendszerben, és miért szükséges?
Milyen környezetben indult a Spark?
Miért volt szükséged általában a Data Vault-ra?
Van tapasztalata Trino típusú motorokkal vagy táblázatos formátumokkal (Iceberg, Parquet) a Spark-ban?
Milyen tapasztalataid vannak SQL és relációs adatbázisokkal kapcsolatban?
Miért keresel új munkahelyet, és mit szeretnél a jövőben csinálni?
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Mesélj a CI/CD folyamatokról, az adatbázisban végrehajtott változásokról, verziókezelésről és séma migrációkról (séma fejlődése).
Mit vonz a travel területen? Talán szeretsz utazni, vagy a travel-tech valamilyen módon felkeltette az érdeklődésedet?
Milyen adatátvitési módszereket ismersz az Airflow feladatok között?
Mely mezőkön történt az adatok összefűzése, és hogyan szüntették meg a duplikátumokat a vitrínben?
LeetCode #? — A PostgreSQL-ben van egy [tábla] nevű táblázat egyetlen oszloppal, amelynek értékei 1, 1, 2. Írjon egy DELETE lekérdezést, amely fizikailag eltávolít egy duplikátumot.
Mit tudsz a spillről a Sparkban?
Használja az AI-t jelenlegi munkájában? Milyen eszközöket és hogyan pontosan?
Dolgoztál már batch- vagy streaming feltöltéssel?
Meséljen a legjelentősebb Python-projektről vagy feladatról az elmúlt évben.