Data Engineer
Az API-n kívül milyen más módszerekkel és protokollokkal dolgozott az adatforrásokkal?
Mesélj aadat az adatok minőségéről — volt már tapasztalatod ezzel a területtel kapcsolatban?
Milyen ügynökök és modellek vannak a vállalati MI-megoldásában? Kódot ír helyette?
Miért szükséges a cache és a persist a Sparkban?
Hogyan indították el a DAG-okat: cron, adatkészletek, trigger-ek vagy függőségek szerint?
importáld be a clickhouse_driver-t from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Milyen Spark JDBC paramétereket használtak az olvasás párhuzosításához?
Mi az a CROSS JOIN és mi az eredménye a használatának?
Milyen irányban lenne érdekes fejlődni — kirakatok, fejlesztés, elemzés, esetleg AI?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefon] null null 5 VÁLASZ a.num MINT a_num, b.num MINT b_num TÁBLÁBÓL t1 a BAL OLDALI CSATLAKOZÁS t2 b ON a.num = b.num;
Milyen nem nyilvánvaló problémák merülhetnek fel nagy táblák betöltésekor (teljesítményen kívül)?
A SUM() OVER (PARTITION BY user_id) ablakfüggvény — egyik esetben hozzáadjuk az ORDER BY vásárlási dátumot, másikban nem. Mi a különbség?
Miért volt szükséged általában a Data Vault-ra?
Milyen tárolási típusú a Parquet: soros vagy oszlopos?
Meséljen a replikáció beállítási feladatról, amit megoldott.
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Mesélj a CI/CD folyamatokról, az adatbázisban végrehajtott változásokról, verziókezelésről és séma migrációkról (séma fejlődése).
Mit vonz a travel területen? Talán szeretsz utazni, vagy a travel-tech valamilyen módon felkeltette az érdeklődésedet?
Meséljen a terjesztett adatbázisokkal (Greenplum, ClickHouse) szerzett tapasztalatairól.
Javasolja meg egy nagy tábla rendszeres inkrementális betöltésének megoldását rugalmas (változtatható) frissítési gyakorisággal a Postgres-ból a Data Lake-be.