Data Engineer
Kromě API, jakými dalšími způsoby a protokoly pracoval s datovými zdroji?
Pověz mi o svém chápání kvality dat — máš zkušenosti s tímto oborem?
Jaké agenti a modely jsou používány ve vašem firemním AI řešení? Píše za vás kód?
Na co jsou v Sparku cache a persist?
Jak jste spouštěli DAGy: podle cron, datasetů, spouštěčů nebo závislostí?
import clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Jaké parametry Spark JDBC byly použity pro paralelní čtení?
Co je to CROSS JOIN a jaký je výsledek jeho použití?
V jakém směru by bylo zajímavé se rozvíjet: výlohy, vývoj, analýza, možná AI?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefon] null null 5 VYBER a.num AKO a_num, b.num AKO b_num Z t1 a LEVA PŘIPOJENÍ t2 b ON a.num = b.num;
Jaké ne zřejmé problémy mohou nastat při načítání velkých tabulek (kromě výkonu)?
Funkce okna SUM() OVER (PARTITION BY user_id) — v jednom případě přidáváme ORDER BY datum nákupu, v jiném ne. V čem je rozdíl?
Na co vám vůbec byl Data Vault?
Jaký typ ukládání má Parquet: řádkový nebo sloupcový?
Povězte mi o úloze s nastavením replikace, kterou jste řešili.
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Pověz mi o procesech CI/CD, změnách v databázi, verzování a migracích schématu (vývoj schématu).
Co tě přitahuje v oblasti travel? Možná rád cestuješ sám, nebo tě zaujal travel-tech nějakým způsobem?
Povězte mi o své zkušenosti s distribuovanými databázemi (Greenplum, ClickHouse)?
Navrhněte řešení pro pravidelné inkrementální načítání velké tabulky s flexibilní (měnitelnou) frekvencí aktualizace z Postgres do Data Lake.