Data Engineer
Jak vyřešit problém, když čtecí proces může během vícestupňového ETL (delete+insert) v Iceberg vidět mezistav (nesouladný) stavu tabulky?
Úložiště bylo postaveno podle schématu Data Vault — ty jsi ho také rozvíjel, udržoval? Přidával jsi ručně huby, odkazy?
Prováděli jste kontroly kvality dat sami, nebo přišly požadavky od podnikání/zákazníků?
Prosím, řekněte nám, proč vás tato pozice zajímá.
V jakých případech může Materialized View v ClickHouse vynechat data nebo je naopak zdvojit?
Co je to normalizace a denormalizace, kdy jsou potřeba?
Uveďte příklad typického úkolu při psaní DAG v Airflow.
Co se stalo a jak obnovit práci?
Co je ACID? Co znamená každé písmeno? Jak to souvisí s transakcemi?
Ohodnoťte konečné řešení z hlediska času a paměti.
Jak realistické jsou plány společnosti na vybudování systému sběru, normalizace a analýzy dat?
V čem se liší EXPLAIN ANALYZE od běžného EXPLAIN? Proč se nedoporučuje spouštět ho na DELETE/UPDATE dotazech?
Vysvětlete líné a okamžité výpočty v Spark.
V Hive došlo k pomalému analytickému dotazu. Jak pochopit, co se s ním stalo, a jak ho opravit?
Můžeš vysvětlit, co zde na konci získáme? Je třeba okomentovat každý krok, jak to funguje.
Existuje tabulka T1 (10 řádků) a tabulka T2 (5 řádků), obě s polem ID. Kolik řádků může být maximálně a minimálně na výstupu při INNER JOIN a LEFT JOIN těchto tabulek?
Co je třeba zkontrolovat, pokud se logy neotevírají (chyba 403)?
V jaké fázi, jaké kontroly se provádějí a co se děje s neplatnými daty při kontrole kvality dat (Data Quality)?
Data Vault je užitečný nástroj, ale je tam příliš mnoho objektů. Můžeš vysvětlit rozdíl mezi huby, linky a satelity?
Z čeho obvykle sestávají logy úloh Airflow?