Dodržiava sa ACID v Greenplum?
Data Engineer
Aké procesy sa spustia, keď odstraňujeme alebo meníme záznamy v ClickHouse?
Data Vault je užitočný nástroj, ale je veľa objektov. Môžeš vysvetliť rozdiel medzi hubmi, linkami a satelitmi?
Poznáš nejakú knižnicu v Rust, ktorá je viacvláknová, veľmi rýchla a môže nahradiť Pandas pre Data Science a Big Data?
V čom sa líši CTE od poddotazu?
Ako rozdeliť dopyt na etapy? Čo pre to robíme?
Aké technológie ste použili na načítanie údajov do Parquet a aké mechanizmy boli použité na získanie a načítanie údajov?
Načítali ste dáta zo Spark do S3 vo formáte Parquet, a potom z Parquet do Greenplum — ako prebieha proces načítania?
Ako si napisal DAG in naloge v Airflow: ročno ali s predlogami?
Ako boli údaje z vonkajšej tabuľky načítané do cieľových tabuliek?
Pracoval ste s Gitom? Čo ste v Gite ukladal?
Ako si običajno načrtoval shemo baze podatkov — si to delal ročno v bazi ali si shranjeval skripte nekje, ali si sploh uporabljal Liquibase? Kakšen je bil postopek?
S streamovaním fungoval Iceberg, počul si? Je to odpadové úložisko súborov.
S závislosťami medzi úlohami, medzi DAG — ste použili senzory, aby sa niekoľko úloh spustili po sebe?
Ide o v reálnom čase, ako to realizovať medzi Kafka a ClickHouse Spark?
Má zmysel používať CTE, ak sa používa iba raz v dopyte?
Budeme parsovať JSON — kto bude parsovať JSON? Čo ja viem, v ClickHouse nie sú žiadne funkcie.
Pracoval ste priamo so Spark? Aké je jeho mínus?
Iceberg je motor, ktorý umožňuje spraviť z S3 databázu, dokonca dodržiava ACID. Aký je jeho mínus?
Potrebujeme engine pipeline — mechanizmus, ktorý umožní veľmi rýchle vytváranie tokov zadávaním kontraktov a parametrov. Ako by si to realizoval na vyššej úrovni?