Sobes.tech

Data Engineer

Aké procesy sa spustia, keď odstraňujeme alebo meníme záznamy v ClickHouse?

187

Data Vault je užitočný nástroj, ale je veľa objektov. Môžeš vysvetliť rozdiel medzi hubmi, linkami a satelitmi?

187

Poznáš nejakú knižnicu v Rust, ktorá je viacvláknová, veľmi rýchla a môže nahradiť Pandas pre Data Science a Big Data?

184

Ako rozdeliť dopyt na etapy? Čo pre to robíme?

180

Aké technológie ste použili na načítanie údajov do Parquet a aké mechanizmy boli použité na získanie a načítanie údajov?

180

Načítali ste dáta zo Spark do S3 vo formáte Parquet, a potom z Parquet do Greenplum — ako prebieha proces načítania?

177

Ako si napisal DAG in naloge v Airflow: ročno ali s predlogami?

175

Ako boli údaje z vonkajšej tabuľky načítané do cieľových tabuliek?

175

Pracoval ste s Gitom? Čo ste v Gite ukladal?

174

Ako si običajno načrtoval shemo baze podatkov — si to delal ročno v bazi ali si shranjeval skripte nekje, ali si sploh uporabljal Liquibase? Kakšen je bil postopek?

173

S streamovaním fungoval Iceberg, počul si? Je to odpadové úložisko súborov.

173

S závislosťami medzi úlohami, medzi DAG — ste použili senzory, aby sa niekoľko úloh spustili po sebe?

171

Ide o v reálnom čase, ako to realizovať medzi Kafka a ClickHouse Spark?

170

Má zmysel používať CTE, ak sa používa iba raz v dopyte?

169

Budeme parsovať JSON — kto bude parsovať JSON? Čo ja viem, v ClickHouse nie sú žiadne funkcie.

166

Pracoval ste priamo so Spark? Aké je jeho mínus?

165

Iceberg je motor, ktorý umožňuje spraviť z S3 databázu, dokonca dodržiava ACID. Aký je jeho mínus?

161

Potrebujeme engine pipeline — mechanizmus, ktorý umožní veľmi rýchle vytváranie tokov zadávaním kontraktov a parametrov. Ako by si to realizoval na vyššej úrovni?

161
/3