Sobes.tech

Data Engineer

Ce procese sunt inițiate atunci când ștergem sau modificăm înregistrări în ClickHouse?

187

Data Vault este un instrument util, dar devine prea mult de obiecte. Poți explica diferența dintre hub-uri, link-uri și sateliți?

187

Cunoști o bibliotecă în Rust, multithread, foarte rapidă, care poate înlocui Pandas pentru Data Science și Big Data?

184

Care este diferența dintre un CTE și o subinterogare?

183

Cum împărțim o solicitare în etape? Ce facem pentru asta?

180

Ce tehnologii ai folosit pentru a obține și încărca datele în Parquet și ce mecanisme au fost utilizate?

178

Cum au fost încărcate datele din tabelul extern în tabelele țintă?

175

Cum ai scris DAG-ul Airflow și joburile: manual sau cu șabloane?

175

Ați încărcat date din Spark în S3 în format Parquet, apoi din Parquet în Greenplum — cum are loc procesul de încărcare?

175

Cu streaming, Iceberg funcționa, ai auzit? Este un depozit de fișiere gunoi.

173

Cu dependențe între joburi, între DAG-uri — ați folosit senzori pentru ca acestea să pornească unul după altul mai multe joburi?

171

Cum obișnuiai să proiectezi schema bazei de date — o făceai manual în bază sau stocai scripturile undeva, sau foloseai Liquibase, care era procesul?

171

Este în timp real, cum se implementează între Kafka și ClickHouse Spark?

170

Are sens să folosești CTE dacă este utilizată o singură dată în interogare?

169

Vom analiza JSON — cine va analiza JSON? Din câte știu, în ClickHouse nu există funcții.

166

Ai lucrat direct cu Spark? Care este dezavantajul său?

165

Iceberg este un motor care permite transformarea S3 într-o bază de date, respectând chiar ACID. Care este dezavantajul său?

161

Avem nevoie de un motor de pipeline — un mecanism care să permită crearea foarte rapidă a fluxurilor prin furnizarea de contracte și parametri la intrare. Cum ai implementa acest lucru la un nivel superior?

161
/3