Se respectă ACID în Greenplum?
Data Engineer
Ce procese sunt inițiate atunci când ștergem sau modificăm înregistrări în ClickHouse?
Data Vault este un instrument util, dar devine prea mult de obiecte. Poți explica diferența dintre hub-uri, link-uri și sateliți?
Cunoști o bibliotecă în Rust, multithread, foarte rapidă, care poate înlocui Pandas pentru Data Science și Big Data?
Care este diferența dintre un CTE și o subinterogare?
Cum împărțim o solicitare în etape? Ce facem pentru asta?
Ce tehnologii ai folosit pentru a obține și încărca datele în Parquet și ce mecanisme au fost utilizate?
Cum au fost încărcate datele din tabelul extern în tabelele țintă?
Cum ai scris DAG-ul Airflow și joburile: manual sau cu șabloane?
Ați încărcat date din Spark în S3 în format Parquet, apoi din Parquet în Greenplum — cum are loc procesul de încărcare?
Ai lucrat cu Git? Ce stocai în Git?
Cu streaming, Iceberg funcționa, ai auzit? Este un depozit de fișiere gunoi.
Cu dependențe între joburi, între DAG-uri — ați folosit senzori pentru ca acestea să pornească unul după altul mai multe joburi?
Cum obișnuiai să proiectezi schema bazei de date — o făceai manual în bază sau stocai scripturile undeva, sau foloseai Liquibase, care era procesul?
Este în timp real, cum se implementează între Kafka și ClickHouse Spark?
Are sens să folosești CTE dacă este utilizată o singură dată în interogare?
Vom analiza JSON — cine va analiza JSON? Din câte știu, în ClickHouse nu există funcții.
Ai lucrat direct cu Spark? Care este dezavantajul său?
Iceberg este un motor care permite transformarea S3 într-o bază de date, respectând chiar ACID. Care este dezavantajul său?
Avem nevoie de un motor de pipeline — un mecanism care să permită crearea foarte rapidă a fluxurilor prin furnizarea de contracte și parametri la intrare. Cum ai implementa acest lucru la un nivel superior?