Aké ďalšie parametre DDL/CREATE TABLE v ClickHouse poznáte, na čo vplývajú a v akých prípadoch sa používajú?
Data Engineer
Ako implementovať nerovnomerné rozdelenie údajov vo vitríne: 50% na prvej a po 25% na ďalších dvoch?
Ako so bile ustvarjene tabele v klastru in kako ste rešili problem, ko je zaradi ZooKeeperja manjkala replika na shard-u?
Ako ste reševali težave z optimizacijo, ko je poizvedba trajala dolgo in je izvajala popoln sken? Kako bi pristopili k novi taki nalogi?
Ako ste presne čítali Parquet?
V ktorých prípadoch môže Materialized View v ClickHouse vynechať údaje alebo ich naopak zdvojnásobiť?
Stretli ste sa chybou ClickHouse `Too many parts` pri vkladaní? Ako ste ju riešili?
S akými knižnicami Python ste pracovali?
Povedajte nám viac o skreslení dát medzi shardami: ako bolo určené a ako bola použitá príslušná funkcia/mechanizmus?
Poznáte UDF (Používateľom definované funkcie) v ClickHouse, pracovali ste s nimi?
Ako ste opravili skreslenie dát podľa client_id, keď bol jeden klient výrazne väčší ako ostatní? Aké sú možnosti?
S akými parametrami motora Distributed v ClickHouse ste oboznámený?
Ako bi ste postopali s verigo Materialized View prek intermediære tabele ReplacingMergeTree, da pravilno napolnite podatke koji već postoje pre pokretanja nove MV?
Na ktorých poliach došlo k zlúčeniu údajov a ako sa v vitríne odstraňovali duplikáty?
S akou verziou Airflow ste pracovali?
Ako organizovať nalaganje podatkov v ClickHouse v veliki tabeli PostgreSQL, v katero nenehno prihajajo novi zapisi z monotonim naraščajočim primarnim ključem?
Poznáte ReplicatedQueue? Máte s ňou skúsenosti?