Ce parametri suplimentari DDL/CREATE TABLE în ClickHouse cunoști, la ce influențează și în ce cazuri sunt utilizate?
Data Engineer
Cum se implementează distribuirea inegală a datelor în vitrină: 50% pe primul și câte 25% pe celelalte două?
Cum au fost create tabelele în cluster și cum a fost rezolvată problema atunci când, din cauza ZooKeeper, lipsea o replică pe un shard?
Cum ați rezolvat problemele de optimizare atunci când interogarea durează mult și efectuează o scanare completă? Cum ați aborda o astfel de sarcină nouă?
Cum anume ai citit Parquet?
În ce cazuri o Vizualizare Materializată în ClickHouse poate omite date sau, dimpotrivă, le poate duplica?
V-ați confruntat vreodată cu eroarea ClickHouse `Too many parts` la inserare? Cum ați rezolvat-o?
Cu ce biblioteci Python ați lucrat?
Povestiți-ne mai multe despre dezechilibrul datelor între sharding-uri: cum a fost determinat și cum a fost utilizată funcția/mecanismul corespunzător?
Ești familiar cu UDF (Funcții definite de utilizator) în ClickHouse, ai lucrat cu ele?
Cum ați corectat biasul datelor pe client_id atunci când un client era semnificativ mai mare decât ceilalți? Care sunt opțiunile?
Cu ce parametri ai motorului Distributed în ClickHouse?
Cum ai proceda cu lanțul Materialized View printr-o tabelă intermediară ReplacingMergeTree pentru a popula corect datele deja existente înainte de lansarea noii MV?
Cu ce versiune de Airflow ați lucrat?
Pe ce câmpuri a avut loc unirea datelor și cum au fost eliminate duplicatele din vitrină?
Cum se organizează încărcarea datelor în ClickHouse într-un tabel mare PostgreSQL, în care apar constant noi înregistrări cu o cheie primară monoton crescătoare?
Cunoașteți ReplicatedQueue? Aveți experiență de lucru cu ea?