Sobes.tech

Data Engineer

Ce parametri suplimentari DDL/CREATE TABLE în ClickHouse cunoști, la ce influențează și în ce cazuri sunt utilizate?

206

Cum se implementează distribuirea inegală a datelor în vitrină: 50% pe primul și câte 25% pe celelalte două?

191

Cum au fost create tabelele în cluster și cum a fost rezolvată problema atunci când, din cauza ZooKeeper, lipsea o replică pe un shard?

189

Cum ați rezolvat problemele de optimizare atunci când interogarea durează mult și efectuează o scanare completă? Cum ați aborda o astfel de sarcină nouă?

181

În ce cazuri o Vizualizare Materializată în ClickHouse poate omite date sau, dimpotrivă, le poate duplica?

169

V-ați confruntat vreodată cu eroarea ClickHouse `Too many parts` la inserare? Cum ați rezolvat-o?

165

Povestiți-ne mai multe despre dezechilibrul datelor între sharding-uri: cum a fost determinat și cum a fost utilizată funcția/mecanismul corespunzător?

160

Ești familiar cu UDF (Funcții definite de utilizator) în ClickHouse, ai lucrat cu ele?

141

Cum ați corectat biasul datelor pe client_id atunci când un client era semnificativ mai mare decât ceilalți? Care sunt opțiunile?

138

Cu ce parametri ai motorului Distributed în ClickHouse?

134

Cum ai proceda cu lanțul Materialized View printr-o tabelă intermediară ReplacingMergeTree pentru a popula corect datele deja existente înainte de lansarea noii MV?

131

Pe ce câmpuri a avut loc unirea datelor și cum au fost eliminate duplicatele din vitrină?

128

Cum se organizează încărcarea datelor în ClickHouse într-un tabel mare PostgreSQL, în care apar constant noi înregistrări cu o cheie primară monoton crescătoare?

124

Cunoașteți ReplicatedQueue? Aveți experiență de lucru cu ea?

117