Sobes.tech

Data Engineer

Jaké další parametry DDL/CREATE TABLE v ClickHouse znáte, na co ovlivňují a v jakých případech se používají?

204

Jak nerovnoměrně rozdělit data této vitríny na tři shardy: 50 % na prvním a po 25 % na ostatních dvou?

190

Jak byly tabulky vytvořeny v clusteru a jak byl řešen problém, když kvůli ZooKeeper chyběla replika na shard?

189

Jak jste řešili problémy s optimalizací, když dotaz trvá dlouho a provádí úplný sken? Jak byste přistoupili k takové nové úloze?

178

V jakých případech může Materialized View v ClickHouse vynechat data nebo je naopak zdvojit?

169

Setkali jste se s chybou ClickHouse `Too many parts` při vkládání? Jak jste ji řešili?

165

Povězte nám více o zkreslení dat mezi shardami: jak bylo určeno a jaký mechanismus/funkce byl použit?

160

Znáte UDF (uživatelsky definované funkce) v ClickHouse, pracovali jste s nimi?

141

Jak jste opravili zkreslení dat podle client_id, když byl jeden klient výrazně větší než ostatní? Jaké jsou možnosti?

138

S jakými parametry motoru Distributed v ClickHouse jste obeznámen?

134

Jak byste postupovali s řetězcem Materialized View přes mezilehlou tabulku ReplacingMergeTree, aby bylo možné správně naplnit již existující data před spuštěním nové MV?

131

Na jakých polích došlo ke sloučení dat a jak se v přehledu zbavovali duplicit?

126

Jak zorganizovat načítání dat do ClickHouse ve velké tabulce PostgreSQL, do které neustále přicházejí nové záznamy s monotonně rostoucím primárním klíčem?

124

Znáte ReplicatedQueue? Měli jste s ní zkušenosti?

114