Jaké další parametry DDL/CREATE TABLE v ClickHouse znáte, na co ovlivňují a v jakých případech se používají?
Data Engineer
Jak nerovnoměrně rozdělit data této vitríny na tři shardy: 50 % na prvním a po 25 % na ostatních dvou?
Jak byly tabulky vytvořeny v clusteru a jak byl řešen problém, když kvůli ZooKeeper chyběla replika na shard?
Jak jste řešili problémy s optimalizací, když dotaz trvá dlouho a provádí úplný sken? Jak byste přistoupili k takové nové úloze?
Jak přesně jste četli Parquet?
V jakých případech může Materialized View v ClickHouse vynechat data nebo je naopak zdvojit?
Setkali jste se s chybou ClickHouse `Too many parts` při vkládání? Jak jste ji řešili?
S jakými knihovnami Python jste pracoval?
Povězte nám více o zkreslení dat mezi shardami: jak bylo určeno a jaký mechanismus/funkce byl použit?
Znáte UDF (uživatelsky definované funkce) v ClickHouse, pracovali jste s nimi?
Jak jste opravili zkreslení dat podle client_id, když byl jeden klient výrazně větší než ostatní? Jaké jsou možnosti?
S jakými parametry motoru Distributed v ClickHouse jste obeznámen?
Jak byste postupovali s řetězcem Materialized View přes mezilehlou tabulku ReplacingMergeTree, aby bylo možné správně naplnit již existující data před spuštěním nové MV?
S jakou verzí Airflow jste pracoval?
Na jakých polích došlo ke sloučení dat a jak se v přehledu zbavovali duplicit?
Jak zorganizovat načítání dat do ClickHouse ve velké tabulce PostgreSQL, do které neustále přicházejí nové záznamy s monotonně rostoucím primárním klíčem?
Znáte ReplicatedQueue? Měli jste s ní zkušenosti?