Milliseid täiendavaid DDL/CREATE TABLE parameetreid ClickHouse'is teate, millele need mõjuvad ja millal neid kasutatakse?
Data Engineer
Kuidas jaotada selle vitriini andmed ebavõrdselt kolmele shardile: 50% esimesel ja 25% teistel kahel?
Kuidas loodi tabelid klastris ja kuidas lahendati probleem, kui ZooKeeperi tõttu puudus replika ühel shardil?
Kuidas lahendasite optimeerimisprobleeme, kui päring kestab kaua ja teostab täieliku skannimise? Kuidas läheneksite sellisele uuele ülesandele?
Kuidas täpselt te lugesite Parquet'i?
Millistel juhtudel võib ClickHouse'i Materialized View andmeid vahele jätta või vastupidi, duplitseerida?
Kas teiega on kunagi juhtunud ClickHouse `Too many parts` viga sisestamisel? Kuidas te selle lahendasite?
Milliste Python'i teekondadega olete töötanud?
Rääkige meile rohkem andmete kallutatusest shardide vahel: kuidas seda määratleti ja kuidas kasutati vastavat funktsiooni/mekhanismi?
Kas teadsite UDF-dest (Kasutaja määratletud funktsioonidest) ClickHouse'is, kas olete nendega töötanud?
Kuidas te parandasite andmete kallutat client_id järgi, kui üks klient oli oluliselt suurem kui teised? Millised on võimalused?
Milliste Distributed mootori parameetritega olete ClickHouse'is tuttav?
Kuidas teeksite Materialized View ahelaga läbi vahepealse ReplacingMergeTree tabeli, et õigesti täita juba olemasolevad andmed enne uue MV käivitamist?
Millistel väljadelt toimus andmete ühendamine ja kuidas eemaldati duplikaadid vitriinist?
Millise Airflow versiooniga te töötasite?
Kuidas korraldada andmete laadimine ClickHouse'i suure PostgreSQL-tabeli puhul, kuhu pidevalt tulevad uued kirjed monotoniliselt kasvava primaarvõtmega?
Kas teate ReplicatedQueue'ist? Kas teil on selle kasutamise kogemust?