Kokius papildomus DDL/CREATE TABLE parametrus žinote ClickHouse, į ką jie daro įtaką ir kokiais atvejais jie naudojami?
Data Engineer
Kaip ne tolygiai paskirstyti šios vitrinės duomenis į tris shard'us: 50% pirmame ir po 25% kituose dviejuose?
Kaip buvo sukurtos lentelės klasteryje ir kaip išsprendėte problemą, kai dėl ZooKeeper trūko replikos viename shard'e?
Kaip sprendėte optimizavimo problemas, kai užklausa trunka ilgai ir atlieka pilną nuskaitymą? Kaip prieitumėte prie tokio naujo uždavinio?
Kaip tiksliai skaitėte Parquet?
Kokiais atvejais Materialized View ClickHouse gali praleisti duomenis arba, priešingai, juos dubliuoti?
Ar kada nors susidūrėte su klaida ClickHouse `Too many parts` įterpiant? Kaip ją sprendėte?
Su kokiomis Python bibliotekomis dirbote?
Pasakykite daugiau apie duomenų iškraipymą tarp shardų: kaip jis buvo nustatytas ir kaip buvo naudojama atitinkama funkcija/mekanizmas?
Ar esate susipažinęs su UDF (Naudotojo apibrėžtos funkcijos) ClickHouse, ar dirbote su jomis?
Kaip ištaisėte duomenų iškraipymą pagal client_id, kai vienas klientas buvo žymiai didesnis už kitus? Kokios yra galimybės?
Su kuriais Distributed variklio parametrais esate susipažinęs ClickHouse?
Kaip elgtumėtės su Materialized View grandine per tarpinę ReplacingMergeTree lentelę, kad teisingai užpildytumėte jau egzistuojančius duomenis prieš pradedant naują MV?
Kuriuose laukuose įvyko duomenų sujungimas ir kaip buvo pašalinti dubliuojami elementai iš vitrinų?
Su kuria Airflow versija dirbote?
Kaip organizuoti duomenų įkėlimą į ClickHouse didelėje PostgreSQL lentelėje, kur nuolat ateina nauji įrašai su monotoniniu augančiu pirminiu raktu?
Ar pažįstate ReplicatedQueue? Ar turite patirties dirbant su ja?