Welke aanvullende parameters van DDL/CREATE TABLE in ClickHouse ken je, waarop ze invloed hebben en in welke gevallen worden ze gebruikt?
Data Engineer
Hoe implementeer je een ongelijke verdeling van gegevens in de vitrine: 50% op de eerste en 25% op de andere twee?
Hoe zijn de tabellen in de cluster gemaakt en hoe is het probleem opgelost toen er vanwege ZooKeeper een replica ontbrak op een shard?
Hoe hebt u optimalisatieproblemen opgelost wanneer een query lang duurt en een volledige scan uitvoert? Hoe zou u een nieuwe dergelijke taak aanpakken?
Hoe las je precies Parquet?
In welke gevallen kan een Gematerialiseerde Weergave in ClickHouse gegevens missen of juist dupliceren?
Bent u ooit de fout `Too many parts` van ClickHouse tegengekomen bij het invoegen? Hoe hebt u het opgelost?
Met welke Python-bibliotheken hebt u gewerkt?
Vertel meer over de dataverschuiving tussen de shards: hoe werd het bepaald en hoe werd de bijbehorende functie/mechanisme gebruikt?
Bent u bekend met UDF (User Defined Functions) in ClickHouse, hebt u er mee gewerkt?
Hoe heb je de dataverschuiving op basis van client_id gecorrigeerd wanneer één klant aanzienlijk groter was dan de anderen? Welke opties zijn er?
Met welke parameters van de Distributed-motor in ClickHouse bent u vertrouwd?
Hoe zou je de Materialized View-keten via een tussenliggende ReplacingMergeTree-tabel aanpakken om correct de gegevens te vullen die al bestonden vóór het lanceren van de nieuwe MV?
Op welke velden vond de gegevenssamenvoeging plaats en hoe werden duplicaten in de vitrine verwijderd?
Met welke versie van Airflow hebt u gewerkt?
Hoe organiseer je het laden van gegevens in ClickHouse in een grote PostgreSQL-tabel, waarin voortdurend nieuwe records met een monotoon groeiende primaire sleutel binnenkomen?
Bent u bekend met ReplicatedQueue? Heeft u ervaring met het werken ermee?