Какви допълнителни параметри на DDL/CREATE TABLE в ClickHouse знаете, на какво влияят и в кои случаи се използват?
Data Engineer
Как бяха създадени таблиците в клъстера и как решихте проблема, когато поради ZooKeeper липсваше реплика на шард?
Как да реализираме неравномерното разпределение на данните във витрината: 50% на първата и по 25% на останалите две?
Как точно четяхте Parquet?
Как решавахте проблемите с оптимизацията, когато заявката работи дълго и извършва пълно сканиране? Как бихте подходили към такава нова задача?
В кои случаи Materialized View в ClickHouse може да пропусне данни или, напротив, да ги дублира?
Сблъсквали ли сте се с грешката ClickHouse `Too many parts` при вмъкване? Как я решихте?
С кои библиотеки на Python сте работили?
Разкажете повече за изкривяването на данните между шардовете: как беше определено и каква функция/механизъм беше използван?
Запознат ли сте с UDF (Потребителски дефинирани функции) в ClickHouse, работили ли сте с тях?
Как поправихте изкривяването на данните по client_id, когато един клиент беше значително по-голям от останалите? Какви са вариантите?
С какви параметри на двигателя Distributed в ClickHouse сте запознати?
Как бихте постъпили с веригата Materialized View чрез междинна таблица ReplacingMergeTree, за да попълните правилно данните, които вече съществуват преди стартирането на новата MV?
С коя версия на Airflow работихте?
На кои полета се случи обединяването на данните и как се премахваха дублиращите се записи във витрината?
Как да организираме зареждането на данни в ClickHouse в голяма таблица PostgreSQL, в която постоянно постъпват нови записи с монотонно растящ първичен ключ?
Познат ли ви е ReplicatedQueue? Имали ли сте опит с нея?