Welche zusätzlichen Parameter für DDL/CREATE TABLE in ClickHouse kennen Sie, worauf sie sich auswirken und in welchen Fällen sie verwendet werden?
Data Engineer
Wie verteilt man die Daten dieser Vitrine ungleichmäßig auf drei Shards: 50 % auf dem ersten und jeweils 25 % auf die anderen beiden?
Wie wurden die Tabellen im Cluster erstellt und wie wurde das Problem gelöst, wenn aufgrund von ZooKeeper eine Replik auf einem Shard fehlte?
Wie haben Sie Optimierungsprobleme gelöst, wenn eine Abfrage lange dauert und einen Vollscan durchführt? Wie würden Sie an eine neue solche Aufgabe herangehen?
Wie genau haben Sie Parquet gelesen?
In welchen Fällen kann eine materialisierte Ansicht in ClickHouse Daten überspringen oder sie doppeln?
Haben Sie beim Einfügen den Fehler ClickHouse `Too many parts` erlebt? Wie haben Sie ihn gelöst?
Mit welchen Python-Bibliotheken haben Sie gearbeitet?
Erzählen Sie mehr über die Datenverschiebung zwischen den Shards: Wie wurde sie bestimmt und wie wurde die entsprechende Funktion/Mechanismus verwendet?
Sind Sie mit UDF (Benutzerdefinierte Funktionen) in ClickHouse vertraut, haben Sie damit gearbeitet?
Wie haben Sie den Datenbias bei client_id korrigiert, wenn ein Kunde deutlich größer war als die anderen? Welche Optionen gibt es?
Mit welchen Parametern des Distributed-Motors in ClickHouse sind Sie vertraut?
Wie würdest du mit der Kette der Materialized View über eine Zwischenablage ReplacingMergeTree-Tabelle vorgehen, um die bereits vor dem Start der neuen MV vorhandenen Daten korrekt zu füllen?
Mit welcher Version von Airflow haben Sie gearbeitet?
Nach welchen Feldern wurde die Datenzusammenführung durchgeführt und wie wurden Duplikate im Store entfernt?
Wie organisiert man das Laden von Daten in ClickHouse bei einer großen PostgreSQL-Tabelle, in die ständig neue Einträge mit einem monoton wachsendem Primärschlüssel kommen?
Kennen Sie ReplicatedQueue? Haben Sie Erfahrung im Umgang damit?