Sobes.tech

Data Engineer

Welche zusätzlichen Parameter für DDL/CREATE TABLE in ClickHouse kennen Sie, worauf sie sich auswirken und in welchen Fällen sie verwendet werden?

206

Wie verteilt man die Daten dieser Vitrine ungleichmäßig auf drei Shards: 50 % auf dem ersten und jeweils 25 % auf die anderen beiden?

191

Wie wurden die Tabellen im Cluster erstellt und wie wurde das Problem gelöst, wenn aufgrund von ZooKeeper eine Replik auf einem Shard fehlte?

189

Wie haben Sie Optimierungsprobleme gelöst, wenn eine Abfrage lange dauert und einen Vollscan durchführt? Wie würden Sie an eine neue solche Aufgabe herangehen?

181

In welchen Fällen kann eine materialisierte Ansicht in ClickHouse Daten überspringen oder sie doppeln?

169

Haben Sie beim Einfügen den Fehler ClickHouse `Too many parts` erlebt? Wie haben Sie ihn gelöst?

165

Mit welchen Python-Bibliotheken haben Sie gearbeitet?

163

Erzählen Sie mehr über die Datenverschiebung zwischen den Shards: Wie wurde sie bestimmt und wie wurde die entsprechende Funktion/Mechanismus verwendet?

160

Sind Sie mit UDF (Benutzerdefinierte Funktionen) in ClickHouse vertraut, haben Sie damit gearbeitet?

141

Wie haben Sie den Datenbias bei client_id korrigiert, wenn ein Kunde deutlich größer war als die anderen? Welche Optionen gibt es?

138

Mit welchen Parametern des Distributed-Motors in ClickHouse sind Sie vertraut?

134

Wie würdest du mit der Kette der Materialized View über eine Zwischenablage ReplacingMergeTree-Tabelle vorgehen, um die bereits vor dem Start der neuen MV vorhandenen Daten korrekt zu füllen?

131

Mit welcher Version von Airflow haben Sie gearbeitet?

129

Nach welchen Feldern wurde die Datenzusammenführung durchgeführt und wie wurden Duplikate im Store entfernt?

128

Wie organisiert man das Laden von Daten in ClickHouse bei einer großen PostgreSQL-Tabelle, in die ständig neue Einträge mit einem monoton wachsendem Primärschlüssel kommen?

124

Kennen Sie ReplicatedQueue? Haben Sie Erfahrung im Umgang damit?

117