Was machst du normalerweise, nachdem du das SQL für das DBT-Modell fertiggestellt hast?
Data Analyst
SQL-Aufgabe: Berechnung der Conversion nach Experimentgruppen (exp_id=90) vom Ereignis Epic Match Start bis Epic Fight Win pro Benutzer, mit korrekter Zuordnung der Ereignisse zum Experiment durch einen Join nach Zeit.
Python-Aufgabe: Benutzer-Sitzungen anhand von Ereignissen erstellen (Unterbrechung > 30 Minuten = neue Sitzung) und Tageszusammenfassungen berechnen.
Erzählen Sie von Indizes in ClickHouse.
Was ist ein Semi-Join und Anti-Join? Wozu dienen sie und wo werden sie angewendet?
Gib ein Beispiel, bei dem du selbst Änderungen im DWH, im Pipeline oder im Datenmodell initiiert hast.
ORDER BY und PRIMARY KEY in ClickHouse — was ist der Unterschied, warum sind sie getrennt?
Wir haben ClickHouse und darin eine DBT-Abfrage, die regelmäßig ausgeführt wird, aber lange dauert. Was könnten die Ursachen sein und wie würdest du an die Optimierung herangehen?
Wie entscheidest du, welche Tests für das DBT-Modell geschrieben werden sollen? Sind Alerts notwendig?
Erzählen Sie mir von Ansätzen zum Aufbau eines DWH: Data Vault 2.0 vs Schneeflocke/Sternschema — Hauptentitäten, Vorteile und Nachteile.