Co zwykle robisz po przygotowaniu SQL dla modelu DBT?
Data Analyst
Zadanie SQL: oblicz konwersję według grup eksperymentów (exp_id=90) od zdarzenia Epic Match Start do Epic Fight Win według użytkowników, z poprawną atrybucją zdarzeń do eksperymentu przez join po czasie.
Zadanie w Pythonie: zbudować sesje użytkowników na podstawie zdarzeń (przerwa > 30 minut = nowa sesja) i obliczyć dzienne agregaty.
Opowiedz o indeksach w ClickHouse.
Czym jest semi-join i anti-join? Do czego służą i gdzie je stosować?
ORDER BY i PRIMARY KEY w ClickHouse — jaka jest różnica, dlaczego są oddzielone?
Podaj przykład, kiedy sam zainicjowałeś zmiany w DWH, pipeline lub modelu danych.
Mamy ClickHouse i w nim zapytanie DBT, które jest regularnie uruchamiane, ale działa długo. Jakie mogą być przyczyny i jak podszedłbyś do optymalizacji?
Jak decydujesz, jakie testy napisać dla modelu DBT? Czy potrzebne są alerty?
Opowiedz o podejściach do budowy DWH: Data Vault 2.0 vs schemat śnieżynki/gwiazdy — główne encje, zalety i wady.