Ką dažniausiai darai po to, kai SQL yra paruoštas DBT modeliui?
Data Analyst
SQL užduotis: apskaičiuoti konversiją pagal eksperimentų grupes (exp_id=90) nuo įvykio Epic Match Start iki Epic Fight Win pagal vartotojus, su teisingu įvykių priskyrimu eksperimentui per laiko jungimą.
Python užduotis: naudotojų sesijų kūrimas pagal įvykius (pertrauka > 30 minučių = nauja sesija) ir dienos agregatų skaičiavimas.
Pasakokite apie indeksus ClickHouse.
Kas yra semi-join ir anti-join? Kam jie skirti ir kur juos taikyti?
ORDER BY ir PRIMARY KEY ClickHouse'e — koks yra skirtumas, kodėl jie atskirti?
Pateikite pavyzdį, kada pats inicijavai pakeitimus DWH, pipeline ar duomenų modelyje.
Turime ClickHouse ir jame yra DBT užklausa, kuri reguliariai vykdoma, bet užtrunka ilgai. Kokios galimos priežastys ir kaip prieitumėte prie optimizavimo?
Kaip nusprendžiate, kokius testus rašyti DBT modeliui? Ar reikalingi įspėjimai?
Papaskinkite apie DWH kūrimo būdus: Data Vault 2.0 vs snaigė/žvaigždė — pagrindinės esybės, privalumai ir trūkumai.