Ի՞նչ ես սովորաբար անում, երբ SQL-ը պատրաստ է՝ համար DBT մոդելի համար։
Data Analyst
SQL առաջադրանք՝ փորձի խմբերով փոխարկումը հաշվել (exp_id=90) Epic Match Start-ից մինչև Epic Fight Win՝ օգտագործելով օգտվողների տվյալներ, ճիշտ հղում տալով իրադարձություններին փորձին՝ ժամանակով միանալով։
Python-ի առաջադրանք՝ օգտագործողների սեսիաները կառուցել իրադարձությունների հիման վրա (դադար > 30 րոպե = նոր սեսիա) և հաշվարկել օրական հավաքականները։
Խոսեք ClickHouse-ի ինդեքսների մասին։
Ի՞նչ է semi-join և anti-join-ը: Ինչու են անհրաժեշտ և որտեղ կիրառվում են:
ORDER BY և PRIMARY KEY in ClickHouse — ինչն է տարբերությունը, ինչու են բաժանված?
Ներկայացրեք օրինակ, երբ դուք ինքներդ նախաձեռնեցիք փոփոխություններ DWH-ում, pipeline-ում կամ տվյալների մոդելում։
Մենք ունենք ClickHouse և դրա մեջ կա DBT հարցում, որը ռեգուլյար գործարկվում է, բայց երկար է աշխատում: Ի՞նչ կարող են լինել պատճառները և ինչպես կվերաբերվեիր օպտիմիզացմանը։
Ինչպե՞ս եք որոշում, թե ինչ թեստեր գրել DBT մոդելի համար: Անհրաժեշտ են արդյոք զգուշացումներ?
Պատմեք DWH կառուցելու մոտեցումների մասին՝ Data Vault 2.0 ընդդեմ ձյանուկ/աստղ — հիմնական տարրեր, առավելություններ և թերություններ։