Ako v práci používate Python a v čom sa cítite istejšie: v Pythone alebo v SQL?
Data Engineer
Existuje 101 objekt: 100 objektov triedy 0 a 1 objekt triedy 1. Prvý model dáva všetkým objektom rovnaké skóre. Aké sú jeho ROC AUC a tvar ROC krivky?
Ako otestovať časový rad na stacionárnosť?
Аналитик написал SQL-запрос. Определите неэффективности в запросе и предложите, как их избежать. Запрос объединяет две таблицы: - таблица фактов 'events' с ключом 'event_id' - таблица ссылок источников трафика с ключом 'referer_str' Обе таблицы содержат миллиарды записей. select * from (select distinct e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name, row_number() over(partition by e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name) as rnk from events e left join traffic_source s on e.referer_str = s.referer_str where e.event_date = current_date() - 1 group by 1,2,3,4,5,6,7) t where rnk = 1
Existuje nenegatívny spojitý cieľ a štyri algoritmy: lineárna regresia, rozhodovací strom, náhodný les a gradientový boosting na stromoch. Ktoré z nich môžu produkovať záporné predpovede?
Dáta boli načítané do tabuľky ReplacingMergeTree; čo sa stane pri čítaní, ak ešte merge neprebehol, a ako získať najnovšiu verziu záznamov?
Čo je denormalizácia?
Je možné kombinovať deduplikáciu a následný spill dát bez použitia samostatných tabuliek; a ak áno, ako?
Čo je testovanie hypotéz? Aké sú chyby typu I a typu II a p-hodnota?
Aké sú štruktúry indexov a ako fungujú?
Aké spôsoby poznáte na zrýchlenie vykonávania úloh v PostgreSQL?
Čo je stacionárny časový rad a prečo je stacionárnosť dôležitá pre klasické modely?
Čo je bagging a boosting, a v čom sa líšia?
Aké sú vlastnosti použitia JOIN pri tvorbe vitrín v PostgreSQL/Greenplum v porovnaní s ClickHouse?
Ste oboznámený s uplift modelovaním? Čo o ňom viete?
Ako zabrániť rastu tabuľky, ak je ukladanie údajov časovo obmedzené, na príklad dva roky?
Čo je ROC AUC?
Je potrebné skontrolovať, či v tabuľke sú klienti s viacerými emailmi. Ak áno, odstráňte ich (zachovajte len posledný záznam podľa create_date).
Čo je watermark v Spark Structured Streaming?
Čo je normalizácia a kedy sa používa?