Jak ve své práci používáte Python a v čem se cítíte jistější: v Pythonu nebo v SQL?
Data Engineer
Existuje 101 objekt: 100 objektů třídy 0 a 1 objekt třídy 1. První model dává všem objektům stejný skóre. Jaké jsou jeho ROC AUC a tvar ROC křivky?
Jak otestovat časovou řadu na stacionárnost?
Pokud je vám předložen SQL dotaz napsaný analytikem. Identifikujte neefektivity v dotazu a navrhněte, jak se jim vyhnout. Dotaz spojuje dvě tabulky: - fakt tabulka 'events' s klíčem 'event_id' - referenční tabulka zdroje provozu s klíčem 'referer_str' Obě tabulky obsahují miliardy záznamů. select * from (select distinct e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name, row_number() over(partition by e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name) as rnk from events e left join traffic_source s on e.referer_str = s.referer_str where e.event_date = current_date() - 1 group by 1,2,3,4,5,6,7) t where rnk = 1
Existuje nenegativní spojitý cíl a čtyři algoritmy: lineární regrese, rozhodovací strom, náhodný les a gradientový boosting na stromech. Které z nich mohou vydávat záporné předpovědi?
Data byla načtena do tabulky ReplacingMergeTree; co se stane při čtení, pokud se merge ještě neprovedl, a jak získat nejnovější verzi záznamů?
Co je denormalizace?
Je možné kombinovat deduplikaci a následný spill dat bez použití samostatných tabulek; a pokud ano, jak?
Co je testování hypotéz? Jaké jsou chyby typu I a typu II a p-hodnota?
Jaké jsou struktury indexů a jak fungují?
Jaké způsoby znáte, jak urychlit vykonávání úkolů v PostgreSQL?
Co je stacionární časová řada a proč je stacionárnost důležitá pro klasické modely?
Co je bagging a boosting, a v čem se liší?
Jaké jsou vlastnosti použití JOIN při vytváření vitrin v PostgreSQL/Greenplum ve srovnání s ClickHouse?
Seznámil jste se s uplift modelem? Mit o něm víte?
Jak zabránit růstu tabulky, pokud je ukládání dat omezeno časově, například dvěma lety?
Co je ROC AUC?
Je třeba zkontrolovat, zda v tabulce jsou zákazníci s více emaily. Pokud ano, odstraňte je (ponechte pouze poslední záznam podle create_date).
Co je to watermark v Spark Structured Streaming?
Co je normalizace a kdy se používá?