Cum folosiți Python în munca dvs. și unde vă simțiți mai încrezător: în Python sau în SQL?
Data Engineer
Există 101 obiect: 100 obiecte de clasa 0 și 1 obiect de clasa 1. Primul model atribuie același scor tuturor obiectelor. Care sunt ROC AUC-ul și forma curbei ROC?
Cum se testează o serie temporală pentru staționaritate?
Dat fiind o interogare SQL scrisă de un analist. Identificați ineficiențele din interogare și sugerați cum să le evitați. Interogarea unește două tabele: - tabelul de fapte 'events' cu cheia 'event_id' - tabelul de referință al sursei de trafic cu cheia 'referer_str' Ambele tabele conțin miliarde de înregistrări. select * from (select distinct e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name, row_number() over(partition by e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name) as rnk from events e left join traffic_source s on e.referer_str = s.referer_str where e.event_date = current_date() - 1 group by 1,2,3,4,5,6,7) t where rnk = 1
Există un țintă continuă nenegativă și patru algoritmi: regresie liniară, arbore de decizie, pădure aleatorie și boosting pe arbori. Care dintre acestea pot produce predicții negative?
Datele au fost încărcate într-un tabel ReplacingMergeTree; ce se va întâmpla în timpul citirii dacă fuziunea nu a avut încă loc și cum se obține cea mai recentă versiune a înregistrărilor?
Ce este denormalizarea?
Este posibil să combinați deduplicarea și spill-ul de date ulterioare fără a folosi tabele separate; și dacă da, cum?
Ce este testarea ipotezelor? Care sunt erorile de tip I și de tip II și valoarea p?
Ce structuri de index și cum funcționează?
Ce metode cunoști pentru a accelera executarea sarcinilor în PostgreSQL?
Ce este o serie temporală staționară și de ce este importantă staționaritatea pentru modelele clasice?
Ce este bagging-ul și boosting-ul, și în ce se deosebesc?
Care sunt caracteristicile utilizării JOIN la construirea de vitrine în PostgreSQL/Greenplum comparativ cu ClickHouse?
Ești familiar cu modelarea uplift? Ce știi despre ea?
Cum să previi creșterea tabelului dacă stocarea datelor este limitată în timp, de exemplu doi ani?
Ce este ROC AUC?
Este necesar să verificați dacă în tabel există clienți cu mai multe emailuri. Dacă da, ștergeți-i (păstrați doar ultima înregistrare după create_date).
Ce este un watermark în Spark Structured Streaming?
Ce este normalizarea și când se aplică?