Hogyan használod a Python-t a munkádban, és hol érzed magad magabiztosabbnak: Python vagy SQL?
Data Engineer
101 tárgy van: 100 tárgy osztály 0 és 1 tárgy osztály 1. Az első modell ugyanazt az értékelést adja minden tárgynak. Mi az ROC AUC értéke és az ROC görbe alakja?
Hogyan teszteljük egy idősor stacionaritását?
Egy elemző által írt SQL lekérdezés adott. Azonosítsa a lekérdezésben lévő hatékonysági problémákat, és javasolja, hogyan lehet ezeket elkerülni. A lekérdezés két táblát kapcsol össze: - 'events' tény tábla, kulcs 'event_id' - forrás referencia tábla, kulcs 'referer_str' Mindkét tábla milliárdnyi rekordot tartalmaz. select * from (select distinct e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name, row_number() over(partition by e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name) as rnk from events e left join traffic_source s on e.referer_str = s.referer_str where e.event_date = current_date() - 1 group by 1,2,3,4,5,6,7) t where rnk = 1
Nemnegatív folytonos cél és négy algoritmus van: lineáris regresszió, döntési fa, véletlen erdő és gradient boosting fákon. Melyikük képes negatív előrejelzéseket adni?
Adatok kerültek betöltésre egy ReplacingMergeTree táblába; mi fog történni olvasás közben, ha a merge még nem történt meg, és hogyan szerezhetjük meg a rekordok legfrissebb verzióját?
Mi a denormalizálás?
Lehetséges-e a deduplikáció és a későbbi adatspill kombinálása külön táblák használata nélkül; és ha igen, hogyan?
Mi az a hipotézis tesztelés? Milyen típusú hibák vannak, és mi a p-érték?
Milyen indexstruktúrák léteznek és hogyan működnek?
Milyen módszereket ismersz a PostgreSQL-ben a feladatok végrehajtásának gyorsítására?
Mi az a stacionáris idősor, és miért fontos a stacionaritás a klasszikus modellek számára?
Mi az a bagging és boosting, és miben különböznek?
Milyen jellemzői vannak a JOIN használatának a PostgreSQL/Greenplum adatvitrinek építésekor a ClickHouse-hoz képest?
Ismered az uplift modellezést? Mit tud róla?
Hogyan akadályozzuk meg a tábla növekedését, ha az adatok tárolása időben korlátozott, például két év?
Mi az a ROC AUC?
Ellenőrizni kell, hogy van-e több email címmel rendelkező ügyfél a táblában. Ha igen, törölje őket (csak a legutóbbi bejegyzést hagyja a create_date szerint).
Mi az a watermark a Spark Structured Streaming-ben?
Mi az a normalizálás, és mikor alkalmazzák?