Ishingizda Python-dan qanday foydalanasiz va qaysi sohada o'zingizni ko'proq ishonchli his qilasiz: Python yoki SQL?
Data Engineer
101 объект бар: 100 объекти 0-синф ва 1 объект 1-синф. Биринчи модел барча объектларга бирдей балл қўяди. Унинг ROC AUC ва ROC қисмининг шакли қандай?
Vaqt seriyasini stasionarlikka tekshirish uchun qanday?
Bir tahlilchi tomonidan yozilgan SQL so'rov berilgan. So'rovdagi noeffektivliklarni aniqlang va ularni qanday oldini olish mumkinligini taklif qiling. So'rov ikki jadvalni birlashtiradi: - 'events' fakt jadvali, kalit 'event_id' - trafik manbai referensiya jadvali, kalit 'referer_str' Ikkala jadvalda milliardlab yozuvlar mavjud. select * from (select distinct e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name, row_number() over(partition by e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name) as rnk from events e left join traffic_source s on e.referer_str = s.referer_str where e.event_date = current_date() - 1 group by 1,2,3,4,5,6,7) t where rnk = 1
Negaativ bo'lmagan uzluksiz maqsad va to'rtta algoritm mavjud: chiziqli regressiya, qaror darağı, tasodifiy o'rmon va daraxtlar ustida gradient boosting. Ularning qaysilari salbiy prognozlar chiqarishi mumkin?
Ma'lumotlar ReplacingMergeTree jadvaliga yuklandi; agar merge hali amalga oshmagan bo'lsa, o'qish davomida nima bo'ladi va yozuvlarning eng so'nggi versiyasini qanday olish mumkin?
Denormalizatsiya nima?
Deduplikatsiya va keyingi ma'lumotlar spillini alohida jadvallarni ishlatmasdan birlashtirish mumkinmi; va agar mumkin bo'lsa, qanday?
Hipoteza tekshiruvi nima? Tip I va Tip II xatolar va p-qiymat nima?
Indeks tuzilmalari va ular qanday ishlaydi?
PostgreSQLda vazifalarni bajarish tezligini oshirish uchun qanday usullarni bilasiz?
Stasionar vaqt seriyasi nima va nima uchun stasionarlik klassik modellarda muhim?
Bagging va boosting nima va ular qanday farq qiladi?
PostgreSQL/Greenplumda vitrinlar qurishda JOIN foydalanishining ClickHouse bilan taqqoslaganda qanday xususiyatlari bor?
Uplift modeling bilan tanishmisiz? Bu haqda nima bilasiz?
Ma'lumotlarni saqlash vaqti cheklangan bo'lsa, masalan, ikki yil, jadvalning o'sishini qanday oldini olish mumkin?
ROC AUC nima?
Jadvalda bir nechta emailga ega mijozlar borligini tekshirish kerak. Agar bo'lsa, ularni o'chiring (faqat create_date bo'yicha oxirgi yozuvni qoldiring).
Spark Structured Streaming'da watermark nima?
Normallashtirish nima va qachon qo'llaniladi?