DAG tapşırıqları üçün adətən hansı əsas parametrləri təyin edirik və niyə qrafik məhz belə olmalıdır (DAG-in yuxarı səviyyəli məntiqi)?
Machine Learning / AI
Spark ilə işlədinizmi? Bu nə olduğunu ümumi şəkildə necə başa düşürsünüz?
Sinif balansızlığı zamanı metriklərdən danışarkən — hansıları münasibdir və hansıları deyil?
Hərflər və rəqəmlər ehtiva edən bir sətir verilir. Sətirdə rast gəlinən ən böyük rəqəmi tapın (ardıcıl rəqəmləri tək bir rəqəm kimi nəzərə alın).
Python-da sətirlərin birləşdirilməsi zamanı nə baş verir (məsələn, current += char)? Niyə bu yanaşma bu tapşırıqda pis ola bilər və kodu necə optimallaşdırmaq olar, tez-tez sətir birləşdirmədən?
İşdə və ya məktəbdə təsadüfi meşə ilə rastlaşdınızmı? Təsadüfi meşə və boosting arasındakı əsas fərqlər nədir?
JOIN istifadə etmədən eyni klik axtarış problemini necə həll edərdiniz?
Airflow və ya Spark ilə işlədinizmi? Airflow-da DAG nədir, izah edə bilərsinizmi, təcrübənizdən nümunə verə bilərsinizmi? Siz DAG-ləri özünüz yazdınızmı yoxsa sadəcə istifadə etdiniz/işə saldınızmı?
Sinif balansızlığı zamanı dəqiqlik niyə qeyri-münasib keyfiyyət dəyərini göstərir?
Müddətli ardıcıllıqlarla işləmə təcrübəniz varmı? Müddətli ardıcıllıqların proqnozlaşdırma modellərinin keyfiyyətini qiymətləndirmək üçün hansı metriklər istifadə olunur?
100 sikkə var, onlardan biri saxtadır — hər iki tərəfdə iki qartal var. Təsadüfi olaraq bir sikkə seçirik, onu atırıq və qartal çıxır. Sikkənin saxta olma ehtimalı nədir? Həllini Bayes formulundan istifadə edərək izah edin.
İstifadəçilərin hadisələri (user_id, item_id, action_type, timestamp) ilə logs cədvəli verilir. Hər istifadəçi üçün ən son kliklədiyi məhsulun ID-sini tapmaq üçün SQL sorğusu yazın.
Əgər model üçün optimal ağac sayı 500-dürsə, amma təsadüfən həm təsadüfi meşə, həm də boosting 1000 ağac ilə öyrədilibsə, hansı model daha çox overfitt olacaq və niyə?
Spark-də vəzifə niyə ilişib qala və çox uzun çəkə bilər?