DAG тапсырмалары үшін әдетте қандай негізгі параметрлерді орнатамыз және граф неге дәл осылай құрылуы керек (жоғарғы деңгейдегі DAG логикасы)?
Machine Learning / AI
Spark-пен жұмыс істедіңіз бе? Оның не екенін жалпы қалай түсінесіз?
Әріптер мен цифрлар бар жол берілген. Жолда кездесетін ең үлкен санды табыңыз (біріктірілген цифрларды бір сан ретінде қарастырыңыз).
Класс теңгерімсіздігі кезінде метрикалар туралы айтқанда — қайсысы орынды, қайсысы емес?
Python-да жолдарды біріктіру кезінде (мысалы, current += char) не болады? Бұл тәсіл неге нашар болуы мүмкін, және жиі жолдарды біріктіруден қалай аулақ болуға болады?
Сіз жұмыс немесе оқуда кездестірдіңіз бе, кездейсоқ орманды? Кездейсоқ орман мен бустинг арасындағы негізгі айырмашылықтар қандай?
JOIN қолданбай, соңғы басу іздеу мәселесін қалай шешер едіңіз?
Airflow немесе Spark-пен жұмыс істедіңіз бе? Airflow-те DAG деген не екенін түсіндіріп берсеңіз, және өз тәжірибеңізден мысал келтіре аласыз ба? Сіз DAG-ларды өзіңіз жаздыңыз ба немесе тек қолдандыңыз ба/орындадыңыз ба?
Неге сыныптар теңгерімсіз болған кезде дәлдік сапаның жеткіліксіз көрсеткіші болып табылады?
Уақыттық қатарлармен жұмыс істедіңіз бе? Уақыттық қатарларды болжау модельдерінің сапасын бағалау үшін қандай метрикалар пайдаланылады?
Пайдаланушылардың оқиғалары бар logs кестесі берілген (user_id, item_id, action_type, timestamp). Әр пайдаланушы үшін ол соңғы рет басқан тауардың ID-ін табу үшін SQL сұрауын жазыңыз.
100 монета бар, оның біреуі жалған — екі жағында да қыран бейнеленген. Біз кездейсоқ монетаны таңдап, оны лақтыра отырып, қыран шықты. Жалған монета болу ықтималдығы қандай? Шешімді Байес формуласы бойынша жазыңыз.
Егер модель үшін ең оңтайлы ағаш саны 500 болса, бірақ біз кездейсоқ орман мен бустингті 1000 ағашпен кездейсоқ оқытсақ, қай модель көп бейімделуі мүмкін және неге?
Spark-те тапсырма неге тұрып қалуы мүмкін және өте ұзақ жұмыс істей ме?
Сіз бинарлық классификациямен жұмыс жасадыңыз ба? Мұндай тапсырмаларда сыныптардың теңсіздігіне тап болдыңыз ба, және оған не істеуге болады?