Биз адатта DAG тапшырмалары үчүн негизги параметрлерди кандай орнотобуз жана эмне үчүн график так ошондой болушу керек (DAG жогорку деңгээлдеги логика)?
Machine Learning / AI
Spark менен иштедиңби? Бул эмне экендиги жөнүндө жалпы ой-пикирлериң кандай?
Класстар арасындагы теңсиздик жөнүндө сүйлөгөндө кайсы метрикалар ылайыктуу, кайсылары эмес?
Белгилүү бир сапта тамгалар жана сандар бар. Сапта кездешкен эң чоң санды табыңыз (жеке сан катары карап).
Pythonда жолдорду бириктирүүдө эмне болот (мисалы, current += char)? Бул ыкма бул тапшырмада эмне үчүн жаман болушу мүмкүн жана кодду кантип оптималдаштырып, көптөгөн жолдорду бириктирүүдөн качса болот?
Эмне ишиңизде же мектепте кездешкен кездейсоқ орман барбы? Кездейсоқ орман менен бустингтин негизги айырмачылыктары эмне?
JOIN колдонбостон акыркы басууну издөө маселесин кантип чечмексиң?
Airflow же Spark менен иштедиңизби? Airflowдеги DAG эмне экенин айтып берсеңиз, өзүңүздүн тажрыйбаңыздан мисал келтире аласызбы? Сиз DAGтарды өзүңүз жаздыңызбы же гана колдонуп/иштетип жатасызбы?
Неге сыныптардын теңсиздигинде такыгычтык сапатынын мааниси туура эмес көрсөтүлөт?
Убакыттык катарлар менен иштөө тажрыйбасыңыз барбы? Убакыттык катарлардын болжоо моделдеринин сапатын баалоо үчүн кайсы метрикалар колдонулат?
Киргизилген logs таблицасы менен колдонуучулардын окуялары (user_id, item_id, action_type, timestamp). Ар бир колдонуучу үчүн акыркы баскан товардын ID-син табуу үчүн SQL суроо жазгыла.
100 монета бар, алардын бири жалган — эки тарапында да аюу бар. Биз кездейсөңүз бир монета тандайбыз, аны ыргытабыз жана аюу чыгат. Монета жалган болуу мүмкүнчүлүгү кандай? Чечимди Байес формуласы аркылуу түшүндүрүңүз.
Эгер модел үчүн оптималдуу дарак саны 500 болсо, бирок биз случайдуу токой жана boostingти 1000 дарак менен катаалдык менен үйрөтсөк, кайсы модел көбүрөөк overfitting кылышы мүмкүн жана эмнеге?
Spark'ta bir görev neden takılıp çok uzun sürebilir?