DAG vazifalar uchun odatda qanday asosiy parametrlarni belgilaymiz va nima uchun grafik aynan shunday bo'lishi kerak (DAG ning yuqori darajadagi mantiqi)?
Machine Learning / AI
Spark bilan ishlagansizmi? Bu nima ekanligi haqida umumiy tasavvuringiz nima?
Sinflar muvozanatsizligi haqida gapirganda, qaysi metriklar mos keladi va qaysilari emas?
Harflar va raqamlar mavjud bo'lgan satr berilgan. Satrda uchraydigan eng katta raqamni toping (ketma-ket raqamlarni yagona raqam sifatida hisoblang).
Python'da satrlarni birlashtirishda nima bo'ladi (masalan, current += char)? Nima uchun bu yondashuv bu vazifada yomon bo'lishi mumkin va kodni qanday optimallashtirish mumkin, tez-tez satrlarni birlashtirmasdan?
Ish joyingizda yoki maktabda tasodifiy o'rmon bilan ishladingizmi? Tasodifiy o'rmon va boosting o'rtasidagi asosiy farqlar nima?
JOIN ishlatmasdan oxirgi bosishni qidirish muammosini qanday hal qilasiz?
Airflow yoki Spark bilan ishladingizmi? Airflow'da DAG nima, deb ayta olasizmi, o'z tajribangizdan misol keltira olasizmi? Siz DAGlarni yozgansizmi yoki faqat foydalanib/ishga tushirdingizmi?
Nima uchun sinflar muvozanatsizligida aniqlik sifat qiymatini noto'g'ri ko'rsatadi?
Vaqt ketma-ketliklari bilan ishlash tajribangiz bormi? Vaqt ketma-ketliklari prognoz qilish modellari sifatini baholash uchun qanday metrikalar ishlatiladi?
Foydalanuvchilarning voqealari (user_id, item_id, action_type, timestamp) bilan logs jadvali berilgan. Har bir foydalanuvchi uchun u bosgan oxirgi mahsulotning ID sini topish uchun SQL so'rovini yozing.
100 taqsimda, ularning biri soxta — ikkala tomonida ham qarg'a bilan. Tasodifiy bir taqsimni tanlaymiz, uni tashlaymiz va qarg'a chiqadi. Taqsim soxta bo'lish ehtimoli qanday? YeChimni bayes formulasi yordamida tushuntiring.
Agar model uchun optimal daraxtlar soni 500 bo'lsa, lekin biz tasodifan tasodifiy o'rmon va boostingni 1000 daraxt bilan o'rgatsak, qaysi model ehtimolroq ortiqcha o'qitilgan bo'ladi va nima uchun?
Nima uchun Sparkda vazifa to'xtab qolishi va juda uzoq davom etishi mumkin?