Bir nechta REST API-dan skalalashgan ma'lumotlarni yuklashni qanday loyihalashtirasiz: ma'lumotlarni olishdan S3 ga, analitik uchun interfeys bilan?
Data Engineer
Protseduraviy SQL nima?
O'zingiz va ma'lumot muhandisligi bo'yicha tajribangiz haqida gapiring.
101 obyekt bor: 100 nol va 1 bir. Ballariga qarab tartiblanganidan so'ng, avval 50 nol, keyin bir, keyin yana 50 nol. ROC AUC va ROC egri shakli qanday?
Indekslarning egallagan joyidan tashqari qanday kamchiliklari bor?
Gradient boostingda, allaqachon N ta asosiy algoritmdan iborat kompozitsiya qurilgan. Yangi, N+1-chi algoritm uchun maqsad nima bo'ladi?
Nima uchun lazy baholashlar foydalidir?
Sparkda ma'lumotlar spill nima va resurslarni oddiygina qo'shish mumkin bo'lmasa, uni qanday oldini olish mumkin?
Yuqori yukli ma'lumotlarni transformatsiyalarini qanday boshqarasiz?
Spark-ning ishga tushirish modlari qanday farq qiladi: cluster, client va local?
API yuklovchi-ni maxsus Airflow operatori/hook sifatida amalga oshirishning afzalliklari va kamchiliklari nimalardan iborat, alohida kutubxona yoki konteyner xizmati bilan taqqoslaganda?
2. Mijozlarning kundalik tranzaktsiyalarining summasini ko'rsatuvchi t jadvali mavjud: - Har bir satr uchun mijozning joriy va oldingi kalendar kuni tranzaktsiyalarini ko'rsatadigan so'rov yozing Oxirgi jadval quyida:
Lazımi baholashlar nima va ularni qanday tushunish mumkin?
Airflowda qanday odatiy vazifalarni hal qildingiz?
Sana, buyurtma raqami, summa select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3
Yulduz modeli va Data Vault nima?
O'zingiz haqingizda gapiring: so'nggi ish joyingiz qayerda, nima bilan shug'ullandingiz, nima qidiryapsiz va nima uchun?
Cluster mode-da Driver va Executors qayerda joylashgan va nima uchun ishlab chiqarishda ishlatiladi?
Gradient boosting algoritmida, asosiy algoritm oddiy qaror darağı bo'lsa, gradient qayerda yuzaga keladi?
Greenplum va Hadoop HDFS qaysi komponentlardan iborat?