Data Engineer
Umumiy ravishda Spark bilan qancha ishladingiz va unga qanchalik chuqur sho'ng'idingiz?
Greenplum bilan ishlashda qanday muammolarga duch keldingiz?
Ma'lumotlar sifatining xavflari qanday?
Airflow'da depends_on_past parametri nima qiladi?
Yozuvlar hashlarini taqqoslash usuli manba va maqsad jadvali orasidagi farqni hisoblash uchun qoʻllanildimi?
`s ** 2` ni `s = [1, 2, 3]` ro'yxatiga qo'llash natijasida nima bo'ladi?
ETL va ELT yondashuvlarini solishtiring: farqi nima va qachon har biri qo'llaniladi?
Qaysi fayl formatlari bilan ishladingiz?
Qanday bo'lim turlari mavjud?
Spark'da spill haqida nima bilasiz?
Sparkda qanday fizik JOIN turlari mavjud?
Ma'lumotlar nima uchun yo'qolishi mumkin? Bir nechta sabablarni keltiring.
O'zingiz haqida gapiring: tajriba, vazifalar, xususiyatlar yoki g'ururlanadigan yutuqlar.
FastAPI bilan tajribangiz bormi?
Monoton ravishda o'sib borayotgan birlamchi kalit bilan doimiy ravishda yangi yozuvlar keladigan katta PostgreSQL jadvalida ClickHouse ga ma'lumotlarni qanday yuklashni tashkil qilish mumkin?
Qaysi Python kutubxonalar bilan ishladingiz?
Spark'da kechiktirilgan operatsiyalar nima va ular nima uchun kerak?
Qaysi holatda lug'at bo'yicha qidiruv eng yomon holatga tushishi mumkin?
ACID va CAP nazariyasi orasidagi farq nima?
1C bilan qanday ishlashdi: ma'lumotlarni to'g'ridan-to'g'ri ma'lumotlar bazasidan oladimi, yoki shina orqali yoki boshqa usul bilanmi?