Data Engineer
`s ** 2` ni `s = [1, 2, 3]` ro'yxatiga qo'llash natijasida nima bo'ladi?
ETL va ELT yondashuvlarini solishtiring: farqi nima va qachon har biri qo'llaniladi?
Ma'lumotlarni tarqatishning qanday strategiyalari mavjud?
Relatsiyali ma'lumotlar bazasida so'rovning sekin ishlashining odatiy sabablari nima?
O'zingiz haqingizda gapiring: nima bilan shug'ullandingiz, qanday texnologiya to'plamini ishlatdingiz va bu qanday loyiha edi?
Ma'lumotlar vitrinasi nima?
Data Vault mavjud emas deb hisoblaylik va ikkita keng jadvallarni birlashtirish kerak. Buni Greenplumda qanday optimallashtirasiz? Agar bu ClickHouseda bo'lsa?
So'rovda joindan oldin filtratsiyani qanday amalga oshirasiz?
Siz Moskudanmisiz? Bu yerda uzoq vaqt yashayapsizmi? Nima uchun Moskuga ko‘chib keldingiz?
Broadcast mexanizmi qanday fizik tarzda amalga oshadi — kichik jadvalning bo'linmalari katta jadval bilan ishlovchi executor'lar bilan qanday bog'lanadi?
Nima uchun ORC o'rniga Parquet ishlatildi?
Ma'lumotlar muvofiqligidagi xavf-xatarlarga ishlash va ma'lumotlar uchun javobgarlik qanday hal qilinadi?
DAG muvaffaqiyatsizlikdan so'ng uni qayta ishga tushirganda, S3 dagi ma'lumotlarni to'liq bo'lmagan ma'lumotlar bilan yozib qo'ymaslik uchun fayllar bilan qanday ishladingiz?
Agar bir nechta taklif bo'lsa, tanlash uchun eng muhim 3 mezon.
"O'lik to'plam" (dead tuple) nima?
Spark JDBC nima va uni orqali katta jadvalni samarali qanday yuklash mumkin?
Oyna funksiyasi SUM() OVER (PARTITION BY user_id) — bir holatda xarid qilish sanasiga ORDER BY qo'shamiz, boshqasida qo'shmaymiz. Farqi nima?
Sizning dbt modellaringiz qanday tuzilgan va Trino orqali bir nechta manbadan vitrinani qanday yig'aysiz?
Siz uchun biznes vazifalari va infratuzilma vazifalari o'rtasidagi ideal nisbat nima?
Parquet qanday saqlash turi: satr yoki ustun?