Linux/Docker bilan qanchalik yaxshi tanishsiz?
Data Engineer
Spark'da shuffle nima va nima uchun kerak?
Sparkda shuffle qanday boshqariladi (bo'linish, broadcast join va boshqalar)?
Iceberg formati oddiy Parquet bilan solishtirganda nima olib keladi?
Umumiy jadval ifodalarini (CTE) bilasizmi? Foydalanish misolini keltiring.
Ma'lumotlar bazalari boshqaruv tizimlari va so'rovlarni optimallashtirish kontekstida statistikalar nima?
Linuxda log faylida ma'lum bir ustundagi kichik matnni qanday topish mumkin (masalan, uchinchi ustundagi sana)?
[ism] turli ma'lumotlar bazasi boshqaruv tizimlari bilan ishlash tajribasi, optimallashtirish va ichki tafsilotlarga qanchalik chuqur kirishganligi haqida gapirdi.
Manbadan inkrementni ushlash algoritmini batafsil tushuntiring, yuklash chastotasini o'zgartirganda hech narsa yo'qotilmasligi uchun.
"O'lik to'plam" (dead tuple) nima?
Iceberg'da ko'p bosqichli ETL (delete+insert) davomida o'qish jarayoni jadvalning oraliq (noto'g'ri) holatini ko'rishi mumkin bo'lsa, bu muammoni qanday hal qilish mumkin?
Kafka'dan bir xil xabarni bir nechta turli iste'molchilar tomonidan o'qishni qanday tashkil qilish mumkin (fan-out)?
Manba doimiy o'zgarganda, asl ("jonli") va maqsad jadvalini qanday solishtirish mumkin?
Indekslarni qo'llash bo'yicha eng yaxshi amaliyotlar haqida gapiring - qachon va qancha vaqtda foydalanish kerak.
Spark bo'linmalari va jadvallar (masalan, Icebergda) bo'linmalar qanday bog'liq?
Spark JDBC nima va uni orqali katta jadvalni samarali qanday yuklash mumkin?
Sparkda ma'lumotlar tengsizligini (data skew) qanday aniqlash mumkin?
DBMSda tranzaksiya jurnal (WAL) nima va nima uchun kerak?
Yozuvlar hashlarini taqqoslash usuli manba va maqsad jadvali orasidagi farqni hisoblash uchun qoʻllanildimi?
Spark'da cache va persist nima uchun kerak?