Siz hal qilgan replikatsiya sozlash vazifasi haqida gapiring.
Data Engineer
Nima normalizatsiya va ER modeli, ular nima uchun kerak?
Sparkda ma'lumotlarning tarafkashligini qanday oldini olish yoki bartaraf etish mumkin?
Qaysi hollarda normalizatsiya qo'llaniladi va qaysi hollarda denormalizatsiya?
Bir nechta indeks qo'shilgandan so'ng so'rov hali ham sekin bo'lsa, qanday tashxis algoritmi va nima qilish kerak?
Kafka ning asosiy tushunchalari haqida gapiring (foydalanuvchilar guruhi, bo'linmalar, mavzular).
Relatsiyali ma'lumotlar bazasida so'rovning sekin ishlashining odatiy sabablari nima?
Katta jadvallarni yuklashda (ishlashdan tashqari) qanday ko'rinmas muammolar yuzaga kelishi mumkin?
Postgresdan Data Lake'ga katta jadvalni moslashuvchan (o'zgartiriladigan) yangilash chastotasi bilan muntazam inkremental yuklash uchun yechim taklif qiling.
Oyna funksiyasi ichidagi saralash va so'rovdagi yakuniy ORDER BY saralash qanday bog'liq?
Kirish ma'lumotlar hajmi o'zgarganda Spark ilovasining resurslarini qanday boshqarish mumkin, shunda xotira ortiqcha ishlatilmaydi?
Coalesce va repartition orqali bo'limlar bilan qanday ishlash mumkin?
Qaysi Docker tasvirlarini qurishingiz kerak edi va nima uchun?
Coalesce/repartitiondan tashqari shuffle boshqarish uchun boshqa mexanizmlar bormi?
Qaysi Spark JDBC parametrlari o'qishni parallel qilish uchun ishlatilgan?