Репликацияны орнату тапсырмасы туралы айтыңыз.
Data Engineer
Spark-те деректердің бұрмалануын қалай болдырмауға/жоюға болады?
Нормализация және ER моделі дегеніміз не, олар не үшін қажет?
Қандай жағдайларда нормализация қолданылады, ал қандай жағдайларда денормализация?
Егер сұрау бірнеше индекс қосқаннан кейін де баяу болса - қандай диагностика алгоритмі және не істеу керек?
Kafka-ның негізгі ұғымдары туралы айтыңыз (тұтынушы тобы, бөлімдер, тақырыптар).
Дерекқор сұрауының баяу жұмыс істеуінің типтік себептері қандай?
Postgres-тан Data Lake-ке үлкен кестені өзгермелі (өзгермелі) жаңарту жиілігімен тұрақты инкременттік жүктеу тапсырмасына шешім ұсыныңыз.
Үлкен кестелерді жүктегенде (өнімділіктен басқа) қандай байқалмайтын мәселелер туындауы мүмкін?
Терезе функциясы ішіндегі сұрыптау мен сұраудағы соңғы ORDER BY сұрыптауы қалай байланысты?
Кіріс деректер көлемін өзгерткен кезде жадты шамадан тыс пайдалануын болдырмау үшін Spark қолданбасының ресурстарын қалай басқаруға болады?
Partition-тармен қалай жұмыс істеуге болады, coalesce және repartition көмегімен?
Қандай Docker образдарын құру керек болды және не үшін?
Coalesce/repartition-тан басқа shuffle басқару механизмдері бар ма?
Spark JDBC-да оқуды параллелдеу үшін қандай параметрлер қолданылды?