Репликацияны орнотуу тапшырмасы жөнүндө айтып бериңиз, аны сиз чечип калдыңыз.
Data Engineer
Spark'ta маалыматтардын бурмалануусун кантип алдын алуу/жок кылуу керек?
Көптөгөн индекстер кошулгандан кийин дагы суроо жай болсо, кандай диагноз алгоритми жана эмне кылуу керек?
Нормалдаштыруу жана ER модел эмне, алар эмне үчүн керек?
Кайсы учурларда нормализация колдонулат жана кайсы учурларда денормализация?
Kafkaнын негизги түшүнүктөрү жөнүндө айтып бериңиз (кардар тобу, бөлүмдөр, темалар).
Реляциялык маалыматтар базасында суроо-талаптын жай иштешинин типтүү себептери эмне?
Postgresтен Data Lakeке чоң таблицанын ийкемдүү (өзгөрүлмө) жаңылоо ылдамдыгы менен туруктуу инкременталдуу жүктөө үчүн чечим сунуштаңыз.
Идеал эмес чоң таблицаларды жүктөөдө кандай көрүнбөгөн көйгөйлөр пайда болушу мүмкүн?
Терезе функциясынын ичинде сорттоо жана суроо-талаптагы акыркы ORDER BY сорттоо кандайча байланыштуу?
Spark колдонмосунун ресурстарын кантип башкаруу керек, анткени кирүү маалыматтарынын көлөмүн өзгөртүп жатканда эс тутумду ашыкча колдонбоо керек?
Coalesce жана repartition аркылуу бөлүмдөр менен иштөө жолдору.
Coalesce/repartitionтен башка shuffle башкаруу механизмдери барбы?
Кайсы Docker сүрөттөрүн түзүшүңүз керек болду жана эмне үчүн?
Окууну параллелдөө үчүн Spark JDBC үчүн кайсы параметрлер колдонулду?