Data Engineer
Feature store-дар менен иштедиңби?
Sparkтеги spill жөнүндө эмне билесиз?
Data Vault жеткиликтүү эмес деп эсептейли жана эки кең таблицаны бириктирүү керек. Муну Greenplumта кантип оптималдаштырмаксыз? Ал эми ClickHouseта болсо?
Сурооңузда бириктирүүдөн мурун фильтрлоону кантип ишке ашырар элеңиз?
Сен Москвадансыңбы? Мында узак убакыттан бери жашайсыңбы? Неге Москвага көчүп келдиң?
Broadcast механизми физикалык түрдө кандай болот — кичинекей таблицанын бөлүмдөрү чоң таблицасы бар executor'ларга кантип жетет?
Неге ORC ордуна Parquet колдонулду?
Маалыматтардын айырмаларынын кору менен жоопкерчилигин кантип чечиш керек?
DAG ийгиликсиздиктен кийин кайра ишке киргизүүдө, S3деги толук эмес маалыматтар менен маалыматтарды жазып албоо үчүн файлдар менен кантип иштедиңиз?
Эгерде бир нече сунуш болсо, тандоодо эң маанилүү 3 критерий.
"Өлгөн кортеж" (dead tuple) деген эмне?
Spark JDBC эмне жана анын аркылуу чоң таблицаны натыйжалуу жүктөө кандай?
Терезе функциясы SUM() OVER (PARTITION BY user_id) — бир учурда сатып алуу датасын ORDER BY кошуп жатабыз, экинчи учурда — кошпойбуз. Эмне айырмасы?
Сиздин dbt моделдериңиз кандай түзүлгөн жана сиз Trino аркылуу канча булактан витринаны кантип чогултасыз?
Сиз үчүн бизнес жана инфраструктуралык тапшырмалардын идеалдуу катышы кандай?
Parquet кандай сактоо түрү бар: саптык же баганалык?
Репликацияны орнотуу тапшырмасы жөнүндө айтып бериңиз, аны сиз чечип калдыңыз.
`s ** 2` дегенди `s = [1, 2, 3]` тизмесине колдонсоңуз эмне болот?
Coalesce/repartitionтен башка shuffle башкаруу механизмдери барбы?
Сенин travel тармагына кызыгууну эмне түртөт? Мүмкүн, өзүң саякаттаганды жактырасың, же travel-tech сени кандайдыр бир жол менен кызыктырды.