О вакансии
В Wildberries ищут Data Engineer для обеспечения стабильной, производительной и безопасной работы Data Platform на базе Trino, Spark, S3 и Apache Iceberg.
Что нужно делать
- Обеспечивать стабильную, производительную и безопасную работу Data Platform на базе Trino, Spark, S3 и Apache Iceberg, включая администрирование, управление ролевой моделью доступа и документирование изменений в проекте.
- Настраивать, обновлять, мониторить и оптимизировать кластеры Trino.
- Настраивать коннекторы Iceberg и S3.
- Оптимизировать производительность запросов с помощью resource groups и query analysis.
- Оптимизировать производительность Iceberg: partitioning, clustering и metadata management.
- Разрабатывать и внедрять централизованные ролевые модели для доступа к данным и ресурсам платформы.
Какой опыт и знания нужны
- Понимание взаимодействия Spark с Iceberg и S3.
- Опыт эксплуатации Apache Iceberg, включая администрирование таблиц в формате Iceberg и настройку и использование Hive Metastore.
- Понимание и применение compaction, expiration snapshots, time travel и schema evolution.
- Навыки работы с Linux, Bash и Python для автоматизации.
- Опыт управления политиками доступа и правами доступа через Ranger в S3 и Iceberg.
Условия
Удалённая работа.