За позицията
Ищут MLOps-инженера для эксплуатации и масштабирования инфраструктуры инференса, оптимизации производительности моделей и вывода исследовательских разработок в production.
Задачи
- Отвечать за инфраструктуру инференса моделей: оптимизировать задержку, пропускную способность и стоимость работы модельного пула
- Создавать и масштабировать model serving с использованием TensorZero, vLLM, SGLang, TRT и Kubernetes
- Проектировать и поддерживать пайплайны векторного поиска с vector storages
- Работать с метриками поддержки, включая SLA, FCR и deflection, и определять KPI здоровья сервисов