Over de vacature
Ищут MLOps-инженера для развития production-инфраструктуры инференса, масштабирования model serving и вывода исследовательских моделей в продукт.
Задачи
- Отвечать за инфраструктуру инференса end-to-end: оптимизировать задержку, пропускную способность и стоимость работы парка моделей
- Создавать и масштабировать model serving с использованием TensorZero, vLLM, SGLang/TRT и Kubernetes
- Проектировать и поддерживать пайплайны векторного поиска с vector storages
- Работать с метриками поддержки SLA, FCR и deflection, определять KPI здоровья сервисов