Boş pozisyon hakkında
Ищут Middle AI QA Engineer для тестирования LLM и AI-агентных систем. Работа полностью удалённая, вне РФ и РБ, с графиком по часовому поясу PT с 7:00 до 16:00 и оплатой от 25 USD в час.
Задачи
- Тестирование поведения AI-агентов: диалогов, логики, контекста и состояния.
- Выявление и анализ галлюцинаций, отклонений от инструкций и логических ошибок.
- Разработка и поддержка тест-кейсов для LLM-агентов в ручном и автоматизированном режиме.
- Построение и поддержка eval-наборов и Golden Datasets для регрессионного тестирования.
- Использование eval-фреймворков для оценки качества ответов LLM.
- Тестирование интеграций агентов с внешними системами, API, CRM и инструментами.
- Анализ качества ответов по метрикам accuracy, coherence и relevance.
- Участие в развитии тестовой архитектуры для AI-систем.
Условия
- Полностью удалённый формат работы.
- Работа вне РФ и РБ.
- Часовой пояс PT: 7:00–16:00, Вашингтон.
- Оплата по квалификации — от 25 USD в час.
- Работа в команде разработчиков, ML-инженеров и AI-специалистов.
- Возможность профессионального роста в QA для LLM- и AI-агентных систем.
Будет плюсом
- Опыт работы с LangChain, vapi, Synthflow или аналогичными платформами.
- Понимание CI/CD и базовых инструментов мониторинга.
- Опыт участия в проектировании тестовой архитектуры для AI/ML-систем.
- Опыт оценки LLM через метрики и автоматические проверки.