Как обычный семантический поиск поведёт себя в базе знаний поддержки, если все документы содержат позитивные рекомендации, а пользователь спрашивает, чего точно не стоит делать?
Machine Learning / AI
Как конкретно применять VAD для получения качественных сэмплов?
Как устроен structured output как constrained decoding?
В TTS-пайплайне обучение стало в три раза медленнее, загрузка GPU 20%, память GPU 90%. Как искать проблему?
Alignment score и WER — это одно и то же?
Могут ли изменения в инференсе вызывать пропуски слов и повторы фраз, и в какой части?
MOS вырос с 4.1 до 4.3, но модель иногда пропускает слова и повторяет фразы. Что делать?
Почему могли выбрать модель A с WER 3% вместо модели B с WER 2%?
Что означает WER = 0.05?
# Допиши этот метод def __init__(self, nums: List[float]): pass # Допиши этот метод def dot_product(self, vec: 'SparseVector') -> float: pass
Как оценивать качество TTS-модели?
Нужно ли выполнять нормализацию текста на препроцессинге или на инференсе?
Всегда ли нужно преобразовывать текст в фонемы?
Если PCM записан с частотой 8 кГц, а в заголовке WAV указано 48 кГц, что получится и как это будет звучать?
Расскажите о вашем опыте работы с TTS.
Как подготовить 5000 часов речевых данных неизвестного качества для обучения TTS?
Вы самостоятельно проводили A/B-тесты или делали это совместно с аналитикой?
Что такое контекстные менеджеры в Python, для чего и где они используются?
How does DDP differ from DataParallel?
Что такое градиентный бустинг и как он работает?