Какво е принудително съгласуване и сте го използвали?
Machine Learning / AI
Как да диагностицираме и коригираме разликите в скоростта на речта и интервалите между фразите?
Каква е разликата между WAV и PCM?
Ако скоростта на речта и интервалите между фразите се различават, как да диагностицираме и коригираме?
Имаш ли допълнителни въпроси към интервюиращия?
Какво да правим, ако няма транскрипти за аудио сегменти?
Какво е G2P?
След фина настройка моделът започна да поглъща думи. Как да диагностицираме и да поправим?
Какво да правим след сегментирането на VAD?
Защо в градиентния буустинг обикновено се използват слабите модели?
Има ли опит с разпределено обучение и кое точно?
Как да осигурим възпроизводимост на ML експериментите и възможността за възстановяване на модела, ако артефактът е изтрит в S3?
Може ли буустингът да бъде построен върху линейни модели?
Какво трябва да се запази в контролния пункт, за да продължите обучението след 47 часа, без да загубите състоянието?
Каква е асимптотичната сложност на self-attention и какво е KV-кеш при inference?
Какво е нормализираният текст и как да нормализирате обикновения текст за TTS?
Как да анотираме неанотирано аудио, ако различни ASR системи нормализират текста по-различен начин и добавят пунктуация?
Как ще се държи обикновеното семантично търсене в база данни за поддръжка, ако всички документи съдържат положителни препоръки, но потребителят пита какво определено не трябва да се прави?
Как точно да приложите VAD, за да получите качествени проби?
Как се реализира структурираният изход като ограничено декодиране?