Sobes.tech
Обратно към статиите

Как да избера модел за транскрипция на реч?

Alexander10 май 2026 г. (2 мес. назад)
Как да избера модел за транскрипция на реч?

Качеството на AI отговорите започва преди езиковия модел. Всичко започва с транскрипция на речта. Ако системата разбере погрешно въпроса, дори силен модел ще отговори на изкривен текст.

В Sobes можете да избирате между няколко модела за разпознаване на реч: Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, Deepgram Nova-3 и Soniox STT v5. Те се различават не само по точност, но и по латентност, поведение при записване, езикова поддръжка и начина, по който се справят с шумни срещи.

Какво променя Realtime STT?

В интерфейса на Sobes важната настройка е проста: Realtime STT изключен или Realtime STT активиран.

В реално време STT е изключен

Собес изпраща завършен аудио сегмент за разпознаване и чака финалния текст. Така работят Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, както и Deepgram Nova-3 и Soniox STT v5*, когато Realtime STT е изключен.

Това е прост, стабилен поток за кратки фрази: текстът пристига като завършен транскрипт, без междинни корекции. Компромисът е, че Собес получава текст едва след като аудио сегментът бъде изпратен. Дългите фрази правят забавянето по-забележимо и няма пряко излъчване на думи, докато човекът говори.

Активиран STT в реално време

Sobes предава аудио към модела и получава частичен текст преди фразата да приключи. Така работят Deepgram Nova-3 и Soniox STT v5, когато е активиран Realtime STT.

При стрийминг транскрипцията текстът първоначално може да бъде чернова: моделът може да преработва думите, докато човекът продължава да говори. Финализация е моментът, в който фразата приключва, моделът спира да променя този текстов сегмент и Sobes може безопасно да го предаде напред.

Целта на Realtime STT е скоростта на реакция. Виждате, че системата чува реч в момента, дългите отговори стават четими преди фразата да свърши, а автоматичният отговор може да започне по-рано. Компромисът е, че частичният текст може да се промени, качеството зависи повече от стабилността на връзката, а понякога трябва да изчакате моделът да заключи окончателния текст за фразата.

Кои режими на запис поддържат Realtime STT?

Важен детайл: Realtime STT работи във VAD и режими Start/Stop. В VAD Sobes автоматично засича речта, започва запис и затваря сегмента след пауза. В Start / Stop управлявате началото и края ръчно, но стрийминг транскрипцията може да продължи, докато записът е активен.

В One-Shot Realtime STT не се използва: Собес взема последните секунди от аудио буфера и изпраща завършен сегмент за транскрипция.

Така че, ако изберете Deepgram или Soniox, но използвате One-Shot, използвайте броя за латентност "Realtime STT изключен" като референтна база.

Латентност на транскрипцията

Това е латентността на разпознаването на реч: колко дълго Sobes чака текста след завършен аудио сегмент или след като стрийминг модел заключи окончателния текст за фраза. Не включва времето, докато човекът говори, и не включва генериране на отговори от изкуствен интелект.

Модел В реално време STT е изключен Активиран STT в реално време Какво означава
Groq Whisper Large v3 Turbo 500-600 ms Не е наличен Най-бързият вариант без стрийминг. Добри са за кратки въпроси.
OpenAI gpt-4o-mini-transcribe 600-900 ms Не е наличен Малко по-бавен от Groq, но обикновено по-внимателен с трудната реч.
Дийпграм Нова-3 около 900 ms около 300 ms С включен Realtime STT крайният текст се появява много по-бързо.
Soniox STT v5 около 2500 ms около 200 ms Най-бавният без Realtime STT, но най-бърз при заключване на финалния текст, когато Realtime STT е активиран.

Realtime STT не е просто отметка. За Deepgram и Soniox това променя колко бързо се усеща продуктът: текстът започва да се появява почти веднага, а финалният транскрипт пристига по-бързо, отколкото когато Sobes изпраща завършен аудио сегмент след фразата.

WER: какво представлява и как изглеждат числата

WER означава Word Error Rate: дял на неправилно разпознати думи. Колкото по-нисък е WER, толкова по-добре. Например, WER от 6% означава, че приблизително 6 от 100 думи са били разпознати неправилно: заменени, пропуснати или добавени по грешка.

Важно: WER е трудно да се сравнява без контекст. Същият модел може да показва 4% на чист английски звук и 15% при шумен разговор с акценти, прекъсвания и слаб микрофон. Така че числата по-долу са публични отправни точки, а не гаранция за всяко интервю. Източникът е важен, защото доставчиците използват различни набори от данни и методи за оценка.

Groq Whisper Large V3 Turbo. Groq съобщава за общ WER около 12%, но не публикува отделно разбиване на английски/руски език. Като референция за Whisper на семейно ниво, бенчмаркът на FLEURS показва 4.00% за английски и 5.13% за руски.

OpenAI gpt-4o-mini-transcribe. Бенчмаркът на FLEURS в статията на Voxtral Realtime показва 3.65% за английски и 5.30% за руски. OpenAI също казва, че gpt-4o-transcribe и gpt-4o-mini-transcribe подобряват WER в сравнение с Whisper v2/v3, но документацията му не публикува проста разбивка за тези два езика.

Дийпграм Нова-3. За английски Deepgram отчита 5.26% за завършено аудио и 6.84% за стрийминг. За руски, публичното сравнение на Soniox показва 8.0%. Силата на Дийпграм са английските варианти и акценти: американски, британски, австралийски, индийски и новозеландски английски.

Soniox STT v5. Soniox докладва около 6.5% за английски и около 6.2% за руски в бенчмарк за 60 езика. Няма отделна разбивка на английски/руски за Realtime STT, но Soniox казва, че v4 стрийминг режимът подобрява точността.

Основният извод: за Russian Soniox и Deepgram изглеждат по-силни от по-старите подходи в стил Whisper на реални тестове, докато gpt-4o-mini-transcribe изглежда добре на FLEURS. Но FLEURS, YouTube, обаждания и живи интервюта са различни среди. Изборът на модел трябва да взема предвид както WER, така и латентността.

Модели един по един

Groq Whisper Large v3 Turbo

Groq Whisper Large v3 Turbo е най-бързата опция за Sobes, когато Realtime STT е изключен. Той пасва на кратки отговори, бързи интервюта и ситуации, в които минималната латентност е по-важна от максималната точност при трудна реч.

Основната му сила е скоростта. ASR ръководството на Groq показва общо WER от около 12% за Whisper Large v3 Turbo и ускорение до 247x спрямо продължителността на звука. Това го прави добър избор за кратки коментари, където забавянето е най-важно.

Ако речта съдържа много руски, имена, съкращения, английски технически думи в руската реч, шум или силен акцент, Groq може да допусне още грешки. В такъв случай OpenAI или Soniox обикновено са по-добрият резервен вариант, защото запазването на точната формулировка е по-важно от суровата скорост.

OpenAI gpt-4o-mini-transcribe

OpenAI gpt-4o-mini-transcribe транскрибира завършен аудио сегмент. Той е по-бавен от Groq Whisper Large v3 Turbo, но обикновено обработва по-внимателно нюансите на речта, техническите термини и детайли на въпросите.

OpenAI казва, че gpt-4o-transcribe и gpt-4o-mini-transcribe подобряват WER и езиковото разпознаване в сравнение с Whisper. В независимия бенчмарк на FLEURS gpt-4o-mini-transcribe е посочен на 3.65% WER за английски и 5.30% за руски.

OpenAI gpt-4o-mini-transcribe е добър вариант с по-високо качество с изключен Realtime STT, когато Groq Whisper Large v3 Turbo прави твърде много грешки в речта или микрофона ви.

Дийпграм Нова-3

Deepgram е силен в Realtime STT сценарии. Nova-3 работи както с завършено аудио, така и със стрийминг, а документите на Deepgram отчитат WER от 6.84% за стрийминг транскрипция и 5.26% за завършени записи върху набор от 2 703 реални аудио файла.

В Sobes Deepgram е полезен, когато искате да видите текста почти веднага, вместо да чакате фразата да свърши. С изключен Realtime STT, средната латентност на транскрипцията е около 900 ms; с активиран Realtime STT е около 300 ms. Това прави Deepgram удобен за дълги фрази, живи субтитри, смесена реч и интервюта на английски, особено когато интервюиращият има регионален акцент.

Отделно предимство на Deepgram е поддръжката на английски варианти. Можете да изберете не само общ английски, но и американски, британски, австралийски, индийски или новозеландски английски. Това помага при международни интервюта, където интервюиращият има непознат акцент и техническите термини се смесват с бърз разговорен английски.

За руски Deepgram също изглежда прилично: сравнението на Soniox показва 8.0% WER за руски.

Soniox STT v5, Realtime STT изключен

Soniox STT v5 работи добре за руски, смесена реч и трудни технически термини, но с изключен Realtime STT е най-бавният вариант: средната латентност на транскрипцията е около 2500 ms. Има логика, когато точността на руски и смесена реч е по-важна от скоростта на отговор.

Силата на Soniox е многоезичното разпознаване и смяната на езика. Обхваща и голям брой по-рядко срещани езици, където универсалните модели често се влошават повече, отколкото на английския. Това е важно и за интервютата на руски език, където една фраза може да съдържа React, PostgreSQL, Kafka, thread pool, event loop и руски думи, свързани с английски технически термини.

Soniox STT v5, активиран Realtime STT

Soniox STT v5 с активиран Realtime STT е най-добрият вариант, когато ти трябва руска реч и минимална латентност едновременно. Средно крайният транскрипт пристига около 200 ms след фразата. Тази опция се вписва особено добре във VAD и Start/Stop: текстовите потоци на живо, обработват руско-английските фрази добре и заключват окончателния текст бързо след пауза.

Кратка версия: какво трябва да изберете?

Ако не искате да го преосмисляте:

  • Realtime STT работи във VAD и Start / Stop. В One-Shot използвайте опциите с изключен Realtime STT.
  • Groq Whisper Large v3 Turbo е най-бързият вариант с изключен Realtime STT за кратки фрази и типични интервюта.
  • OpenAI gpt-4o-mini-transcribe е добра опция за деактивиране на Realtime STT, когато искате по-внимателна транскрипция чрез OpenAI.
  • Deepgram Nova-3, Realtime STT изключен дава стабилно качество, но със средна латентност около 900 ms.
  • Deepgram Nova-3, активиран Realtime STT е бърз стрийминг режим, около 300 ms до финалния текст след фраза.
  • Soniox STT v5, изключен Realtime STT е силен за руски и смесен език, но има най-висока латентност: около 2500 ms.
  • Soniox STT v5, активиран Realtime STT е най-бързата стрийминг опция за руски и езикова смяна: около 200 ms.