Качеството на AI отговорите започва преди езиковия модел. Всичко започва с транскрипция на речта. Ако системата разбере погрешно въпроса, дори силен модел ще отговори на изкривен текст.
В Sobes можете да избирате между няколко модела за разпознаване на реч: Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, Deepgram Nova-3 и Soniox STT v5. Те се различават не само по точност, но и по латентност, поведение при записване, езикова поддръжка и начина, по който се справят с шумни срещи.
Какво променя Realtime STT?
В интерфейса на Sobes важната настройка е проста: Realtime STT изключен или Realtime STT активиран.
В реално време STT е изключен
Собес изпраща завършен аудио сегмент за разпознаване и чака финалния текст. Така работят Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, както и Deepgram Nova-3 и Soniox STT v5*, когато Realtime STT е изключен.
Това е прост, стабилен поток за кратки фрази: текстът пристига като завършен транскрипт, без междинни корекции. Компромисът е, че Собес получава текст едва след като аудио сегментът бъде изпратен. Дългите фрази правят забавянето по-забележимо и няма пряко излъчване на думи, докато човекът говори.
Активиран STT в реално време
Sobes предава аудио към модела и получава частичен текст преди фразата да приключи. Така работят Deepgram Nova-3 и Soniox STT v5, когато е активиран Realtime STT.
При стрийминг транскрипцията текстът първоначално може да бъде чернова: моделът може да преработва думите, докато човекът продължава да говори. Финализация е моментът, в който фразата приключва, моделът спира да променя този текстов сегмент и Sobes може безопасно да го предаде напред.
Целта на Realtime STT е скоростта на реакция. Виждате, че системата чува реч в момента, дългите отговори стават четими преди фразата да свърши, а автоматичният отговор може да започне по-рано. Компромисът е, че частичният текст може да се промени, качеството зависи повече от стабилността на връзката, а понякога трябва да изчакате моделът да заключи окончателния текст за фразата.
Кои режими на запис поддържат Realtime STT?
Важен детайл: Realtime STT работи във VAD и режими Start/Stop. В VAD Sobes автоматично засича речта, започва запис и затваря сегмента след пауза. В Start / Stop управлявате началото и края ръчно, но стрийминг транскрипцията може да продължи, докато записът е активен.
В One-Shot Realtime STT не се използва: Собес взема последните секунди от аудио буфера и изпраща завършен сегмент за транскрипция.
Така че, ако изберете Deepgram или Soniox, но използвате One-Shot, използвайте броя за латентност "Realtime STT изключен" като референтна база.
Латентност на транскрипцията
Това е латентността на разпознаването на реч: колко дълго Sobes чака текста след завършен аудио сегмент или след като стрийминг модел заключи окончателния текст за фраза. Не включва времето, докато човекът говори, и не включва генериране на отговори от изкуствен интелект.
| Модел | В реално време STT е изключен | Активиран STT в реално време | Какво означава |
|---|---|---|---|
| Groq Whisper Large v3 Turbo | 500-600 ms | Не е наличен | Най-бързият вариант без стрийминг. Добри са за кратки въпроси. |
OpenAI gpt-4o-mini-transcribe |
600-900 ms | Не е наличен | Малко по-бавен от Groq, но обикновено по-внимателен с трудната реч. |
| Дийпграм Нова-3 | около 900 ms | около 300 ms | С включен Realtime STT крайният текст се появява много по-бързо. |
| Soniox STT v5 | около 2500 ms | около 200 ms | Най-бавният без Realtime STT, но най-бърз при заключване на финалния текст, когато Realtime STT е активиран. |
Realtime STT не е просто отметка. За Deepgram и Soniox това променя колко бързо се усеща продуктът: текстът започва да се появява почти веднага, а финалният транскрипт пристига по-бързо, отколкото когато Sobes изпраща завършен аудио сегмент след фразата.
WER: какво представлява и как изглеждат числата
WER означава Word Error Rate: дял на неправилно разпознати думи. Колкото по-нисък е WER, толкова по-добре. Например, WER от 6% означава, че приблизително 6 от 100 думи са били разпознати неправилно: заменени, пропуснати или добавени по грешка.
Важно: WER е трудно да се сравнява без контекст. Същият модел може да показва 4% на чист английски звук и 15% при шумен разговор с акценти, прекъсвания и слаб микрофон. Така че числата по-долу са публични отправни точки, а не гаранция за всяко интервю. Източникът е важен, защото доставчиците използват различни набори от данни и методи за оценка.
Groq Whisper Large V3 Turbo. Groq съобщава за общ WER около 12%, но не публикува отделно разбиване на английски/руски език. Като референция за Whisper на семейно ниво, бенчмаркът на FLEURS показва 4.00% за английски и 5.13% за руски.
OpenAI gpt-4o-mini-transcribe.
Бенчмаркът на FLEURS в статията на Voxtral Realtime показва 3.65% за английски и 5.30% за руски. OpenAI също казва, че gpt-4o-transcribe и gpt-4o-mini-transcribe подобряват WER в сравнение с Whisper v2/v3, но документацията му не публикува проста разбивка за тези два езика.
Дийпграм Нова-3. За английски Deepgram отчита 5.26% за завършено аудио и 6.84% за стрийминг. За руски, публичното сравнение на Soniox показва 8.0%. Силата на Дийпграм са английските варианти и акценти: американски, британски, австралийски, индийски и новозеландски английски.
Soniox STT v5. Soniox докладва около 6.5% за английски и около 6.2% за руски в бенчмарк за 60 езика. Няма отделна разбивка на английски/руски за Realtime STT, но Soniox казва, че v4 стрийминг режимът подобрява точността.
Основният извод: за Russian Soniox и Deepgram изглеждат по-силни от по-старите подходи в стил Whisper на реални тестове, докато gpt-4o-mini-transcribe изглежда добре на FLEURS. Но FLEURS, YouTube, обаждания и живи интервюта са различни среди. Изборът на модел трябва да взема предвид както WER, така и латентността.
Модели един по един
Groq Whisper Large v3 Turbo
Groq Whisper Large v3 Turbo е най-бързата опция за Sobes, когато Realtime STT е изключен. Той пасва на кратки отговори, бързи интервюта и ситуации, в които минималната латентност е по-важна от максималната точност при трудна реч.
Основната му сила е скоростта. ASR ръководството на Groq показва общо WER от около 12% за Whisper Large v3 Turbo и ускорение до 247x спрямо продължителността на звука. Това го прави добър избор за кратки коментари, където забавянето е най-важно.
Ако речта съдържа много руски, имена, съкращения, английски технически думи в руската реч, шум или силен акцент, Groq може да допусне още грешки. В такъв случай OpenAI или Soniox обикновено са по-добрият резервен вариант, защото запазването на точната формулировка е по-важно от суровата скорост.
OpenAI gpt-4o-mini-transcribe
OpenAI gpt-4o-mini-transcribe транскрибира завършен аудио сегмент. Той е по-бавен от Groq Whisper Large v3 Turbo, но обикновено обработва по-внимателно нюансите на речта, техническите термини и детайли на въпросите.
OpenAI казва, че gpt-4o-transcribe и gpt-4o-mini-transcribe подобряват WER и езиковото разпознаване в сравнение с Whisper. В независимия бенчмарк на FLEURS gpt-4o-mini-transcribe е посочен на 3.65% WER за английски и 5.30% за руски.
OpenAI gpt-4o-mini-transcribe е добър вариант с по-високо качество с изключен Realtime STT, когато Groq Whisper Large v3 Turbo прави твърде много грешки в речта или микрофона ви.
Дийпграм Нова-3
Deepgram е силен в Realtime STT сценарии. Nova-3 работи както с завършено аудио, така и със стрийминг, а документите на Deepgram отчитат WER от 6.84% за стрийминг транскрипция и 5.26% за завършени записи върху набор от 2 703 реални аудио файла.
В Sobes Deepgram е полезен, когато искате да видите текста почти веднага, вместо да чакате фразата да свърши. С изключен Realtime STT, средната латентност на транскрипцията е около 900 ms; с активиран Realtime STT е около 300 ms. Това прави Deepgram удобен за дълги фрази, живи субтитри, смесена реч и интервюта на английски, особено когато интервюиращият има регионален акцент.
Отделно предимство на Deepgram е поддръжката на английски варианти. Можете да изберете не само общ английски, но и американски, британски, австралийски, индийски или новозеландски английски. Това помага при международни интервюта, където интервюиращият има непознат акцент и техническите термини се смесват с бърз разговорен английски.
За руски Deepgram също изглежда прилично: сравнението на Soniox показва 8.0% WER за руски.
Soniox STT v5, Realtime STT изключен
Soniox STT v5 работи добре за руски, смесена реч и трудни технически термини, но с изключен Realtime STT е най-бавният вариант: средната латентност на транскрипцията е около 2500 ms. Има логика, когато точността на руски и смесена реч е по-важна от скоростта на отговор.
Силата на Soniox е многоезичното разпознаване и смяната на езика. Обхваща и голям брой по-рядко срещани езици, където универсалните модели често се влошават повече, отколкото на английския. Това е важно и за интервютата на руски език, където една фраза може да съдържа React, PostgreSQL, Kafka, thread pool, event loop и руски думи, свързани с английски технически термини.
Soniox STT v5, активиран Realtime STT
Soniox STT v5 с активиран Realtime STT е най-добрият вариант, когато ти трябва руска реч и минимална латентност едновременно. Средно крайният транскрипт пристига около 200 ms след фразата. Тази опция се вписва особено добре във VAD и Start/Stop: текстовите потоци на живо, обработват руско-английските фрази добре и заключват окончателния текст бързо след пауза.
Кратка версия: какво трябва да изберете?
Ако не искате да го преосмисляте:
- Realtime STT работи във VAD и Start / Stop. В One-Shot използвайте опциите с изключен Realtime STT.
- Groq Whisper Large v3 Turbo е най-бързият вариант с изключен Realtime STT за кратки фрази и типични интервюта.
- OpenAI gpt-4o-mini-transcribe е добра опция за деактивиране на Realtime STT, когато искате по-внимателна транскрипция чрез OpenAI.
- Deepgram Nova-3, Realtime STT изключен дава стабилно качество, но със средна латентност около 900 ms.
- Deepgram Nova-3, активиран Realtime STT е бърз стрийминг режим, около 300 ms до финалния текст след фраза.
- Soniox STT v5, изключен Realtime STT е силен за руски и смесен език, но има най-висока латентност: около 2500 ms.
- Soniox STT v5, активиран Realtime STT е най-бързата стрийминг опция за руски и езикова смяна: около 200 ms.
