Sobes.tech
Späť na články

Ako si vybrať model transkripcie reči?

Alexander10. mája 2026 (2 мес. назад)
Ako si vybrať model transkripcie reči?

Kvalita AI odpovedí začína ešte pred jazykovým modelom. Začína sa to prepisom reči. Ak systém otázku zle počuje, aj silný model odpovie na skreslený text.

V Sobes si môžete vybrať z viacerých modelov rozpoznávania reči: Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, Deepgram Nova-3 a Soniox STT v5. Líšia sa nielen presnosťou, ale aj latenciou, zaznamenávaním správania, jazykovou podporou a spôsobom, akým zvládajú hlučné stretnutia.

Čo mení Realtime STT?

V rozhraní Sobes je dôležité nastavenie jednoduché: Realtime STT vypnuté alebo Realtime STT zapnuté.

Realtime STT deaktivovaný

Sobes pošle hotový audio segment na rozpoznanie a čaká na finálny text. Takto fungujú Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, a tiež Deepgram Nova-3 a Soniox STT v5, keď je Realtime STT vypnutý.

Ide o jednoduchý, stabilný tok pre krátke frázy: text prichádza ako hotový prepis bez medziopráv. Nevýhodou je, že Sobes dostáva text až po odoslaní audio segmentu. Dlhé frázy robia oneskorenie výraznejším a počas rozprávania neprebieha živý prenos slov.

Aktivované STT v reálnom čase

Sobes streamuje zvuk do modelu a prijíma čiastočný text ešte predtým, než fráza skončí. Takto fungujú Deepgram Nova-3 a Soniox STT v5, keď je zapnutý Realtime STT.

Pri streamovanom prepise môže byť text spočiatku len návrh: model môže slová upravovať, zatiaľ čo osoba stále hovorí. Finalizácia je moment, keď fráza skončí, model prestane meniť daný textový segment a Sobes ho môže bezpečne posunúť ďalej.

Zmyslom Realtime STT je rýchlosť reakcie. Vidíte, že systém práve teraz počúva reč, dlhé odpovede sú čitateľné ešte pred koncom frázy a automatická odpoveď môže začať skôr. Nevýhodou je, že čiastočný text sa môže meniť, kvalita závisí viac od stability pripojenia a niekedy musíte počkať, kým model uzamkne finálny text pre frázu.

Ktoré režimy nahrávania podporujú Realtime STT?

Dôležitý detail: Realtime STT funguje v režimoch VAD a Start / Stop. Vo VAD Sobes automaticky detekuje reč, začne nahrávať a segment po pauze ukončí. V režime Start / Stop ovládate začiatok a koniec manuálne, ale streamovaný prepis môže stále bežať, keď je nahrávanie aktívne.

V One-Shot sa Realtime STT nepoužíva: Sobes vezme posledné sekundy z audio bufferu a pošle hotový segment na prepis.

Takže ak si vyberiete Deepgram alebo Soniox, ale používate One-Shot, použite latenciu "Realtime STT disabled" ako referenciu.

Latencia transkripcie

Toto je latencia rozpoznávania reči: ako dlho Sobes čaká na text po dokončení audio segmentu alebo po tom, čo streamovací model uzamkne finálny text pre frázu. Nezahŕňa čas, počas ktorého osoba hovorí, a nezahŕňa generovanie odpovedí pomocou AI.

Model Realtime STT deaktivovaný Aktivované STT v reálnom čase Čo to znamená
Groq Whisper veľký v3 Turbo 500-600 ms Nie je dostupné Najrýchlejšia možnosť bez streamovania. Dobré na krátke otázky.
OpenAI gpt-4o-mini-transcribe 600-900 ms Nie je dostupné O niečo pomalší ako Groq, ale zvyčajne opatrnejší pri náročnej reči.
Deepgram Nova-3 Približne 900 ms Približne 300 ms S povoleným Realtime STT sa finálny text zobrazuje oveľa rýchlejšie.
Soniox STT v5 Približne 2500 ms Približne 200 ms Najpomalší bez Realtime STT, ale najrýchlejší pri zamykaní finálneho textu, keď je Realtime STT zapnutý.

STT v reálnom čase nie je len zaškrtávacie políčko. Pre Deepgram a Soniox to mení, ako rýchlo produkt pôsobí: text sa začne objavovať takmer okamžite a finálny prepis príde rýchlejšie, než keď Sobes pošle dokončený audio segment po fráze.

WER: čo to je a ako vyzerajú čísla

WER znamená mieru chybovosti slov: podiel nesprávne rozpoznaných slov. Čím nižší WER, tým lepšie. Napríklad WER 6 % znamená, že približne 6 zo 100 slov bolo nesprávne rozpoznaných: nahradených, preskočených alebo omylom pridaných.

Dôležité: WER je ťažké porovnávať bez kontextu. Ten istý model dokáže ukázať 4 % pri čistom anglickom zvuku a 15 % pri hlučnom hovore s prízvukmi, prerušeniami a slabým mikrofónom. Takže čísla nižšie sú verejné referenčné body, nie záruka pre každý pohovor. Zdroj je dôležitý, pretože poskytovatelia používajú odlišné dátové súbory a metódy hodnotenia.

Groq Whisper Veľký V3 Turbo. Groq uvádza všeobecný WER okolo 12 %, ale nepublikuje samostatné rozdelenie angličtiny a ruštiny. Ako rodinný referenčný bod Whisper ukazuje benchmark FLEURS 4,00 % pre angličtinu a 5,13 % pre ruštinu.

OpenAI gpt-4o-mini-transcribe. Benchmark FLEURS v článku Voxtral Realtime uvádza 3,65 % pre angličtinu a 5,30 % pre ruštinu. OpenAI tiež uvádza, že gpt-4o-transcribe a gpt-4o-mini-transcribe zlepšiť WER v porovnaní s Whisper v2/v3, ale jeho dokumentácia nepublikuje jednoduchý rozpis pre tieto dva jazyky.

Deepgram Nova-3. Pre angličtinu Deepgram uvádza 5,26% pre hotový zvuk a 6,84% pre streamovanie. Pre ruštinu verejné porovnanie Sonioxu uvádza 8,0%. Deepgramovou silou sú anglické varianty a prízvuky: americká, britská, austrálska, indická a novozélandská angličtina.

Soniox STT v5. Soniox uvádza približne 6,5 % pre angličtinu a asi 6,2 % pre ruštinu v benchmarku s 60 jazykmi. Pre Realtime STT neexistuje samostatné rozdelenie do angličtiny a ruštiny, ale Soniox tvrdí, že režim streamovania v4 zlepšuje presnosť.

Hlavný záver: pre Russian vyzerajú Soniox a Deepgram silnejšie než staršie prístupy v štýle Whisper na reálnych benchmarkoch, zatiaľ čo gpt-4o-mini-transcribe na FLEURS vyzerá dobre. Ale FLEURS, YouTube, telefonáty a živé rozhovory sú iné prostredia. Výber modelu by mal brať do úvahy WER aj latenciu.

Modely jeden po druhom

Groq Whisper veľký v3 Turbo

Groq Whisper Large v3 Turbo je najrýchlejšia možnosť Sobes, keď je Realtime STT vypnutý. Zmestí krátke odpovede, rýchle rozhovory a situácie, kde je minimálna latencia dôležitejšia než maximálna presnosť pri náročnej reči.

Jeho hlavnou silou je rýchlosť. ASR sprievodca od Groq uvádza všeobecný WER okolo 12 % pre Whisper Large v3 Turbo a zrýchlenie až 247x v porovnaní s dĺžkou zvuku. To z neho robí dobrú voľbu na krátke poznámky, kde je najdôležitejšie oneskorenie.

Ak reč obsahuje veľa ruštiny, mien, skratiek, anglických technických slov v ruskej reči, šum alebo silný prízvuk, Groq môže urobiť viac chýb. V takom prípade je OpenAI alebo Soniox zvyčajne lepšou záložnou voľbou, pretože zachovanie presného znenia je dôležitejšie než čistá rýchlosť.

OpenAI gpt-4o-mini-transcribe

OpenAI gpt-4o-mini-transcribe prepisuje dokončený audio segment. Je pomalší ako Groq Whisper Large v3 Turbo, ale zvyčajne rieši rečové nuansy, technické termíny a detaily otázok oveľa opatrnejšie.

OpenAI tvrdí, že gpt-4o-transcribe a gpt-4o-mini-transcribe zlepšujú WER a rozpoznávanie jazyka v porovnaní s Whisperom. V nezávislom benchmarku FLEURS je gpt-4o-mini-transcribe uvedený na úrovni 3,65 % WER pre angličtinu a 5,30 % pre ruštinu.

OpenAI gpt-4o-mini-transcribe je dobrá kvalitnejšia možnosť s vypnutým Realtime STT, keď Groq Whisper Large v3 Turbo robí príliš veľa chýb vo vašej reči alebo mikrofóne.

Deepgram Nova-3

Deepgram je silný v reálnych STT scenároch. Nova-3 pracuje s dokončeným zvukom aj streamovaním a dokumentácia Deepgramu uvádza WER 6,84 % pre streamovanú transkripciu a 5,26 % pre dokončené nahrávky na sade 2 703 reálnych audio súborov.

V Sobes je Deepgram užitočný, keď chcete vidieť text takmer okamžite namiesto čakania, kým fráza skončí. S vypnutým Realtime STT je priemerná latencia transkripcie okolo 900 ms; s povoleným Realtime STT je to približne 300 ms. To robí Deepgram pohodlným na dlhé frázy, živé titulky, zmiešanú reč a anglické rozhovory, najmä ak má interviewér regionálny prízvuk.

Samostatnou výhodou Deepgramu je podpora anglických variantov. Môžete si vybrať nielen všeobecnú angličtinu, ale aj americkú, britskú, austrálsku, indskú alebo novozélandskú angličtinu. To pomáha pri medzinárodných pohovoroch, kde má personalista neznámy prízvuk a technické termíny sa miešajú s rýchlou konverzačnou angličtinou.

Pre ruštinu vyzerá Deepgram tiež slušne: porovnanie so Sonioxom uvádza 8,0 % WER pre ruštinu.

Soniox STT v5, Realtime STT deaktivovaný

Soniox STT v5 funguje dobre pre ruštinu, zmiešanú reč a náročné technické termíny, ale s vypnutým Realtime STT je to najpomalšia možnosť: priemerná latencia prepisu je okolo 2500 ms. Dáva to zmysel, keď presnosť v ruštine a zmiešanej reči je dôležitejšia než rýchlosť odozvy.

Silnou stránkou Sonioxu je rozpoznávanie viacerých jazykov a prepínanie medzi jazykmi. Pokrýva tiež široký okruh menej bežných jazykov, kde všeobecné modely často zhoršujú hodnotu viac než v angličtine. To je dôležité aj pri rusky hovoriacich rozhovoroch, kde jedna fráza môže obsahovať React, PostgreSQL, Kafka, thread pool, event loop a ruské koncovky slov okolo anglických technických termínov.

Soniox STT v5, Realtime STT zapnutý

Soniox STT v5 s povoleným Realtime STT je najlepšia voľba, keď potrebujete ruskú reč a zároveň minimálnu latenciu. Priemerne konečný prepis prichádza približne 200 ms po fráze. Táto možnosť sa obzvlášť hodí vo VAD a Start / Stop: text streamuje naživo, dobre zvláda rusko-anglické frázy a rýchlo sa uzamkne do finálneho textu po pauze.

Krátka verzia: čo by ste si mali vybrať?

Ak to nechcete príliš analyzovať:

  • Realtime STT funguje vo VAD a Start / Stop. V One-Shot použite možnosti s vypnutým Realtime STT.
  • Groq Whisper Large v3 Turbo je najrýchlejšia možnosť s vypnutým Realtime STT pre krátke frázy a bežné rozhovory.
  • OpenAI gpt-4o-mini-transcribe je dobrá možnosť deaktivovať STT v reálnom čase, keď chcete starostlivejší prepis cez OpenAI.
  • Deepgram Nova-3, Realtime STT vypnutý poskytuje solídnu kvalitu, ale s priemernou latenciou okolo 900 ms.
  • Deepgram Nova-3, povolený Realtime STT je rýchly streamovací režim, približne 300 ms do finálneho textu po fráze.
  • Soniox STT v5, Realtime STT vypnutý je silný pre ruštinu a zmiešané jazyky, ale má najvyššiu latenciu: okolo 2500 ms.
  • Soniox STT v5, Realtime STT povolený je najrýchlejšia možnosť streamovania pre ruštinu a prepínanie jazykov: približne 200 ms.