Kvalita odpovědí AI začíná před jazykovým modelem. Začíná to přepisem řeči.
Pokud systém otázku špatně naslouchá, i silný model odpoví na zkreslený text.
V Sobes si můžete vybrat mezi několika modely rozpoznávání řeči: Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transscribe, Deepgram Nova-3a Soniox STT v5. Liší se nejen přesností, ale také latencí, chováním při nahrávání, jazykovou podporou a tím, jak zvládají hlučné schůzky.
Co se mění STT v reálném čase?
V rozhraní Sobes je důležité nastavení jednoduché: STT v reálném čase zakázáno nebo STT v reálném čase povoleno.
STT v reálném čase zakázáno
Sobes odešle hotový audio segment k rozpoznání a čeká na konečný text.
Takto Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transscribea také Deepgram Nova-3 a Soniox STT v5 pracovat, když je vypnutý STT v reálném čase.
Jedná se o jednoduchý, stabilní tok pro krátké fráze: text přichází jako hotový přepis bez mezilehlých oprav. Kompromisem je, že Sobes přijímá text až po odeslání audio segmentu. Dlouhé fráze činí zpoždění znatelnějším a během hovoru není žádný živý proud slov.
STT v reálném čase povoleno
Sobes streamuje zvuk do modelu a přijímá částečný text, než fráze skončí.
Takto Deepgram Nova-3 a Soniox STT v5 pracovat, když je povoleno STT v reálném čase.
Při streamované transkripci může být text nejprve konceptem: model může revidovat slova, zatímco osoba mluví. Finalizace je okamžik, kdy fráze skončí, model přestane tento textový segment měnit a Sobes jej může bezpečně předat dál.
Smyslem STT v reálném čase je rychlost reakce. Můžete vidět, že systém právě teď slyší řeč, dlouhé odpovědi budou čitelné, než fráze skončí, a automatická odpověď může začít dříve. Kompromisem je, že částečný text se může změnit, kvalita závisí více na stabilitě připojení a někdy je potřeba počkat, až model zamkne konečný text pro frázi.
Které režimy nahrávání podporují Realtime STT?
Důležitý detail: Realtime STT pracuje v režimech VAD a Start/Stop. Ve VAD Sobes automaticky detekuje řeč, spustí nahrávání a po pauze zavře segment. V Start/Stop ovládáte začátek a konec ručně, ale přepis streamu může stále běžet, když je aktivní nahrávání.
In One-Shot, Realtime STT se nepoužívá: Sobes vezme poslední sekundy z audio vyrovnávací paměti a odešle hotový segment k přepisu.
Pokud tedy zvolíte Deepgram nebo Soniox, ale používáte One-Shot, použijte jako referenční čísla latence „Realtime STT vypnuto“.
Latence transkripce
Toto je latence rozpoznávání řeči: jak dlouho Sobes čeká na text po dokončeném zvukovém segmentu nebo poté, co model streamování uzamkne konečný text pro frázi. Nezahrnuje čas, kdy osoba mluví, a nezahrnuje generování odpovědí AI.
| Model | STT v reálném čase zakázáno | STT v reálném čase povoleno | Co to znamená |
|---|---|---|---|
| Groq Whisper Large v3 Turbo | 500-600 ms | Není k dispozici | Nejrychlejší možnost bez streamování. Dobré pro krátké otázky. |
OpenAI gpt-4o-mini-transcribe |
600-900 ms | Není k dispozici | O něco pomalejší než Groq, ale obvykle opatrnější s obtížným projevem. |
| Deepgram Nova-3 | asi 900 ms | asi 300 ms | S povoleným STT v reálném čase se konečný text zobrazí mnohem rychleji. |
| Soniox STT v5 | asi 2500 ms | asi 200 ms | Nejpomalejší bez STT v reálném čase, ale nejrychlejší při zamykání konečného textu, když je povoleno STT v reálném čase. |
STT v reálném čase není jen zaškrtávací políčko. U Deepgram a Soniox se mění, jak rychle se produkt cítí: text se začne objevovat téměř okamžitě a konečný přepis dorazí rychleji, než když Sobes odešle dokončený zvukový segment po frázi.
WER: co to je a jak vypadají čísla
WER znamená Word Error Rate: podíl nesprávně rozpoznaných slov. Čím nižší WER, tím lépe. Například WER 6 % znamená, že zhruba 6 ze 100 slov bylo rozpoznáno nesprávně: nahrazeno, přeskočeno nebo přidáno omylem.
Důležité: WER je těžké porovnávat bez kontextu. Stejný model dokáže zobrazit 4 % na čistém anglickém zvuku a 15 % na hlučném hovoru s přízvuky, přerušeními a špatným mikrofonem. Níže uvedená čísla jsou tedy veřejnými referenčními body, nikoli zárukou pro každý rozhovor. Na zdroji záleží, protože poskytovatelé používají různé datové sady a metody hodnocení.
Groq Whisper Large v3 Turbo.
Groq uvádí obecné WER kolem 12 %, ale nezveřejňuje samostatné anglické/ruské rozdělení. Jako referenční Whisper na rodinné úrovni ukazuje benchmark FLEURS 4,00 % pro angličtinu a 5,13 % pro ruštinu.
OpenAI gpt-4o-mini-transscribe.
Benchmark FLEURS v seznamech článků Voxtral Realtime 3,65 % pro angličtinu a 5,30 % pro ruštinu. OpenAI také říká, že gpt-4o-transcribe a gpt-4o-mini-transcribe zlepšují WER ve srovnání s Whisperem v2/v3, ale jeho dokumenty nepublikují jednoduché rozdělení pro tyto dva jazyky.
Deepgram Nova-3.
Pro angličtinu uvádí Deepgram 5.26% pro hotový zvuk a 6.84% pro streamování. Pro ruštinu uvádí veřejné srovnávací seznamy Soniox 8.0%. Silnou stránkou Deepgramu jsou anglické varianty a akcenty: americká, britská, australská, indická a novozélandská angličtina.
Soniox STT v5.
Informuje Soniox asi 6,5 % pro angličtinu a asi 6,2 % pro ruštinu v 60jazyčném benchmarku. Pro Realtime STT neexistuje samostatné anglické/ruské rozdělení, ale Soniox říká, že režim streamování v4 zlepšuje přesnost.
Hlavní jídlo s sebou: pro ruštinu vypadají Soniox a Deepgram silnější než starší přístupy ve stylu Whisper v reálných benchmarcích, zatímco gpt-4o-mini-transcribe vypadá dobře na FLEURS. Ale FLEURS, YouTube, hovory a živé rozhovory jsou různá prostředí. Výběr modelu by měl vzít v úvahu jak WER, tak latenci.
Modely jeden po druhém
Groq Whisper Large v3 Turbo
Groq Whisper Large v3 Turbo je nejrychlejší Sobes možnost, když je deaktivován Realtime STT. Hodí se k krátkým odpovědím, rychlým rozhovorům a situacím, kde záleží na minimální latenci více než na maximální přesnosti obtížné řeči.
Jeho hlavní předností je rychlost. Průvodce ASR společnosti Groq uvádí obecnou WER přibližně 12 % pro Whisper Large v3 Turbo a zrychlení až 247x vzhledem k délce zvuku. To z něj dělá dobrou volbu pro krátké poznámky, kde na zpoždění záleží nejvíce.
Pokud řeč obsahuje hodně ruštiny, jména, zkratky, anglická odborná slova v ruské řeči, hluk nebo silný přízvuk, může Groq udělat více chyb. V takovém případě je OpenAI nebo Soniox obvykle lepší záložní variantou, protože na zachování přesného znění záleží více než na hrubé rychlosti.
OpenAI gpt-4o-mini-transscribe
OpenAI gpt-4o-mini-transcribe přepíše dokončený audio segment. Je pomalejší než Groq Whisper Large v3 Turbo, ale obvykle pečlivěji zpracovává nuance řeči, technické výrazy a detaily otázek.
OpenAI říká, že gpt-4o-transcribe a gpt-4o-mini-transcribe zlepšují WER a rozpoznávání jazyka ve srovnání s Whisperem. V nezávislém benchmarku FLEURS je gpt-4o-mini-transcribe uvedena na 3,65 % WER pro angličtinu a 5,30 % pro ruštinu.
OpenAI gpt-4o-mini-transcribe je dobrá možnost vyšší kvality s deaktivovaným STT v reálném čase, když Groq Whisper Large v3 Turbo dělá ve vaší řeči nebo mikrofonu příliš mnoho chyb.
Deepgram Nova-3
Deepgram je silný ve scénářích STT v reálném čase. Nova-3 pracuje s dokončeným zvukem i streamováním a dokumenty Deepgramu hlásí WER 6,84 % u streamovaného přepisu a 5,26 % u dokončených nahrávek na sadě 2 703 skutečných zvukových souborů.
V Sobes je Deepgram užitečný, když chcete vidět text téměř okamžitě, místo abyste čekali, až fráze skončí. S deaktivovaným Realtime STT je průměrná transkripční latence přibližně 900 ms; s povoleným STT v reálném čase je to přibližně 300 ms. Díky tomu je Deepgram vhodný pro dlouhé fráze, živé titulky, smíšenou řeč a rozhovory v angličtině, zvláště když má tazatel regionální přízvuk.
Samostatnou výhodou Deepgramu je podpora anglických variant. Můžete si vybrat nejen obecnou angličtinu, ale také americký, Britové, australský, indickýnebo Nový Zéland anglicky. To pomáhá při mezinárodních pohovorech, kde má tazatel neznámý přízvuk a technické výrazy se mísí s rychlou konverzační angličtinou.
Pro ruštinu vypadá Deepgram také slušně: srovnání Soniox uvádí 8,0 % WER pro ruštinu.
Soniox STT v5, Realtime STT zakázáno
Soniox STT v5 funguje dobře pro ruštinu, smíšenou řeč a obtížné technické výrazy, ale s deaktivovaným STT v reálném čase je to nejpomalejší možnost: průměrná latence přepisu je kolem 2500 ms. Dává to smysl, když na přesnosti v ruštině a smíšené řeči záleží více než na rychlosti odezvy.
Silnou stránkou Sonioxu je vícejazyčné rozpoznávání a přepínání jazyků. Pokrývá také velké množství méně běžných jazyků, kde modely pro všeobecné použití často degradují více než angličtinu. To je důležité i pro rusky mluvící rozhovory, kde jedna fráze může obsahovat React, PostgreSQL, Kafka, thread pool, event loop a ruská slova zakončená anglickými odbornými výrazy.
Soniox STT v5, povoleno STT v reálném čase
Soniox STT v5 s povoleným Realtime STT je nejlepší volbou, když potřebujete ruskou řeč a zároveň minimální latenci. V průměru dorazí konečný přepis asi 200 ms po frázi. Tato možnost se hodí obzvláště dobře ve VAD a Start / Stop: text se streamuje živě, dobře zvládá rusko-anglické fráze a po pauze rychle uzamkne konečný text.
Krátká verze: co byste si měli vybrat?
Pokud to nechcete přehánět:
- Realtime STT funguje ve VAD a Start / Stop. V One-Shot použijte možnosti s deaktivovaným Realtime STT.
- Groq Whisper Large v3 Turbo je nejrychlejší možností s vypnutým STT v reálném čase pro krátké fráze a typické rozhovory.
- OpenAI gpt-4o-mini-transscribe je dobrá možnost deaktivace STT v reálném čase, když chcete pečlivější přepis přes OpenAI.
- Deepgram Nova-3, Realtime STT zakázáno dává solidní kvalitu, ale s průměrnou latencí kolem 900 ms.
- Deepgram Nova-3, povoleno STT v reálném čase je režim rychlého streamování, přibližně 300 ms do konečného textu po frázi.
- Soniox STT v5, Realtime STT zakázáno je silný pro ruskou a smíšenou řeč, ale má nejvyšší latenci: kolem 2500 ms.
- Soniox STT v5, povoleno STT v reálném čase je nejrychlejší možností streamování pro přepínání ruštiny a jazyka: přibližně 200 ms.
