Sobes.tech
Vissza a cikkekhez

Hogyan válasszunk beszédátírási modellt?

Alexander2026. május 10. (2 мес. назад)
Hogyan válasszunk beszédátírási modellt?

Az MI válaszok minősége a nyelvi modell előtt kezdődik. A beszéd átiratával kezdődik. Ha a rendszer félreérti a kérdést, még egy erős modell is válaszol a torzított szövegre.

A Sobes-ban több beszédfelismerő modell közül választhatsz: Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, Deepgram Nova-3 és Soniox STT v5. Nemcsak pontosságban, hanem késleltetésben, a viselkedés rögzítésében, a nyelvi támogatásban és a zajos megbeszélések kezelésében is különböznek.

Mit változtat a valós idejű STT?

A Sobes interfészben a legfontosabb beállítás egyszerű: Realtime STT letiltva vagy Realtime STT engedélyezve.

Valós idejű STT kikapcsolva

Sobes elküld egy kész hangrészletet elismerésre, és várja a végső szöveget. Így működnek Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, valamint Deepgram Nova-3 és Soniox STT v5, amikor a valós idejű STT le van tiltva.

Ez egy egyszerű, stabil áramlás rövid frazitokra: a szöveg befejezett átiratként érkezik, köztes javítások nélkül. A kompromisszum, hogy a Sobes csak a hang elküldése után kap szöveget. A hosszú kifejezések egyre feltűnőbbé teszik a késést, és nincs élő szóközvetítés, miközben az illető beszél.

Valós idejű STT engedélyezve

A Sobes hangot továbbít a modellhez, és részleges szöveget kap, mielőtt a kifejezés véget ér. Így működik a Deepgram Nova-3 és Soniox STT v5, amikor valós idejű STT be van kapcsolva.

A streaming átiratban a szöveg először vázlat lehet: a modell módosíthatja a szavakat, miközben az illető tovább beszél. Véglegesítés az a pillanat, amikor a kifejezés véget ér, a modell abbahagyja a szövegszegmens megváltoztatását, és Sobes biztonságosan továbbíthatja azt.

A valós idejű STT lényege a reakciósebesség. Láthatod, hogy a rendszer most is hallja a beszédet, a hosszú válaszok olvashatóvá válnak, mielőtt a mondat vége lenne, és az automatikus válasz hamarabb elindulhat. A kompromisszum az, hogy a részleges szöveg változhat, a minőség inkább a kapcsolat stabilitásától függ, és néha várni kell, amíg a modell lezárja a végső szöveget a kifejezéshez.

Mely felvételi módok támogatják a valós idejű STT-t?

Fontos részlet: Valós idejű STT működik VAD és Start / Stop módokban. A VAD-ban a Sobes automatikusan érzékeli a beszédet, elkezdi a felvételt, és egy szünet után lezárja a szegmenst. Start / Stop módban kézzel irányítod a kezdetet és a véget, de a streaming átiratok még akkor is futhatnak, amikor a felvétel aktív.

A One-Shot alatt a valós idejű STT nem használatos: a Sobes az audio pufferből a végső másodperceket veszi fel, és egy kész szegmenst küld átírásra.

Tehát ha Deepgramot vagy Sonioxot választasz, de One-Shotot használsz, használd a "Realtime STT disabled" késleltetésszámokat referenciaként.

Transzkripciós késleltetés

Ez a beszédfelismerő késleltetés: mennyi ideig vár Sobes a szövegre egy befejezett hangos szegmens után, vagy miután egy streaming modell lezárja a végső szöveget egy frázshoz. Nem tartalmazza az illető beszédének idejét, és nem tartalmazza az AI válaszgenerálását.

Modell Valós idejű STT kikapcsolva Valós idejű STT engedélyezve Mit jelent
Groq Whisper Nagy V3 Turbo 500-600 ms Nem elérhető A leggyorsabb nem streaming lehetőség. Jó rövid kérdésekhez.
OpenAI gpt-4o-mini-transcribe 600-900 ms Nem elérhető Kicsit lassabb, mint Groq, de általában óvatosabb a nehéz beszéddel.
Deepgram Nova-3 Körülbelül 900 ms Körülbelül 300 ms A valós idejű STT bekapcsolásával a végső szöveg sokkal gyorsabban jelenik meg.
Soniox STT v5 Körülbelül 2500 ms Körülbelül 200 ms A leglassabb valós idejű STT nélkül, de a leggyorsabb a végső szöveg rögzítésében, amikor a valós idejű STT engedélyezve.

A valós idejű STT nem csupán egy jelölőnégyzet. A Deepgram és a Soniox esetében ez megváltoztatja, hogy milyen gyorsan érzed a terméket: a szöveg szinte azonnal megjelenik, és a végső átirat gyorsabban érkezik, mint amikor Sobes egy befejezett hangrészletet küld a frakció után.

WER: mi ez, és hogyan néznek ki a számok

A WER jelentése Szóhiba Arány: a helytelenül felismert szavak aránya. Minél alacsonyabb a WER, annál jobb. Például a 6%-os WR azt jelenti, hogy körülbelül 6 szóból 100 szóból hibásan ismertek el: kicserélték, kihagyták vagy véletlenül hozzáadták.

Fontos: a WER nehéz összehasonlítani kontextus nélkül. Ugyanaz a modell 4%-ot mutat tiszta angol hangon, és 15%-ot egy zajos hívásnál, akcentusokkal, megszakításokkal és gyenge mikrofonnal. Tehát az alábbi számok nyilvános referenciapontok, nem garantálják minden interjút. A forrás számít, mert a szolgáltatók különböző adathalmazokat és értékelési módszereket használnak.

Groq Whisper Large v3 Turbo. A Groq általános WER-t körülbelül 12%-ról számol be, de nem tesz közzé külön angol/orosz bontást. Családi szintű Whisper referenciaként a FLEURS benchmark 4,00%-ot mutat angolul és 5,13%-kal oroszul.

OpenAI gpt-4o-mini-transcribe. A Voxtral Realtime cikkben szereplő FLEURS benchmark szerint az angol oldalon **3,65%, oroszban **5,30%. Az OpenAI azt is mondja, hogy gpt-4o-transcribe és gpt-4o-mini-transcribe javítják a WER-t a Whisper v2/v3-hoz képest, de a dokumentációja nem közöl egyszerű elemzést ezekről a két nyelvről.

Deepgram Nova-3. Angol nyelven a Deepgram 5,26% a kész hangzásért és 6,84% a streamingért is beszámol. Orosz esetében a nyilvános Soniox összehasonlítás 8,0%-ot említi. Deepgram erőssége az angol változatokban és akcentusokban: amerikai, brit, ausztrál, indiai és új-zélandi angol.

Soniox STT v5. A Soniox egy 60 nyelves benchmarkban körülbelül 6,5%-ot jelent angolban és körülbelül 6,2%-ot oroszban. Nincs külön angol/orosz bontási rendszer a valós idejű STT-re, de a Soniox szerint a v4 streaming mód javítja a pontosságot.

A fő tanulság: orosz szinten a Soniox és a Deepgram erősebbnek tűnik, mint a régebbi, Whisper-stílusú megközelítések a valós mérföldi teszteken, míg gpt-4o-mini-transcribe jól néz ki a FLEURS-en. De a FLEURS, a YouTube, a hívások és az élő interjúk más környezetek. A modellválasztásnak figyelembe kell vennie mind a WR-t, mind a késleltetést.

Modellek egyenként

Groq Whisper Nagy V3 Turbo

A Groq Whisper Large v3 Turbo a leggyorsabb Sobes opció, ha a valós idejű STT ki van kapcsolva. Rövid válaszokat, gyors interjúkat és olyan helyzeteket tartalmaz, ahol a minimális késleltetés fontosabb, mint a maximális pontosság nehéz beszédben.

Fő ereje a sebesség. A Groq ASR útmutatója szerint a Whisper Large v3 Turbo általános WER körülbelül 12%, és a hanghosszhoz képest akár 247-szeres gyorsulás is lehetséges. Ez jó választássá teszi rövid megjegyzésekhez, ahol a késlelés a legfontosabb.

Ha a beszéd sok orosz nyelvet tartalmaz, neveket, rövidítéseket, angol technikai szavakat az orosz nyelven belül, zajt vagy erős akcentust, Groq több hibát követhet el. Ebben az esetben az OpenAI vagy a Soniox általában jobb tartalék, mert a pontos megfogalmazás megőrzése fontosabb, mint a nyers sebesség.

OpenAI gpt-4o-mini-transcribe

Az OpenAI gpt-4o-mini-transcribe egy befejezett hangrészletet ír át. Lassabb, mint a Groq Whisper Large v3 Turbo, de általában gondosabban kezeli a beszéd árnyalatait, a technikai kifejezéseket és a kérdés részleteit.

Az OpenAI szerint gpt-4o-transcribe és gpt-4o-mini-transcribe javítják a WER és a nyelvfelismerést a Whisperhez képest. A független FLEURS benchmarkban gpt-4o-mini-transcribe angol és 5,30% nyugati arányban szerepel.

Az OpenAI gpt-4o-mini-transcribe egy jó, jobb minőségű opció, amikor a valós idejű STT ki van tiltva, amikor a Groq Whisper Large v3 Turbo túl sok hibát követ el a beszédeddel vagy a mikrofonoddal.

Deepgram Nova-3

A Deepgram erős a valós idejű STT helyzetekben. A Nova-3 mind befejezett hangzással, mind streaminggel dolgozik, és a Deepgram dokumentumai 6,84%-os WER-t jelentenek a streaming átiratolásnál, és 5,26%-ot a költött felvételeknél 2 703 valós hangfájlból álló készleten.

A Sobes-ban a Deepgram hasznos, ha szinte azonnal látni akarod a szöveget, ahelyett, hogy várnád, amíg a kifejezés véget ér. Valós idejű STT kikapcsolásával az átlagos átiratátviteli késleltetés körülbelül 900 ms; Realtime STT bekapcsolva körülbelül 300 ms. Ez kényelmessé teszi a Deepgramot hosszú kifejezésekhez, élő feliratokhoz, vegyes beszédhez és angol interjúkhoz, különösen, ha az interjúztatónak regionális akcentusa van.

Egy külön Deepgram előnye az angol változatok támogatása. Választhatsz nemcsak általános angolt, hanem amerikai, brit, ausztrál, indiai vagy új-zélandi angolt is. Ez segít nemzetközi interjúkon, ahol az interjúztatónak ismeretlen akcentusa van, és a technikai kifejezések gyors beszélgetési angol nyelvvel keverednek.

Orosz szinten a Deepgram is rendben van: a Soniox összehasonlítása 8,0%-os ÉSZAK-arányt mutat az orosz esetében.

Soniox STT v5, valós idejű STT kikapcsolva

A Soniox STT v5 jól működik orosz, vegyes nyelvű beszéd és nehéz technikai kifejezések esetén, de a valós idejű STT letiltásával ez a leglassabb opció: az átlagos átiratási késleltetés körülbelül 2500 ms. Ez akkor érthető, ha az orosz és vegyes beszéd pontossága fontosabb, mint a válaszsebesség.

A Soniox erőssége a többnyelvű felismerés és a nyelvváltás. Emellett lefed egy olyan kevésbé gyakori nyelvkészletet is, ahol az általános célú modellek gyakran jobban romlanak, mint angolon. Ez az orosz nyelvű interjúknál is számít, ahol egyetlen kifejezés tartalmazhat React, PostgreSQL, Kafka, thread pool, event loop és orosz szóvégeket az angol technikai kifejezések körül.

Soniox STT v5, valós idejű STT engedélyezve

A Soniox STT v5 valós idejű STT-vel a legjobb választás, ha egyszerre orosz beszédre és minimális késleltetésre van szükséged. Átlagosan a végleges átirat körülbelül 200 másodperccel a kifejezés után érkezik. Ez az opció különösen jól illik a VAD és Start / Stop beállításokhoz: a szöveg élő streamet sugározza, jól kezeli az orosz-angol kifejezéseket, és egy szünet után gyorsan rögzíti a végső szöveget.

Röviden: mit válassz?

Ha nem akarod túlgondolni:

  • Valós idejű STT működik VAD-ban és Start / Stop rendszerekben. One-Shotban használd a lehetőségeket, ha a valós idejű STT kikapcsolva van.
  • Groq Whisper Large v3 Turbo a leggyorsabb opció, amikor a Realtime STT ki van kapcsolva rövid kifejezésekhez és tipikus interjúkhoz.
  • OpenAI gpt-4o-mini-transcribe jó valós idejű STT letiltó opció, ha gondosabb átiratolást szeretnél az OpenAI-n keresztül.
  • Deepgram Nova-3, Realtime STT kikapcsolva jó minőséget ad, de az átlagos késleltetés körülbelül 900 ms.
  • Deepgram Nova-3, Realtime STT engedélyezve egy gyors streaming mód, körülbelül 300 ms a végső szövegig egy frért után.
  • Soniox STT v5, Realtime STT kikapcsolva erős orosz és vegyes nyelvű beszédhez, de a legnagyobb késleltetéssel rendelkezik: körülbelül 2500 ms.
  • Soniox STT v5, Realtime STT engedélyezve a leggyorsabb streaming opció orosz és nyelvváltáshoz: körülbelül 200 ms.