AI vastuste kvaliteet algab enne keelemudelit. See algab kõne transkriptsiooniga.
Kui süsteem kuuleb küsimust valesti, vastab isegi tugev mudel moonutatud tekstile.
Sobesis saate valida mitme kõnetuvastusmudeli vahel: Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transkriptsioon, Deepgram Nova-3 ja Soniox STT v5. Need erinevad mitte ainult täpsuse, vaid ka latentsuse, salvestuskäitumise, keeletoe ja mürarikaste koosolekute käsitlemise poolest.
Mida reaalajas STT muudab?
Sobesi liideses on oluline seadistus lihtne: Reaalajas STT keelatud või Reaalajas STT lubatud.
Reaalajas STT on keelatud
Sobes saadab äratundmiseks valmis helilõigu ja ootab lõplikku teksti.
Nii töötavad Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transkriptsioon ning ka Deepgram Nova-3 ja Soniox STT v5, kui reaalajas STT on keelatud.
See on lühikeste fraaside jaoks lihtne ja stabiilne voog: tekst saabub valmis ärakirjana, ilma vahepealsete parandusteta. Kompromiss seisneb selles, et Sobes saab teksti alles pärast helisegmendi saatmist. Pikad fraasid muudavad viivituse märgatavamaks ja inimese rääkimise ajal pole otsest sõnavoogu.
Reaalajas STT on lubatud
Sobes voogesitab heli modellile ja võtab osa teksti vastu enne fraasi lõppu.
Nii töötavad Deepgram Nova-3 ja Soniox STT v5, kui reaalajas STT on lubatud.
Voogesituse transkriptsioonis võib tekst alguses olla mustand: mudel võib sõnu muuta, kui inimene räägib. Lõpetamine on hetk, mil fraas on lõppenud, mudel lõpetab selle tekstilõigu muutmise ja Sobes saab selle ohutult edasi anda.
Reaalajas STT eesmärk on reaktsioonikiirus. Näete, et süsteem kuuleb praegu kõnet, pikad vastused muutuvad loetavaks enne fraasi lõppu ja automaatvastus võib alata varem. Kompromiss seisneb selles, et osaline tekst võib muutuda, kvaliteet sõltub rohkem ühenduse stabiilsusest ja mõnikord peate ootama, kuni mudel fraasi lõpliku teksti lukustab.
Millised salvestusrežiimid toetavad reaalajas STT-d?
Oluline detail: Reaalajas STT töötab VAD ja Start/Stop režiimides. VAD-is tuvastab Sobes kõne automaatselt, alustab salvestamist ja sulgeb segmendi pärast pausi. Menüüs Start/Stop saate algust ja lõppu käsitsi juhtida, kuid voogesituse transkriptsiooni saab siiski käivitada ka siis, kui salvestamine on aktiivne.
Funktsioonis One-Shot ei kasutata reaalajas STT-d: Sobes võtab helipuhvrist viimased sekundid ja saadab transkriptsiooniks valmis segmendi.
Nii et kui valite Deepgrami või Sonioxi, kuid kasutate One-Shoti, kasutage viitena "Reaalajas STT keelatud" latentsusnumbreid.
Transkriptsiooni latentsus
See on kõnetuvastuse latentsus: kui kaua Sobes ootab teksti pärast lõpetatud helisegmenti või pärast seda, kui voogesitusmudel lukustab fraasi lõpliku teksti. See ei sisalda aega, mil inimene räägib, ega AI vastuste genereerimist.
| Mudel | Reaalajas STT keelatud | Reaalajas STT lubatud | Mida see tähendab |
|---|---|---|---|
| Groq Whisper Large v3 Turbo | 500-600 ms | Pole saadaval | Kiireim mittevoogesituse valik. Hea lühikeste küsimuste jaoks. |
OpenAI gpt-4o-mini-transcribe |
600-900 ms | Pole saadaval | Veidi aeglasem kui Groq, kuid tavaliselt ettevaatlikum raske kõnega. |
| Deepgram Nova-3 | umbes 900 ms | umbes 300 ms | Kui reaalajas STT on lubatud, kuvatakse lõplik tekst palju kiiremini. |
| Soniox STT v5 | umbes 2500 ms | umbes 200 ms | Aeglasem ilma reaalajas STT-ta, kuid kiireim lõpliku teksti lukustamisel, kui reaalajas STT on lubatud. |
Reaalajas STT ei ole lihtsalt märkeruut. Deepgrami ja Sonioxi puhul muudab see seda, kui kiiresti toode tundub: tekst hakkab ilmuma peaaegu kohe ja lõplik transkriptsioon saabub kiiremini kui siis, kui Sobes saadab pärast fraasi valmis helilõigu.
WER: mis see on ja kuidas numbrid välja näevad
WER tähendab Word Error Rate: valesti tuvastatud sõnade osakaal. Mida madalam on WER, seda parem. Näiteks WER 6% tähendab, et ligikaudu 6 sõna 100-st tuvastati valesti: asendati, jäeti vahele või lisati kogemata.
Tähtis: WER-i on ilma kontekstita raske võrrelda. Sama mudel suudab näidata 4% puhtast ingliskeelsest helist ja 15% mürarohkest kõnest, millel on aktsendid, katkestused ja kehv mikrofon. Seega on allolevad numbrid avalikud võrdluspunktid, mitte iga intervjuu garantii. Allikas on oluline, kuna pakkujad kasutavad erinevaid andmekogumeid ja hindamismeetodeid.
Groq Whisper Large v3 Turbo.
Groq teatab üldiseks WER-iks umbes 12%, kuid ei avalda eraldi ingliskeelset/Russian jaotust. FLEURSi etalonina on peretasemel sosinal 4,00% inglise keele ja 5,13% vene keele jaoks.
OpenAI gpt-4o-mini-transkriptsioon.
Voxtral Realtime artiklis sisalduv FLEURSi võrdlusalus on 3,65% inglise keele ja 5,30% vene keele jaoks. OpenAI ütleb ka, et gpt-4o-transcribe ja gpt-4o-mini-transcribe parandavad WER-i võrreldes Whisper v2/v3,-ga, kuid selle dokumendid ei avalda nende kahe keele kohta lihtsat jaotust.
Deepgram Nova-3.
Inglise keeles teatab Deepgram 5,26% valmis heli ja 6,84% voogesituse kohta. Vene keeles on Sonioxi avalik võrdlusnimekiri 8,0%. Deepgrami tugevuseks on inglise keele variandid ja aktsendid: Ameerika, Briti, Austraalia, India ja Uus-Meremaa inglise keel.
Soniox STT v5.
Soniox teatab ligikaudu 6,5% inglise keeles ja umbes 6,2% vene keeles 60-keelses võrdlusaluses. Reaalajas STT jaoks pole eraldi inglisekeelset/Russian jaotust, kuid Soniox ütleb, et v4 voogesitusrežiim parandab täpsust.
Peamine kokkuvõte: Vene keele jaoks näevad Soniox ja Deepgram reaalsetes võrdlusnäitajates tugevamad välja kui vanemad Whisper-stiilis lähenemisviisid, samas kui gpt-4o-mini-transcribe näevad FLEURSi puhul head välja. Kuid FLEURS, YouTube, kõned ja reaalajas intervjuud on erinevad keskkonnad. Mudeli valikul tuleks arvesse võtta nii WER-i kui ka latentsust.
Mudelid ükshaaval
Groq Whisper Large v3 Turbo
Groq Whisper Large v3 Turbo on kiireim Sobesi valik, kui reaalajas STT on keelatud. See sobib lühikeste vastuste, kiirete intervjuude ja olukordadega, kus minimaalne latentsusaeg on raske kõne puhul olulisem kui maksimaalne täpsus.
Selle peamine tugevus on kiirus. Groqi ASR-i juhend teatab Whisper Large v3 Turbo üldiseks WER-iks umbes 12% ja kiirenduseks kuni 247-kordseks heli kestusega võrreldes. See teeb sellest hea võimaluse lühikeste märkuste jaoks, kus viivitus on kõige olulisem.
Kui kõnes on palju vene keelt, nimesid, lühendeid, ingliskeelseid tehnilisi sõnu vene kõne sees, müra või tugevat aktsenti, võib Groq teha rohkem vigu. Sel juhul on OpenAI või Soniox tavaliselt parem varu, sest täpse sõnastuse säilitamine loeb rohkem kui töötlemata kiirus.
OpenAI gpt-4o-mini-transkriptsioon
OpenAI gpt-4o-mini-transcribe transkribeerib lõpetatud helilõigu. See on aeglasem kui Groq Whisper Large v3 Turbo, kuid tavaliselt käsitleb see kõnenüansse, tehnilisi termineid ja küsimuste üksikasju hoolikamalt.
OpenAI ütleb, et gpt-4o-transcribe ja gpt-4o-mini-transcribe parandavad WER-i ja keeletuvastust võrreldes Whisperiga. Sõltumatu FLEURSi võrdlusaluses on gpt-4o-mini-transcribe inglise keele jaoks 3,65% WER ja vene keele jaoks 5,30%.
OpenAI gpt-4o-mini-transcribe on hea kõrgema kvaliteediga valik, mille reaalajas STT on keelatud, kui Groq Whisper Large v3 Turbo teeb teie kõnes või mikrofonis liiga palju vigu.
Deepgram Nova-3
Deepgram on reaalajas STT stsenaariumides tugev. Nova-3 töötab nii lõpetatud heli kui ka voogedastusega ning Deepgrami dokumendid teatavad WER-iks 6,84% voogesituse transkriptsiooni ja 5,26% lõpetatud salvestiste puhul 2703 reaalsest helifailist koosnevas komplektis.
Sobesis on Deepgram kasulik, kui soovite teksti peaaegu kohe näha, selle asemel, et oodata, kuni fraas on läbi. Kui reaalajas STT on keelatud, on transkriptsiooni keskmine latentsus umbes 900 ms; kui reaalajas STT on lubatud, on see umbes 300 ms. See muudab Deepgrami mugavaks pikkade fraaside, reaalajas subtiitrite, segakõne ja ingliskeelsete intervjuude jaoks, eriti kui intervjueerijal on piirkondlik aktsent.
Eraldi Deepgrami eeliseks on ingliskeelsete variantide tugi. Saate valida mitte ainult üldise inglise keele, vaid ka Ameerika, Briti, Austraalia, India või Uus-Meremaa inglise keele. See aitab rahvusvahelistel intervjuudel, kus intervjueerijal on harjumatu aktsent ja tehnilisi termineid segatakse kiire vestluse inglise keelega.
Vene keele jaoks näeb Deepgram ka korralik välja: Sonioxi võrdluses on vene keele jaoks 8,0% WER.
Soniox STT v5, reaalajas STT keelatud
Soniox STT v5 töötab hästi vene, segakeelse kõne ja keeruliste tehniliste terminite puhul, kuid kui reaalajas STT on keelatud, on see kõige aeglasem variant: keskmine transkriptsiooni latentsusaeg on umbes 2500 ms. See on mõistlik, kui täpsus vene ja segakõne puhul loeb rohkem kui reageerimiskiirus.
Sonioxi tugevuseks on mitmekeelne äratundmine ja keelevahetus. See hõlmab ka suurt hulka vähem levinud keeli, kus üldotstarbelised mudelid halvenevad sageli rohkem kui inglise keele puhul. See on oluline ka venekeelsete intervjuude puhul, kus üks fraas võib sisaldada React, PostgreSQL, Kafka, thread pool, event loop ja ingliskeelsete tehniliste terminite ümber venekeelseid sõnalõpusid.
Soniox STT v5, reaalajas STT lubatud
Soniox STT v5 koos reaalajas STT-ga on parim valik, kui vajate samal ajal venekeelset kõnet ja minimaalset latentsust. Keskmiselt saabub lõplik ärakiri umbes 200 ms pärast fraasi. See valik sobib eriti hästi VAD-is ja Start/Stop: tekst voogustab otse, saab hästi hakkama vene-ingliskeelsete fraasidega ja lukustab pärast pausi kiiresti lõppteksti.
Lühiversioon: mida peaksite valima?
Kui te ei taha seda üle mõelda:
- Reaalajas STT töötab VAD-is ja Start/Stop. Funktsioonis One-Shot kasutage valikuid, mille reaalajas STT on keelatud.
- Groq Whisper Large v3 Turbo on kiireim valik, kus reaalajas STT on lühikeste fraaside ja tüüpiliste intervjuude jaoks keelatud.
- OpenAI gpt-4o-mini-transcribe on hea reaalajas STT keelatud valik, kui soovite OpenAI kaudu hoolikamat transkriptsiooni.
- Deepgram Nova-3, reaalajas STT on keelatud tagab kindla kvaliteedi, kuid keskmise latentsusega umbes 900 ms.
- Deepgram Nova-3, reaalajas STT lubatud on kiire voogesituse režiim, umbes 300 ms kuni fraasijärgse tekstini.
- Soniox STT v5, reaalajas STT on keelatud sobib hästi vene ja segakeelse kõne jaoks, kuid sellel on suurim latentsusaeg: umbes 2500 ms.
- Soniox STT v5, reaalajas STT lubatud on kiireim voogesitusvõimalus vene keele ja keele vahetamiseks: umbes 200 ms.
