AI atsakymų kokybė prasideda prieš kalbos modelį. Tai prasideda kalbos transkripcija.
Jei sistema neteisingai išgirs klausimą, net stiprus modelis atsakys į iškreiptą tekstą.
„Sobes“ galite rinktis iš kelių kalbos atpažinimo modelių: Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transscribe, Deepgram Nova-3 ir Soniox STT v5. Jie skiriasi ne tik tikslumu, bet ir delsa, įrašymo elgesiu, kalbos palaikymu ir tuo, kaip jie tvarko triukšmingus susitikimus.
Ką keičia realaus laiko STT?
„Sobes“ sąsajoje svarbus nustatymas yra paprastas: Realiojo laiko STT išjungta arba Realiojo laiko STT įjungta.
STT realiuoju laiku išjungtas
Sobes siunčia baigtą garso segmentą atpažinti ir laukia galutinio teksto.
Taip veikia Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transscribe, taip pat Deepgram Nova-3 ir Soniox STT v5, kai realaus laiko STT išjungtas.
Tai paprastas, stabilus trumpų frazių srautas: tekstas gaunamas kaip baigtas nuorašas, be tarpinių pataisymų. Kompromisas yra tas, kad Sobes gauna tekstą tik po to, kai išsiunčiamas garso segmentas. Dėl ilgų frazių delsimas tampa labiau pastebimas, o žmogui kalbant nėra tiesioginio žodžių srauto.
STT realiuoju laiku įgalintas
„Sobes“ perduoda garsą modeliui ir gauna dalinį tekstą dar nepasibaigus frazei.
Taip veikia Deepgram Nova-3 ir Soniox STT v5, kai įjungtas Realtime STT.
Srautinio transkripcijos metu tekstas iš pradžių gali būti juodraštis: modelis gali peržiūrėti žodžius, kol asmuo kalba. Užbaigimas – tai momentas, kai baigiasi frazė, modelis nustoja keisti tą teksto segmentą ir Sobes gali saugiai perduoti jį į priekį.
Realtime STT esmė yra reakcijos greitis. Matote, kad sistema šiuo metu girdi kalbą, ilgi atsakymai tampa įskaitomi dar nepasibaigus frazei, o automatinis atsakymas gali prasidėti anksčiau. Kompromisas yra tas, kad dalinis tekstas gali keistis, kokybė labiau priklauso nuo ryšio stabilumo, o kartais reikia palaukti, kol modelis užfiksuos galutinį frazės tekstą.
Kurie įrašymo režimai palaiko realaus laiko STT?
Svarbi detalė: Realiojo laiko STT veikia VAD ir Start/Stop režimais. VAD sistemoje Sobes automatiškai aptinka kalbą, pradeda įrašymą ir uždaro segmentą po pauzės. Pradėti / sustabdyti pradžią ir pabaigą valdote rankiniu būdu, tačiau transliacijos transkripcija vis tiek gali būti vykdoma, kol įrašymas aktyvus.
Naudojant One-Shot, realaus laiko STT nenaudojamas: „Sobes“ paima paskutines sekundes iš garso buferio ir siunčia užbaigtą segmentą transkripcijai.
Taigi, jei pasirenkate „Deepgram“ arba „Soniox“, bet naudojate „One-Shot“, kaip nuorodą naudokite „Realiojo laiko STT išjungta“ delsos numerius.
Transkripcijos delsa
Tai kalbos atpažinimo delsa: kiek laiko Sobes laukia teksto po užbaigto garso segmento arba po to, kai srautinio perdavimo modelis užrakina galutinį frazės tekstą. Į jį neįtraukiamas laikas, kol asmuo kalba, ir AI atsakymo generavimas.
| Modelis | STT realiuoju laiku išjungtas | STT realiuoju laiku įjungtas | Ką tai reiškia |
|---|---|---|---|
| Groq Whisper Large v3 Turbo | 500–600 ms | Nėra | Greičiausias ne srautinio perdavimo variantas. Tinka trumpiems klausimams. |
OpenAI gpt-4o-mini-transcribe |
600–900 ms | Nėra | Šiek tiek lėtesnis nei Groq, bet dažniausiai atsargesnis kalbant sunkiai. |
| Deepgram Nova-3 | apie 900 ms | apie 300 ms | Įjungus realiojo laiko STT, galutinis tekstas pasirodo daug greičiau. |
| Soniox STT v5 | apie 2500 ms | apie 200 ms | Lėčiausia be realiojo laiko STT, bet greičiausia užrakinama galutiniame tekste, kai įgalinta STT realiuoju laiku. |
STT realiuoju laiku nėra tik žymės langelis. „Deepgram“ ir „Soniox“ keičia produkto veikimo greitį: tekstas pradeda pasirodyti beveik iš karto, o galutinis nuorašas gaunamas greičiau nei tada, kai „Sobes“ siunčia užbaigtą garso segmentą po frazės.
WER: kas tai yra ir kaip atrodo skaičiai
WER reiškia Word Error Rate: neteisingai atpažintų žodžių dalis. Kuo mažesnis WER, tuo geriau. Pavyzdžiui, 6 % WER reiškia, kad maždaug 6 iš 100 žodžių buvo atpažinti neteisingai: pakeisti, praleisti arba pridėti per klaidą.
Svarbu: WER sunku palyginti be konteksto. Tas pats modelis gali parodyti 4% švaraus anglų kalbos garso ir 15% triukšmingo skambučio su akcentais, pertraukimais ir prastu mikrofonu. Taigi žemiau pateikti skaičiai yra vieši atskaitos taškai, o ne kiekvieno interviu garantija. Šaltinis yra svarbus, nes teikėjai naudoja skirtingus duomenų rinkinius ir vertinimo metodus.
Groq Whisper Large v3 Turbo.
Groq praneša apie 12 % bendrą WER, bet neskelbia atskiro anglų kalbos/Russian suskirstymo. Kaip šeimos lygio „Whisper“ nuoroda, FLEURS etalonas rodo 4,00 % anglų kalba ir 5,13 % rusų kalbai.
OpenAI gpt-4o-mini-transkribuoti.
FLEURS etalonas Voxtral Realtime straipsnyje nurodo 3,65% anglų kalba ir 5,30% rusų kalba. OpenAI taip pat sako, kad gpt-4o-transcribe ir gpt-4o-mini-transcribe pagerina WER, palyginti su Whisper v2/v3,, tačiau jo dokumentuose neskelbiamas paprastas šių dviejų kalbų suskirstymas.
Deepgram Nova-3.
Anglų kalba „Deepgram“ nurodo 5,26% už baigtą garsą ir 6,84% už srautinį perdavimą. Rusų kalba vieši Soniox palyginimo sąrašai 8,0%. „Deepgram“ stiprybė – angliški variantai ir akcentai: amerikiečių, britų, australų, indų ir naujosios Zelandijos anglų kalbos.
Soniox STT v5.
„Soniox“ praneša apie apie 6,5 % anglų kalba ir apie 6,2 % rusų kalba pagal 60 kalbų etaloną. Realtime STT nėra atskiro anglų/Russian suskirstymo, tačiau Soniox teigia, kad v4 srautinio perdavimo režimas pagerina tikslumą.
Pagrindinis aspektas: Rusų kalboms Soniox ir Deepgram atrodo stipriau nei senesni Whisper stiliaus metodai, naudojant realaus pasaulio etalonus, o gpt-4o-mini-transcribe puikiai atrodo FLEURS. Tačiau FLEURS, YouTube, skambučiai ir tiesioginiai interviu yra skirtingos aplinkos. Renkantis modelį reikia atsižvelgti ir į WER, ir į delsą.
Modeliai po vieną
Groq Whisper Large v3 Turbo
„Groq Whisper Large v3 Turbo“ yra greičiausia „Sobes“ parinktis, kai realaus laiko STT išjungtas. Jis tinka trumpiems atsakymams, greitiems interviu ir situacijoms, kai minimali delsa yra svarbesnė nei maksimalus sudėtingos kalbos tikslumas.
Pagrindinė jo stiprybė yra greitis. Groq ASR vadove nurodoma, kad bendras WER yra maždaug 12 % Whisper Large v3 Turbo ir pagreitis iki 247 kartų, palyginti su garso trukme. Tai yra geras pasirinkimas trumpoms pastaboms, kai delsimas yra svarbiausias.
Jei kalboje yra daug rusų kalbos, pavadinimų, santrumpų, anglų kalbos techninių žodžių rusų kalboje, triukšmo ar stipraus kirčio, Groq gali padaryti daugiau klaidų. Tokiu atveju OpenAI arba Soniox paprastai yra geresnis atsarginis variantas, nes tikslios formuluotės išsaugojimas yra svarbesnis nei neapdorotas greitis.
OpenAI gpt-4o-mini-transkribuoti
OpenAI gpt-4o-mini-transcribe perrašo užbaigtą garso segmentą. Jis yra lėtesnis nei „Groq Whisper Large v3 Turbo“, tačiau paprastai atidžiau tvarko kalbos niuansus, techninius terminus ir klausimų detales.
OpenAI sako, kad gpt-4o-transcribe ir gpt-4o-mini-transcribe pagerina WER ir kalbos atpažinimą, palyginti su Whisper. Nepriklausomuose FLEURS etalonuose gpt-4o-mini-transcribe yra 3,65 % WER anglų kalba ir 5,30 % rusų kalba.
„OpenAI“ gpt-4o-mini-transcribe yra gera aukštesnės kokybės parinktis, kai realaus laiko STT išjungtas, kai „Groq Whisper Large v3 Turbo“ daro per daug klaidų jūsų kalboje ar mikrofone.
Deepgram Nova-3
Deepgram yra stipri realaus laiko STT scenarijuose. „Nova-3“ veikia tiek su užbaigtu garsu, tiek su srautiniu perdavimu, o „Deepgram“ dokumentai praneša, kad WER yra 6,84 % transliacijos transkripcijai ir 5,26 % užbaigtų įrašų 2 703 realaus pasaulio garso failų rinkinyje.
„Sobes“ programoje „Deepgram“ naudinga, kai norite pamatyti tekstą beveik iš karto, o ne laukti, kol baigsis frazė. Kai STT realiuoju laiku išjungtas, vidutinė transkripcijos delsa yra apie 900 ms; įjungus realaus laiko STT, tai yra apie 300 ms. Dėl to „Deepgram“ patogu naudoti ilgoms frazėms, tiesioginiams subtitrams, mišriai kalbai ir interviu anglų kalba, ypač kai pašnekovas turi regioninį akcentą.
Atskiras Deepgram pranašumas yra anglų kalbos variantų palaikymas. Galite pasirinkti ne tik bendrąją anglų kalbą, bet ir amerikietišką, britų, australų, indų arba naujosios Zelandijos anglų kalbą. Tai padeda tarptautiniuose interviu, kai pašnekovas turi nepažįstamą akcentą, o techniniai terminai maišomi su greita šnekamąja anglų kalba.
Rusų kalba Deepgram taip pat atrodo neblogai: Soniox palyginimas rodo 8,0% WER rusų kalbai.
Soniox STT v5, STT realiuoju laiku išjungtas
Soniox STT v5 puikiai tinka kalbant rusiškai, mišriomis kalbomis ir sudėtingais techniniais terminais, tačiau išjungus realaus laiko STT tai yra lėčiausia parinktis: vidutinė transkripcijos delsa yra apie 2500 ms. Tai prasminga, kai rusiškos ir mišrios kalbos tikslumas yra svarbesnis nei atsakymo greitis.
„Soniox“ stiprybė – daugiakalbis atpažinimas ir kalbų keitimas. Ji taip pat apima daug mažiau paplitusių kalbų, kuriose bendrosios paskirties modeliai dažnai blogėja nei anglų kalba. Tai svarbu ir interviu rusakalbiams, kai vienoje frazėje gali būti React, PostgreSQL, Kafka, thread pool, event loop ir rusiškų žodžių galūnių aplink angliškus techninius terminus.
Soniox STT v5, STT realiuoju laiku įjungtas
„Soniox STT v5“ su įjungtu realiuoju laiku STT yra geriausias pasirinkimas, kai reikia rusiškos kalbos ir minimalios delsos tuo pačiu metu. Vidutiniškai galutinis nuorašas gaunamas maždaug po 200 ms po frazės. Ši parinktis ypač tinka VAD ir Start / Stop: tekstas transliuojamas tiesiogiai, gerai tvarkomos rusų-anglų kalbos frazės, o po pauzės greitai užrakinamas galutinis tekstas.
Trumpa versija: ką pasirinkti?
Jei nenorite per daug galvoti:
- Realiojo laiko STT veikia VAD ir Start/Stop. Naudodami „One-Shot“ naudokite parinktis, kai realiojo laiko STT išjungta.
- Groq Whisper Large v3 Turbo yra greičiausia parinktis, kai realaus laiko STT išjungtas trumpoms frazėms ir tipiniams interviu.
- OpenAI gpt-4o-mini-transcribe yra gera realaus laiko STT išjungta parinktis, kai norite kruopštesnės transkripcijos naudojant OpenAI.
- Deepgram Nova-3, Realtime STT išjungtas užtikrina gerą kokybę, tačiau vidutinė delsa yra apie 900 ms.
- Deepgram Nova-3, Realtime STT įgalinta yra greitas srautinio perdavimo režimas, maždaug 300 ms iki galutinio teksto po frazės.
- Soniox STT v5, STT realiuoju laiku išjungta yra tinkama kalbai rusiškai ir mišriomis kalbomis, tačiau turi didžiausią delsą: apie 2500 ms.
- Soniox STT v5, įgalintas STT realiuoju laiku yra greičiausia rusų ir kalbos perjungimo galimybė: maždaug 200 ms.
