AI atbilžu kvalitāte sākas pirms valodas modeļa. Tas sākas ar runas transkripciju.
Ja sistēma nepareizi uzklausa jautājumu, pat spēcīgs modelis atbildēs uz izkropļotu tekstu.
Pakalpojumā Sobes varat izvēlēties starp vairākiem runas atpazīšanas modeļiem: Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, Deepgram Nova-3 un Soniox STT v5. Tie atšķiras ne tikai ar precizitāti, bet arī ar latentumu, ierakstīšanas uzvedību, valodas atbalstu un to, kā viņi rīkojas trokšņainās sanāksmēs.
Ko maina reāllaika STT?
Sobes saskarnē svarīgais iestatījums ir vienkāršs: Reāllaika STT atspējots vai Reāllaika STT iespējots.
Reāllaika STT ir atspējota
Sobes nosūta gatavu audio segmentu atpazīšanai un gaida galīgo tekstu.
Šādi darbojas Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transscribe, kā arī Deepgram Nova-3 un Soniox STT v5, kad ir atspējota reāllaika STT.
Šī ir vienkārša, stabila plūsma īsām frāzēm: teksts tiek saņemts kā pabeigts atšifrējums, bez starplabojumiem. Kompromiss ir tāds, ka Sobes saņem tekstu tikai pēc audio segmenta nosūtīšanas. Garas frāzes padara kavēšanos pamanāmāku, un, kamēr cilvēks runā, nav tiešraides vārdu.
Reāllaika STT ir iespējots
Sobes straumē audio modelim un saņem daļēju tekstu, pirms frāze ir beigusies.
Šādi darbojas Deepgram Nova-3 un Soniox STT v5, kad ir iespējots reāllaika STT.
Straumēšanas transkripcijā teksts sākumā var būt melnraksts: modelis var pārskatīt vārdus, kamēr persona turpina runāt. Pabeigšana ir brīdis, kad frāze ir beigusies, modelis pārtrauc mainīt šo teksta segmentu, un Sobes var to droši nodot tālāk.
Reāllaika STT mērķis ir reakcijas ātrums. Var redzēt, ka sistēma šobrīd dzird runu, garas atbildes kļūst nolasāmas, pirms frāze ir beigusies, un automātiskā atbilde var sākties ātrāk. Kompromiss ir tāds, ka daļējs teksts var mainīties, kvalitāte vairāk ir atkarīga no savienojuma stabilitātes, un dažreiz ir jāgaida, līdz modelis bloķē frāzes galīgo tekstu.
Kuri ierakstīšanas režīmi atbalsta reāllaika STT?
Svarīga informācija: Reāllaika STT darbojas VAD un Start/Stop režīmos. VAD programmā Sobes automātiski nosaka runu, sāk ierakstīšanu un pēc pauzes aizver segmentu. Sadaļā Start/Stop jūs manuāli kontrolējat sākumu un beigas, taču straumēšanas transkripcija joprojām var darboties, kamēr ir aktīva ierakstīšana.
One-Shot režīmā reāllaika STT netiek izmantots: Sobes ņem pēdējās sekundes no audio bufera un nosūta gatavu segmentu transkripcijai.
Tātad, ja izvēlaties Deepgram vai Soniox, bet izmantojat One-Shot, izmantojiet latentuma numurus "Reāllaika STT atspējots" kā atsauci.
Transkripcijas latentums
Šis ir runas atpazīšanas latentums: cik ilgi Sobes gaida tekstu pēc pabeigta audio segmenta vai pēc tam, kad straumēšanas modelis bloķē frāzes galīgo tekstu. Tas neietver laiku, kamēr persona runā, un neietver AI atbilžu ģenerēšanu.
| Modelis | Reāllaika STT atspējota | Reāllaika STT iespējots | Ko tas nozīmē |
|---|---|---|---|
| Groq Whisper Large v3 Turbo | 500-600 ms | Nav pieejams | Ātrākā iespēja bez straumēšanas. Piemērots īsiem jautājumiem. |
OpenAI gpt-4o-mini-transcribe |
600-900 ms | Nav pieejams | Nedaudz lēnāks par Groq, bet parasti uzmanīgāks ar sarežģītu runu. |
| Deepgram Nova-3 | apmēram 900 ms | apmēram 300 ms | Ja ir iespējots reāllaika STT, gala teksts tiek parādīts daudz ātrāk. |
| Soniox STT v5 | apmēram 2500 ms | apmēram 200 ms | Lēnākais bez reāllaika STT, bet ātrākais gala teksta bloķēšanā, ja ir iespējots reāllaika STT. |
Reāllaika STT nav tikai izvēles rūtiņa. Attiecībā uz Deepgram un Soniox tas maina produkta darbības ātrumu: teksts sāk parādīties gandrīz nekavējoties, un galīgais atšifrējums tiek saņemts ātrāk nekā tad, kad Sobes pēc frāzes nosūta pabeigtu audio segmentu.
WER: kas tas ir un kā izskatās skaitļi
WER nozīmē vārdu kļūdu līmenis: nepareizi atpazīto vārdu daļa. Jo zemāks WER, jo labāk. Piemēram, WER 6% nozīmē, ka aptuveni 6 no 100 vārdiem tika atpazīti nepareizi: aizstāti, izlaisti vai pievienoti kļūdas dēļ.
Svarīgi: WER ir grūti salīdzināt bez konteksta. Tas pats modelis var parādīt 4% tīrā angļu valodas audio un 15% trokšņainā zvanā ar akcentiem, pārtraukumiem un sliktu mikrofonu. Tātad zemāk minētie skaitļi ir publiski atskaites punkti, nevis garantija katrai intervijai. Avotam ir nozīme, jo pakalpojumu sniedzēji izmanto dažādas datu kopas un novērtēšanas metodes.
Groq Whisper Large v3 Turbo.
Groq ziņo par vispārējo WER aptuveni 12%, bet nepublicē atsevišķu angļu valodas/Russian sadalījumu. Kā ģimenes līmeņa Whisper atsauce FLEURS etalonā ir 4,00% angļu valodā un 5,13% krievu valodā.
OpenAI gpt-4o-mini-transscribe.
FLEURS etalons Voxtral Realtime rakstā norāda 3,65% angļu valodā un 5,30% krievu valodā. OpenAI arī saka, ka gpt-4o-transcribe un gpt-4o-mini-transcribe uzlabo WER salīdzinājumā ar Whisper v2/v3,, taču tā dokumenti nepublicē vienkāršu sadalījumu šīm divām valodām.
Deepgram Nova-3.
Angļu valodā Deepgram uzrāda 5,26% par pabeigto audio un 6,84% par straumēšanu. Krievu valodā Soniox publiskajos salīdzināšanas sarakstos ir 8,0%. Deepgram stiprā puse ir angļu valodas varianti un akcenti: amerikāņu, britu, austrāliešu, indiešu un jaunzēlandiešu angļu valoda.
Soniox STT v5.
Soniox ziņo par apmēram 6,5% angļu valodā un apmēram 6,2% krievu valodā 60 valodu etalonā. Reāllaika STT nav atsevišķa angļu/Russian sadalījuma, taču Soniox saka, ka v4 straumēšanas režīms uzlabo precizitāti.
Galvenās iezīmes: krievu valodā Soniox un Deepgram izskatās spēcīgāk nekā vecākas Whisper stila pieejas, izmantojot reālās pasaules etalonus, savukārt gpt-4o-mini-transcribe izskatās labi FLEURS. Taču FLEURS, YouTube, zvani un tiešraides intervijas ir dažādas vides. Izvēloties modeli, jāņem vērā gan WER, gan latentums.
Modeļi pa vienam
Groq Whisper Large v3 Turbo
Groq Whisper Large v3 Turbo ir ātrākā Sobes opcija, kad reāllaika STT ir atspējota. Tas ir piemērots īsām atbildēm, ātrām intervijām un situācijām, kad sarežģītas runas minimālais latentums ir svarīgāks par maksimālo precizitāti.
Tās galvenā stiprā puse ir ātrums. Groq ASR ceļvedis ziņo par kopējo WER aptuveni 12% Whisper Large v3 Turbo un paātrinājumu līdz 247x attiecībā pret audio ilgumu. Tas padara to par labu iespēju īsām piezīmēm, kur kavēšanās ir vissvarīgākā.
Ja runā ir daudz krievu valodas, nosaukumi, saīsinājumi, angļu valodas tehniskie vārdi krievu valodā, troksnis vai spēcīgs akcents, Groq var kļūdīties vairāk. Tādā gadījumā OpenAI vai Soniox parasti ir labāks rezerves variants, jo precīza formulējuma saglabāšana ir svarīgāka par neapstrādātu ātrumu.
OpenAI gpt-4o-mini-transkribēt
OpenAI gpt-4o-mini-transcribe transkribē pabeigtu audio segmentu. Tas ir lēnāks nekā Groq Whisper Large v3 Turbo, taču parasti uzmanīgāk apstrādā runas nianses, tehniskos terminus un jautājumu detaļas.
OpenAI saka, ka gpt-4o-transcribe un gpt-4o-mini-transcribe uzlabo WER un valodas atpazīšanu salīdzinājumā ar Whisper. Neatkarīgajā FLEURS etalonā gpt-4o-mini-transcribe ir iekļauts 3,65% WER angļu valodā un 5,30% krievu valodā.
OpenAI gpt-4o-mini-transcribe ir laba augstākas kvalitātes opcija ar reāllaika STT atspējošanu, kad Groq Whisper Large v3 Turbo pieļauj pārāk daudz kļūdu jūsu runā vai mikrofonā.
Deepgram Nova-3
Deepgram ir spēcīga reāllaika STT scenārijos. Nova-3 darbojas gan ar pabeigtu audio, gan straumēšanu, un Deepgram dokumenti ziņo, ka WER ir 6,84% straumēšanas transkripcijai un 5,26% pabeigtiem ierakstiem 2703 reālu audio failu komplektā.
Programmā Sobes Deepgram ir noderīga, ja vēlaties redzēt tekstu gandrīz nekavējoties, nevis gaidīt, līdz frāze ir beigusies. Ja reāllaika STT ir atspējots, vidējais transkripcijas latentums ir aptuveni 900 ms; ar iespējotu reāllaika STT, tas ir aptuveni 300 ms. Tas padara Deepgram ērtu garām frāzēm, tiešraides subtitriem, jauktu runu un intervijām angļu valodā, it īpaši, ja intervētājam ir reģionāls akcents.
Atsevišķa Deepgram priekšrocība ir angļu valodas variantu atbalsts. Varat izvēlēties ne tikai vispārīgo angļu valodu, bet arī amerikāņu, britu, austrāliešu, indiešu vai jaunzēlandes angļu valodu. Tas palīdz starptautiskās intervijās, kurās intervētājam ir nepazīstams akcents un tehniskie termini tiek sajaukti ar ātru sarunvalodu angļu valodā.
Krievu valodai Deepgram arī izskatās pieklājīgi: Soniox salīdzinājumā krievu valodai ir norādīts 8,0% WER.
Soniox STT v5, reāllaika STT ir atspējota
Soniox STT v5 labi darbojas krievu valodā, jauktu valodu runai un sarežģītiem tehniskajiem terminiem, taču ar atspējotu reāllaika STT ir vislēnākā iespēja: vidējais transkripcijas latentums ir aptuveni 2500 ms. Tas ir loģiski, ja krievu valodas un jauktās runas precizitāte ir svarīgāka par reakcijas ātrumu.
Soniox stiprā puse ir daudzvalodu atpazīšana un valodu maiņa. Tas aptver arī lielu skaitu mazāk izplatītu valodu, kur vispārējas nozīmes modeļi bieži vien pasliktinās vairāk nekā angļu valodā. Tas attiecas arī uz krievvalodīgo intervijām, kur vienā frāzē var būt React, PostgreSQL, Kafka, thread pool, event loop un krievu vārdu galotnes ap angļu valodas tehniskajiem terminiem.
Soniox STT v5, ir iespējota reāllaika STT
Soniox STT v5 ar iespējotu reāllaika STT ir labākā iespēja, ja vienlaikus nepieciešama krievu valoda un minimāls latentums. Vidēji galīgais atšifrējums tiek saņemts aptuveni 200 ms pēc frāzes. Šī opcija īpaši labi iederas VAD un Start/Stop: teksts tiek straumēts tiešraidē, labi tiek apstrādātas krievu-angļu frāzes un pēc pauzes ātri tiek bloķēts gala teksts.
Īsā versija: ko izvēlēties?
Ja nevēlaties to pārdomāt:
- Reāllaika STT darbojas VAD un Start/Stop. Programmā One-Shot izmantojiet opcijas ar atspējotu reāllaika STT.
- Groq Whisper Large v3 Turbo ir ātrākā iespēja ar reāllaika STT atspējošanu īsām frāzēm un tipiskām intervijām.
- OpenAI gpt-4o-mini-transcribe ir laba reāllaika STT atspējota opcija, ja vēlaties rūpīgāk veikt transkripciju, izmantojot OpenAI.
- Deepgram Nova-3, reāllaika STT ir atspējota nodrošina stabilu kvalitāti, bet ar vidējo latentumu aptuveni 900 ms.
- Deepgram Nova-3, reāllaika STT iespējots ir ātrs straumēšanas režīms, aptuveni 300 ms līdz pēdējam tekstam pēc frāzes.
- Soniox STT v5, reāllaika STT atspējota ir piemērota krievu un jauktu valodu runai, taču tai ir lielākais latentums: aptuveni 2500 ms.
- Soniox STT v5, reāllaika STT iespējots ir ātrākā straumēšanas opcija krievu un valodu maiņai: aptuveni 200 ms.
