Sobes.tech
Վերադարձ դեպի հոդվածներ

Ինչպե՞ս ընտրել խոսքի արտագրման մոդել:

Alexander10 մայիսի, 2026 թ. (2 ամիս առաջ)
Ինչպե՞ս ընտրել խոսքի արտագրման մոդել:

AI-ի պատասխանների որակը սկսվում է լեզվական մոդելից առաջ: Այն սկսվում է խոսքի արտագրումից:
Եթե ​​համակարգը սխալ լսի հարցը, նույնիսկ ուժեղ մոդելը կպատասխանի աղավաղված տեքստին:

Sobes-ում դուք կարող եք ընտրել խոսքի ճանաչման մի քանի մոդելների միջև. Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, Deepgram Nova-3, և Soniox STT v5. Նրանք տարբերվում են ոչ միայն ճշգրտությամբ, այլև ուշացումով, ձայնագրման պահվածքով, լեզվական աջակցությամբ և ինչպես են նրանք վարում աղմկոտ հանդիպումները:

Ինչ է անում Realtime STT փոխել?

Sobes ինտերֆեյսում կարևոր կարգավորումը պարզ է. Realtime STT հաշմանդամ կամ Realtime STT միացված է.

Realtime STT հաշմանդամ

Sobes-ն ուղարկում է պատրաստի աուդիո հատվածը ճանաչման համար և սպասում վերջնական տեքստին:
Ահա թե ինչպես Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, և նաև Deepgram Nova-3 և Soniox STT v5 աշխատել, երբ Realtime STT հաշմանդամ է.

Սա պարզ, կայուն հոսք է կարճ արտահայտությունների համար. տեքստը հայտնվում է որպես ավարտված տառադարձում, առանց միջանկյալ ուղղումների: Փոխզիջումն այն է, որ Sobes-ը տեքստ է ստանում միայն աուդիո հատվածն ուղարկելուց հետո: Երկար արտահայտությունները ուշացումն ավելի նկատելի են դարձնում, և խոսքի ուղիղ հեռարձակում չկա:

Realtime STT միացված է

Sobes-ը հեռարձակում է աուդիո մոդելը և ստանում մասնակի տեքստ նախքան արտահայտության ավարտը:
Ահա թե ինչպես Deepgram Nova-3 և Soniox STT v5 աշխատել, երբ Realtime STT միացված է:

Հոսքային տառադարձման ժամանակ տեքստը սկզբում կարող է լինել սևագիր. մոդելը կարող է վերանայել բառերը, մինչ մարդը շարունակում է խոսել: Վերջնականացում այն պահն է, երբ արտահայտությունն ավարտված է, մոդելը դադարում է փոխել տեքստի այդ հատվածը, և Սոբսը կարող է ապահով փոխանցել այն։

կետը Realtime STT ռեակցիայի արագությունն է։ Դուք կարող եք տեսնել, որ համակարգը հենց հիմա լսում է խոսք, երկար պատասխանները ընթեռնելի են դառնում նախքան արտահայտության ավարտը, և ավտոմատ արձագանքը կարող է ավելի շուտ սկսվել: Փոխզիջումն այն է, որ մասնակի տեքստը կարող է փոխվել, որակն ավելի շատ կախված է կապի կայունությունից, և երբեմն պետք է սպասել, մինչև մոդելը փակվի վերջնական տեքստում արտահայտության համար:

Որ ձայնագրման ռեժիմներն են աջակցում Realtime STT?

Կարևոր մանրամասն. Realtime STT աշխատում է VAD-ում և Start / Stop ռեժիմներ. VAD-ում Sobes-ը ավտոմատ կերպով հայտնաբերում է խոսքը, սկսում է ձայնագրել և դադարից հետո փակում է հատվածը: Մեջ Start / Stop, դուք կառավարում եք սկիզբն ու ավարտը ձեռքով, սակայն հոսքային տառադարձումը դեռ կարող է գործարկվել, մինչ ձայնագրումն ակտիվ է:

Մեջ One-Shot, Realtime STT չի օգտագործվում. Sobes-ը վերցնում է ձայնային բուֆերից վերջին վայրկյանները և ուղարկում ավարտված հատվածը տառադարձման համար:

Այսպիսով, եթե դուք ընտրում եք Deepgram կամ Soniox, բայց օգտագործեք One-Shot, օգտագործեք «Realtime STT անջատված» ուշացման համարները՝ որպես հղում:

Տառադարձման ուշացում

Սա խոսքի ճանաչման ուշացումն է. որքան ժամանակ է Sobes-ը սպասում տեքստին ավարտված աուդիո հատվածից հետո, կամ երբ հոսքային մոդելը փակում է վերջնական տեքստը արտահայտության համար: Այն չի ներառում այն ​​ժամանակը, երբ մարդը խոսում է, և այն չի ներառում AI պատասխանների ստեղծումը:

Մոդել Realtime STT հաշմանդամ Realtime STT միացված է Ինչ է դա նշանակում
Groq Whisper Large v3 Turbo 500-600 ms Հասանելի չէ Ամենաարագ ոչ հոսքային տարբերակը: Լավ է կարճ հարցերի համար:
OpenAI gpt-4o-mini-transcribe 600-900 ms Հասանելի չէ Մի փոքր ավելի դանդաղ, քան Գրոկը, բայց սովորաբար ավելի զգույշ դժվար խոսքի հետ:
Deepgram Nova-3 մոտ 900 ms մոտ 300 ms Հետ Realtime STT միացված է, վերջնական տեքստը շատ ավելի արագ է հայտնվում:
Soniox STT v5 մոտ 2500 ms մոտ 200 ms Դանդաղ առանց Realtime STT, բայց ամենաարագը վերջնական տեքստը փակելու հարցում, երբ Realtime STT միացված է:

Realtime STT դա պարզապես վանդակ չէ: Deepgram-ի և Soniox-ի համար այն փոխում է արտադրանքի արագությունը. տեքստը սկսում է գրեթե անմիջապես երևալ, և վերջնական տառադարձումն ավելի արագ է գալիս, քան երբ Sobes-ը ավարտված աուդիո հատված է ուղարկում արտահայտությունից հետո:

WER. ինչ է դա և ինչպիսին են թվերը

WER նշանակում է Word Error Rate՝ սխալ ճանաչված բառերի բաժինը: Որքան ցածր է WER-ը, այնքան լավ: Օրինակ, 6% WER-ը նշանակում է, որ 100 բառից մոտավորապես 6-ը սխալ է ճանաչվել՝ փոխարինվել, բաց թողնել կամ սխալմամբ ավելացվել:

Կարևոր է. WER-ը դժվար է համեմատել առանց համատեքստի: Նույն մոդելը կարող է ցույց տալ 4% մաքուր անգլերեն ձայնի վրա և 15% աղմկոտ զանգի դեպքում՝ շեշտադրումներով, ընդհատումներով և վատ խոսափողով: Այսպիսով, ստորև բերված թվերը հանրային հղման կետեր են, ոչ թե երաշխիք յուրաքանչյուր հարցազրույցի համար: Աղբյուրը կարևոր է, քանի որ մատակարարներն օգտագործում են տարբեր տվյալների հավաքածուներ և գնահատման մեթոդներ:

Groq Whisper Large v3 Turbo.
Groq-ը հայտնում է ընդհանուր WER-ը մոտ 12%, բայց չի հրապարակում առանձին անգլերեն/ռուսերեն բալանսը: Որպես ընտանեկան մակարդակի Whisper-ի հղում, the FLEURS հենանիշ ցույց է տալիս 4.00% անգլերենի համար և 5.13% ռուսերենի համար.

OpenAI gpt-4o-mini-transcribe.
Այն FLEURS հենանիշ Voxtral Realtime հոդվածների ցանկում 3,65% անգլերենի համար և 5,30% ռուսերեն. OpenAI-ն նաև ասում է gpt-4o-transcribe և gpt-4o-mini-transcribe բարելավել WER-ը՝ համեմատած Whisper v2/v3-ի հետ, սակայն դրա փաստաթղթերը չեն հրապարակում այս երկու լեզուների պարզ վերլուծությունը:

Deepgram Nova-3.
Անգլերենի համար հայտնում է Deepgram-ը 5.26% պատրաստի աուդիո և 6.84% հոսքի համար։ Ռուսերենի համար հանրային Soniox-ի համեմատական ​​ցուցակները 8.0%. Deepgram-ի ուժը անգլերեն տարբերակներն ու շեշտադրումներն են՝ ամերիկյան, բրիտանական, ավստրալիական, հնդկական և նորզելանդական անգլերեն:

Soniox STT v5.
հայտնում է Soniox-ը մոտ 6.5% անգլերենի համար և մոտ 6,2% ռուսերենի համար 60 լեզվով չափանիշով: Առանձին անգլերեն/ռուսերեն բաժանում չկա Realtime STT, բայց Soniox-ն ասում է, որ v4 հոսքային ռեժիմը բարելավում է ճշգրտությունը:

Հիմնական միջոցը. ռուսերենի համար Soniox-ը և Deepgram-ն ավելի ուժեղ տեսք ունեն, քան իրական աշխարհի չափանիշների վրա Whisper-ի ոճի հին մոտեցումները, մինչդեռ. gpt-4o-mini-transcribe լավ տեսք ունի FLEURS. Բայց FLEURS, YouTube, զանգերը և կենդանի հարցազրույցները տարբեր միջավայրեր են: Մոդելի ընտրությունը պետք է հաշվի առնի ինչպես WER-ը, այնպես էլ հետաձգումը:

Մոդելները մեկ առ մեկ

Groq Whisper Large v3 Turbo

Groq Whisper Large v3 Turbo ամենաարագ Sobes տարբերակն է, երբ Realtime STT հաշմանդամ է. Այն համապատասխանում է կարճ պատասխաններին, արագ հարցազրույցներին և իրավիճակներին, որտեղ նվազագույն ուշացումը ավելի կարևոր է, քան առավելագույն ճշգրտությունը դժվար խոսքի դեպքում:

Նրա հիմնական ուժը արագությունն է: Groq-ի ASR ուղեցույցը հայտնում է WER-ի ընդհանուր չափը մոտ 12% Whisper Large v3 Turbo-ի համար և մինչև 247x արագացում՝ համեմատած աուդիո տևողության հետ: Դա լավ տարբերակ է դարձնում կարճ դիտողությունների համար, որտեղ ուշացումն ամենակարևորն է:

Եթե ​​խոսքը պարունակում է շատ ռուսերեն, անուններ, հապավումներ, անգլերեն տեխնիկական բառեր ռուսերեն խոսքի ներսում, աղմուկ կամ ուժեղ առոգանություն, Գրոկը կարող է ավելի շատ սխալներ թույլ տալ: Այդ դեպքում OpenAI-ը կամ Soniox-ը սովորաբար ավելի լավն է, քանի որ ճշգրիտ ձևակերպումների պահպանումն ավելի կարևոր է, քան հումքի արագությունը:

OpenAI gpt-4o-mini-transcribe

OpenAI gpt-4o-mini-transcribe տառադարձում է ավարտված աուդիո հատվածը: Այն ավելի դանդաղ է, քան Groq Whisper Large v3 Turbo, բայց սովորաբար ավելի զգույշ է վերաբերվում խոսքի նրբերանգներին, տեխնիկական պայմաններին և հարցերի մանրամասներին:

OpenAI-ն ասում է gpt-4o-transcribe և gpt-4o-mini-transcribe բարելավել WER-ը և լեզվի ճանաչումը՝ համեմատած Whisper-ի հետ: Անկախի մեջ FLEURS հենանիշ, gpt-4o-mini-transcribe նշված է 3,65% WER անգլերենի և 5,30% ռուսերենի համար:

OpenAI gpt-4o-mini-transcribe լավ ավելի որակյալ տարբերակ է Realtime STT հաշմանդամ, երբ Groq Whisper Large v3 Turbo չափազանց շատ սխալներ է թույլ տալիս ձեր խոսքի կամ խոսափողի վրա:

Deepgram Nova-3

Deepgram-ը ուժեղ է Realtime STT սցենարներ. Nova-3-ն աշխատում է ինչպես ավարտված աուդիոով, այնպես էլ հոսքով, և Deepgram-ի փաստաթղթերը հայտնում են, որ WER-ը կազմում է 6,84%՝ հոսքային տառադարձման համար և 5,26%՝ ավարտված ձայնագրությունների համար 2703 իրական աշխարհի աուդիո ֆայլերի հավաքածուի վրա:

Sobes-ում Deepgram-ը օգտակար է, երբ ցանկանում եք գրեթե անմիջապես տեսնել տեքստը, այլ ոչ թե սպասել մինչև արտահայտությունը ավարտվի: Հետ Realtime STT հաշմանդամ, տառադարձման միջին ուշացումը մոտ 900 ms է; հետ Realtime STT միացված է, այն մոտ 300 ms է: Դա Deepgram-ին հարմար է դարձնում երկար արտահայտությունների, կենդանի ենթագրերի, խառը խոսքի և անգլերեն հարցազրույցների համար, հատկապես, երբ հարցազրուցավարն ունի տարածաշրջանային շեշտադրություն:

Deepgram-ի առանձին առավելությունն անգլերեն տարբերակների աջակցությունն է: Դուք կարող եք ընտրել ոչ միայն ընդհանուր անգլերեն, այլ նաև ամերիկյան, բրիտանական, Ավստրալիական, Հնդկական, կամ Նոր Զելանդիա Անգլերեն. Սա օգնում է միջազգային հարցազրույցներին, որտեղ հարցազրուցավարն ունի անծանոթ առոգանություն և տեխնիկական տերմինները խառնվում են արագ խոսակցական անգլերենի հետ:

Ռուսերենի համար Deepgram-ը նույնպես պարկեշտ տեսք ունի. Soniox-ի համեմատության մեջ ռուսերենի համար նշվում է 8,0% WER:

Soniox STT v5, Realtime STT հաշմանդամ

Soniox STT v5 լավ է աշխատում ռուսերենի, խառնալեզու խոսքի և բարդ տեխնիկական տերմինների համար, բայց Realtime STT անջատված, դա ամենադանդաղ տարբերակն է. տառադարձման միջին ուշացումը մոտ 2500 ms է: Իմաստ է, երբ ռուսերենի և խառը խոսքի ճշգրտությունն ավելի կարևոր է, քան արձագանքման արագությունը:

Soniox-ի ուժը բազմալեզու ճանաչումն ու լեզվի փոխարկումն է: Այն նաև ներառում է ավելի քիչ տարածված լեզուների մի մեծ զանգված, որտեղ ընդհանուր նշանակության մոդելները հաճախ ավելի շատ են նսեմացնում, քան անգլերենում: Սա կարևոր է նաև ռուսալեզու հարցազրույցների համար, որտեղ կարող է լինել մեկ արտահայտություն React, PostgreSQL, Kafka, thread pool, event loop, և ռուսերեն բառերի վերջավորություններ անգլերեն տեխնիկական տերմինների շուրջ։

Soniox STT v5, Realtime STT միացված է

Soniox STT v5 հետ Realtime STT միացվածը լավագույն տարբերակն է, երբ անհրաժեշտ է ռուսերեն խոսք և միևնույն ժամանակ նվազագույն ուշացում: Միջին հաշվով, վերջնական տեքստը հասնում է արտահայտությունից մոտ 200 ms հետո: Այս տարբերակը հատկապես լավ է տեղավորվում VAD-ում և Start / StopՏեքստը ուղիղ հեռարձակվում է, լավ է մշակում ռուսերեն-անգլերեն արտահայտությունները և դադարից հետո արագ կողպվում է վերջնական տեքստում:

Կարճ տարբերակ. ի՞նչ ընտրել:

Եթե ​​չես ուզում չափից շատ մտածել.

  • Realtime STT աշխատում է VAD-ում և Start / Stop. Մեջ One-Shot, օգտագործեք տարբերակները Realtime STT հաշմանդամ.
  • Groq Whisper Large v3 Turbo հետ ամենաարագ տարբերակն է Realtime STT հաշմանդամ է կարճ արտահայտությունների և բնորոշ հարցազրույցների համար:
  • OpenAI gpt-4o-mini-transcribe լավ է Realtime STT անջատված տարբերակ, երբ ցանկանում եք ավելի զգույշ արտագրել OpenAI-ի միջոցով:
  • Deepgram Nova-3, Realtime STT հաշմանդամ տալիս է ամուր որակ, բայց միջին ուշացումով մոտ 900 ms:
  • Deepgram Nova-3, Realtime STT միացված է արագ հոսքային ռեժիմ է՝ շուրջ 300 ms մինչև արտահայտությունից հետո վերջնական տեքստ:
  • Soniox STT v5, Realtime STT հաշմանդամ ուժեղ է ռուսերեն և խառը խոսքի համար, բայց ունի ամենաբարձր հետաձգումը` շուրջ 2500 ms:
  • Soniox STT v5, Realtime STT միացված է ռուսերենի և լեզվի փոխարկման ամենաարագ հոսքային տարբերակն է՝ շուրջ 200 ms: