AI-ի պատասխանների որակը սկսվում է լեզվական մոդելից առաջ: Այն սկսվում է խոսքի արտագրումից:
Եթե համակարգը սխալ լսի հարցը, նույնիսկ ուժեղ մոդելը կպատասխանի աղավաղված տեքստին:
Sobes-ում դուք կարող եք ընտրել խոսքի ճանաչման մի քանի մոդելների միջև. Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, Deepgram Nova-3, և Soniox STT v5. Նրանք տարբերվում են ոչ միայն ճշգրտությամբ, այլև ուշացումով, ձայնագրման պահվածքով, լեզվական աջակցությամբ և ինչպես են նրանք վարում աղմկոտ հանդիպումները:
Ինչ է անում Realtime STT փոխել?
Sobes ինտերֆեյսում կարևոր կարգավորումը պարզ է. Realtime STT հաշմանդամ կամ Realtime STT միացված է.
Realtime STT հաշմանդամ
Sobes-ն ուղարկում է պատրաստի աուդիո հատվածը ճանաչման համար և սպասում վերջնական տեքստին:
Ահա թե ինչպես Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, և նաև Deepgram Nova-3 և Soniox STT v5 աշխատել, երբ Realtime STT հաշմանդամ է.
Սա պարզ, կայուն հոսք է կարճ արտահայտությունների համար. տեքստը հայտնվում է որպես ավարտված տառադարձում, առանց միջանկյալ ուղղումների: Փոխզիջումն այն է, որ Sobes-ը տեքստ է ստանում միայն աուդիո հատվածն ուղարկելուց հետո: Երկար արտահայտությունները ուշացումն ավելի նկատելի են դարձնում, և խոսքի ուղիղ հեռարձակում չկա:
Realtime STT միացված է
Sobes-ը հեռարձակում է աուդիո մոդելը և ստանում մասնակի տեքստ նախքան արտահայտության ավարտը:
Ահա թե ինչպես Deepgram Nova-3 և Soniox STT v5 աշխատել, երբ Realtime STT միացված է:
Հոսքային տառադարձման ժամանակ տեքստը սկզբում կարող է լինել սևագիր. մոդելը կարող է վերանայել բառերը, մինչ մարդը շարունակում է խոսել: Վերջնականացում այն պահն է, երբ արտահայտությունն ավարտված է, մոդելը դադարում է փոխել տեքստի այդ հատվածը, և Սոբսը կարող է ապահով փոխանցել այն։
կետը Realtime STT ռեակցիայի արագությունն է։ Դուք կարող եք տեսնել, որ համակարգը հենց հիմա լսում է խոսք, երկար պատասխանները ընթեռնելի են դառնում նախքան արտահայտության ավարտը, և ավտոմատ արձագանքը կարող է ավելի շուտ սկսվել: Փոխզիջումն այն է, որ մասնակի տեքստը կարող է փոխվել, որակն ավելի շատ կախված է կապի կայունությունից, և երբեմն պետք է սպասել, մինչև մոդելը փակվի վերջնական տեքստում արտահայտության համար:
Որ ձայնագրման ռեժիմներն են աջակցում Realtime STT?
Կարևոր մանրամասն. Realtime STT աշխատում է VAD-ում և Start / Stop ռեժիմներ. VAD-ում Sobes-ը ավտոմատ կերպով հայտնաբերում է խոսքը, սկսում է ձայնագրել և դադարից հետո փակում է հատվածը: Մեջ Start / Stop, դուք կառավարում եք սկիզբն ու ավարտը ձեռքով, սակայն հոսքային տառադարձումը դեռ կարող է գործարկվել, մինչ ձայնագրումն ակտիվ է:
Մեջ One-Shot, Realtime STT չի օգտագործվում. Sobes-ը վերցնում է ձայնային բուֆերից վերջին վայրկյանները և ուղարկում ավարտված հատվածը տառադարձման համար:
Այսպիսով, եթե դուք ընտրում եք Deepgram կամ Soniox, բայց օգտագործեք One-Shot, օգտագործեք «Realtime STT անջատված» ուշացման համարները՝ որպես հղում:
Տառադարձման ուշացում
Սա խոսքի ճանաչման ուշացումն է. որքան ժամանակ է Sobes-ը սպասում տեքստին ավարտված աուդիո հատվածից հետո, կամ երբ հոսքային մոդելը փակում է վերջնական տեքստը արտահայտության համար: Այն չի ներառում այն ժամանակը, երբ մարդը խոսում է, և այն չի ներառում AI պատասխանների ստեղծումը:
| Մոդել | Realtime STT հաշմանդամ | Realtime STT միացված է | Ինչ է դա նշանակում |
|---|---|---|---|
| Groq Whisper Large v3 Turbo | 500-600 ms | Հասանելի չէ | Ամենաարագ ոչ հոսքային տարբերակը: Լավ է կարճ հարցերի համար: |
OpenAI gpt-4o-mini-transcribe |
600-900 ms | Հասանելի չէ | Մի փոքր ավելի դանդաղ, քան Գրոկը, բայց սովորաբար ավելի զգույշ դժվար խոսքի հետ: |
| Deepgram Nova-3 | մոտ 900 ms | մոտ 300 ms | Հետ Realtime STT միացված է, վերջնական տեքստը շատ ավելի արագ է հայտնվում: |
| Soniox STT v5 | մոտ 2500 ms | մոտ 200 ms | Դանդաղ առանց Realtime STT, բայց ամենաարագը վերջնական տեքստը փակելու հարցում, երբ Realtime STT միացված է: |
Realtime STT դա պարզապես վանդակ չէ: Deepgram-ի և Soniox-ի համար այն փոխում է արտադրանքի արագությունը. տեքստը սկսում է գրեթե անմիջապես երևալ, և վերջնական տառադարձումն ավելի արագ է գալիս, քան երբ Sobes-ը ավարտված աուդիո հատված է ուղարկում արտահայտությունից հետո:
WER. ինչ է դա և ինչպիսին են թվերը
WER նշանակում է Word Error Rate՝ սխալ ճանաչված բառերի բաժինը: Որքան ցածր է WER-ը, այնքան լավ: Օրինակ, 6% WER-ը նշանակում է, որ 100 բառից մոտավորապես 6-ը սխալ է ճանաչվել՝ փոխարինվել, բաց թողնել կամ սխալմամբ ավելացվել:
Կարևոր է. WER-ը դժվար է համեմատել առանց համատեքստի: Նույն մոդելը կարող է ցույց տալ 4% մաքուր անգլերեն ձայնի վրա և 15% աղմկոտ զանգի դեպքում՝ շեշտադրումներով, ընդհատումներով և վատ խոսափողով: Այսպիսով, ստորև բերված թվերը հանրային հղման կետեր են, ոչ թե երաշխիք յուրաքանչյուր հարցազրույցի համար: Աղբյուրը կարևոր է, քանի որ մատակարարներն օգտագործում են տարբեր տվյալների հավաքածուներ և գնահատման մեթոդներ:
Groq Whisper Large v3 Turbo.
Groq-ը հայտնում է ընդհանուր WER-ը մոտ 12%, բայց չի հրապարակում առանձին անգլերեն/ռուսերեն բալանսը: Որպես ընտանեկան մակարդակի Whisper-ի հղում, the FLEURS հենանիշ ցույց է տալիս 4.00% անգլերենի համար և 5.13% ռուսերենի համար.
OpenAI gpt-4o-mini-transcribe.
Այն FLEURS հենանիշ Voxtral Realtime հոդվածների ցանկում 3,65% անգլերենի համար և 5,30% ռուսերեն. OpenAI-ն նաև ասում է gpt-4o-transcribe և gpt-4o-mini-transcribe բարելավել WER-ը՝ համեմատած Whisper v2/v3-ի հետ, սակայն դրա փաստաթղթերը չեն հրապարակում այս երկու լեզուների պարզ վերլուծությունը:
Deepgram Nova-3.
Անգլերենի համար հայտնում է Deepgram-ը 5.26% պատրաստի աուդիո և 6.84% հոսքի համար։ Ռուսերենի համար հանրային Soniox-ի համեմատական ցուցակները 8.0%. Deepgram-ի ուժը անգլերեն տարբերակներն ու շեշտադրումներն են՝ ամերիկյան, բրիտանական, ավստրալիական, հնդկական և նորզելանդական անգլերեն:
Soniox STT v5.
հայտնում է Soniox-ը մոտ 6.5% անգլերենի համար և մոտ 6,2% ռուսերենի համար 60 լեզվով չափանիշով: Առանձին անգլերեն/ռուսերեն բաժանում չկա Realtime STT, բայց Soniox-ն ասում է, որ v4 հոսքային ռեժիմը բարելավում է ճշգրտությունը:
Հիմնական միջոցը. ռուսերենի համար Soniox-ը և Deepgram-ն ավելի ուժեղ տեսք ունեն, քան իրական աշխարհի չափանիշների վրա Whisper-ի ոճի հին մոտեցումները, մինչդեռ. gpt-4o-mini-transcribe լավ տեսք ունի FLEURS. Բայց FLEURS, YouTube, զանգերը և կենդանի հարցազրույցները տարբեր միջավայրեր են: Մոդելի ընտրությունը պետք է հաշվի առնի ինչպես WER-ը, այնպես էլ հետաձգումը:
Մոդելները մեկ առ մեկ
Groq Whisper Large v3 Turbo
Groq Whisper Large v3 Turbo ամենաարագ Sobes տարբերակն է, երբ Realtime STT հաշմանդամ է. Այն համապատասխանում է կարճ պատասխաններին, արագ հարցազրույցներին և իրավիճակներին, որտեղ նվազագույն ուշացումը ավելի կարևոր է, քան առավելագույն ճշգրտությունը դժվար խոսքի դեպքում:
Նրա հիմնական ուժը արագությունն է: Groq-ի ASR ուղեցույցը հայտնում է WER-ի ընդհանուր չափը մոտ 12% Whisper Large v3 Turbo-ի համար և մինչև 247x արագացում՝ համեմատած աուդիո տևողության հետ: Դա լավ տարբերակ է դարձնում կարճ դիտողությունների համար, որտեղ ուշացումն ամենակարևորն է:
Եթե խոսքը պարունակում է շատ ռուսերեն, անուններ, հապավումներ, անգլերեն տեխնիկական բառեր ռուսերեն խոսքի ներսում, աղմուկ կամ ուժեղ առոգանություն, Գրոկը կարող է ավելի շատ սխալներ թույլ տալ: Այդ դեպքում OpenAI-ը կամ Soniox-ը սովորաբար ավելի լավն է, քանի որ ճշգրիտ ձևակերպումների պահպանումն ավելի կարևոր է, քան հումքի արագությունը:
OpenAI gpt-4o-mini-transcribe
OpenAI gpt-4o-mini-transcribe տառադարձում է ավարտված աուդիո հատվածը: Այն ավելի դանդաղ է, քան Groq Whisper Large v3 Turbo, բայց սովորաբար ավելի զգույշ է վերաբերվում խոսքի նրբերանգներին, տեխնիկական պայմաններին և հարցերի մանրամասներին:
OpenAI-ն ասում է gpt-4o-transcribe և gpt-4o-mini-transcribe բարելավել WER-ը և լեզվի ճանաչումը՝ համեմատած Whisper-ի հետ: Անկախի մեջ FLEURS հենանիշ, gpt-4o-mini-transcribe նշված է 3,65% WER անգլերենի և 5,30% ռուսերենի համար:
OpenAI gpt-4o-mini-transcribe լավ ավելի որակյալ տարբերակ է Realtime STT հաշմանդամ, երբ Groq Whisper Large v3 Turbo չափազանց շատ սխալներ է թույլ տալիս ձեր խոսքի կամ խոսափողի վրա:
Deepgram Nova-3
Deepgram-ը ուժեղ է Realtime STT սցենարներ. Nova-3-ն աշխատում է ինչպես ավարտված աուդիոով, այնպես էլ հոսքով, և Deepgram-ի փաստաթղթերը հայտնում են, որ WER-ը կազմում է 6,84%՝ հոսքային տառադարձման համար և 5,26%՝ ավարտված ձայնագրությունների համար 2703 իրական աշխարհի աուդիո ֆայլերի հավաքածուի վրա:
Sobes-ում Deepgram-ը օգտակար է, երբ ցանկանում եք գրեթե անմիջապես տեսնել տեքստը, այլ ոչ թե սպասել մինչև արտահայտությունը ավարտվի: Հետ Realtime STT հաշմանդամ, տառադարձման միջին ուշացումը մոտ 900 ms է; հետ Realtime STT միացված է, այն մոտ 300 ms է: Դա Deepgram-ին հարմար է դարձնում երկար արտահայտությունների, կենդանի ենթագրերի, խառը խոսքի և անգլերեն հարցազրույցների համար, հատկապես, երբ հարցազրուցավարն ունի տարածաշրջանային շեշտադրություն:
Deepgram-ի առանձին առավելությունն անգլերեն տարբերակների աջակցությունն է: Դուք կարող եք ընտրել ոչ միայն ընդհանուր անգլերեն, այլ նաև ամերիկյան, բրիտանական, Ավստրալիական, Հնդկական, կամ Նոր Զելանդիա Անգլերեն. Սա օգնում է միջազգային հարցազրույցներին, որտեղ հարցազրուցավարն ունի անծանոթ առոգանություն և տեխնիկական տերմինները խառնվում են արագ խոսակցական անգլերենի հետ:
Ռուսերենի համար Deepgram-ը նույնպես պարկեշտ տեսք ունի. Soniox-ի համեմատության մեջ ռուսերենի համար նշվում է 8,0% WER:
Soniox STT v5, Realtime STT հաշմանդամ
Soniox STT v5 լավ է աշխատում ռուսերենի, խառնալեզու խոսքի և բարդ տեխնիկական տերմինների համար, բայց Realtime STT անջատված, դա ամենադանդաղ տարբերակն է. տառադարձման միջին ուշացումը մոտ 2500 ms է: Իմաստ է, երբ ռուսերենի և խառը խոսքի ճշգրտությունն ավելի կարևոր է, քան արձագանքման արագությունը:
Soniox-ի ուժը բազմալեզու ճանաչումն ու լեզվի փոխարկումն է: Այն նաև ներառում է ավելի քիչ տարածված լեզուների մի մեծ զանգված, որտեղ ընդհանուր նշանակության մոդելները հաճախ ավելի շատ են նսեմացնում, քան անգլերենում: Սա կարևոր է նաև ռուսալեզու հարցազրույցների համար, որտեղ կարող է լինել մեկ արտահայտություն React, PostgreSQL, Kafka, thread pool, event loop, և ռուսերեն բառերի վերջավորություններ անգլերեն տեխնիկական տերմինների շուրջ։
Soniox STT v5, Realtime STT միացված է
Soniox STT v5 հետ Realtime STT միացվածը լավագույն տարբերակն է, երբ անհրաժեշտ է ռուսերեն խոսք և միևնույն ժամանակ նվազագույն ուշացում: Միջին հաշվով, վերջնական տեքստը հասնում է արտահայտությունից մոտ 200 ms հետո: Այս տարբերակը հատկապես լավ է տեղավորվում VAD-ում և Start / StopՏեքստը ուղիղ հեռարձակվում է, լավ է մշակում ռուսերեն-անգլերեն արտահայտությունները և դադարից հետո արագ կողպվում է վերջնական տեքստում:
Կարճ տարբերակ. ի՞նչ ընտրել:
Եթե չես ուզում չափից շատ մտածել.
- Realtime STT աշխատում է VAD-ում և Start / Stop. Մեջ One-Shot, օգտագործեք տարբերակները Realtime STT հաշմանդամ.
- Groq Whisper Large v3 Turbo հետ ամենաարագ տարբերակն է Realtime STT հաշմանդամ է կարճ արտահայտությունների և բնորոշ հարցազրույցների համար:
- OpenAI gpt-4o-mini-transcribe լավ է Realtime STT անջատված տարբերակ, երբ ցանկանում եք ավելի զգույշ արտագրել OpenAI-ի միջոցով:
- Deepgram Nova-3, Realtime STT հաշմանդամ տալիս է ամուր որակ, բայց միջին ուշացումով մոտ 900 ms:
- Deepgram Nova-3, Realtime STT միացված է արագ հոսքային ռեժիմ է՝ շուրջ 300 ms մինչև արտահայտությունից հետո վերջնական տեքստ:
- Soniox STT v5, Realtime STT հաշմանդամ ուժեղ է ռուսերեն և խառը խոսքի համար, բայց ունի ամենաբարձր հետաձգումը` շուրջ 2500 ms:
- Soniox STT v5, Realtime STT միացված է ռուսերենի և լեզվի փոխարկման ամենաարագ հոսքային տարբերակն է՝ շուրջ 200 ms:
