Квалитет АИ одговора почиње пре језичког модела. Почиње транскрипцијом говора.
Ако систем погрешно разуме питање, чак и јак модел ће одговорити на искривљен текст.
У Sobes можете бирати између неколико модела препознавања говора: Грок Вхиспер Ларге в3 Турбо, OpenAI гпт-4о-мини-транскрипција, Деепграм Нова-3, и Сониок СТТ в5. Разликују се не само по тачности, већ и по кашњењу, понашању снимања, језичкој подршци и начину на који се баве бучним састанцима.
Шта мења СТТ у реалном времену?
У интерфејсу Sobes, важно подешавање је једноставно: СТТ у реалном времену је онемогућен или СТТ у реалном времену је омогућен.
СТТ у реалном времену је онемогућен
Sobes шаље готов аудио сегмент на препознавање и чека коначни текст.
Овако Грок Вхиспер Ларге в3 Турбо, OpenAI гпт-4о-мини-транскрипција, и такође Деепграм Нова-3 и Сониок СТТ в5 раде када је СТТ у реалном времену онемогућен.
Ово је једноставан, стабилан ток за кратке фразе: текст стиже као готов транскрипт, без средњих исправки. Компромис је у томе што Sobes прима текст тек након слања аудио сегмента. Дуге фразе чине кашњење уочљивијим и нема живог тока речи док особа говори.
СТТ у реалном времену је омогућен
Sobes преноси аудио на модел и прима делимичан текст пре него што се фраза заврши.
Овако Деепграм Нова-3 и Сониок СТТ в5 раде када је омогућен СТТ у реалном времену.
У стримованој транскрипцији, текст у почетку може бити нацрт: модел може да ревидира речи док особа наставља да говори. Финализација је тренутак када се фраза заврши, модел престаје да мења тај сегмент текста и Sobes може безбедно да га проследи унапред.
Поента СТТ у реалном времену је брзина реакције. Можете видети да систем тренутно чује говор, дуги одговори постају читљиви пре него што се фраза заврши, а аутоматски одговор може почети раније. Компромис је у томе што се делимични текст може променити, квалитет више зависи од стабилности везе, а понекад треба да сачекате док модел не закључа коначни текст за фразу.
Који режими снимања подржавају СТТ у реалном времену?
Важан детаљ: СТТ у реалном времену ради у ВАД и Старт/Стоп режимима. У ВАД-у, Sobes аутоматски открива говор, почиње снимање и затвара сегмент након паузе. У Старт/Стоп, можете ручно да контролишете почетак и крај, али стримовање транскрипције и даље може да се покреће док је снимање активно.
У Оне-Схот, СТТ у реалном времену се не користи: Sobes узима последње секунде из аудио бафера и шаље готов сегмент на транскрипцију.
Дакле, ако изаберете Деепграм или Сониок, али користите Оне-Схот, користите бројеве кашњења „Реалтиме СТТ дисаблед” као референцу.
Латенција транскрипције
Ово је кашњење препознавања говора: колико дуго Sobes чека на текст након завршеног аудио сегмента, или након што модел стримовања закључа у финалном тексту за фразу. Не укључује време док особа говори и не укључује генерисање одговора помоћу вештачке интелигенције.
| Модел | СТТ у реалном времену је онемогућен | СТТ у реалном времену је омогућен | Шта то значи |
|---|---|---|---|
| Грок Вхиспер Ларге в3 Турбо | 500-600 мс | Није доступно | Најбржа опција без стримовања. Добро за кратка питања. |
OpenAI gpt-4o-mini-transcribe |
600-900 мс | Није доступно | Нешто спорији од Грока, али обично опрезнији са тешким говором. |
| Деепграм Нова-3 | око 900 мс | око 300 мс | Са омогућеним СТТ у реалном времену, коначни текст се појављује много брже. |
| Сониок СТТ в5 | око 2500 мс | око 200 мс | Најспорије без СТТ у реалном времену, али најбрже при закључавању коначног текста када је омогућен СТТ у реалном времену. |
СТТ у реалном времену није само поље за потврду. За Деепграм и Сониок, мења брзину производа: текст почиње да се појављује скоро одмах, а коначни транскрипт стиже брже него када Sobes пошаље завршен аудио сегмент након фразе.
ВЕР: шта је то и како изгледају бројеви
ВЕР означава стопу грешака у речи: удео погрешно препознатих речи. Што је ВЕР нижи, то боље. На пример, ВЕР од 6% значи да је отприлике 6 од 100 речи погрешно препознато: замењено, прескочено или додато грешком.
Важно: ВЕР је тешко упоредити без контекста. Исти модел може да покаже 4% на чистом звуку на енглеском и 15% на бучном позиву са акцентима, прекидима и лошим микрофоном. Дакле, бројеви испод су јавне референтне тачке, а не гаранција за сваки интервју. Извор је важан јер добављачи користе различите скупове података и методе евалуације.
Грок Вхиспер Ларге в3 Турбо.
Грок извештава о општем ВЕР-у од око 12%, али не објављује засебну анализу на енглеском/руском језику. Као референца за Вхиспер на нивоу породице, показује ФЛЕУРС бенцхмарк 4,00% за енглески и 5,13% за руски.
OpenAI гпт-4о-мини-транскрипција.
ФЛЕУРС бенцхмарк на листи чланака Воктрал Реалтиме 3,65% за енглески и 5,30% за руски. OpenAI такође каже да gpt-4o-transcribe и gpt-4o-mini-transcribe побољшавају ВЕР у поређењу са Вхиспер в2/в3, али његови документи не објављују једноставну анализу за ова два језика.
Деепграм Нова-3.
За енглески, преноси Деепграм 5.26% за готов аудио и 6.84% за стримовање. За руски, јавне листе поређења Сониок 8.0%. Деепграмова снага су енглеске варијанте и акценти: амерички, британски, аустралијски, индијски и новозеландски енглески.
Сониок СТТ в5.
Сониок извештава око 6,5% за енглески и око 6,2% за руски у мерилу за 60 језика. Не постоји посебна подела на енглеском/руском за СТТ у реалном времену, али Сониок каже да в4 режим стримовања побољшава прецизност.
Главни захват: за руски, Сониок и Деепграм изгледају јаче од старијих приступа у стилу Вхиспера на мерилима у стварном свету, док gpt-4o-mini-transcribe изгледа добро на ФЛЕУРС-у. Али ФЛЕУРС, ИоуТубе, позиви и интервјуи уживо су различита окружења. Избор модела треба да узме у обзир и ВЕР и кашњење.
Модели један по један
Грок Вхиспер Ларге в3 Турбо
Грок Вхиспер Ларге в3 Турбо је најбржа опција Sobes када је СТТ у реалном времену онемогућен. Одговара кратким одговорима, брзим интервјуима и ситуацијама у којима је минимално кашњење важније од максималне прецизности у тешком говору.
Његова главна снага је брзина. Грок-ов АСР водич извештава о општем ВЕР-у од око 12% за Вхиспер Ларге в3 Турбо и убрзању до 247к у односу на трајање звука. То га чини добром опцијом за кратке напомене где је кашњење најважније.
Ако говор садржи много руског језика, имена, скраћенице, енглеске техничке речи унутар руског говора, буку или јак акценат, Грок може направити више грешака. У том случају, OpenAI или Сониок је обично боља резерва, јер је очување тачне формулације важније од сирове брзине.
OpenAI гпт-4о-мини-транскрипција
OpenAI gpt-4o-mini-transcribe транскрибује завршени аудио сегмент. Спорији је од Грок Вхиспер Ларге в3 Турбо, али обично пажљивије обрађује нијансе говора, техничке термине и детаље питања.
OpenAI каже да gpt-4o-transcribe и gpt-4o-mini-transcribe побољшавају ВЕР и препознавање језика у поређењу са Вхиспером. У независном мерилу ФЛЕУРС, gpt-4o-mini-transcribe се наводи на 3,65% ВЕР за енглески и 5,30% за руски.
OpenAI gpt-4o-mini-transcribe је добра опција вишег квалитета са онемогућеним СТТ у реалном времену када Грок Вхиспер Ларге в3 Турбо направи превише грешака на вашем говору или микрофону.
Деепграм Нова-3
Деепграм је јак у СТТ сценаријима у реалном времену. Нова-3 ради и са завршеним звуком и са стримингом, а Деепграм-ови документи извештавају о ВЕР-у од 6,84% за стримовање транскрипције и 5,26% за завршене снимке на скупу од 2703 аудио датотеке из стварног света.
У Sobes, Деепграм је користан када желите да видите текст скоро одмах уместо да чекате да се фраза заврши. Када је СТТ у реалном времену онемогућен, просечна латенција транскрипције је око 900 мс; са омогућеним СТТ у реалном времену, износи око 300 мс. То чини Деепграм погодним за дугачке фразе, живе титлове, мешани говор и интервјуе на енглеском, посебно када анкетар има регионални нагласак.
Посебна предност Деепграма је подршка за енглеске варијанте. Можете изабрати не само генерички енглески, већ и амерички, Британци, аустралијски, Индијанац, или Нови Зеланд енглески. Ово помаже у међународним интервјуима где анкетар има непознат акценат и технички изрази су помешани са брзим конверзацијским енглеским.
За руски, Деепграм такође изгледа пристојно: Сониок поређење наводи 8,0% ВЕР за руски.
Сониок СТТ в5, СТТ у реалном времену онемогућен
Сониок СТТ в5 добро функционише за руски говор на мешовитом језику и тешке техничке термине, али са онемогућеним СТТ у реалном времену то је најспорија опција: просечна латенција транскрипције је око 2500 мс. Има смисла када је тачност руског и мешовитог говора важнија од брзине одговора.
Сониок-ова снага је вишејезично препознавање и промена језика. Такође покрива велики број мање уобичајених језика где модели опште намене често деградирају више него на енглеском. Ово је важно и за интервјуе на руском језику, где једна фраза може да садржи React, PostgreSQL, Kafka, thread pool, event loop и завршетке руских речи око енглеских техничких термина.
Сониок СТТ в5, СТТ у реалном времену омогућен
Сониок СТТ в5 са омогућеним СТТ у реалном времену је најбоља опција када вам је потребан руски говор и минимално кашњење у исто време. У просеку, коначни транскрипт стиже око 200 мс након фразе. Ова опција се посебно добро уклапа у ВАД и Старт/Стоп: текст стримује уживо, добро обрађује руско-енглеске фразе и закључава коначни текст брзо након паузе.
Кратка верзија: шта да изаберете?
Ако не желите превише да размишљате о томе:
- СТТ у реалном времену ради у ВАД-у и Старт/Стоп. У Оне-Схот, користите опције са онемогућеним СТТ у реалном времену.
- Грок Вхиспер Ларге в3 Турбо је најбржа опција са онемогућеним СТТ у реалном времену за кратке фразе и типичне интервјуе.
- OpenAI гпт-4о-мини-транскрипција је добра опција онемогућена СТТ у реалном времену када желите пажљивију транскрипцију преко OpenAI.
- Деепграм Нова-3, СТТ у реалном времену онемогућен даје солидан квалитет, али са просечном латенцијом око 900 мс.
- Деепграм Нова-3, СТТ у реалном времену омогућен је брзи режим стримовања, око 300 мс до коначног текста након фразе.
- Сониок СТТ в5, СТТ у реалном времену онемогућен је јак за говор на руском и мешовитом језику, али има највеће кашњење: око 2500 мс.
- Сониок СТТ в5, СТТ у реалном времену омогућен је најбржа опција стриминга за пребацивање руског и језика: око 200 мс.
