Sobes.tech
Бозгашт ба мақолаҳо

Модели транскрипсияи нутқро чӣ гуна бояд интихоб кард?

Alexander10 Май 2026 (2 м. пеш)
Модели транскрипсияи нутқро чӣ гуна бояд интихоб кард?

Сифати ҷавобҳои AI пеш аз модели забон оғоз мешавад. Он бо транскрипсияи нутқ оғоз меёбад.
Агар система саволро нодуруст қабул кунад, ҳатто модели қавӣ ба матни таҳрифшуда ҷавоб медиҳад.

Дар Sobes шумо метавонед дар байни якчанд моделҳои шинохти нутқ интихоб кунед: Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, Deepgram Nova-3, ва Soniox STT v5. Онҳо на танҳо бо дақиқӣ, балки дар таъхир, рафтори сабт, дастгирии забон ва тарзи қабули вохӯриҳои пурғавғо фарқ мекунанд.

Чи кор мекунад Realtime STT тағйир?

Дар интерфейси Sobes, танзимоти муҳим оддӣ аст: Realtime STT маъюб ё Realtime STT фаъол карда шуд.

Realtime STT маъюб

Sobes як сегменти тайёри аудиоиро барои шинохтан мефиристад ва матни ниҳоиро интизор аст.
Ин тавр аст Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, ва инчунин Deepgram Nova-3 ва Soniox STT v5 кор кай Realtime STT маъюб аст.

Ин як ҷараёни оддӣ ва устувор барои ибораҳои кӯтоҳ аст: матн ҳамчун стенограммаи анҷомшуда, бидуни ислоҳи фосилавӣ меояд. Муомила дар он аст, ки Sobes матнро танҳо пас аз фиристодани сегменти аудио қабул мекунад. Ибораҳои дароз таъхирро назаррастар мекунанд ва ҳангоми суханронии шахс ҷараёни мустақими калимаҳо вуҷуд надорад.

Realtime STT фаъол карда шуд

Sobes аудиоро ба модел интиқол медиҳад ва пеш аз тамом шудани ибора матни қисман мегирад.
Ин тавр аст Deepgram Nova-3 ва Soniox STT v5 кор кай Realtime STT фаъол карда шудааст.

Ҳангоми транскрипсияи ҷараён, матн дар аввал метавонад лоиҳа бошад: модел метавонад калимаҳоро ҳангоми суханронии шахс ислоҳ кунад. Анҷом лаҳзаи тамом шудани ибора аст, модел тағир додани он сегменти матнро қатъ мекунад ва Sobes метавонад онро бехатар ба пеш гузаронад.

Нуқтаи Realtime STT суръати реаксия аст. Шумо мебинед, ки система ҳоло нутқро мешунавад, ҷавобҳои дароз пеш аз тамом шудани ибора хондашаванда мешаванд ва ҷавоби худкор метавонад зудтар оғоз шавад. Муомила дар он аст, ки матни қисман метавонад тағир ёбад, сифат бештар аз устувории пайвастшавӣ вобаста аст ва баъзан шумо бояд интизор шавед, ки модел дар матни ниҳоии ибора қуфл карда шавад.

Кадом режимҳои сабтро дастгирӣ мекунанд Realtime STT?

Тафсилоти муҳим: Realtime STT дар VAD кор мекунад ва Start / Stop режимҳо. Дар VAD, Sobes суханро ба таври худкор муайян мекунад, сабтро оғоз мекунад ва пас аз таваққуф сегментро мепӯшонад. Дар Start / Stop, шумо оғоз ва анҷоми онро дастӣ идора мекунед, аммо транскрипсияи ҷараён дар ҳоле ки сабт фаъол аст, метавонад иҷро шавад.

Дар One-Shot, Realtime STT истифода намешавад: Собес сонияҳои охирро аз буфери аудио мегирад ва сегменти тайёрро барои транскрипт мефиристад.

Пас, агар шумо Deepgram ё Soniox-ро интихоб кунед, аммо истифода баред One-Shot, истифода баред "Realtime STT ғайрифаъол" рақамҳои таъхир ҳамчун истинод.

Нигоҳубини транскрипсия

Ин таъхири шинохти нутқ аст: то чӣ андоза Sobes матнро пас аз сегменти анҷоми аудиоӣ ё пас аз бастани модели ҷараён дар матни ниҳоӣ барои ибора интизор аст. Он вақтро ҳангоми суханронии шахс дар бар намегирад ва тавлиди ҷавоби AI-ро дар бар намегирад.

Модели Realtime STT маъюб Realtime STT фаъол карда шуд Ин чй маъно дорад
Groq Whisper Large v3 Turbo 500-600 мс Дастрас нест Варианти зудтарин бидуни ҷараён. Барои саволҳои кӯтоҳ хуб.
OpenAI gpt-4o-mini-transcribe 600-900 мс Дастрас нест Каме сусттар аз Groq, аммо одатан бо сухани душвор эҳтиёткортар.
Deepgram Nova-3 тақрибан 900 мс тақрибан 300 мс Бо Realtime STT фаъол, матни ниҳоӣ хеле зудтар пайдо мешавад.
Soniox STT v5 тақрибан 2500 мс тақрибан 200 мс Сусттарин бе Realtime STT, аммо зудтарин ҳангоми бастани матни ниҳоӣ вақте Realtime STT фаъол карда шудааст.

Realtime STT танҳо қуттии қайд нест. Барои Deepgram ва Soniox, он то чӣ андоза зуд ҳис кардани маҳсулотро тағир медиҳад: матн қариб дарҳол пайдо мешавад ва стенограммаи ниҳоӣ назар ба он вақте ки Sobes як сегменти пурраи аудиоиро пас аз ибора мефиристад, зудтар мерасад.

WER: ин чист ва рақамҳо чӣ гунаанд

WER маънои Меъёри хатогии калимаро дорад: ҳиссаи калимаҳои нодуруст эътирофшуда. Чӣ қадаре ки WER паст бошад, ҳамон қадар беҳтар аст. Масалан, WER 6% маънои онро дорад, ки тақрибан 6 аз 100 калима нодуруст эътироф шудааст: иваз карда шуд, гузаред ё бо хато илова карда шуд.

Муҳим: WER-ро бидуни контекст муқоиса кардан душвор аст. Ҳамин модел метавонад 4% дар аудиои тозаи англисӣ ва 15% ҳангоми занги пурғавғо бо аксентҳо, таваққуфҳо ва микрофони бад нишон диҳад. Ҳамин тавр, рақамҳои дар поён овардашуда нуқтаҳои истинодҳои ҷамъиятӣ мебошанд, на кафолат барои ҳар як мусоҳиба. Сарчашма муҳим аст, зеро провайдерҳо маҷмӯи додаҳо ва усулҳои арзёбии гуногунро истифода мебаранд.

Groq Whisper Large v3 Turbo.
Groq гузориш медиҳад, ки WER умумии тақрибан 12% -ро ташкил медиҳад, аммо тақсимоти алоҳидаи англисӣ/русӣ нашр намекунад. Ҳамчун истинод ба Whisper дар сатҳи оилавӣ, FLEURS бенчмарк нишон медихад 4,00% барои забони англисӣ ва 5,13% барои русӣ.

OpenAI gpt-4o-mini-transcribe.
Дар FLEURS меъёр дар рӯйхати мақолаҳои Voxtral Realtime 3,65% барои забони англисӣ ва 5,30% барои русӣ. OpenAI низ мегӯяд gpt-4o-transcribe ва gpt-4o-mini-transcribe беҳтар кардани WER дар муқоиса бо Whisper v2/v3, аммо ҳуҷҷатҳои он тақсимоти оддии ин ду забонро нашр намекунанд.

Deepgram Nova-3.
Барои забони англисӣ, Deepgram гузориш медиҳад 5.26% барои аудио анҷом ва 6.84% барои ҷараён. Барои русӣ, муқоисаи ҷамъиятии Soniox рӯйхат мекунад 8.0%. Қувваи Deepgram вариантҳо ва аксентҳои англисӣ мебошад: англисӣ, амрикоӣ, бритониёӣ, австралиягӣ, ҳиндӣ ва Зеландияи Нав.

Soniox STT v5.
Soniox хабар медиҳад тақрибан 6,5% барои забони англисӣ ва тақрибан 6,2% барои забони русӣ дар муқоиса бо 60 забон. Ягон тақсимоти алоҳидаи англисӣ/русӣ барои Realtime STT, аммо Soniox мегӯяд, ки режими ҷараёнии v4 дақиқиро беҳтар мекунад.

Баррасии асосӣ: барои русӣ, Soniox ва Deepgram нисбат ба равишҳои кӯҳнаи Whisper дар меъёрҳои ҷаҳонии воқеӣ қавитаранд, дар ҳоле ки gpt-4o-mini-transcribe хуб ба назар мерасад FLEURS. Аммо FLEURS, YouTube, зангҳо ва мусоҳибаҳои мустақим муҳити гуногун мебошанд. Интихоби модел бояд ҳам WER ва ҳам таъхирро ба назар гирад.

Моделҳо як ба як

Groq Whisper Large v3 Turbo

Groq Whisper Large v3 Turbo зудтарин варианти Sobes вақте аст, Realtime STT маъюб аст. Он ба ҷавобҳои кӯтоҳ, мусоҳибаҳои зуд ва вазъиятҳое мувофиқат мекунад, ки ҳадди ақали таъхир дар муқоиса бо дақиқии ҳадди аксар дар нутқи душвор муҳимтар аст.

Қувваи асосии он суръат аст. Дастури ASR Groq дар бораи WER умумии тақрибан 12% барои Whisper Large v3 Turbo ва суръатбахшии то 247x нисбат ба давомнокии аудио гузориш медиҳад. Ин онро як варианти хуб барои мулоҳизаҳои кӯтоҳе месозад, ки таъхир аз ҳама муҳим аст.

Агар дар нутқ забони русӣ зиёд бошад, номҳо, ихтисоротҳо, калимаҳои техникии инглисӣ дар дохили гуфтори русӣ, ғавғо ё аксенти қавӣ, Groq метавонад хатогиҳои бештар кунад. Дар ин ҳолат, OpenAI ё Soniox одатан бозгашти беҳтар аст, зеро нигоҳ доштани матни дақиқ аз суръати хом муҳимтар аст.

OpenAI gpt-4o-mini-transcribe

OpenAI gpt-4o-mini-transcribe як сегменти аудиоии анҷомшударо тарҷума мекунад. Аз он сусттар аст Groq Whisper Large v3 Turbo, аммо одатан нозукиҳои нутқ, истилоҳҳои техникӣ ва ҷузъиёти саволҳоро бодиққат кор мекунад.

OpenAI мегӯяд gpt-4o-transcribe ва gpt-4o-mini-transcribe беҳтар кардани WER ва шинохти забон дар муқоиса бо Whisper. Дар мустакил FLEURS меъёр, gpt-4o-mini-transcribe 3,65% WER барои забони англисӣ ва 5,30% барои русӣ номбар шудааст.

OpenAI gpt-4o-mini-transcribe як варианти хуби сифатнок бо аст Realtime STT маъюб мешавад, вақте Groq Whisper Large v3 Turbo дар суханронӣ ё микрофони шумо хатогиҳои аз ҳад зиёд мекунад.

Deepgram Nova-3

Deepgram қавӣ аст Realtime STT сенарияҳо. Nova-3 ҳам бо аудио ва ҳам ҷараёнҳои анҷомёфта кор мекунад ва ҳуҷҷатҳои Deepgram WER-ро барои транскрипсияи ҷараён 6,84% ва барои сабтҳои анҷомёфта дар маҷмӯи 2,703 файли аудиоии ҷаҳонии воқеӣ 5,26% гузориш медиҳанд.

Дар Sobes, Deepgram муфид аст, вақте ки шумо мехоҳед матнро қариб фавран бинед, ба ҷои интизор шудан то тамом шудани ибора. Бо Realtime STT ғайрифаъол, таъхири миёнаи транскрипсия тақрибан 900 мс аст; бо Realtime STT фаъол, он тақрибан 300 мс аст. Ин Deepgram-ро барои ибораҳои тӯлонӣ, субтитрҳои зинда, нутқи омехта ва мусоҳибаҳои англисӣ қулай мегардонад, хусусан вақте ки мусоҳиба акценти минтақавӣ дорад.

Бартарии алоҳидаи Deepgram ин дастгирии вариантҳои англисӣ мебошад. Шумо метавонед на танҳо забони англисӣ умумӣ, балки низ интихоб кунед амрикоӣ, Бритониё, австралиягӣ, Ҳиндустон, ё Зеландияи Нав англисӣ. Ин дар мусоҳибаҳои байналмилалӣ кӯмак мекунад, ки дар он мусоҳиба акценти ношинос дорад ва истилоҳҳои техникӣ бо забони англисӣ зуд гуфтугӯ мекунанд.

Барои русӣ, Deepgram низ хуб ба назар мерасад: муқоисаи Soniox 8,0% WER-ро барои русӣ номбар мекунад.

Soniox STT v5, Realtime STT маъюб

Soniox STT v5 барои гуфтугуи русй, омехта ва истилохоти душвори техникй нагз кор мекунад, вале бо Realtime STT ғайрифаъол он сусттарин вариант аст: таъхири миёнаи транскрипт тақрибан 2500 мс аст. Ин маънои онро дорад, ки дурустии суханронии русӣ ва омехта бештар аз суръати посух муҳимтар аст.

Қувваи Soniox эътирофи бисёрзабона ва ивазкунии забон мебошад. Он инчунин як ҳавзи калони забонҳои камтар маъмулро дар бар мегирад, ки моделҳои таъиноти умумӣ аксар вақт нисбат ба забони англисӣ пасттар мешаванд. Ин барои мусоҳибаҳои русзабон низ муҳим аст, ки дар он як ибора метавонад дар бар гирад React, PostgreSQL, Kafka, thread pool, event loop, ва охири калимаҳои русӣ дар атрофи истилоҳҳои техникии англисӣ.

Soniox STT v5, Realtime STT фаъол карда шуд

Soniox STT v5 бо Realtime STT фаъол беҳтарин вариант аст, вақте ки шумо дар як вақт ба забони русӣ ва ҳадди ақали таъхир ниёз доред. Ба ҳисоби миёна, стенограммаи ниҳоӣ тақрибан 200 мс пас аз ибора меояд. Ин хосият махсусан дар VAD ва Start / Stop: матн ба таври мустақим ҷараён мегирад, ибораҳои русӣ-англисиро хуб идора мекунад ва матни ниҳоӣ пас аз таваққуф зуд қуфл мешавад.

Версияи кӯтоҳ: чӣ бояд интихоб кард?

Агар шумо намехоҳед аз ҳад зиёд фикр кунед:

  • Realtime STT дар VAD кор мекунад ва Start / Stop. Дар One-Shot, интихобҳоро бо истифода баред Realtime STT маъюб.
  • Groq Whisper Large v3 Turbo зудтарин вариант бо аст Realtime STT барои ибораҳои кӯтоҳ ва мусоҳибаҳои маъмулӣ ғайрифаъол.
  • OpenAI gpt-4o-mini-transcribe хуб аст Realtime STT имконоти ғайрифаъол вақте ки шумо мехоҳед транскрипсияи бодиққат тавассути OpenAI дошта бошед.
  • Deepgram Nova-3, Realtime STT маъюб сифати устувор медиҳад, аммо бо таъхири миёна тақрибан 900 мс.
  • Deepgram Nova-3, Realtime STT фаъол карда шуд режими ҷараёни зуд аст, тақрибан 300 мс то матни ниҳоӣ пас аз як ибора.
  • Soniox STT v5, Realtime STT маъюб барои гуфтугӯи русӣ ва омехта қавӣ аст, аммо таъхири баландтарин дорад: тақрибан 2500 мс.
  • Soniox STT v5, Realtime STT фаъол карда шуд зудтарин варианти ҷараён барои гузариши забони русӣ ва забон аст: тақрибан 200 мс.