Süni intellekt cavablarının keyfiyyəti dil modelindən əvvəl başlayır. Bu, nitqin transkripsiyası ilə başlayır. Əgər sistem sualı səhv eşidərsə, güclü model belə təhrif olunmuş mətnə cavab verəcək.
Sobes-də bir neçə nitq tanıma modelindən birini seçə bilərsiniz: Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, Deepgram Nova-3 və Soniox STT v5. Onlar yalnız dəqiqlik baxımından deyil, həm də gecikmə, davranışın yazılması, dil dəstəyi və səs-küylü iclasları idarə etmə tərzlərində fərqlənirlər.
Realtime STT nəyi dəyişir?
Sobes interfeysində vacib ayar sadədir: Realtime STT deaktiv və ya Realtime STT aktiv.
Realtime STT deaktiv edilib
Sobes tamamlanmış audio seqmenti tanıma üçün göndərir və son mətni gözləyir. Realtime STT deaktiv olduqda Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe** və Deepgram Nova-3 və Soniox STT v5 belə işləyir.
Bu, qısa frazalar üçün sadə və sabit axındır: mətn ara düzəlişlər olmadan tamamlanmış transkript kimi gəlir. Əvəzində isə Sobes yalnız audio seqmenti göndərildikdən sonra mətn alır. Uzun ifadələr gecikməni daha nəzərə çarpan edir və danışan şəxs canlı olaraq sözlər yayımlanmır.
Realtime STT aktivdir
Sobes səsi modelə ötürür və fraza bitməzdən əvvəl qismən mətn alır. Realtime STT aktiv olduqda Deepgram Nova-3 və Soniox STT v5 belə işləyir.
Axın transkripsiyasında mətn əvvəlcə layihə ola bilər: model danışmağa davam edərkən sözləri redaktə edə bilər. Finalizasiya ifadənin bitdiyi, modelin həmin mətn seqmentini dəyişdirməyi dayandırdığı və Sobes-in onu təhlükəsiz şəkildə ötürə biləcəyi anıdır.
Realtime STT-nin məqsədi reaksiya sürətidir. Görürsünüz ki, sistem indi nitqi eşidir, uzun cavablar ifadə bitməzdən əvvəl oxunaqlı olur və avtomatik cavab daha tez başlaya bilər. Bunun əvəzində qismən mətn dəyişə bilər, keyfiyyət daha çox bağlantının sabitliyindən asılıdır və bəzən modelin fraza üçün son mətnini kilidləməsini gözləmək lazımdır.
Realtime STT-ni hansı qeyd rejimləri dəstəkləyir?
Vacib detal: Realtime STT VAD və Start / Stop rejimlərində işləyir. VAD-da Sobes nitqi avtomatik aşkar edir, yazmağa başlayır və fasilədən sonra seqmenti bağlayır. Start / Stop rejimində başlanğıc və sonu əl ilə idarə edirsiniz, amma yazı aktiv olanda stream transkripsiyası işləyə bilər.
One-Shot rejimində Realtime STT istifadə olunmur: Sobes audio tamponundan son saniyələri götürür və transkripsiya üçün tamamlanmış seqmenti göndərir.
Əgər Deepgram və ya Soniox seçirsinizsə, amma One-Shot istifadə edirsinizsə, "Realtime STT disabled" gecikmə rəqəmlərini istinad kimi götürün.
Transkripsiya gecikməsi
Bu, nitq tanıma gecikməsidir: Sobes-in bitmiş audio seqmentindən sonra və ya axın modeli fraza üçün son mətnini kilidlədikdən sonra mətn üçün nə qədər gözlədiyi. Bu, şəxsin danışdığı vaxtı və süni intellekt cavablarının yaradılmasını əhatə etmir.
| Model | Realtime STT deaktiv edilib | Realtime STT aktivdir | Bu nə deməkdir |
|---|---|---|---|
| Groq Whisper Böyük v3 Turbo | 500-600 ms | Mövcud deyil | Ən sürətli yayımsız seçim. Qısa suallar üçün yaxşıdır. |
OpenAI gpt-4o-mini-transcribe |
600-900 ms | Mövcud deyil | Groq-dan bir az yavaşdır, amma adətən çətin danışıqda daha ehtiyatlıdır. |
| Deepgram Nova-3 | Təxminən 900 ms | təxminən 300 ms | Realtime STT aktiv olduqda, son mətn daha sürətli görünür. |
| Soniox STT v5 | Təxminən 2500 ms | Təxminən 200 ms | Realtime STT olmadan ən yavaşdır, amma Realtime STT aktiv olduqda son mətnləri kilidləməkdə ən sürətlidir. |
Realtime STT sadəcə bir qutu deyil. Deepgram və Soniox üçün bu, məhsulun nə qədər sürətli hiss olunduğunu dəyişir: mətn demək olar ki, dərhal görünməyə başlayır və son transkript Sobes-in frazadan sonra tamamlanmış audio seqmenti göndərməsindən daha tez gəlir.
WER: nədir və rəqəmlər necə görünür
WER Söz Səhv Faizi deməkdir: səhv tanınan sözlərin payı. WER nə qədər aşağı olsa, bir o qədər yaxşıdır. Məsələn, 6% WER deməkdir ki, təxminən 100 sözdən 6-sı səhv tanınıb: dəyişdirilib, atılıb və ya səhvən əlavə edilib.
Vacib: WER kontekstsiz müqayisə etmək çətindir. Eyni model təmiz ingilis dilində 4%, səs-küylü zəngdə isə vurğular, kəsintilər və zəif mikrofonla 15% göstərə bilir. Aşağıdakı rəqəmlər ictimai istinad nöqtələridir, hər müsahibə üçün zəmanət deyil. Mənbə önəmlidir, çünki provayderlər fərqli məlumat dəstləri və qiymətləndirmə metodlarından istifadə edirlər.
Groq Whisper Böyük v3 Turbo. Groq ümumi GER-in təxminən 12% olduğunu bildirir, lakin ayrıca ingilis/rus bölməsini dərc etmir. Ailə səviyyəsində Whisper referansı kimi, FLEURS benchmarkı ingilis dili üçün **4.00%, rus dili üçün 5.13% göstərir.
OpenAI gpt-4o-mini-transcribe.
Voxtral Realtime məqaləsində FLEURS benchmark ingilis dili üçün **3.65%, rus dili üçün 5.30% göstərilib. OpenAI həmçinin deyir ki, gpt-4o-transcribe və gpt-4o-mini-transcribe Whisper v2/v3 ilə müqayisədə WER-i yaxşılaşdırır, amma onun sənədləri bu iki dil üçün sadə təhlil dərc etmir.
Deepgram Nova-3. İngilis dili üçün Deepgram tamamlanmış audio üçün 5.26% və yayım üçün 6.84% göstərir. Russian üçün isə ictimai Soniox müqayisəsi 8.0% göstərir. Deepgramın gücü ingilis variantları və ləhcələrindədir: Amerika, Britaniya, Avstraliya, Hindistan və Yeni Zelandiya ingiliscələri.
Soniox STT v5. Soniox 60 dillik benchmarkda ingilis dili üçün **təxminən 6.5%, rus dili üçün təxminən 6.2% hesabat verir. Realtime STT üçün ayrıca ingilis/rus bölgüləri yoxdur, amma Soniox deyir ki, v4 yayım rejimi dəqiqliyi artırır.
Əsas nəticə: Russian üçün Soniox və Deepgram real dünya benchmarklarında köhnə Whisper tərzi yanaşmalardan daha güclü görünür, gpt-4o-mini-transcribe isə FLEURS-da yaxşı görünür. Amma FLEURS, YouTube, zənglər və canlı müsahibələr fərqli mühitlərdir. Model seçimi həm WER, həm də gecikməni nəzərə almalıdır.
Modellər bir-bir
Groq Whisper Böyük v3 Turbo
Groq Whisper Large v3 Turbo Realtime STT deaktiv olduqda ən sürətli Sobes seçimidir. Qısa cavablar, sürətli müsahibələr və minimal gecikmənin çətin nitqdə maksimum dəqiqlikdən daha vacib olduğu vəziyyətlərə uyğundur.
Onun əsas gücü sürətdir. Groq-un ASR bələdçisi Whisper Large v3 Turbo üçün ümumi WER təxminən 12% və audio müddətinə nisbətən 247x-ə qədər sürətlənmə göstərir. Bu, gecikmənin ən vacib olduğu qısa şərhlər üçün yaxşı seçimdir.
Əgər nitqdə çoxlu rus dili, adlar, qısaltmalar, rus dilində ingilis texniki sözləri, səs-küy və ya güclü aksent varsa, Groq daha çox səhv edə bilər. Bu halda, OpenAI və ya Soniox adətən daha yaxşı ehtiyat seçimdir, çünki dəqiq ifadənin qorunması xam sürətdən daha önəmlidir.
OpenAI gpt-4o-mini-transkripsiya
OpenAI gpt-4o-mini-transcribe tamamlanmış audio seqmentini transkripsiya edir. Groq Whisper Large v3 Turbo-dan daha yavaşdır, amma adətən nitq incəliklərini, texniki terminləri və sual detalları ilə daha diqqətlə işləyir.
OpenAI deyir ki, gpt-4o-transcribe və gpt-4o-mini-transcribe Whisper ilə müqayisədə WER-i və dil tanımanı yaxşılaşdırır. Müstəqil FLEURS göstəricisində gpt-4o-mini-transcribe ingilis dili üçün 3.65%, rus dili üçün isə 5.30% olaraq göstərilib.
OpenAI gpt-4o-mini-transcribe Groq Whisper Large v3 Turbo çox səhv etdikdə Realtime STT-ni deaktiv edərək daha keyfiyyətli yaxşı seçimdir.
Deepgram Nova-3
Deepgram Realtime STT ssenarilərində güclüdür. Nova-3 həm tamamlanmış audio, həm də yayım ilə işləyir və Deepgram-ın sənədləri 2,703 real dünya audio faylından ibarət dəstdə yayım transkripsiyasında WER 6.84%, tamamlanmış yazılar üçün isə 5.26% olduğunu bildirir.
Sobes-də Deepgram demək olar ki, dərhal mətn görmək istəyəndə faydalıdır, frazanı bitirənə qədər gözləmək əvəzinə. Realtime STT deaktiv olduqda, orta transkripsiya gecikməsi təxminən 900 ms-dir; Realtime STT aktiv olduqda isə təxminən 300 ms-dir. Bu, Deepgram-ı uzun ifadələr, canlı altyazılar, qarışıq nitq və ingilis müsahibələri üçün əlverişli edir, xüsusilə müsahibəçinin regional ləhcəsi olduqda.
Başqa bir Deepgram üstünlüyü ingilis variantlarının dəstəklənməsidir. Yalnız ümumi ingilis dilini deyil, həm də Amerikan, Britaniya, Avstraliya, Hind və ya Yeni Zelandiya İngilis dillərini də seçə bilərsiniz. Bu, beynəlxalq müsahibələrdə kömək edir, çünki müsahibəçi yad ləhcəyə malikdir və texniki terminlər sürətli söhbət ingiliscəsi ilə qarışdırılır.
Russian üçün Deepgram da yaxşı görünür: Soniox müqayisəsində Russian üçün 8.0% WER göstərilir.
Soniox STT v5, Realtime STT deaktiv edilib
Soniox STT v5 rus, qarışıq dil danışıq və çətin texniki terminlər üçün yaxşı işləyir, amma Realtime STT deaktiv olduqda ən yavaş seçimdir: orta transkripsiya gecikməsi təxminən 2500 ms-dir. Rus və qarışıq nitqdə dəqiqlik cavab sürətindən daha çox önəmlidirsə, bu məntiqlidir.
Soniox-un gücü çoxdilli tanıma və dil dəyişdirməsidir. Həmçinin, ümumi məqsədli modellərin ingilis dilindəkindən daha çox zəiflədiyi daha az yayılmış dillər hovuzunu əhatə edir. Bu, rusdilli müsahibələr üçün də önəmlidir, çünki bir ifadə ingilis texniki terminləri ətrafında React, PostgreSQL, Kafka, thread pool, event loop və rus söz sonları ola bilər.
Soniox STT v5, Realtime STT aktiv
Realtime STT aktiv olan Soniox STT v5 rus dili və eyni zamanda minimal gecikmə lazım olduqda ən yaxşı seçimdir. Orta hesabla, son transkript ifadədən təxminən 200 ms sonra gəlir. Bu seçim xüsusilə VAD və Start / Stop rejimlərində yaxşı uyğundur: mətn canlı yayımlanır, rus-ingilis ifadələrini yaxşı idarə edir və fasilədən sonra son mətni tez kilidləyir.
Qısa versiya: hansını seçməlisiniz?
Əgər çox düşünmək istəmirsinizsə:
- Realtime STT VAD və Start / Stop rejimlərində işləyir. One-Shot-da, Realtime STT-ni deaktiv edən seçimlərdən istifadə edin.
- Groq Whisper Large v3 Turbo qısa ifadələr və tipik müsahibələr üçün Realtime STT deaktiv edilmiş ən sürətli seçimdir.
- OpenAI gpt-4o-mini-transcribe OpenAI vasitəsilə daha diqqətli transkripsiya etmək istədiyiniz zaman Realtime STT-ni deaktiv etmək üçün yaxşı seçimdir.
- Deepgram Nova-3, Realtime STT deaktiv möhkəm keyfiyyət verir, amma orta gecikmə təxminən 900 ms-dir.
- Deepgram Nova-3, Realtime STT aktiv sürətli yayım rejimidir, təxminən 300 ms son mətnə qədər.
- Soniox STT v5, Realtime STT deaktiv rus və qarışıq dillərdə danışıq üçün güclüdür, lakin ən yüksək gecikməyə malikdir: təxminən 2500 ms.
- Soniox STT v5, Realtime STT aktiv rus dili və dil dəyişdirmə üçün ən sürətli yayım seçimidir: təxminən 200 ms.
