Sobes.tech
Makalelere geri dön

Konuşma transkripsiyon modeli nasıl seçilir?

Alexander10 Mayıs 2026 (2 мес. назад)
Konuşma transkripsiyon modeli nasıl seçilir?

Yapay zeka yanıtlarının kalitesi dil modelinden önce başlar. Konuşmanın transkripsiyonuyla başlar. Sistem soruyu yanlış anlarsa güçlü bir model bile çarpık metni yanıtlayacaktır.

Sobes'te çeşitli konuşma tanıma modelleri arasından seçim yapabilirsiniz: Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transscribe, Deepgram Nova-3 ve Soniox STT v5. Yalnızca doğruluk açısından değil, aynı zamanda gecikme, kayıt davranışı, dil desteği ve gürültülü toplantıları yönetme biçimleri açısından da farklılık gösterirler.

Gerçek Zamanlı STT neyi değiştirir?

Sobes arayüzünde önemli ayar basittir: Gerçek Zamanlı STT devre dışı veya Gerçek Zamanlı STT etkin.

Gerçek Zamanlı STT devre dışı

Sobes, tanıma için tamamlanmış bir ses bölümü gönderir ve son metni bekler. Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transscribe ve ayrıca Deepgram Nova-3 ve Soniox STT v5, Realtime STT devre dışı bırakıldığında bu şekilde çalışır.

Bu, kısa ifadeler için basit ve istikrarlı bir akıştır: metin, ara düzeltmeler yapılmadan tamamlanmış bir transkript olarak gelir. Buradaki çelişki, Sobes'in metni yalnızca ses bölümü gönderildikten sonra almasıdır. Uzun cümleler gecikmeyi daha belirgin hale getirir ve kişi konuşurken canlı sözcük akışı olmaz.

Gerçek Zamanlı STT etkin

Sobes, sesi modele aktarır ve cümle bitmeden kısmi metni alır. Gerçek Zamanlı STT etkinleştirildiğinde Deepgram Nova-3 ve Soniox STT v5 bu şekilde çalışır.

Akışlı transkripsiyonda, metin ilk başta bir taslak olabilir: kişi konuşmaya devam ederken model, kelimeleri gözden geçirebilir. Sonlandırma, ifadenin bittiği, modelin söz konusu metin bölümünü değiştirmeyi bıraktığı ve Sobes'in bunu güvenli bir şekilde iletebildiği andır.

Gerçek Zamanlı STT'nin amacı reaksiyon hızıdır. Sistemin şu anda konuşmayı duyduğunu, uzun yanıtların cümle bitmeden okunabilir hale geldiğini ve otomatik yanıtın daha erken başlayabildiğini görebilirsiniz. Buradaki ödün, kısmi metnin değişebilmesi, kalitenin daha çok bağlantı kararlılığına bağlı olması ve bazen modelin ifade için son metinde kilitlenmesini beklemeniz gerekmesidir.

Hangi kayıt modları Gerçek Zamanlı STT'yi destekler?

Önemli detay: Gerçek Zamanlı STT, VAD ve Başlat/Durdur modlarında çalışır. VAD'de Sobes konuşmayı otomatik olarak algılar, kayda başlar ve bir duraklamanın ardından bölümü kapatır. Başlat / Durdur'da başlangıcı ve bitişi manuel olarak kontrol edersiniz, ancak akışlı transkripsiyon, kayıt etkinken çalışmaya devam edebilir.

Tek Çekim'de Gerçek Zamanlı STT kullanılmaz: Sobes ses arabelleğinden son saniyeleri alır ve tamamlanmış bir bölümü transkripsiyon için gönderir.

Yani Deepgram veya Soniox'u seçip One-Shot kullanıyorsanız referans olarak "Gerçek Zamanlı STT devre dışı" gecikme sayılarını kullanın.

Transkripsiyon gecikmesi

Bu, konuşma tanıma gecikmesidir: Bitmiş bir ses bölümünden sonra veya bir akış modeli bir cümle için son metinde kilitlendikten sonra Sobes'in metni ne kadar beklediği. Kişinin konuştuğu süreyi içermez ve yapay zeka yanıt oluşturmayı içermez.

Modeli Gerçek Zamanlı STT devre dışı Gerçek Zamanlı STT etkin Bu ne anlama geliyor?
Groq Whisper Large v3 Turbo 500-600 ms Mevcut değil En hızlı akış dışı seçenek. Kısa sorular için iyi.
OpenAI gpt-4o-mini-transcribe 600-900 ms Mevcut değil Groq'tan biraz daha yavaştır ama genellikle zor konuşmalarda daha dikkatlidir.
Deepgram Nova-3 yaklaşık 900 ms yaklaşık 300 ms Gerçek Zamanlı STT etkinleştirildiğinde son metin çok daha hızlı görünür.
Soniox STT v5 yaklaşık 2500 ms yaklaşık 200 ms Gerçek Zamanlı STT olmadan en yavaş, ancak Gerçek Zamanlı STT etkinleştirildiğinde son metni kilitlemede en hızlı.

Gerçek Zamanlı STT yalnızca bir onay kutusu değildir. Deepgram ve Soniox için bu, ürünün hızını değiştiriyor: metin neredeyse anında görünmeye başlıyor ve son transkript, Sobes'in ifadeden sonra tamamlanmış bir ses bölümü göndermesine kıyasla daha hızlı ulaşıyor.

WER: nedir ve sayılar neye benziyor

WER, Kelime Hata Oranı anlamına gelir: yanlış tanınan kelimelerin payı. WER ne kadar düşük olursa o kadar iyidir. Örneğin %6'lık WER, kabaca 100 kelimeden 6'sının yanlış tanındığı anlamına gelir: değiştirilmiş, atlanmış veya yanlışlıkla eklenmiştir.

Önemli: WER'yi bağlam olmadan karşılaştırmak zordur. Aynı model, temiz İngilizce seste %4, vurgulu, kesintili ve zayıf mikrofonlu gürültülü bir çağrıda ise %15 gösterebilir. Dolayısıyla aşağıdaki sayılar kamuya açık referans noktalarıdır, her görüşme için bir garanti değildir. Kaynak önemlidir çünkü sağlayıcılar farklı veri kümeleri ve değerlendirme yöntemleri kullanır.

Groq Whisper Large v3 Turbo. Groq %12 civarında genel bir WER bildiriyor ancak ayrı bir İngilizce/Rusça dökümü yayınlamıyor. Aile düzeyinde bir Whisper referansı olarak FLEURS karşılaştırması İngilizce için %4,00 ve Rusça için %5,13 göstermektedir.

OpenAI gpt-4o-mini-transscribe. Voxtral Realtime makalesindeki FLEURS karşılaştırması İngilizce için %3,65 ve Rusça için %5,30'u listelemektedir. OpenAI ayrıca gpt-4o-transcribe ve gpt-4o-mini-transcribe'nin Whisper v2/v3 ile karşılaştırıldığında WER'yi iyileştirdiğini söylüyor ancak dokümanları bu iki dil için basit bir döküm yayınlamıyor.

Deepgram Nova-3. Deepgram, İngilizce için bitmiş ses için %5,26 ve akış için %6,84 rapor ediyor. Rusça için halka açık Soniox karşılaştırması %8,0'ı listeliyor. Deepgram'ın gücü İngilizce varyantları ve aksanlarıdır: Amerikan, İngiliz, Avustralya, Hint ve Yeni Zelanda İngilizcesi.

Soniox STT v5. Soniox, 60 dillik bir kıyaslamada İngilizce için yaklaşık %6,5 ve Rusça için yaklaşık %6,2 rapor ediyor. Realtime STT için ayrı bir İngilizce/Rusça dökümü yok ancak Soniox, v4 akış modunun doğruluğu artırdığını söylüyor.

Ana çıkarım: Rusça için, Soniox ve Deepgram, gerçek dünya kıyaslamalarında eski Whisper tarzı yaklaşımlardan daha güçlü görünürken gpt-4o-mini-transcribe, FLEURS'ta iyi görünüyor. Ancak FLEURS, YouTube, çağrılar ve canlı röportajlar farklı ortamlardır. Model seçiminde hem WER hem de gecikme dikkate alınmalıdır.

Modeller tek tek

Groq Whisper Large v3 Turbo

Groq Whisper Large v3 Turbo, Gerçek Zamanlı STT devre dışı bırakıldığında en hızlı Sobes seçeneğidir. Kısa yanıtlara, hızlı görüşmelere ve zor konuşmalarda minimum gecikmenin maksimum doğruluktan daha önemli olduğu durumlara uygundur.

Ana gücü hızdır. Groq'un ASR kılavuzu, Whisper Large v3 Turbo için yaklaşık %12'lik genel bir WER ve ses süresine göre 247 kata kadar hızlanma rapor ediyor. Bu, gecikmenin en önemli olduğu kısa açıklamalar için onu iyi bir seçenek haline getirir.

Konuşmada çok fazla Rusça, isim, kısaltma, Rusça konuşmanın içinde İngilizce teknik kelimeler, gürültü veya güçlü bir aksan varsa Groq daha fazla hata yapabilir. Bu durumda, OpenAI veya Soniox genellikle daha iyi bir geri dönüş yöntemidir çünkü tam ifadeyi korumak ham hızdan daha önemlidir.

OpenAI gpt-4o-mini-transkripsiyon

OpenAI gpt-4o-mini-transcribe tamamlanmış bir ses bölümünü kopyalar. Groq Whisper Large v3 Turbo'dan daha yavaştır ancak genellikle konuşma inceliklerini, teknik terimleri ve soru ayrıntılarını daha dikkatli bir şekilde ele alır.

OpenAI, gpt-4o-transcribe ve gpt-4o-mini-transcribe'nin Whisper'a kıyasla WER ve dil tanımayı geliştirdiğini söylüyor. Bağımsız FLEURS kıyaslamasında gpt-4o-mini-transcribe, İngilizce için %3,65 WER ve Rusça için %5,30 WER seviyesinde listelenmiştir.

OpenAI gpt-4o-mini-transcribe, Groq Whisper Large v3 Turbo konuşmanızda veya mikrofonunuzda çok fazla hata yaptığında Gerçek Zamanlı STT'nin devre dışı bırakıldığı iyi bir yüksek kaliteli seçenektir.

Deepgram Nova-3

Deepgram, Gerçek Zamanlı STT senaryolarında güçlüdür. Nova-3 hem tamamlanmış ses hem de akışla çalışır ve Deepgram'ın belgeleri, 2.703 gerçek dünya ses dosyasından oluşan bir sette akış transkripsiyonu için %6,84 ve tamamlanmış kayıtlar için %5,26 WER rapor etmektedir.

Sobes'te Deepgram, cümlenin bitmesini beklemek yerine metni hemen görmek istediğinizde kullanışlıdır. Gerçek Zamanlı STT devre dışı bırakıldığında ortalama transkripsiyon gecikmesi 900 ms civarındadır; Gerçek Zamanlı STT etkinken bu süre yaklaşık 300 ms'dir. Bu, Deepgram'ı uzun cümleler, canlı altyazılar, karışık konuşmalar ve özellikle görüşmecinin bölgesel aksanı varsa İngilizce röportajlar için kullanışlı hale getirir.

Ayrı bir Deepgram avantajı, İngilizce varyantlarının desteklenmesidir. Yalnızca genel İngilizceyi değil aynı zamanda Amerikan, İngiliz, Avustralya, Hint veya Yeni Zelanda İngilizcesini de seçebilirsiniz. Bu, görüşmeyi yapan kişinin alışılmadık bir aksan kullandığı ve teknik terimlerin hızlı konuşma İngilizcesiyle karıştırıldığı uluslararası görüşmelerde yardımcı olur.

Rusça için Deepgram da iyi görünüyor: Soniox karşılaştırması Rusça için %8,0 WER'yi listeliyor.

Soniox STT v5, Gerçek Zamanlı STT devre dışı

Soniox STT v5 Rusça, karma dilli konuşma ve zor teknik terimler için iyi çalışır, ancak Gerçek Zamanlı STT devre dışı bırakıldığında en yavaş seçenektir: ortalama transkripsiyon gecikmesi yaklaşık 2500 ms'dir. Rusça ve karışık konuşmalarda doğruluğun yanıt hızından daha önemli olması mantıklıdır.

Soniox'un gücü çok dilli tanıma ve dil değiştirmedir. Aynı zamanda, genel amaçlı modellerin genellikle İngilizceye göre daha fazla bozulduğu, daha az yaygın olan dillerden oluşan geniş bir havuzu da kapsar. Bu, tek bir ifadenin React, PostgreSQL, Kafka, thread pool, event loop ve İngilizce teknik terimlerin etrafındaki Rusça sözcük sonlarını içerebildiği Rusça konuşulan röportajlar için de önemlidir.

Soniox STT v5, Gerçek Zamanlı STT etkin

Gerçek Zamanlı STT etkin Soniox STT v5, aynı anda hem Rusça konuşmaya hem de minimum gecikmeye ihtiyaç duyduğunuzda en iyi seçenektir. Ortalama olarak son transkripsiyon cümleden yaklaşık 200 ms sonra gelir. Bu seçenek özellikle VAD ve Başlat / Durdur'a çok iyi uyuyor: metin akışları canlı, Rusça-İngilizce cümleleri iyi işliyor ve bir duraklamanın ardından son metni hızlı bir şekilde kilitliyor.

Kısa versiyon: Neyi seçmelisiniz?

Fazla düşünmek istemiyorsanız:

  • Gerçek zamanlı STT, VAD ve Başlat/Durdur'da çalışır. One-Shot'ta seçenekleri Gerçek Zamanlı STT devre dışıyken kullanın.
  • Groq Whisper Large v3 Turbo, kısa cümleler ve tipik röportajlar için Gerçek Zamanlı STT'nin devre dışı bırakıldığı en hızlı seçenektir.
  • OpenAI gpt-4o-mini-transscribe, OpenAI aracılığıyla daha dikkatli transkripsiyon istediğinizde, Gerçek Zamanlı STT'nin devre dışı bırakıldığı iyi bir seçenektir.
  • Deepgram Nova-3, Gerçek Zamanlı STT devre dışı sağlam kalite sağlar, ancak ortalama gecikme süresi yaklaşık 900 ms'dir.
  • Deepgram Nova-3, Gerçek Zamanlı STT etkin, bir cümleden sonraki son metne kadar yaklaşık 300 ms süren hızlı bir akış modudur.
  • Soniox STT v5, Gerçek Zamanlı STT devre dışı Rusça ve karma dillerde konuşma için güçlüdür ancak en yüksek gecikme süresine sahiptir: yaklaşık 2500 ms.
  • Soniox STT v5, Gerçek Zamanlı STT etkin, Rusça ve dil değiştirme için en hızlı akış seçeneğidir: yaklaşık 200 ms.