De kwaliteit van AI-antwoorden begint vóór het taalmodel. Het begint met spraaktranscriptie. Als het systeem de vraag verkeerd interpreteert, zal zelfs een sterk model vervormde tekst beantwoorden.
In Sobes kun je kiezen uit verschillende spraakherkenningsmodellen: Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, Deepgram Nova-3 en Soniox STT v5. Ze verschillen niet alleen in nauwkeurigheid, maar ook in latentie, opnamegedrag, taalondersteuning en de manier waarop ze omgaan met luidruchtige vergaderingen.
Wat verandert Realtime STT?
In de Sobes-interface is de belangrijke instelling eenvoudig: Realtime STT uitgeschakeld of Realtime STT ingeschakeld.
Realtime STT uitgeschakeld
Sobes stuurt een voltooid audiosegment ter herkenning en wacht op de definitieve tekst. Dit is hoe Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, en ook Deepgram Nova-3 en Soniox STT v5 werken wanneer Realtime STT is uitgeschakeld.
Dit is een eenvoudige, stabiele stroom voor korte zinnen: de tekst arriveert als een voltooide transcriptie, zonder tussentijdse correcties. Het nadeel is dat Sobes pas tekst ontvangt nadat het audiosegment is verzonden. Lange zinnen maken de vertraging duidelijker en er is geen livestroom van woorden terwijl de persoon aan het woord is.
Realtime STT ingeschakeld
Sobes streamt audio naar het model en ontvangt een gedeeltelijke tekst voordat de zin voorbij is. Dit is hoe Deepgram Nova-3 en Soniox STT v5 werken wanneer Realtime STT is ingeschakeld.
Bij streaming-transcriptie kan de tekst in eerste instantie een concept zijn: het model kan woorden herzien terwijl de persoon blijft spreken. Afronding is het moment waarop de zin voorbij is, het model stopt met het wijzigen van dat tekstsegment en Sobes het veilig kan doorgeven.
Het punt van Realtime STT is reactiesnelheid. U kunt zien dat het systeem momenteel spraak hoort, dat lange antwoorden leesbaar worden voordat de zin voorbij is, en dat het automatische antwoord eerder kan beginnen. Het nadeel is dat gedeeltelijke tekst kan veranderen, dat de kwaliteit meer afhangt van de stabiliteit van de verbinding, en dat je soms moet wachten tot het model de definitieve tekst voor de zin vastlegt.
Welke opnamemodi ondersteunen Realtime STT?
Belangrijk detail: Realtime STT werkt in de VAD- en Start/Stop-modi. In VAD detecteert Sobes automatisch spraak, start de opname en sluit het segment na een pauze. In Start/Stop regelt u het begin en einde handmatig, maar streaming-transcriptie kan nog steeds worden uitgevoerd terwijl de opname actief is.
In One-Shot wordt Realtime STT niet gebruikt: Sobes haalt de laatste seconden uit de audiobuffer en verzendt een voltooid segment voor transcriptie.
Dus als u Deepgram of Soniox kiest maar One-Shot gebruikt, gebruik dan de latentienummers van "Realtime STT uitgeschakeld" als referentie.
Transcriptielatentie
Dit is de latentie voor spraakherkenning: hoe lang Sobes wacht op tekst na een voltooid audiosegment, of nadat een streamingmodel de definitieve tekst voor een zin heeft vergrendeld. Het omvat niet de tijd waarin de persoon aan het woord is, en ook niet het genereren van AI-antwoorden.
| Model | Realtime STT uitgeschakeld | Realtime STT ingeschakeld | Wat het betekent |
|---|---|---|---|
| Groq Whisper Large v3 Turbo | 500-600 ms | Niet beschikbaar | De snelste niet-streamingoptie. Goed voor korte vragen. |
OpenAI gpt-4o-mini-transcribe |
600-900 ms | Niet beschikbaar | Iets langzamer dan Groq, maar meestal voorzichtiger bij moeilijke spraak. |
| Deepgram Nova-3 | ongeveer 900 ms | ongeveer 300 ms | Als Realtime STT is ingeschakeld, verschijnt de definitieve tekst veel sneller. |
| Soniox STT v5 | ongeveer 2500 ms | ongeveer 200 ms | Het langzaamst zonder Realtime STT, maar het snelst bij het vergrendelen van de definitieve tekst wanneer Realtime STT is ingeschakeld. |
Realtime STT is niet alleen een selectievakje. Voor Deepgram en Soniox verandert het hoe snel het product aanvoelt: de tekst verschijnt vrijwel onmiddellijk en het definitieve transcript arriveert sneller dan wanneer Sobes een voltooid audiosegment na de zin verzendt.
WER: wat het is en hoe de cijfers eruit zien
WER betekent Word Error Rate: het aandeel verkeerd herkende woorden. Hoe lager de WER, hoe beter. Een WER van 6% betekent bijvoorbeeld dat ongeveer 6 van de 100 woorden onjuist zijn herkend: per ongeluk vervangen, overgeslagen of toegevoegd.
Belangrijk: WER is zonder context moeilijk te vergelijken. Hetzelfde model kan 4% laten zien bij zuivere Engelse audio en 15% bij een luidruchtig gesprek met accenten, onderbrekingen en een slechte microfoon. Onderstaande cijfers zijn dus publieke referentiepunten en geen garantie voor elk interview. De bron is van belang omdat aanbieders verschillende datasets en evaluatiemethoden gebruiken.
Groq Whisper Large v3 Turbo. Groq rapporteert een algemene WER van ongeveer 12%, maar publiceert geen aparte Engels/Russische uitsplitsing. Als Whisper-referentie op gezinsniveau toont de FLEURS-benchmark 4,00% voor Engels en 5,13% voor Russisch.
OpenAI gpt-4o-mini-transcriberen.
De FLEURS-benchmark in het Voxtral Realtime-artikel vermeldt 3,65% voor Engels en 5,30% voor Russisch. OpenAI zegt ook dat gpt-4o-transcribe en gpt-4o-mini-transcribe WER verbeteren in vergelijking met Whisper v2/v3, maar de documenten publiceren geen eenvoudig overzicht voor deze twee talen.
Deepgram Nova-3. Voor Engels rapporteert Deepgram 5,26% voor voltooide audio en 6,84% voor streaming. Voor Russisch vermeldt de openbare Soniox-vergelijking 8,0%. De kracht van Deepgram zijn Engelse varianten en accenten: Amerikaans, Brits, Australisch, Indiaas en Nieuw-Zeelands Engels.
Soniox STT v5. Soniox rapporteert ongeveer 6,5% voor Engels en ongeveer 6,2% voor Russisch in een benchmark met 60 talen. Er is geen aparte Engels/Russische uitsplitsing voor Realtime STT, maar Soniox zegt dat de v4-streamingmodus de nauwkeurigheid verbetert.
De belangrijkste conclusie: voor Russisch zien Soniox en Deepgram er sterker uit dan oudere Whisper-achtige benaderingen op echte benchmarks, terwijl gpt-4o-mini-transcribe er goed uitziet op FLEURS. Maar FLEURS, YouTube, bellen en live interviews zijn verschillende omgevingen. Bij de modelkeuze moet rekening worden gehouden met zowel WER als latentie.
Modellen één voor één
Groq Whisper Large v3 Turbo
Groq Whisper Large v3 Turbo is de snelste Sobes-optie wanneer Realtime STT is uitgeschakeld. Het is geschikt voor korte antwoorden, snelle interviews en situaties waarin minimale latentie belangrijker is dan maximale nauwkeurigheid bij moeilijke spraak.
De grootste kracht is snelheid. De ASR-gids van Groq rapporteert een algemene WER van ongeveer 12% voor Whisper Large v3 Turbo en een acceleratie tot 247x in verhouding tot de audioduur. Dat maakt het een goede optie voor korte opmerkingen waarbij vertraging het belangrijkst is.
Als de toespraak veel Russische namen, afkortingen, Engelse technische woorden in de Russische spraak, ruis of een sterk accent bevat, kan Groq meer fouten maken. In dat geval is OpenAI of Soniox meestal de betere uitwijkmogelijkheid, omdat het behouden van de exacte bewoording belangrijker is dan de pure snelheid.
OpenAI gpt-4o-mini-transcriberen
OpenAI gpt-4o-mini-transcribe transcribeert een voltooid audiosegment. Het is langzamer dan Groq Whisper Large v3 Turbo, maar gaat doorgaans zorgvuldiger om met spraaknuance, technische termen en vraagdetails.
OpenAI zegt dat gpt-4o-transcribe en gpt-4o-mini-transcribe de WER- en taalherkenning verbeteren in vergelijking met Whisper. In de onafhankelijke FLEURS-benchmark staat gpt-4o-mini-transcribe genoteerd op 3,65% WER voor Engels en 5,30% voor Russisch.
OpenAI gpt-4o-mini-transcribe is een goede optie van hogere kwaliteit waarbij Realtime STT is uitgeschakeld wanneer Groq Whisper Large v3 Turbo te veel fouten maakt in uw spraak of microfoon.
Deepgram Nova-3
Deepgram is sterk in Realtime STT-scenario's. Nova-3 werkt met zowel voltooide audio als streaming, en de documenten van Deepgram rapporteren een WER van 6,84% voor streaming-transcriptie en 5,26% voor voltooide opnames op een set van 2.703 echte audiobestanden.
In Sobes is Deepgram handig als je tekst vrijwel onmiddellijk wilt zien in plaats van te wachten tot de zin voorbij is. Als Realtime STT is uitgeschakeld, bedraagt de gemiddelde transcriptielatentie ongeveer 900 ms; met Realtime STT ingeschakeld, is dit ongeveer 300 ms. Dat maakt Deepgram handig voor lange zinnen, live ondertiteling, gemengde spraak en Engelse interviews, vooral als de interviewer een regionaal accent heeft.
Een apart Deepgram-voordeel is ondersteuning voor Engelse varianten. U kunt niet alleen kiezen voor algemeen Engels, maar ook voor Amerikaans, Brits, Australisch, Indisch of Nieuw-Zeelands Engels. Dit helpt bij internationale interviews waarbij de interviewer een onbekend accent heeft en technische termen worden gemengd met snel conversatie Engels.
Voor Russisch ziet Deepgram er ook behoorlijk uit: de Soniox-vergelijking vermeldt 8,0% WER voor Russisch.
Soniox STT v5, Realtime STT uitgeschakeld
Soniox STT v5 werkt goed voor Russisch, gemengd taalgebruik en moeilijke technische termen, maar als Realtime STT uitgeschakeld is, is dit de langzaamste optie: de gemiddelde transcriptielatentie bedraagt ongeveer 2500 ms. Het is logisch als nauwkeurigheid bij Russische en gemengde spraak belangrijker is dan reactiesnelheid.
De kracht van Soniox is meertalige herkenning en taalwisseling. Het bestrijkt ook een groot aantal minder vaak voorkomende talen, waar modellen voor algemene doeleinden vaak meer degraderen dan op het Engels. Dit is ook van belang voor Russischtalige interviews, waarbij een enkele zin React, PostgreSQL, Kafka, thread pool, event loop en Russische woorduitgangen rond Engelse technische termen kan bevatten.
Soniox STT v5, Realtime STT ingeschakeld
Soniox STT v5 met Realtime STT ingeschakeld is de beste optie als u tegelijkertijd Russische spraak en minimale latentie nodig heeft. Gemiddeld arriveert het definitieve transcript ongeveer 200 ms na de zin. Deze optie past vooral goed in VAD en Start/Stop: tekst wordt live gestreamd, verwerkt Russisch-Engelse zinnen goed en vergrendelt de definitieve tekst snel na een pauze.
Korte versie: wat moet je kiezen?
Als je er niet te veel over wilt nadenken:
- Realtime STT werkt in VAD en Start/Stop. Gebruik in One-Shot de opties terwijl Realtime STT is uitgeschakeld.
- Groq Whisper Large v3 Turbo is de snelste optie met Realtime STT uitgeschakeld voor korte zinnen en typische interviews.
- OpenAI gpt-4o-mini-transcribe is een goede Realtime STT uitgeschakelde optie als u een zorgvuldigere transcriptie via OpenAI wilt.
- Deepgram Nova-3, Realtime STT uitgeschakeld geeft solide kwaliteit, maar met een gemiddelde latentie van ongeveer 900 ms.
- Deepgram Nova-3, Realtime STT ingeschakeld is een snelle streamingmodus, ongeveer 300 ms tot de laatste tekst na een zin.
- Soniox STT v5, Realtime STT uitgeschakeld is sterk voor Russische en gemengde spraak, maar heeft de hoogste latentie: ongeveer 2500 ms.
- Soniox STT v5, Realtime STT ingeschakeld is de snelste streamingoptie voor Russisch en taalwisseling: ongeveer 200 ms.
