Sobes.tech
Zurück zu den Artikeln

Wie wählt man ein Sprachtranskriptionsmodell aus?

Alexander10. Mai 2026 (vor 2 Monaten)
Wie wählt man ein Sprachtranskriptionsmodell aus?

Die Qualität von KI-Antworten beginnt vor dem Sprachmodell. Es beginnt mit der Sprachtranskription.
Wenn das System die Frage falsch versteht, antwortet selbst ein starkes Modell mit verzerrtem Text.

In Sobes können Sie zwischen mehreren Spracherkennungsmodellen wählen: Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transkribieren, Deepgram Nova-3, und Soniox STT v5. Sie unterscheiden sich nicht nur in der Genauigkeit, sondern auch in der Latenz, dem Aufnahmeverhalten, der Sprachunterstützung und dem Umgang mit lauten Besprechungen.

Was ändert sich durch Realtime STT?

In der Sobes-Schnittstelle ist die wichtige Einstellung einfach: Echtzeit-STT deaktiviert oder Echtzeit-STT aktiviert.

Echtzeit-STT deaktiviert

Sobes sendet ein fertiges Audiosegment zur Erkennung und wartet auf den endgültigen Text.
So geht's Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transkribieren, und auch Deepgram Nova-3 und Soniox STT v5 funktionieren, wenn Realtime STT deaktiviert ist.

Dies ist ein einfacher, stabiler Ablauf für kurze Phrasen: Der Text kommt als fertiges Transkript an, ohne Zwischenkorrekturen. Der Nachteil besteht darin, dass Sobes Text erst empfängt, nachdem das Audiosegment gesendet wurde. Lange Phrasen machen die Verzögerung deutlicher spürbar und es gibt keinen Live-Stream der Wörter, während die Person spricht.

Echtzeit-STT aktiviert

Sobes streamt Audio an das Modell und empfängt einen Teiltext, bevor die Phrase zu Ende ist.
So geht's Deepgram Nova-3 und Soniox STT v5 funktionieren, wenn Realtime STT aktiviert ist.

Bei der Streaming-Transkription kann der Text zunächst ein Entwurf sein: Das Modell kann Wörter überarbeiten, während die Person weiter spricht. Finalisierung ist der Moment, in dem die Phrase zu Ende ist, das Modell aufhört, dieses Textsegment zu ändern, und Sobes kann es sicher weitergeben.

Bei Realtime STT geht es um die Reaktionsgeschwindigkeit. Sie können sehen, dass das System gerade jetzt Sprache hört, lange Antworten lesbar werden, bevor die Phrase zu Ende ist, und die automatische Antwort früher beginnen kann. Der Nachteil besteht darin, dass sich Teiltexte ändern können, die Qualität mehr von der Verbindungsstabilität abhängt und man manchmal warten muss, bis das Modell den endgültigen Text für die Phrase festlegt.

Welche Aufnahmemodi unterstützen Realtime STT?

Wichtiges Detail: Echtzeit-STT funktioniert im VAD- und Start/Stopp-Modus. In VAD erkennt Sobes Sprache automatisch, startet die Aufnahme und schließt das Segment nach einer Pause. In Start/Stop steuern Sie Anfang und Ende manuell, die Streaming-Transkription kann jedoch weiterhin ausgeführt werden, während die Aufnahme aktiv ist.

In One-Shot, Echtzeit-STT wird nicht verwendet: Sobes entnimmt die letzten Sekunden aus dem Audiopuffer und sendet ein fertiges Segment zur Transkription.

Wenn Sie sich also für Deepgram oder Soniox entscheiden, aber One-Shot verwenden, verwenden Sie die Latenzzahlen „Realtime STT deaktiviert“ als Referenz.

Transkriptionslatenz

Dies ist die Spracherkennungslatenz: Wie lange Sobes auf Text wartet, nachdem ein Audiosegment abgeschlossen ist oder nachdem ein Streaming-Modell den endgültigen Text für eine Phrase gesperrt hat. Die Zeit, während der die Person spricht, wird nicht berücksichtigt, und die Generierung von KI-Antworten ist nicht enthalten.

Modell Echtzeit-STT deaktiviert Echtzeit-STT aktiviert Was es bedeutet
Groq Whisper Large v3 Turbo 500-600 ms Nicht verfügbar Die schnellste Nicht-Streaming-Option. Gut für kurze Fragen.
OpenAI gpt-4o-mini-transcribe 600-900 ms Nicht verfügbar Etwas langsamer als Groq, aber normalerweise vorsichtiger bei schwieriger Sprache.
Deepgram Nova-3 ca. 900 ms etwa 300 ms Wenn Realtime STT aktiviert ist, wird der endgültige Text viel schneller angezeigt.
Soniox STT v5 etwa 2500 ms etwa 200 ms Am langsamsten ohne Echtzeit-STT, aber am schnellsten beim Festlegen des endgültigen Textes, wenn Echtzeit-STT aktiviert ist.

Echtzeit-STT ist nicht nur ein Kontrollkästchen. Bei Deepgram und Soniox ändert sich dadurch die Geschwindigkeit, mit der sich das Produkt anfühlt: Der Text erscheint fast sofort und das endgültige Transkript kommt schneller an, als wenn Sobes nach der Phrase ein fertiges Audiosegment sendet.

WER: Was es ist und wie die Zahlen aussehen

WER bedeutet Word Error Rate: der Anteil falsch erkannter Wörter. Je niedriger der WER, desto besser. Beispielsweise bedeutet ein WER von 6 %, dass etwa 6 von 100 Wörtern falsch erkannt wurden: ersetzt, übersprungen oder versehentlich hinzugefügt.

Wichtig: WER ist ohne Kontext schwer zu vergleichen. Das gleiche Modell kann bei klarem Englischton 4 % und bei einem lauten Anruf mit Akzenten, Unterbrechungen und einem schlechten Mikrofon 15 % anzeigen. Die unten aufgeführten Zahlen sind daher öffentliche Anhaltspunkte und keine Garantie für jedes Interview. Die Quelle ist wichtig, da Anbieter unterschiedliche Datensätze und Auswertungsmethoden verwenden.

Groq Whisper Large v3 Turbo.
Groq meldet eine allgemeine WER von etwa 12 %, veröffentlicht jedoch keine separate Aufschlüsselung in Englisch/Russisch. Als Whisper-Referenz auf Familienebene zeigt der FLEURS-Benchmark 4,00 % für Englisch und 5,13 % für Russisch.

OpenAI gpt-4o-mini-transkribieren.
Der FLEURS-Benchmark in den Artikellisten von Voxtral Realtime 3,65 % für Englisch und 5,30 % für Russisch. OpenAI sagt auch, dass gpt-4o-transcribe und gpt-4o-mini-transcribe WER im Vergleich zu Whisper v2/v3 verbessern, aber seine Dokumente veröffentlichen keine einfache Aufschlüsselung für diese beiden Sprachen.

Deepgram Nova-3.
Für Englisch berichtet Deepgram 5.26% für fertige Audio- und 6.84% zum Streamen. Für Russisch gibt es die öffentlichen Soniox-Vergleichslisten 8.0%. Die Stärke von Deepgram sind englische Varianten und Akzente: amerikanisches, britisches, australisches, indisches und neuseeländisches Englisch.

Soniox STT v5.
Soniox berichtet etwa 6,5 % für Englisch und etwa 6,2 % für Russisch in einem 60-sprachigen Benchmark. Es gibt keine separate Aufschlüsselung in Englisch/Russisch für Realtime STT, aber Soniox sagt, dass der V4-Streaming-Modus die Genauigkeit verbessert.

Das Wichtigste zum Mitnehmen: Für Russisch sehen Soniox und Deepgram bei realen Benchmarks stärker aus als ältere Ansätze im Whisper-Stil, während gpt-4o-mini-transcribe bei FLEURS gut aussieht. Aber FLEURS, YouTube, Anrufe und Live-Interviews sind unterschiedliche Umgebungen. Bei der Modellauswahl sollten sowohl WER als auch Latenz berücksichtigt werden.

Modelle einzeln

Groq Whisper Large v3 Turbo

Groq Whisper Large v3 Turbo ist die schnellste Sobes Option, wenn Realtime STT deaktiviert ist. Es eignet sich für kurze Antworten, schnelle Interviews und Situationen, in denen minimale Latenz bei schwieriger Sprache wichtiger ist als maximale Genauigkeit.

Seine Hauptstärke ist die Geschwindigkeit. Der ASR-Leitfaden von Groq berichtet von einer allgemeinen WER von etwa 12 % für Whisper Large v3 Turbo und einer Beschleunigung von bis zu 247x im Verhältnis zur Audiodauer. Das macht es zu einer guten Option für kurze Bemerkungen, bei denen die Verzögerung am wichtigsten ist.

Wenn die Rede viel Russisch, Namen, Abkürzungen, englische Fachwörter innerhalb der russischen Sprache, Lärm oder einen starken Akzent enthält, kann Groq mehr Fehler machen. In diesem Fall ist OpenAI oder Soniox normalerweise der bessere Ausweg, da die Beibehaltung des genauen Wortlauts wichtiger ist als die bloße Geschwindigkeit.

OpenAI gpt-4o-mini-transkribieren

OpenAI gpt-4o-mini-transcribe transkribiert ein abgeschlossenes Audiosegment. Es ist langsamer als Groq Whisper Large v3 Turbo, geht aber normalerweise sorgfältiger mit Sprachnuancen, Fachbegriffen und Fragendetails um.

OpenAI sagt gpt-4o-transcribe und gpt-4o-mini-transcribe verbessern WER und Spracherkennung im Vergleich zu Whisper. Im unabhängigen FLEURS-Benchmark liegt gpt-4o-mini-transcribe bei 3,65 % WER für Englisch und 5,30 % für Russisch.

OpenAI gpt-4o-mini-transcribe ist eine gute Option mit höherer Qualität und deaktiviertem Echtzeit-STT, wenn Groq Whisper Large v3 Turbo zu viele Fehler bei Ihrer Sprache oder Ihrem Mikrofon macht.

Deepgram Nova-3

Deepgram ist in Echtzeit-STT-Szenarien stark. Nova-3 funktioniert sowohl mit abgeschlossenem Audio als auch mit Streaming, und die Dokumente von Deepgram berichten von einer WER von 6,84 % für Streaming-Transkription und 5,26 % für abgeschlossene Aufnahmen bei einem Satz von 2.703 realen Audiodateien.

In Sobes ist Deepgram nützlich, wenn Sie Text fast sofort sehen möchten, anstatt zu warten, bis die Phrase zu Ende ist. Wenn Realtime STT deaktiviert ist, beträgt die durchschnittliche Transkriptionslatenz etwa 900 ms; Bei aktiviertem Echtzeit-STT beträgt sie etwa 300 ms. Dadurch ist Deepgram praktisch für lange Phrasen, Live-Untertitel, gemischte Sprache und Interviews auf Englisch, insbesondere wenn der Interviewer einen regionalen Akzent hat.

Ein weiterer Vorteil von Deepgram ist die Unterstützung englischer Varianten. Sie können nicht nur allgemeines Englisch wählen, sondern auch Amerikaner, Britisch, Australisch, Indisch, oder Neuseeland Englisch. Dies hilft bei internationalen Interviews, bei denen der Interviewer einen ungewohnten Akzent hat und Fachbegriffe mit schnellem Konversationsenglisch vermischt werden.

Für Russisch sieht Deepgram ebenfalls gut aus: Der Soniox-Vergleich listet 8,0 % WER für Russisch auf.

Soniox STT v5, Echtzeit-STT deaktiviert

Soniox STT v5 funktioniert gut für Russisch, gemischtsprachige Sprache und schwierige Fachbegriffe, aber mit deaktiviertem Echtzeit-STT ist es die langsamste Option: Die durchschnittliche Transkriptionslatenz beträgt etwa 2500 ms. Dies ist sinnvoll, wenn Genauigkeit bei Russisch und gemischter Sprache wichtiger ist als die Reaktionsgeschwindigkeit.

Die Stärke von Soniox liegt in der Mehrsprachigkeitserkennung und Sprachumschaltung. Es deckt auch einen großen Pool weniger gebräuchlicher Sprachen ab, bei denen Allzweckmodelle oft stärker nachlassen als bei Englisch. Dies ist auch für russischsprachige Interviews wichtig, bei denen eine einzelne Phrase React, PostgreSQL, Kafka, thread pool, event loop und russische Wortendungen rund um englische Fachbegriffe enthalten kann.

Soniox STT v5, Echtzeit-STT aktiviert

Soniox STT v5 mit aktiviertem Realtime STT ist die beste Option, wenn Sie russische Sprache und gleichzeitig minimale Latenz benötigen. Im Durchschnitt kommt das endgültige Transkript etwa 200 ms nach der Phrase an. Diese Option passt besonders gut zu VAD und Start/Stopp: Der Text wird live übertragen, verarbeitet Russisch-Englisch-Phrasen gut und sperrt den endgültigen Text nach einer Pause schnell ein.

Kurzfassung: Was sollten Sie wählen?

Wenn Sie nicht zu viel darüber nachdenken möchten:

  • Echtzeit-STT funktioniert in VAD und Start/Stopp. Verwenden Sie in One-Shot die Optionen mit deaktiviertem Echtzeit-STT.
  • Groq Whisper Large v3 Turbo ist die schnellste Option mit deaktivierter Echtzeit-STT für kurze Sätze und typische Interviews.
  • OpenAI gpt-4o-mini-transkribieren ist eine gute Option mit deaktivierter Echtzeit-STT, wenn Sie eine sorgfältigere Transkription bis OpenAI wünschen.
  • Deepgram Nova-3, Echtzeit-STT deaktiviert liefert solide Qualität, allerdings mit einer durchschnittlichen Latenz von etwa 900 ms.
  • Deepgram Nova-3, Echtzeit-STT aktiviert ist ein schneller Streaming-Modus, etwa 300 ms bis zum endgültigen Text nach einer Phrase.
  • Soniox STT v5, Echtzeit-STT deaktiviert ist stark für russische und gemischtsprachige Sprache, hat aber die höchste Latenz: etwa 2500 ms.
  • Soniox STT v5, Echtzeit-STT aktiviert ist die schnellste Streaming-Option für Russisch und Sprachumschaltung: etwa 200 ms.