La qualité des réponses de l’IA commence avant le modèle linguistique. Cela commence par la transcription du discours.
Si le système comprend mal la question, même un modèle solide répondra à un texte déformé.
Dans Sobes, vous pouvez choisir entre plusieurs modèles de reconnaissance vocale : Groq Whisper Grand v3 Turbo, OpenAI gpt-4o-mini-transcription, Deepgramme Nova-3, et Soniox STTv5. Ils diffèrent non seulement par la précision, mais également par la latence, le comportement d'enregistrement, la prise en charge linguistique et la manière dont ils gèrent les réunions bruyantes.
Que change le STT en temps réel ?
Dans l'interface Sobes, le paramètre important est simple : STT en temps réel désactivé ou STT en temps réel activé.
STT en temps réel désactivé
Sobes envoie un segment audio terminé pour reconnaissance et attend le texte final.
C'est ainsi que Groq Whisper Grand v3 Turbo, OpenAI gpt-4o-mini-transcription, et aussi Deepgramme Nova-3 et Soniox STTv5 fonctionne lorsque Realtime STT est désactivé.
Il s'agit d'un flux simple et stable pour des phrases courtes : le texte arrive sous forme de transcription terminée, sans corrections intermédiaires. Le compromis est que Sobes reçoit le texte uniquement après l'envoi du segment audio. Les phrases longues rendent le retard plus visible et il n'y a pas de flux de mots en direct pendant que la personne parle.
STT en temps réel activé
Sobes diffuse l'audio vers le modèle et reçoit un texte partiel avant la fin de la phrase.
C'est ainsi que Deepgramme Nova-3 et Soniox STTv5 fonctionne lorsque Realtime STT est activé.
Dans la transcription en streaming, le texte peut être au début une ébauche : le modèle peut réviser les mots pendant que la personne continue de parler. Finalisation est le moment où la phrase est terminée, le modèle arrête de modifier ce segment de texte et Sobes peut le transmettre en toute sécurité.
L’intérêt de Realtime STT est la vitesse de réaction. Vous pouvez voir que le système entend la parole en ce moment, que les réponses longues deviennent lisibles avant la fin de la phrase et que la réponse automatique peut démarrer plus tôt. Le compromis est que le texte partiel peut changer, la qualité dépend davantage de la stabilité de la connexion et vous devez parfois attendre que le modèle verrouille le texte final de la phrase.
Quels modes d'enregistrement prennent en charge le STT en temps réel ?
Détail important : Le STT en temps réel fonctionne en modes VAD et Start/Stop. Dans VAD, Sobes détecte automatiquement la parole, démarre l'enregistrement et ferme le segment après une pause. Dans Start/Stop, vous contrôlez le début et la fin manuellement, mais la transcription en streaming peut toujours s'exécuter pendant que l'enregistrement est actif.
Dans Un coup, Realtime STT n'est pas utilisé : Sobes prend les dernières secondes du tampon audio et envoie un segment terminé pour transcription.
Donc, si vous choisissez Deepgram ou Soniox mais utilisez One-Shot, utilisez les numéros de latence « Realtime STT désactivé » comme référence.
Latence de transcription
Il s'agit de la latence de la reconnaissance vocale : combien de temps Sobes attend le texte après un segment audio terminé ou après qu'un modèle de streaming ait verrouillé le texte final d'une phrase. Cela n’inclut pas le temps pendant lequel la personne parle, ni la génération de réponses par l’IA.
| Modèle | STT en temps réel désactivé | STT en temps réel activé | Ce que cela signifie |
|---|---|---|---|
| Groq Whisper Grand v3 Turbo | 500-600 ms | Non disponible | L’option sans streaming la plus rapide. Idéal pour les questions courtes. |
OpenAI gpt-4o-mini-transcribe |
600-900 ms | Non disponible | Légèrement plus lent que Groq, mais généralement plus prudent avec les discours difficiles. |
| Deepgramme Nova-3 | environ 900 ms | environ 300 ms | Avec Realtime STT activé, le texte final apparaît beaucoup plus rapidement. |
| Soniox STTv5 | environ 2500 ms | environ 200 ms | Le plus lent sans Realtime STT, mais le plus rapide pour verrouiller le texte final lorsque Realtime STT est activé. |
Le STT en temps réel n’est pas qu’une simple case à cocher. Pour Deepgram et Soniox, cela modifie la rapidité avec laquelle le produit apparaît : le texte commence à apparaître presque immédiatement et la transcription finale arrive plus rapidement que lorsque Sobes envoie un segment audio terminé après la phrase.
WER : qu'est-ce que c'est et à quoi ressemblent les chiffres
WER signifie Word Error Rate : la part des mots mal reconnus. Plus le WER est bas, mieux c'est. Par exemple, un WER de 6 % signifie qu’environ 6 mots sur 100 ont été mal reconnus : remplacés, ignorés ou ajoutés par erreur.
Important : WER est difficile à comparer sans contexte. Le même modèle peut afficher 4 % sur un son anglais clair et 15 % sur un appel bruyant avec des accents, des interruptions et un microphone de mauvaise qualité. Les chiffres ci-dessous sont donc des points de référence publics et non une garantie pour chaque entretien. La source est importante car les fournisseurs utilisent des ensembles de données et des méthodes d'évaluation différents.
Groq Whisper Grand v3 Turbo.
Groq fait état d'un WER général d'environ 12 %, mais ne publie pas de répartition distincte entre l'anglais et le russe. En tant que référence Whisper au niveau familial, le benchmark FLEURS montre 4,00% pour l'anglais et 5,13% pour le russe.
OpenAI gpt-4o-mini-transcribe.
Le benchmark FLEURS dans l'article Voxtral Realtime répertorie 3,65% pour l'anglais et 5,30% pour le russe. OpenAI dit également gpt-4o-transcribe et gpt-4o-mini-transcribe améliorent WER par rapport à Whisper v2/v3, mais sa documentation ne publie pas de ventilation simple pour ces deux langues.
Deepgramme Nova-3.
Pour l'anglais, Deepgram rapporte 5.26% pour l'audio fini et 6.84% pour le streaming. Pour le russe, les listes de comparaison publiques Soniox 8.0%. La force de Deepgram réside dans les variantes et les accents anglais : anglais américain, britannique, australien, indien et néo-zélandais.
Soniox STTv5.
Rapports Soniox environ 6,5% pour l'anglais et environ 6,2% pour le russe dans un benchmark de 60 langues. Il n'y a pas de répartition distincte entre l'anglais et le russe pour Realtime STT, mais Soniox affirme que le mode de streaming v4 améliore la précision.
Le principal à retenir : pour le russe, Soniox et Deepgram semblent plus forts que les anciennes approches de style Whisper sur des benchmarks du monde réel, tandis que gpt-4o-mini-transcribe semble bien sur FLEURS. Mais FLEURS, YouTube, les appels et les interviews en direct sont des environnements différents. Le choix du modèle doit prendre en compte à la fois le WER et la latence.
Modèles un par un
Groq Whisper Grand v3 Turbo
Groq Whisper Large v3 Turbo est l'option Sobes la plus rapide lorsque Realtime STT est désactivé. Il convient aux réponses courtes, aux entretiens rapides et aux situations où une latence minimale compte plus qu'une précision maximale sur des discours difficiles.
Sa principale force est la vitesse. Le guide ASR de Groq rapporte un WER général d'environ 12 % pour Whisper Large v3 Turbo et une accélération jusqu'à 247x par rapport à la durée audio. Cela en fait une bonne option pour les remarques courtes où le retard compte le plus.
Si le discours contient beaucoup de russe, des noms, des abréviations, des mots techniques anglais à l'intérieur du discours russe, du bruit ou un fort accent, Groq peut faire plus d'erreurs. Dans ce cas, OpenAI ou Soniox sont généralement la meilleure solution de repli, car la préservation de la formulation exacte compte plus que la vitesse brute.
OpenAI gpt-4o-mini-transcription
OpenAI gpt-4o-mini-transcribe transcrit un segment audio terminé. Il est plus lent que Groq Whisper Large v3 Turbo, mais gère généralement les nuances du discours, les termes techniques et les détails des questions avec plus de soin.
OpenAI dit gpt-4o-transcribe et gpt-4o-mini-transcribe améliorent le WER et la reconnaissance linguistique par rapport à Whisper. Dans le benchmark indépendant FLEURS, gpt-4o-mini-transcribe est coté à 3,65% WER pour l'anglais et 5,30% pour le russe.
OpenAI gpt-4o-mini-transcribe est une bonne option de meilleure qualité avec Realtime STT désactivé lorsque Groq Whisper Large v3 Turbo fait trop d'erreurs sur votre parole ou votre microphone.
Deepgramme Nova-3
Deepgram est fort dans les scénarios STT en temps réel. Nova-3 fonctionne à la fois avec l'audio terminé et le streaming, et les documents de Deepgram rapportent un WER de 6,84 % pour la transcription en streaming et de 5,26 % pour les enregistrements terminés sur un ensemble de 2 703 fichiers audio du monde réel.
Dans Sobes, Deepgram est utile lorsque vous souhaitez voir le texte presque immédiatement au lieu d'attendre la fin de la phrase. Avec Realtime STT désactivé, la latence moyenne de transcription est d’environ 900 ms ; avec Realtime STT activé, il est d'environ 300 ms. Cela rend Deepgram pratique pour les phrases longues, les sous-titres en direct, les discours mixtes et les interviews en anglais, en particulier lorsque l'intervieweur a un accent régional.
Un avantage distinct de Deepgram est la prise en charge des variantes anglaises. Vous pouvez choisir non seulement l'anglais générique, mais aussi Américain, Britannique, Australien, Indien, ou Nouvelle-Zélande Anglais. Cela est utile lors des entretiens internationaux où l'intervieweur a un accent inconnu et où les termes techniques sont mélangés à un anglais conversationnel rapide.
Pour le russe, Deepgram semble également correct : la comparaison Soniox indique 8,0 % WER pour le russe.
Soniox STT v5, STT en temps réel désactivé
Soniox STT v5 fonctionne bien pour le russe, les langues mixtes et les termes techniques difficiles, mais avec Realtime STT désactivé, c'est l'option la plus lente : la latence moyenne de transcription est d'environ 2 500 ms. Cela a du sens lorsque la précision des discours russes et mixtes compte plus que la vitesse de réponse.
La force de Soniox réside dans la reconnaissance multilingue et le changement de langue. Il couvre également un large éventail de langues moins courantes dans lesquelles les modèles à usage général se dégradent souvent plus que l'anglais. Cela est également important pour les entretiens en russe, où une seule phrase peut contenir React, PostgreSQL, Kafka, thread pool, event loop et des terminaisons de mots russes autour de termes techniques anglais.
Soniox STT v5, STT en temps réel activé
Soniox STT v5 avec Realtime STT activé est la meilleure option lorsque vous avez besoin à la fois de la parole russe et d'une latence minimale. En moyenne, la transcription finale arrive environ 200 ms après la phrase. Cette option s'adapte particulièrement bien à VAD et Start/Stop : le texte est diffusé en direct, gère bien les phrases russe-anglais et verrouille le texte final rapidement après une pause.
Version courte : que choisir ?
Si vous ne voulez pas trop y réfléchir :
- Le STT en temps réel fonctionne en VAD et Start/Stop. Dans One-Shot, utilisez les options avec Realtime STT désactivé.
- Groq Whisper Grand v3 Turbo est l'option la plus rapide avec Realtime STT désactivé pour les phrases courtes et les entretiens typiques.
- OpenAI gpt-4o-mini-transcription est une bonne option désactivée STT en temps réel lorsque vous souhaitez une transcription plus soignée via OpenAI.
- Deepgram Nova-3, STT en temps réel désactivé donne une qualité solide, mais avec une latence moyenne autour de 900 ms.
- Deepgram Nova-3, STT en temps réel activé est un mode de diffusion rapide, environ 300 ms jusqu'au texte final après une phrase.
- Soniox STT v5, STT en temps réel désactivé est puissant pour le russe et les langues mixtes, mais présente la latence la plus élevée : environ 2 500 ms.
- Soniox STT v5, STT en temps réel activé est l'option de streaming la plus rapide pour le russe et le changement de langue : environ 200 ms.
