La calidad de las respuestas de la IA comienza antes del modelo de lenguaje. Comienza con la transcripción del habla.
Si el sistema no entiende la pregunta, incluso un modelo sólido responderá con un texto distorsionado.
En Sobes, puedes elegir entre varios modelos de reconocimiento de voz: Groq Whisper Grande v3 Turbo, OpenAI gpt-4o-mini-transcribir, Deepgrama Nova-3, y Soniox STT v5. Se diferencian no sólo en la precisión, sino también en la latencia, el comportamiento de grabación, el soporte lingüístico y la forma en que manejan reuniones ruidosas.
¿Qué cambia STT en tiempo real?
En la interfaz Sobes, la configuración importante es simple: STT en tiempo real deshabilitado o STT en tiempo real habilitado.
STT en tiempo real deshabilitado
Sobes envía un segmento de audio terminado para su reconocimiento y espera el texto final.
Así es como Groq Whisper Grande v3 Turbo, OpenAI gpt-4o-mini-transcribir, y también Deepgrama Nova-3 y Soniox STT v5 funcionan cuando Realtime STT está desactivado.
Se trata de un flujo sencillo y estable para frases cortas: el texto llega como una transcripción terminada, sin correcciones intermedias. La desventaja es que Sobes recibe texto solo después de enviar el segmento de audio. Las frases largas hacen que el retraso sea más notorio y no hay una transmisión en vivo de palabras mientras la persona habla.
STT en tiempo real habilitado
Sobes transmite audio al modelo y recibe texto parcial antes de que termine la frase.
Así es como Deepgrama Nova-3 y Soniox STT v5 funcionan cuando Realtime STT está habilitado.
En la transcripción en streaming, el texto puede ser un borrador al principio: el modelo puede revisar las palabras mientras la persona sigue hablando. Finalización Es el momento en que termina la frase, el modelo deja de cambiar ese segmento de texto y Sobes puede pasarlo hacia adelante con seguridad.
El objetivo de Realtime STT es la velocidad de reacción. Puede ver que el sistema está escuchando el habla en este momento, las respuestas largas se pueden leer antes de que termine la frase y la respuesta automática puede comenzar antes. La desventaja es que el texto parcial puede cambiar, la calidad depende más de la estabilidad de la conexión y, a veces, es necesario esperar hasta que el modelo bloquee el texto final de la frase.
¿Qué modos de grabación admiten STT en tiempo real?
Detalle importante: STT en tiempo real funciona en modos VAD y Start/Stop. En VAD, Sobes detecta el habla automáticamente, comienza a grabar y cierra el segmento después de una pausa. En Iniciar/Detener, usted controla el comienzo y el final manualmente, pero la transcripción de transmisión aún puede ejecutarse mientras la grabación está activa.
en Un trago, No se utiliza STT en tiempo real: Sobes toma los últimos segundos del búfer de audio y envía un segmento terminado para su transcripción.
Entonces, si elige Deepgram o Soniox pero usa One-Shot, use los números de latencia "Realtime STT deshabilitado" como referencia.
Latencia de transcripción
Esta es la latencia del reconocimiento de voz: cuánto tiempo Sobes espera el texto después de un segmento de audio terminado, o después de que un modelo de transmisión bloquea el texto final de una frase. No incluye el tiempo que la persona está hablando y no incluye la generación de respuestas de IA.
| modelo | STT en tiempo real deshabilitado | STT en tiempo real habilitado | lo que significa |
|---|---|---|---|
| Groq Whisper Grande v3 Turbo | 500-600 ms | No disponible | La opción sin transmisión más rápida. Bueno para preguntas cortas. |
OpenAI gpt-4o-mini-transcribe |
600-900 ms | No disponible | Un poco más lento que Groq, pero normalmente más cuidadoso con el habla difícil. |
| Deepgrama Nova-3 | unos 900 ms | unos 300 ms | Con Realtime STT habilitado, el texto final aparece mucho más rápido. |
| Soniox STT v5 | unos 2500 ms | unos 200 ms | Más lento sin Realtime STT, pero más rápido a la hora de bloquear el texto final cuando Realtime STT está habilitado. |
STT en tiempo real no es sólo una casilla de verificación. Para Deepgram y Soniox, cambia la rapidez con la que se siente el producto: el texto comienza a aparecer casi de inmediato y la transcripción final llega más rápido que cuando Sobes envía un segmento de audio completo después de la frase.
WER: qué es y cómo son los números
WER significa Tasa de error de palabras: la proporción de palabras reconocidas incorrectamente. Cuanto menor sea el WER, mejor. Por ejemplo, un WER del 6 % significa que aproximadamente 6 de cada 100 palabras se reconocieron incorrectamente: reemplazadas, omitidas o agregadas por error.
Importante: el WER es difícil de comparar sin contexto. El mismo modelo puede mostrar un 4% en audio en inglés limpio y un 15% en una llamada ruidosa con acentos, interrupciones y un micrófono deficiente. Entonces, los números a continuación son puntos de referencia públicos, no una garantía para cada entrevista. La fuente es importante porque los proveedores utilizan diferentes conjuntos de datos y métodos de evaluación.
Groq Whisper Grande v3 Turbo.
Groq informa un WER general de alrededor del 12%, pero no publica un desglose separado en inglés y ruso. Como referencia de Whisper a nivel familiar, el punto de referencia FLEURS muestra 4,00% para inglés y 5,13% para los rusos.
OpenAI gpt-4o-mini-transcribir.
El punto de referencia FLEURS en las listas de artículos de Voxtral Realtime 3,65% para inglés y 5,30% para ruso. OpenAI también dice que gpt-4o-transcribe y gpt-4o-mini-transcribe mejoran WER en comparación con Whisper v2/v3, pero sus documentos no publican un desglose simple para estos dos idiomas.
Deepgrama Nova-3.
Para inglés, informa Deepgram 5.26% para audio terminado y 6.84% para transmisión. Para ruso, las listas comparativas públicas de Soniox 8.0%. El punto fuerte de Deepgram son las variantes y acentos del inglés: inglés americano, británico, australiano, indio y neozelandés.
Soniox STT v5.
informes soniox alrededor del 6,5% para inglés y alrededor del 6,2% para los rusos en un punto de referencia de 60 idiomas. No hay un desglose separado entre inglés y ruso para Realtime STT, pero Soniox dice que el modo de transmisión v4 mejora la precisión.
La conclusión principal: Para Russian, Soniox y Deepgram parecen más fuertes que los enfoques anteriores de estilo Whisper en puntos de referencia del mundo real, mientras que gpt-4o-mini-transcribe se ve bien en FLEURS.. Pero FLEURS, YouTube, las llamadas y las entrevistas en vivo son entornos diferentes. La elección del modelo debe considerar tanto el WER como la latencia.
Modelos uno por uno
Groq Whisper Grande v3 Turbo
Groq Whisper Large v3 Turbo es la opción Sobes más rápida cuando Realtime STT está desactivado. Se adapta a respuestas breves, entrevistas rápidas y situaciones en las que la latencia mínima importa más que la máxima precisión en discursos difíciles.
Su principal punto fuerte es la velocidad. La guía ASR de Groq informa un WER general de alrededor del 12 % para Whisper Large v3 Turbo y una aceleración de hasta 247 veces en relación con la duración del audio. Eso lo convierte en una buena opción para comentarios breves donde la demora es más importante.
Si el discurso contiene mucho ruso, nombres, abreviaturas, palabras técnicas en inglés dentro del habla rusa, ruido o un acento fuerte, Groq puede cometer más errores. En ese caso, OpenAI o Soniox suele ser la mejor alternativa, porque preservar la redacción exacta es más importante que la velocidad bruta.
OpenAI gpt-4o-mini-transcribir
OpenAI gpt-4o-mini-transcribe transcribe un segmento de audio completo. Es más lento que Groq Whisper Large v3 Turbo, pero normalmente maneja los matices del habla, los términos técnicos y los detalles de las preguntas con más cuidado.
OpenAI dice gpt-4o-transcribe y gpt-4o-mini-transcribe mejoran el WER y el reconocimiento del lenguaje en comparación con Whisper. En el índice de referencia independiente FLEURS, gpt-4o-mini-transcribe cotiza al 3,65% WER para inglés y al 5,30% para ruso.
OpenAI gpt-4o-mini-transcribe es una buena opción de mayor calidad con Realtime STT desactivado cuando Groq Whisper Large v3 Turbo comete demasiados errores en su discurso o micrófono.
Deepgrama Nova-3
Deepgram es fuerte en escenarios STT en tiempo real. Nova-3 funciona tanto con audio completo como con streaming, y los documentos de Deepgram informan un WER del 6,84% para la transcripción en streaming y del 5,26% para grabaciones completas en un conjunto de 2.703 archivos de audio del mundo real.
En Sobes, Deepgram es útil cuando quieres ver el texto casi inmediatamente en lugar de esperar hasta que termine la frase. Con Realtime STT desactivado, la latencia de transcripción promedio es de alrededor de 900 ms; con STT en tiempo real habilitado, es de alrededor de 300 ms. Eso hace que Deepgram sea conveniente para frases largas, subtítulos en vivo, discursos mixtos y entrevistas en inglés, especialmente cuando el entrevistador tiene acento regional.
Una ventaja separada de Deepgram es la compatibilidad con variantes en inglés. Puedes elegir no sólo inglés genérico, sino también americano, británico, australiano, indio, o Nueva Zelanda Inglés. Esto ayuda en entrevistas internacionales donde el entrevistador tiene un acento desconocido y los términos técnicos se mezclan con un inglés conversacional rápido.
Para el ruso, Deepgram también parece decente: la comparación de Soniox muestra un WER del 8,0% para el ruso.
Soniox STT v5, STT en tiempo real deshabilitado
Soniox STT v5 funciona bien para ruso, habla en varios idiomas y términos técnicos difíciles, pero con Realtime STT desactivado es la opción más lenta: la latencia de transcripción promedio es de alrededor de 2500 ms. Tiene sentido cuando la precisión en el habla rusa y mixta importa más que la velocidad de respuesta.
La fortaleza de Soniox es el reconocimiento multilingüe y el cambio de idioma. También cubre un gran conjunto de idiomas menos comunes donde los modelos de propósito general a menudo se degradan más que en inglés. Esto también es importante para las entrevistas en ruso, donde una sola frase puede contener React, PostgreSQL, Kafka, thread pool, event loop y terminaciones de palabras en ruso en términos técnicos en inglés.
Soniox STT v5, STT en tiempo real habilitado
Soniox STT v5 con Realtime STT habilitado es la mejor opción cuando necesitas voz en ruso y una latencia mínima al mismo tiempo. En promedio, la transcripción final llega unos 200 ms después de la frase. Esta opción encaja especialmente bien en VAD y Start/Stop: el texto se transmite en vivo, maneja bien las frases ruso-inglés y bloquea el texto final rápidamente después de una pausa.
Versión corta: ¿qué deberías elegir?
Si no quieres pensar demasiado:
- STT en tiempo real funciona en VAD y Start/Stop. En One-Shot, utilice las opciones con Realtime STT desactivado.
- Groq Whisper Grande v3 Turbo es la opción más rápida con Realtime STT desactivado para frases cortas y entrevistas típicas.
- OpenAI gpt-4o-mini-transcribir es una buena opción STT en tiempo real desactivada cuando desea una transcripción más cuidadosa a través de OpenAI.
- Deepgram Nova-3, STT en tiempo real deshabilitado Ofrece una calidad sólida, pero con una latencia promedio de alrededor de 900 ms.
- Deepgram Nova-3, STT en tiempo real habilitado Es un modo de transmisión rápida, alrededor de 300 ms hasta el texto final después de una frase.
- Soniox STT v5, STT en tiempo real deshabilitado es fuerte para el habla rusa y de idiomas mixtos, pero tiene la latencia más alta: alrededor de 2500 ms.
- Soniox STT v5, STT en tiempo real habilitado es la opción de transmisión más rápida para cambiar de idioma y ruso: alrededor de 200 ms.
