A qualidade das respostas da IA começa antes do modelo de linguagem. Começa com a transcrição da fala. Se o sistema interpretar mal a pergunta, mesmo um modelo forte responderá ao texto distorcido.
Em Sobes, pode escolher entre vários modelos de reconhecimento de voz: Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, Deepgram Nova-3 e Soniox STT v5. Diferem não só na precisão, mas também na latência, comportamento de gravação, suporte linguístico e como lidam com reuniões ruidosas.
O que muda o STT em tempo real?
Na interface Sobes, a definição importante é simples: STT em tempo real desativado ou STT em tempo real ativado.
STT em tempo real desativado
Sobes envia um segmento áudio terminado para reconhecimento e espera pelo texto final. É assim que funcionam Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, e também Deepgram Nova-3 e Soniox STT v5 quando o Realtime STT está desativado.
Este é um fluxo simples e estável para frases curtas: o texto chega como uma transcrição concluída, sem correções intermédias. A desvantagem é que Sobes só recebe texto depois de o segmento áudio ser enviado. Frases longas tornam o atraso mais notório, e não há transmissão em direto das palavras enquanto a pessoa fala.
STT em tempo real ativado
Sobes transmite áudio para o modelo e recebe texto parcial antes de a frase terminar. É assim que funcionam o Deepgram Nova-3 e o Soniox STT v5 quando o Realtime STT está ativado.
Na transcrição em streaming, o texto pode ser inicialmente um rascunho: o modelo pode rever palavras enquanto a pessoa continua a falar. Finalização é o momento em que a frase termina, o modelo deixa de alterar esse segmento de texto e o Sobes pode passá-lo em segurança para a frente.
O objetivo do STT em tempo real é a velocidade de reação. Pode ver que o sistema está a ouvir a fala neste momento, as respostas longas tornam-se legíveis antes da frase terminar, e a resposta automática pode começar mais cedo. A desvantagem é que o texto parcial pode mudar, a qualidade depende mais da estabilidade da ligação, e por vezes é preciso esperar que o modelo fixe o texto final para a frase.
Que modos de gravação suportam STT em tempo real?
Detalhe importante: STT em tempo real funciona nos modos VAD e Start / Stop. No VAD, Sobes deteta automaticamente a fala, começa a gravar e fecha o segmento após uma pausa. No Start / Stop, controlas manualmente o início e o fim, mas a transcrição em streaming ainda pode correr enquanto a gravação está ativa.
Em One-Shot, não é usado STT em tempo real: Sobes retira os últimos segundos do buffer de áudio e envia um segmento finalizado para transcrição.
Por isso, se escolheres Deepgram ou Soniox mas usares One-Shot, usa os números de latência "Realtime STT disabled" como referência.
Latência de transcrição
Isto é latência de reconhecimento de voz: quanto tempo Sobes espera por texto após um segmento de áudio terminado, ou depois de um modelo de streaming bloquear o texto final para uma frase. Não inclui o tempo em que a pessoa está a falar, nem a geração de respostas por IA.
| Modelo | STT em tempo real desativado | STT em tempo real ativado | O que significa |
|---|---|---|---|
| Groq Whisper Grande V3 Turbo | 500-600 ms | Não disponível | A opção mais rápida sem streaming. Bom para perguntas curtas. |
OpenAI gpt-4o-mini-transcribe |
600-900 ms | Não disponível | Um pouco mais lento que o Groq, mas normalmente mais cuidadoso com discursos difíceis. |
| Deepgram Nova-3 | cerca de 900 ms | cerca de 300 ms | Com o STT em tempo real ativado, o texto final aparece muito mais rápido. |
| Soniox STT v5 | cerca de 2500 ms | cerca de 200 ms | Mais lento sem Realtime STT, mas mais rápido a bloquear o texto final quando o Realtime STT está ativado. |
O STT em tempo real não é apenas uma caixa de seleção. Para Deepgram e Soniox, isso altera a rapidez com que o produto se sente: o texto começa a aparecer quase imediatamente, e a transcrição final chega mais depressa do que quando Sobes envia um segmento de áudio completo após a frase.
WER: o que é e como são os números
WER significa Taxa de Erro de Palavra: a percentagem de palavras reconhecidas incorretamente. Quanto menor o WER, melhor. Por exemplo, um WER de 6% significa que cerca de 6 em cada 100 palavras foram reconhecidas incorretamente: substituídas, saltadas ou adicionadas por engano.
Importante: O WER é difícil de comparar sem contexto. O mesmo modelo pode mostrar 4% no áudio limpo em inglês e 15% numa chamada ruidosa com sotaques, interrupções e um microfone fraco. Portanto, os números abaixo são pontos de referência públicos, não uma garantia para todas as entrevistas. A fonte importa porque os fornecedores utilizam conjuntos de dados e métodos de avaliação diferentes.
Groq Whisper Grande V3 Turbo. O Groq reporta um WER geral de cerca de 12%, mas não publica uma divisão separada em inglês/russo. Como referência familiar do Whisper, o benchmark FLEURS mostra 4,00% para inglês e 5,13% para russo.
OpenAI gpt-4o-mini-transcribe.
O benchmark FLEURS no artigo da Voxtral Realtime lista 3,65% para inglês e 5,30% para russo. A OpenAI também afirma que gpt-4o-transcribe e gpt-4o-mini-transcribe melhoram o WER em comparação com o Whisper v2/v3, mas a sua documentação não publica uma explicação simples para estas duas línguas.
Deepgram Nova-3. Para inglês, a Deepgram reporta 5,26% para áudio finalizado e 6,84% para streaming. Para o russo, a comparação pública Soniox indica 8,0%. A força de Deepgram são as variantes e sotaques ingleses: americano, britânico, australiano, indiano e neozelandês.
Soniox STT v5. A Soniox reporta cerca de 6,5% para inglês e cerca de 6,2% para russo num benchmark de 60 línguas. Não existe uma divisão separada em inglês/russo para o STT em tempo real, mas a Soniox diz que o modo de streaming v4 melhora a precisão.
A principal conclusão: para o russo, Soniox e Deepgram parecem mais fortes do que abordagens antigas ao estilo Whisper em benchmarks do mundo real, enquanto gpt-4o-mini-transcribe tem bom aspeto no FLEURS. Mas FLEURS, YouTube, chamadas e entrevistas ao vivo são ambientes diferentes. A escolha do modelo deve considerar tanto o WER como a latência.
Modelos um a um
Groq Whisper Grande V3 Turbo
O Groq Whisper Large v3 Turbo é a opção Sobes mais rápida quando o Realtime STT está desativado. Serve respostas curtas, entrevistas rápidas e situações em que a latência mínima importa mais do que a precisão máxima em discursos difíceis.
A sua principal força é a velocidade. O guia ASR da Groq reporta um WER geral de cerca de 12% para o Whisper Large v3 Turbo e uma aceleração até 247x em relação à duração do áudio. Isso torna-o uma boa opção para comentários curtos onde o atraso mais importa.
Se a fala contiver muito russo, nomes, abreviaturas, palavras técnicas inglesas dentro do russo, ruído ou um sotaque forte, Groq pode cometer mais erros. Nesse caso, OpenAI ou Soniox são geralmente o melhor plano B, porque preservar a redação exata importa mais do que a velocidade bruta.
OpenAI gpt-4o-mini-transcribe
A OpenAI gpt-4o-mini-transcribe transcreve um segmento de áudio completo. É mais lento do que o Groq Whisper Large v3 Turbo, mas normalmente lida com mais cuidado com nuances de fala, termos técnicos e detalhes das perguntas.
A OpenAI afirma gpt-4o-transcribe e gpt-4o-mini-transcribe melhorar o WER e o reconhecimento de línguas em comparação com o Whisper. No benchmark independente FLEURS, gpt-4o-mini-transcribe está listado com 3,65% WER para inglês e 5,30% para russo.
O OpenAI gpt-4o-mini-transcribe é uma boa opção de maior qualidade com o Realtime STT desativado quando o Groq Whisper Large v3 Turbo comete demasiados erros na fala ou no microfone.
Deepgram Nova-3
O Deepgram é forte em cenários STT em tempo real. O Nova-3 trabalha tanto com áudio como com streaming completos, e a documentação da Deepgram reporta um WER de 6,84% para transcrição em streaming e 5,26% para gravações completas num conjunto de 2.703 ficheiros de áudio do mundo real.
Em Sobes, o Deepgram é útil quando se quer ver o texto quase imediatamente, em vez de esperar que a frase termine. Com o STT em tempo real desativado, a latência média de transcrição ronda os 900 ms; com o STT em tempo real ativado, são cerca de 300 ms. Isso torna o Deepgram conveniente para frases longas, legendas ao vivo, fala mista e entrevistas em inglês, especialmente quando o entrevistador tem sotaque regional.
Uma vantagem separada do Deepgram é o suporte para variantes em inglês. Pode escolher não só inglês genérico, mas também americano, britânico, australiano, indiano ou Nova Zelândia. Isto ajuda em entrevistas internacionais, onde o entrevistador tem um sotaque desconhecido e os termos técnicos são misturados com inglês conversacional rápido.
Para o russo, o Deepgram também parece razoável: a comparação com a Soniox indica 8,0% de WER para o russo.
Soniox STT v5, Realtime STT desativado
O Soniox STT v5 funciona bem para russo, fala mista e termos técnicos difíceis, mas com o Realtime STT desativado é a opção mais lenta: a latência média de transcrição ronda os 2500 ms. Faz sentido quando a precisão em russo e na fala mista importa mais do que a velocidade de resposta.
A força da Soniox é o reconhecimento multilíngue e a troca de línguas. Abrange também um grande conjunto de línguas menos comuns, onde os modelos de uso geral frequentemente se degradam mais do que no inglês. Isto também é relevante para entrevistas de língua russa, onde uma única frase pode conter terminações de React, PostgreSQL, Kafka, thread pool, event loop e terminações de palavras russas em torno de termos técnicos em inglês.
Soniox STT v5, STT em tempo real ativado
O Soniox STT v5 com Realtime STT ativado é a melhor opção quando precisas de fala em russo e latência mínima ao mesmo tempo. Em média, a transcrição final chega cerca de 200 ms depois da frase. Esta opção encaixa especialmente bem em VAD e Start/Stop: o texto transmite em direto, lida bem com frases russo-inglês e bloqueia o texto final rapidamente após uma pausa.
Versão curta: o que deves escolher?
Se não quiser pensar demasiado:
- STT em tempo real funciona em VAD e Start / Stop. No One-Shot, usa as opções com o Realtime STT desativado.
- Groq Whisper Large v3 Turbo é a opção mais rápida, com o Realtime STT desativado para frases curtas e entrevistas típicas.
- O OpenAI gpt-4o-mini-transcribe é uma boa opção desativada para STT em tempo real quando se quer uma transcrição mais cuidadosa através do OpenAI.
- Deepgram Nova-3, STT em tempo real desativado oferece qualidade sólida, mas com uma latência média de cerca de 900 ms.
- Deepgram Nova-3, Realtime STT ativado é um modo de streaming rápido, cerca de 300 ms até ao texto final após uma frase.
- Soniox STT v5, Realtime STT desativado é forte para russo e fala mista, mas tem a maior latência: cerca de 2500 ms.
- Soniox STT v5, Realtime STT ativado é a opção de streaming mais rápida para russo e mudança de idioma: cerca de 200 ms.
