Sobes.tech
Voltar aos artigos

Como escolher um modelo de transcrição de voz?

Alexander10 de maio de 2026 (2 мес. назад)
Como escolher um modelo de transcrição de voz?

A qualidade das respostas da IA começa antes do modelo de linguagem. Começa com a transcrição da fala. Se o sistema interpretar mal a pergunta, mesmo um modelo forte responderá ao texto distorcido.

Em Sobes, pode escolher entre vários modelos de reconhecimento de voz: Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, Deepgram Nova-3 e Soniox STT v5. Diferem não só na precisão, mas também na latência, comportamento de gravação, suporte linguístico e como lidam com reuniões ruidosas.

O que muda o STT em tempo real?

Na interface Sobes, a definição importante é simples: STT em tempo real desativado ou STT em tempo real ativado.

STT em tempo real desativado

Sobes envia um segmento áudio terminado para reconhecimento e espera pelo texto final. É assim que funcionam Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, e também Deepgram Nova-3 e Soniox STT v5 quando o Realtime STT está desativado.

Este é um fluxo simples e estável para frases curtas: o texto chega como uma transcrição concluída, sem correções intermédias. A desvantagem é que Sobes só recebe texto depois de o segmento áudio ser enviado. Frases longas tornam o atraso mais notório, e não há transmissão em direto das palavras enquanto a pessoa fala.

STT em tempo real ativado

Sobes transmite áudio para o modelo e recebe texto parcial antes de a frase terminar. É assim que funcionam o Deepgram Nova-3 e o Soniox STT v5 quando o Realtime STT está ativado.

Na transcrição em streaming, o texto pode ser inicialmente um rascunho: o modelo pode rever palavras enquanto a pessoa continua a falar. Finalização é o momento em que a frase termina, o modelo deixa de alterar esse segmento de texto e o Sobes pode passá-lo em segurança para a frente.

O objetivo do STT em tempo real é a velocidade de reação. Pode ver que o sistema está a ouvir a fala neste momento, as respostas longas tornam-se legíveis antes da frase terminar, e a resposta automática pode começar mais cedo. A desvantagem é que o texto parcial pode mudar, a qualidade depende mais da estabilidade da ligação, e por vezes é preciso esperar que o modelo fixe o texto final para a frase.

Que modos de gravação suportam STT em tempo real?

Detalhe importante: STT em tempo real funciona nos modos VAD e Start / Stop. No VAD, Sobes deteta automaticamente a fala, começa a gravar e fecha o segmento após uma pausa. No Start / Stop, controlas manualmente o início e o fim, mas a transcrição em streaming ainda pode correr enquanto a gravação está ativa.

Em One-Shot, não é usado STT em tempo real: Sobes retira os últimos segundos do buffer de áudio e envia um segmento finalizado para transcrição.

Por isso, se escolheres Deepgram ou Soniox mas usares One-Shot, usa os números de latência "Realtime STT disabled" como referência.

Latência de transcrição

Isto é latência de reconhecimento de voz: quanto tempo Sobes espera por texto após um segmento de áudio terminado, ou depois de um modelo de streaming bloquear o texto final para uma frase. Não inclui o tempo em que a pessoa está a falar, nem a geração de respostas por IA.

Modelo STT em tempo real desativado STT em tempo real ativado O que significa
Groq Whisper Grande V3 Turbo 500-600 ms Não disponível A opção mais rápida sem streaming. Bom para perguntas curtas.
OpenAI gpt-4o-mini-transcribe 600-900 ms Não disponível Um pouco mais lento que o Groq, mas normalmente mais cuidadoso com discursos difíceis.
Deepgram Nova-3 cerca de 900 ms cerca de 300 ms Com o STT em tempo real ativado, o texto final aparece muito mais rápido.
Soniox STT v5 cerca de 2500 ms cerca de 200 ms Mais lento sem Realtime STT, mas mais rápido a bloquear o texto final quando o Realtime STT está ativado.

O STT em tempo real não é apenas uma caixa de seleção. Para Deepgram e Soniox, isso altera a rapidez com que o produto se sente: o texto começa a aparecer quase imediatamente, e a transcrição final chega mais depressa do que quando Sobes envia um segmento de áudio completo após a frase.

WER: o que é e como são os números

WER significa Taxa de Erro de Palavra: a percentagem de palavras reconhecidas incorretamente. Quanto menor o WER, melhor. Por exemplo, um WER de 6% significa que cerca de 6 em cada 100 palavras foram reconhecidas incorretamente: substituídas, saltadas ou adicionadas por engano.

Importante: O WER é difícil de comparar sem contexto. O mesmo modelo pode mostrar 4% no áudio limpo em inglês e 15% numa chamada ruidosa com sotaques, interrupções e um microfone fraco. Portanto, os números abaixo são pontos de referência públicos, não uma garantia para todas as entrevistas. A fonte importa porque os fornecedores utilizam conjuntos de dados e métodos de avaliação diferentes.

Groq Whisper Grande V3 Turbo. O Groq reporta um WER geral de cerca de 12%, mas não publica uma divisão separada em inglês/russo. Como referência familiar do Whisper, o benchmark FLEURS mostra 4,00% para inglês e 5,13% para russo.

OpenAI gpt-4o-mini-transcribe. O benchmark FLEURS no artigo da Voxtral Realtime lista 3,65% para inglês e 5,30% para russo. A OpenAI também afirma que gpt-4o-transcribe e gpt-4o-mini-transcribe melhoram o WER em comparação com o Whisper v2/v3, mas a sua documentação não publica uma explicação simples para estas duas línguas.

Deepgram Nova-3. Para inglês, a Deepgram reporta 5,26% para áudio finalizado e 6,84% para streaming. Para o russo, a comparação pública Soniox indica 8,0%. A força de Deepgram são as variantes e sotaques ingleses: americano, britânico, australiano, indiano e neozelandês.

Soniox STT v5. A Soniox reporta cerca de 6,5% para inglês e cerca de 6,2% para russo num benchmark de 60 línguas. Não existe uma divisão separada em inglês/russo para o STT em tempo real, mas a Soniox diz que o modo de streaming v4 melhora a precisão.

A principal conclusão: para o russo, Soniox e Deepgram parecem mais fortes do que abordagens antigas ao estilo Whisper em benchmarks do mundo real, enquanto gpt-4o-mini-transcribe tem bom aspeto no FLEURS. Mas FLEURS, YouTube, chamadas e entrevistas ao vivo são ambientes diferentes. A escolha do modelo deve considerar tanto o WER como a latência.

Modelos um a um

Groq Whisper Grande V3 Turbo

O Groq Whisper Large v3 Turbo é a opção Sobes mais rápida quando o Realtime STT está desativado. Serve respostas curtas, entrevistas rápidas e situações em que a latência mínima importa mais do que a precisão máxima em discursos difíceis.

A sua principal força é a velocidade. O guia ASR da Groq reporta um WER geral de cerca de 12% para o Whisper Large v3 Turbo e uma aceleração até 247x em relação à duração do áudio. Isso torna-o uma boa opção para comentários curtos onde o atraso mais importa.

Se a fala contiver muito russo, nomes, abreviaturas, palavras técnicas inglesas dentro do russo, ruído ou um sotaque forte, Groq pode cometer mais erros. Nesse caso, OpenAI ou Soniox são geralmente o melhor plano B, porque preservar a redação exata importa mais do que a velocidade bruta.

OpenAI gpt-4o-mini-transcribe

A OpenAI gpt-4o-mini-transcribe transcreve um segmento de áudio completo. É mais lento do que o Groq Whisper Large v3 Turbo, mas normalmente lida com mais cuidado com nuances de fala, termos técnicos e detalhes das perguntas.

A OpenAI afirma gpt-4o-transcribe e gpt-4o-mini-transcribe melhorar o WER e o reconhecimento de línguas em comparação com o Whisper. No benchmark independente FLEURS, gpt-4o-mini-transcribe está listado com 3,65% WER para inglês e 5,30% para russo.

O OpenAI gpt-4o-mini-transcribe é uma boa opção de maior qualidade com o Realtime STT desativado quando o Groq Whisper Large v3 Turbo comete demasiados erros na fala ou no microfone.

Deepgram Nova-3

O Deepgram é forte em cenários STT em tempo real. O Nova-3 trabalha tanto com áudio como com streaming completos, e a documentação da Deepgram reporta um WER de 6,84% para transcrição em streaming e 5,26% para gravações completas num conjunto de 2.703 ficheiros de áudio do mundo real.

Em Sobes, o Deepgram é útil quando se quer ver o texto quase imediatamente, em vez de esperar que a frase termine. Com o STT em tempo real desativado, a latência média de transcrição ronda os 900 ms; com o STT em tempo real ativado, são cerca de 300 ms. Isso torna o Deepgram conveniente para frases longas, legendas ao vivo, fala mista e entrevistas em inglês, especialmente quando o entrevistador tem sotaque regional.

Uma vantagem separada do Deepgram é o suporte para variantes em inglês. Pode escolher não só inglês genérico, mas também americano, britânico, australiano, indiano ou Nova Zelândia. Isto ajuda em entrevistas internacionais, onde o entrevistador tem um sotaque desconhecido e os termos técnicos são misturados com inglês conversacional rápido.

Para o russo, o Deepgram também parece razoável: a comparação com a Soniox indica 8,0% de WER para o russo.

Soniox STT v5, Realtime STT desativado

O Soniox STT v5 funciona bem para russo, fala mista e termos técnicos difíceis, mas com o Realtime STT desativado é a opção mais lenta: a latência média de transcrição ronda os 2500 ms. Faz sentido quando a precisão em russo e na fala mista importa mais do que a velocidade de resposta.

A força da Soniox é o reconhecimento multilíngue e a troca de línguas. Abrange também um grande conjunto de línguas menos comuns, onde os modelos de uso geral frequentemente se degradam mais do que no inglês. Isto também é relevante para entrevistas de língua russa, onde uma única frase pode conter terminações de React, PostgreSQL, Kafka, thread pool, event loop e terminações de palavras russas em torno de termos técnicos em inglês.

Soniox STT v5, STT em tempo real ativado

O Soniox STT v5 com Realtime STT ativado é a melhor opção quando precisas de fala em russo e latência mínima ao mesmo tempo. Em média, a transcrição final chega cerca de 200 ms depois da frase. Esta opção encaixa especialmente bem em VAD e Start/Stop: o texto transmite em direto, lida bem com frases russo-inglês e bloqueia o texto final rapidamente após uma pausa.

Versão curta: o que deves escolher?

Se não quiser pensar demasiado:

  • STT em tempo real funciona em VAD e Start / Stop. No One-Shot, usa as opções com o Realtime STT desativado.
  • Groq Whisper Large v3 Turbo é a opção mais rápida, com o Realtime STT desativado para frases curtas e entrevistas típicas.
  • O OpenAI gpt-4o-mini-transcribe é uma boa opção desativada para STT em tempo real quando se quer uma transcrição mais cuidadosa através do OpenAI.
  • Deepgram Nova-3, STT em tempo real desativado oferece qualidade sólida, mas com uma latência média de cerca de 900 ms.
  • Deepgram Nova-3, Realtime STT ativado é um modo de streaming rápido, cerca de 300 ms até ao texto final após uma frase.
  • Soniox STT v5, Realtime STT desativado é forte para russo e fala mista, mas tem a maior latência: cerca de 2500 ms.
  • Soniox STT v5, Realtime STT ativado é a opção de streaming mais rápida para russo e mudança de idioma: cerca de 200 ms.