Sobes.tech
Torna agli articoli

Come scegliere un modello di trascrizione vocale?

Alexander10 maggio 2026 (2 mesi fa)
Come scegliere un modello di trascrizione vocale?

La qualità delle risposte dell’IA inizia prima del modello linguistico. Si inizia con la trascrizione del discorso.
Se il sistema fraintende la domanda, anche un modello forte risponderà a un testo distorto.

In Sobes puoi scegliere tra diversi modelli di riconoscimento vocale: Groq Whisper Grande v3 Turbo, OpenAI gpt-4o-mini-trascrizione, Deepgram Nova-3, e Soniox STT v5. Differiscono non solo per la precisione, ma anche per la latenza, il comportamento di registrazione, il supporto linguistico e il modo in cui gestiscono le riunioni rumorose.

Cosa cambia in Realtime STT?

Nell'interfaccia Sobes, l'impostazione importante è semplice: STT in tempo reale disabilitato o STT in tempo reale abilitato.

STT in tempo reale disabilitato

Sobes invia un segmento audio finito per il riconoscimento e attende il testo finale.
Ecco come Groq Whisper Grande v3 Turbo, OpenAI gpt-4o-mini-trascrizione, e anche Deepgram Nova-3 e Soniox STT v5 funzionano quando Realtime STT è disabilitato.

Si tratta di un flusso semplice e stabile per frasi brevi: il testo arriva come trascrizione finita, senza correzioni intermedie. Il compromesso è che Sobes riceve il testo solo dopo l'invio del segmento audio. Le frasi lunghe rendono il ritardo più evidente e non vi è alcun flusso di parole in tempo reale mentre la persona parla.

STT in tempo reale abilitato

Sobes trasmette l'audio al modello e riceve il testo parziale prima che la frase finisca.
Ecco come Deepgram Nova-3 e Soniox STT v5 funzionano quando Realtime STT è abilitato.

Nella trascrizione in streaming, il testo può essere inizialmente una bozza: il modello può rivedere le parole mentre la persona continua a parlare. Finalizzazione è il momento in cui la frase è finita, il modello smette di modificare quel segmento di testo e Sobes può tranquillamente trasmetterlo avanti.

Il punto di Realtime STT è la velocità di reazione. Puoi vedere che il sistema sta ascoltando il parlato in questo momento, le risposte lunghe diventano leggibili prima che la frase finisca e la risposta automatica può iniziare prima. Il compromesso è che il testo parziale può cambiare, la qualità dipende maggiormente dalla stabilità della connessione e talvolta è necessario attendere finché il modello non blocca il testo finale della frase.

Quali modalità di registrazione supportano Realtime STT?

Dettaglio importante: STT in tempo reale funziona nelle modalità VAD e Start/Stop. In VAD, Sobes rileva automaticamente il parlato, avvia la registrazione e chiude il segmento dopo una pausa. In Avvia/Interrompi puoi controllare manualmente l'inizio e la fine, ma la trascrizione in streaming può comunque essere eseguita mentre la registrazione è attiva.

Dentro Un colpo, Realtime STT non viene utilizzato: Sobes prende gli ultimi secondi dal buffer audio e invia un segmento finito per la trascrizione.

Quindi, se scegli Deepgram o Soniox ma usi One-Shot, usa i numeri di latenza "Realtime STT disabilitato" come riferimento.

Latenza di trascrizione

Questa è la latenza del riconoscimento vocale: quanto tempo Sobes attende il testo dopo il completamento di un segmento audio o dopo che un modello di streaming blocca il testo finale per una frase. Non include il tempo durante il quale la persona parla e non include la generazione della risposta AI.

Modello STT in tempo reale disabilitato STT in tempo reale abilitato Cosa significa
Groq Whisper Grande v3 Turbo 500-600 ms Non disponibile L'opzione non streaming più veloce. Buono per domande brevi.
OpenAI gpt-4o-mini-transcribe 600-900 ms Non disponibile Leggermente più lento di Groq, ma solitamente più attento ai discorsi difficili.
Deepgram Nova-3 circa 900 ms circa 300 ms Con Realtime STT abilitato, il testo finale appare molto più velocemente.
Soniox STT v5 circa 2500 ms circa 200 ms Il più lento senza Realtime STT, ma più veloce nel bloccare il testo finale quando Realtime STT è abilitato.

Realtime STT non è solo una casella di controllo. Per Deepgram e Soniox, la velocità del prodotto cambia: il testo inizia ad apparire quasi immediatamente e la trascrizione finale arriva più velocemente di quando Sobes invia un segmento audio completo dopo la frase.

WER: cos'è e come appaiono i numeri

WER significa Word Error Rate: la quota di parole riconosciute in modo errato. Più basso è il WER, meglio è. Ad esempio, un WER del 6% significa che circa 6 parole su 100 sono state riconosciute in modo errato: sostituite, saltate o aggiunte per errore.

Importante: il WER è difficile da confrontare senza contesto. Lo stesso modello può mostrare il 4% su un audio inglese pulito e il 15% su una chiamata rumorosa con accenti, interruzioni e un microfono scadente. Quindi i numeri seguenti sono punti di riferimento pubblici, non una garanzia per ogni intervista. La fonte è importante perché i fornitori utilizzano set di dati e metodi di valutazione diversi.

Groq Whisper Grande v3 Turbo.
Groq riporta un WER generale di circa il 12%, ma non pubblica una ripartizione separata inglese/russo. Come riferimento Whisper a livello familiare, il benchmark FLEURS lo dimostra 4,00% per l'inglese e 5,13% per il russo.

OpenAI gpt-4o-mini-trascrizione.
Il benchmark FLEURS negli elenchi di articoli di Voxtral Realtime 3,65% per l'inglese e 5,30% per il russo. OpenAI dice anche che gpt-4o-transcribe e gpt-4o-mini-transcribe migliorano il WER rispetto a Whisper v2/v3, ma i suoi documenti non pubblicano una semplice ripartizione per queste due lingue.

Deepgram Nova-3.
Per l'inglese, riporta Deepgram 5.26% per l'audio finito e 6.84% per lo streaming. Per il russo, gli elenchi di confronto pubblici Soniox 8.0%. Il punto di forza di Deepgram sono le varianti e gli accenti inglesi: inglese americano, britannico, australiano, indiano e neozelandese.

Soniox STT v5.
Lo riferisce Soniox circa il 6,5% per l'inglese e circa il 6,2% per il russo in un benchmark di 60 lingue. Non esiste una suddivisione separata inglese/russo per Realtime STT, ma Soniox afferma che la modalità di streaming v4 migliora la precisione.

L'asporto principale: per il russo, Soniox e Deepgram sembrano più forti dei vecchi approcci in stile Whisper sui benchmark del mondo reale, mentre gpt-4o-mini-transcribe sembra buono su FLEURS. Ma FLEURS, YouTube, le chiamate e le interviste dal vivo sono ambienti diversi. La scelta del modello dovrebbe considerare sia il WER che la latenza.

I modelli uno per uno

Groq Whisper Grande v3 Turbo

Groq Whisper Large v3 Turbo è l'opzione Sobes più veloce quando Realtime STT è disabilitato. Si adatta a risposte brevi, interviste veloci e situazioni in cui la latenza minima conta più della massima precisione nei discorsi difficili.

Il suo punto di forza principale è la velocità. La guida ASR di Groq riporta un WER generale di circa il 12% per Whisper Large v3 Turbo e un'accelerazione fino a 247x relativa alla durata dell'audio. Ciò lo rende una buona opzione per brevi commenti in cui il ritardo conta di più.

Se il discorso contiene molto russo, nomi, abbreviazioni, parole tecniche inglesi all'interno del parlato russo, rumore o un forte accento, Groq può commettere più errori. In tal caso, OpenAI o Soniox è solitamente il ripiego migliore, perché preservare la dicitura esatta conta più della velocità pura.

OpenAI gpt-4o-mini-trascrizione

OpenAI gpt-4o-mini-transcribe trascrive un segmento audio completato. È più lento di Groq Whisper Large v3 Turbo, ma di solito gestisce le sfumature del parlato, i termini tecnici e i dettagli delle domande con maggiore attenzione.

OpenAI dice che gpt-4o-transcribe e gpt-4o-mini-transcribe migliorano il WER e il riconoscimento della lingua rispetto a Whisper. Nel benchmark indipendente FLEURS, gpt-4o-mini-transcribe è quotato al 3,65% WER per l'inglese e al 5,30% per il russo.

OpenAI gpt-4o-mini-transcribe è una buona opzione di qualità superiore con Realtime STT disabilitato quando Groq Whisper Large v3 Turbo commette troppi errori nel parlato o nel microfono.

Deepgram Nova-3

Deepgram è forte negli scenari STT in tempo reale. Nova-3 funziona sia con l'audio completato che con lo streaming e i documenti di Deepgram riportano un WER del 6,84% per la trascrizione in streaming e del 5,26% per le registrazioni completate su un set di 2.703 file audio reali.

In Sobes, Deepgram è utile quando vuoi vedere il testo quasi immediatamente invece di aspettare fino alla fine della frase. Con Realtime STT disabilitato, la latenza media di trascrizione è di circa 900 ms; con Realtime STT abilitato è di circa 300 ms. Ciò rende Deepgram conveniente per frasi lunghe, sottotitoli in tempo reale, discorsi misti e interviste in inglese, soprattutto quando l’intervistatore ha un accento regionale.

Un vantaggio separato di Deepgram è il supporto per le varianti inglesi. Puoi scegliere non solo l'inglese generico, ma anche americano, Britannico, Australiano, indiano, o Nuova Zelanda Inglese. Ciò aiuta nelle interviste internazionali in cui l’intervistatore ha un accento sconosciuto e i termini tecnici sono mescolati con un inglese colloquiale veloce.

Per il russo, anche Deepgram sembra decente: il confronto con Soniox elenca un WER dell'8,0% per il russo.

Soniox STT v5, STT in tempo reale disabilitato

Soniox STT v5 funziona bene per il russo, il parlato in lingue miste e i termini tecnici difficili, ma con Realtime STT disabilitato è l'opzione più lenta: la latenza media di trascrizione è di circa 2500 ms. Ha senso quando la precisione nel parlato russo e misto conta più della velocità di risposta.

La forza di Soniox è il riconoscimento multilingue e il cambio di lingua. Copre anche un ampio gruppo di lingue meno comuni in cui i modelli generici spesso degradano più di quanto non facciano con l’inglese. Questo è importante anche per le interviste in lingua russa, dove una singola frase può contenere React, PostgreSQL, Kafka, thread pool, event loop e desinenze di parole russe attorno a termini tecnici inglesi.

Soniox STT v5, STT in tempo reale abilitato

Soniox STT v5 con Realtime STT abilitato è l'opzione migliore quando hai bisogno della voce russa e di una latenza minima allo stesso tempo. In media, la trascrizione finale arriva circa 200 ms dopo la frase. Questa opzione si adatta particolarmente bene a VAD e Start / Stop: il testo scorre in tempo reale, gestisce bene le frasi russo-inglese e blocca rapidamente il testo finale dopo una pausa.

Versione breve: cosa scegliere?

Se non vuoi pensarci troppo:

  • STT in tempo reale funziona in VAD e Start/Stop. In One-Shot, utilizza le opzioni con Realtime STT disabilitato.
  • Groq Whisper Grande v3 Turbo è l'opzione più veloce con Realtime STT disabilitato per frasi brevi e interviste tipiche.
  • OpenAI gpt-4o-mini-trascrizione è una buona opzione disabilitata per STT in tempo reale quando desideri una trascrizione più attenta tramite OpenAI.
  • Deepgram Nova-3, STT in tempo reale disabilitato dà una qualità solida, ma con una latenza media intorno ai 900 ms.
  • Deepgram Nova-3, STT in tempo reale abilitato è una modalità di streaming veloce, circa 300 ms fino al testo finale dopo una frase.
  • Soniox STT v5, STT in tempo reale disabilitato è forte per il parlato russo e in lingue miste, ma ha la latenza più alta: circa 2500 ms.
  • Soniox STT v5, STT in tempo reale abilitato è l'opzione di streaming più veloce per il russo e il cambio di lingua: circa 200 ms.