Sobes.tech
Powrót do artykułów

Jak wybrać model transkrypcji mowy?

Alexander10 maja 2026 (2 mies. temu)
Jak wybrać model transkrypcji mowy?

Jakość odpowiedzi AI zaczyna się przed modelem językowym. Zaczyna się od transkrypcji mowy.
Jeśli system źle usłyszy pytanie, nawet mocny model odpowie na zniekształcony tekst.

W Sobes masz do wyboru kilka modeli rozpoznawania mowy: Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, Deepgram Nova-3 i Soniox STT v5. Różnią się nie tylko dokładnością, ale także opóźnieniami, zachowaniem podczas nagrywania, obsługą języka i sposobem obsługi hałaśliwych spotkań.

Co zmienia Realtime STT?

W interfejsie Sobes ważne ustawienie jest proste: Realtime STT wyłączone lub Realtime STT włączone.

Realtime STT wyłączone

Sobes wysyła gotowy segment audio do rozpoznania i czeka na końcowy tekst.
W ten sposób Groq Whisper Large v3 Turbo, OpenAI gpt-4o-mini-transcribe, a także Deepgram Nova-3 i Soniox STT v5 działają, gdy funkcja Realtime STT jest wyłączona.

Jest to prosty, stabilny przepływ w przypadku krótkich fraz: tekst przychodzi jako gotowy transkrypcja, bez pośrednich poprawek. Kompromis polega na tym, że Sobes odbiera tekst dopiero po wysłaniu segmentu audio. Długie frazy sprawiają, że opóźnienie jest bardziej zauważalne i nie ma strumienia słów na żywo, gdy osoba mówi.

Realtime STT włączone

Sobes przesyła strumieniowo dźwięk do modela i odbiera częściowy tekst przed zakończeniem frazy.
W ten sposób Deepgram Nova-3 i Soniox STT v5 działa, gdy włączona jest funkcja Realtime STT.

W przypadku transkrypcji strumieniowej tekst może początkowo być wersją roboczą: model może poprawiać słowa, podczas gdy osoba zachowuje mówienie. Finalizacja to moment, w którym fraza się kończy, model przestaje zmieniać ten segment tekstu, a Sobes może bezpiecznie przekazać go dalej.

Istotą Realtime STT jest szybkość reakcji. Widać, że system właśnie słyszy mowę, długie odpowiedzi stają się czytelne przed zakończeniem frazy, a automatyczna odpowiedź może rozpocząć się wcześniej. Wadą jest to, że częściowy tekst może się zmienić, jakość zależy bardziej od stabilności połączenia i czasami trzeba poczekać, aż model zablokuje ostateczny tekst frazy.

Które tryby nagrywania obsługują Realtime STT?

Ważny szczegół: Realtime STT działa w trybach VAD i Start/Stop. W VAD Sobes automatycznie wykrywa mowę, rozpoczyna nagrywanie i zamyka segment po pauzie. W opcji Start/Stop możesz ręcznie kontrolować początek i koniec, ale transkrypcja strumieniowa może nadal działać, gdy nagrywanie jest aktywne.

W One-Shot, Realtime STT nie jest używany: Sobes pobiera ostatnie sekundy z bufora audio i wysyła gotowy segment do transkrypcji.

Tak więc, jeśli wybierzesz Deepgram lub Soniox, ale używasz One-Shot, użyj opcji "Realtime STT wyłączone” jako odniesienie.

Opóźnienie transkrypcji

To jest opóźnienie rozpoznawania mowy: jak długo Sobes czeka na tekst po zakończeniu segmentu audio lub po tym, jak model przesyłania strumieniowego zablokuje końcowy tekst frazy. Nie obejmuje czasu, w którym osoba mówi, ani generowania odpowiedzi AI.

Model STT w czasie rzeczywistym wyłączone STT włączone w czasie rzeczywistym Co to znaczy
Groq Whisper Large v3 Turbo 500-600 ms Niedostępne Najszybsza opcja bez przesyłania strumieniowego. Dobre w przypadku krótkich pytań.
OpenAI gpt-4o-mini-transcribe 600-900 ms Niedostępne Nieco wolniejszy niż Groq, ale zwykle ostrożniejszy w przypadku trudnej mowy.
Deepgram Nova-3 około 900 ms około 300 ms Przy włączonej funkcji Realtime STT końcowy tekst pojawia się znacznie szybciej.
Soniox STT v5 około 2500 ms około 200 ms Najwolniejszy bez Realtime STT, ale najszybszy w blokowaniu końcowego tekstu, gdy włączona jest funkcja Realtime STT.

Realtime STT to nie tylko pole wyboru. W przypadku Deepgram i Soniox zmienia to szybkość działania produktu: tekst zaczyna pojawiać się niemal natychmiast, a ostateczna transkrypcja dociera szybciej niż wtedy, gdy Sobes wysyła kompletny segment audio po frazie.

WER: co to jest i jak wyglądają liczby

WER oznacza współczynnik błędów słów: udział nieprawidłowo rozpoznanych słów. Im niższy WER, tym lepiej. Na przykład WER wynoszący 6% oznacza, że ​​około 6 ze 100 słów zostało błędnie rozpoznanych: zastąpionych, pominiętych lub dodanych przez pomyłkę.

Ważne: WER trudno porównać bez kontekstu. Ten sam model może wyświetlić 4% czystego dźwięku w języku angielskim i 15% w przypadku hałaśliwego połączenia z akcentami, przerwami i słabym mikrofonem. Zatem poniższe liczby stanowią publiczne punkty odniesienia, a nie gwarancję każdej rozmowy kwalifikacyjnej. Źródło ma znaczenie, ponieważ dostawcy korzystają z różnych zbiorów danych i metod oceny.

Groq Whisper Large v3 Turbo.
Groq podaje ogólny WER na poziomie około 12%, ale nie publikuje osobnego podziału na język angielski/rosyjski. Jako odniesienie do szeptów na poziomie rodzinnym, benchmark FLEURS pokazuje 4,00% dla języka angielskiego i 5,13% dla języka rosyjskiego.

OpenAI gpt-4o-mini-transcribe.
Benchmark FLEURS na listach artykułów Voxtral Realtime 3,65% dla języka angielskiego i 5,30% dla języka rosyjskiego. OpenAI mówi również, że gpt-4o-transcribe i gpt-4o-mini-transcribe poprawiają WER w porównaniu z Whisper v2/v3, ale jego dokumentacja nie publikuje prostego zestawienia dla tych dwóch języków.

Deepgram Nova-3.
W przypadku języka angielskiego Deepgram raportuje 5.26% skończone audio i 6.84% streaming. W przypadku języka rosyjskiego dostępne są publiczne listy porównawcze Soniox 8.0%. Siłą Deepgram są angielskie warianty i akcenty: amerykański, brytyjski, australijski, indyjski i nowozelandzki angielski.

Soniox STT v5.
Soniox raportuje około 6,5% dla języka angielskiego i około 6,2% dla języka rosyjskiego w teście porównawczym obejmującym 60 języków. Nie ma oddzielnego podziału na język angielski/rosyjski dla Realtime STT, ale Soniox twierdzi, że tryb przesyłania strumieniowego v4 poprawia dokładność.

Główny wniosek: w przypadku języka rosyjskiego, Soniox i Deepgram wyglądają lepiej niż starsze podejścia w stylu Whisper w rzeczywistych testach porównawczych, podczas gdy gpt-4o-mini-transcribe wygląda dobrze na FLEURS. Ale FLEURS, YouTube, rozmowy telefoniczne i wywiady na żywo to różne środowiska. Wybór modelu powinien uwzględniać zarówno WER, jak i opóźnienie.

Modele jeden po drugim

Groq Whisper Large v3 Turbo

Groq Whisper Large v3 Turbo to najszybsza opcja Sobes, gdy funkcja Realtime STT jest wyłączona. Pasuje do krótkich odpowiedzi, szybkich wywiadów i sytuacji, w których minimalne opóźnienie jest ważniejsze niż maksymalna dokładność trudnej mowy.

Jego główną zaletą jest szybkość. Przewodnik po ASR firmy Groq podaje ogólny WER na poziomie około 12% dla Whisper Large v3 Turbo i przyspieszenie do 247x w stosunku do czasu trwania dźwięku. To sprawia, że ​​jest to dobra opcja w przypadku krótkich uwag, w których opóźnienie ma największe znaczenie.

Jeśli przemówienie zawiera dużo rosyjskiego, imion, skrótów, angielskich słów technicznych w mowie rosyjskiej, hałasu lub silnego akcentu, Groq może popełnić więcej błędów. W takim przypadku OpenAI lub Soniox jest zwykle lepszym rozwiązaniem zastępczym, ponieważ zachowanie dokładnego brzmienia jest ważniejsze niż sama prędkość.

OpenAI gpt-4o-mini-transcribe

OpenAI gpt-4o-mini-transcribe transkrybuje ukończony segment audio. Jest wolniejszy niż Groq Whisper Large v3 Turbo, ale zazwyczaj radzi sobie z niuansami mowy, terminami technicznymi i szczegółami pytań.

OpenAI mówi, że gpt-4o-transcribe i gpt-4o-mini-transcribe poprawiają WER i rozpoznawanie języka w porównaniu z Whisper. W niezależnym teście FLEURS gpt-4o-mini-transcribe ma współczynnik WER 3,65% dla języka angielskiego i 5,30% dla języka rosyjskiego.

OpenAI gpt-4o-mini-transcribe to dobra opcja wyższej jakości z wyłączoną funkcją Realtime STT, gdy Groq Whisper Large v3 Turbo popełnia zbyt wiele błędów w mowie lub mikrofonie.

Deepgram Nova-3

Deepgram jest mocny w trybie Realtime STT scenariusze. Nova-3 współpracuje zarówno z ukończonym dźwiękiem, jak i transmisją strumieniową, a dokumentacja Deepgram podaje WER na poziomie 6,84% w przypadku transkrypcji strumieniowej i 5,26% w przypadku ukończonych nagrań na zestawie 2703 plików audio ze świata rzeczywistego.

W Sobes Deepgram jest przydatny, gdy chcesz zobaczyć tekst niemal natychmiast, zamiast czekać, aż fraza się skończy. Przy wyłączonej funkcji Realtime STT średnie opóźnienie transkrypcji wynosi około 900 ms; z włączoną funkcją Realtime STT wynosi około 300 ms. To sprawia, że ​​Deepgram jest wygodny w przypadku długich fraz, napisów na żywo, mowy mieszanej i wywiadów w języku angielskim, szczególnie gdy osoba przeprowadzająca wywiad ma regionalny akcent.

Odrębną zaletą Deepgram jest obsługa wariantów angielskich. Możesz wybrać nie tylko ogólny angielski, ale także amerykański, brytyjski, australijski, indyjski lub nowozelandzki angielski. Pomaga to w rozmowach międzynarodowych, podczas których osoba przeprowadzająca wywiad ma nieznany akcent, a terminy techniczne mieszają się z szybko używanym angielskim.

W przypadku języka rosyjskiego Deepgram również wygląda przyzwoicie: porównanie Soniox podaje 8,0% WER dla języka rosyjskiego.

Soniox STT v5, Realtime STT wyłączony

Soniox STT v5 sprawdza się dobrze w przypadku języka rosyjskiego, mowy w różnych językach i trudnych technicznych warunkach, ale z wyłączoną funkcją Realtime STT jest to najwolniejsza opcja: średnie opóźnienie transkrypcji wynosi około 2500 ms. Ma to sens, gdy dokładność mowy rosyjskiej i mieszanej jest ważniejsza niż szybkość reakcji.

Siła Soniox polega na rozpoznawaniu wielojęzycznym i przełączaniu języków. Obejmuje także dużą pulę mniej popularnych języków, w przypadku których modele ogólnego przeznaczenia często ulegają degradacji w większym stopniu niż w przypadku języka angielskiego. Ma to znaczenie również w przypadku rozmów kwalifikacyjnych rosyjskojęzycznych, gdzie pojedyncza fraza może zawierać React, PostgreSQL, Kafka, thread pool, event loop oraz rosyjskie końcówki słów wokół angielskich terminów technicznych.

Soniox STT v5, z włączoną funkcją Realtime STT

Soniox STT v5 z włączoną funkcją Realtime STT to najlepsza opcja, gdy potrzebujesz mowy rosyjskiej i jednocześnie minimalnego opóźnienia. Ostateczna transkrypcja pojawia się średnio około 200 ms po frazie. Ta opcja szczególnie dobrze sprawdza się w VAD i Start/Stop: tekst jest przesyłany strumieniowo na żywo, dobrze obsługuje zwroty rosyjsko-angielskie i szybko zatrzymuje tekst końcowy po pauzie.

Wersja krótka: co wybrać?

Jeśli nie chcesz się nad tym zastanawiać:

  • Realtime STT działa w VAD i Start/Stop. W One-Shot użyj opcji przy wyłączonym Realtime STT.
  • Groq Whisper Large v3 Turbo to najszybsza opcja z wyłączonym Realtime STT dla krótkich fraz i typowych wywiadów.
  • OpenAI gpt-4o-mini-transcribe jest dobrą opcją z wyłączonym Realtime STT, gdy chcesz dokładniejszej transkrypcji przez OpenAI.
  • Deepgram Nova-3, Realtime STT wyłączony zapewnia solidną jakość, ale ze średnim opóźnieniem około 900 ms.
  • Deepgram Nova-3 z obsługą Realtime STT to szybki tryb przesyłania strumieniowego, około 300 ms do końcowego tekstu po frazie.
  • Soniox STT v5, Realtime STT wyłączony jest odpowiedni dla mowy rosyjskiej i wielojęzycznej, ale ma największe opóźnienie: około 2500 ms.
  • Soniox STT v5, z włączoną funkcją Realtime STT jest najszybszą opcją przesyłania strumieniowego przy przełączaniu języka rosyjskiego i języka: około 200 ms.