Tryby nagrywania
Tryb nagrywania określa, co dzieje się po naciśnięciu przycisku nagrywania lub klawisza skrótu. We wszystkich trybach aplikacja wysyła tylko fragmenty, w których wykryto mowę do transkrypcji.
Automatyczny (VAD)
VAD jest najlepszy do regularnych rozmów, wywiadów i rozmów telefonicznych, w których mowa może rozpoczynać się i kończyć bez konieczności zarządzania każdym fragmentem.
Ważne: nadal musisz włączyć VAD za pomocą przycisku nagrywania lub skrótu klawiszowego. Po włączeniu aplikacja słucha wybranych źródeł dźwięku i automatycznie wykrywa mowę. Kiedy ktoś mówi, fragment jest nagrywany. Po przerwie fragment jest zamykany i wysyłany do transkrypcji. Po wyłączeniu VAD aplikacja przestaje analizować dźwięk.
Jak to działa:
- Włączasz VAD
- Aplikacja odsłuchuje wybrane źródła dźwięku i szuka mowy
- Po wykryciu mowy rozpoczyna się nagrywanie fragmentu
- Po pauzie fragment jest wysyłany do transkrypcji
- Jeśli mowa trwa dłuższy czas, nagranie można podzielić na kawałki
Ręcznie (Przełącz)
Przełącznik służy do sytuacji, w których chcesz samodzielnie wybrać początek i koniec fragmentu. Pierwsze naciśnięcie przycisku nagrywania lub Ctrl+R rozpoczyna nagrywanie, drugie naciśnięcie zatrzymuje je i wysyła dźwięk do transkrypcji.
Przed rozpoczęciem nagrywania aplikacja przechowuje krótki bufor w tle. Jeśli naciśniesz lekko klawisz skrótu po rozpoczęciu frazy, pierwsze sekundy nadal będą mogły zostać uwzględnione. Jeśli ostatni fragment nie zawiera mowy, jest automatycznie odrzucany.
One-shot (Oneshot)
One-shot dotyczy pytań, które chcesz usłyszeć w całości, zanim poprosisz o odpowiedź. Nie rozpoczynaj nagrywania wcześniej: poczekaj, aż druga osoba skończy, a następnie naciśnij przycisk nagrywania lub Ctrl+R. Aplikacja pobiera z bufora najnowszy plik audio, transkrybuje go i wykorzystuje do udzielenia odpowiedzi.
Ten tryb jest przydatny, gdy nie wiadomo z góry, który moment będzie miał znaczenie. Nie rejestruje długiego segmentu od początku do końca; wykonuje jedno krótkie zdjęcie ostatniego dźwięku.
Wybór trybu nagrywania
Otwórz ustawienia (ikona koła zębatego w bocznym menu), sekcja „Nagrywanie dźwięku”. Tutaj możesz wybrać tryb nagrywania i skonfigurować inne parametry.
Wszystkie ustawienia nagrywania
Ustawienia przechwytywania znajdują się w ustawieniach aplikacji w sekcji „Nagrywanie audio”. Niektóre elementy pojawiają się tylko dla określonego trybu nagrywania, źródła dźwięku, platformy lub wersji aplikacji.
Ustawienia podstawowe
Źródło dźwięku są zawsze widoczne. Wybiera, co ma zostać nagrane: dźwięk systemowy + mikrofon, tylko dźwięk systemowy lub tylko mikrofon.
Tryb nagrywania jest zawsze widoczny. Określa zachowanie przycisku nagrywania: VAD, Toggle lub Oneshot.
Mikrofon pojawia się, gdy wybrane źródło zawiera dźwięk z mikrofonu. Tutaj możesz wybrać konkretne urządzenie wejściowe. Jeśli pozostawisz ustawienie „Domyślne”, używany będzie domyślny mikrofon systemowy.
Urządzenie wyjściowe pojawia się w systemie Windows, gdy wybrane źródło zawiera dźwięk systemowy. Wybiera głośniki lub słuchawki, których dźwięk będzie nagrywany.
Źródło dźwięku
Dźwięk systemowy + mikrofon służy do rozmów i wywiadów: przechwytuje zarówno Twój głos, jak i dźwięk drugiej osoby.
Tylko dźwięk systemowy przechwytuje dźwięk z aplikacji lub głośnika. Twój mikrofon nie jest dołączony.
Tylko mikrofon rejestruje tylko Twój głos. Użyj go, gdy nie potrzebujesz dźwięku systemowego lub gdy dźwięk systemowy przeszkadza.
Ustawienia VAD
Chunking znajduje się w zaawansowanych ustawieniach VAD i jest domyślnie włączony. Dzieli długą mowę na osobne pliki audio, dzięki czemu transkrypcja i generowanie odpowiedzi mogą rozpocząć się wcześniej.
Czas trwania fragmentu pojawia się w zaawansowanych ustawieniach VAD, gdy włączone jest fragmentowanie. Zakres: od 5 do 15 sekund, domyślnie 7 sekund. Ogranicza maksymalną długość jednego fragmentu audio, zanim zostanie on przesłany do transkrypcji.
Wyzwalacz zatrzymania nagrywania (mikrofon) pojawia się w zaawansowanych ustawieniach VAD, gdy źródło zawiera dźwięk z mikrofonu. Zakres: 0,5 do 5 sekund, domyślnie 0,5 sekundy. Ustawia czas wyciszenia mikrofonu potrzebny do zakończenia bieżącego fragmentu mowy.
Wyzwalacz zatrzymania nagrywania (dźwięk systemowy) pojawia się w zaawansowanych ustawieniach VAD, gdy źródło zawiera dźwięk systemowy. Zakres: 0,5 do 5 sekund, domyślnie 1 sekunda. Ustawia ilość wyciszenia dźwięku systemowego potrzebnego do zakończenia bieżącego fragmentu mowy.
Przełącz ustawienia
Czas trwania bufora pojawia się w opcji Przełącznik. Zakres: 0 do 15 sekund, domyślnie 4 sekundy. Dodaje kilka sekund od momentu naciśnięcia do początku nagrania, co pomaga, gdy lekko naciśniesz klawisz skrótu po rozpoczęciu frazy.
Wysyłaj zrzuty ekranu z dźwiękiem pojawia się w przełączniku i jest domyślnie włączony. Automatycznie dołącza zrzuty ekranu z czatu do fragmentu audio.
Sprawdź dźwięk pod kątem mowy jest w zaawansowanych ustawieniach przełączania i jest domyślnie włączony. Nagranie przechodzi przez Silero VAD, a fragmenty bez mowy są odrzucane. Wyłącz tę opcję tylko wtedy, gdy chcesz wysłać dowolny dźwięk, w tym ciszę i hałas. W Oneshot pojawia się
Ustawienia Oneshot
Czas przechwytywania . Zakres: od 5 do 60 sekund, domyślnie 20 sekund. Ustawia liczbę ostatnich sekund, które mają zostać pobrane z bufora po naciśnięciu klawisza skrótu.
Wyczyść bufor po przechwyceniu pojawia się w Oneshot i jest domyślnie wyłączony. Po włączeniu czyści bufor po każdej migawce, więc kolejne naciśnięcie nie powoduje ponownego wysłania już transkrybowanego dźwięku.
Wysyłaj zrzuty ekranu z dźwiękiem pojawia się w Oneshot i jest domyślnie włączony. Automatycznie dołącza zrzuty ekranu z czatu do fragmentu audio.
Sprawdź dźwięk pod kątem mowy jest w zaawansowanych ustawieniach Oneshot i jest domyślnie włączony. Nagranie przechodzi przez Silero VAD, a fragmenty bez mowy są odrzucane. Wyłącz tę opcję tylko wtedy, gdy chcesz wysłać dowolny dźwięk, w tym ciszę i hałas.
Często zadawane pytania
Nagrywanie wyzwalane przez hałas
Sieć neuronowa dobrze filtruje dźwięki inne niż mowa, ale wysoki poziom szumu tła może powodować fałszywe wyzwalacze. Spróbuj zmniejszyć czułość mikrofonu w ustawieniach systemu lub użyj zestawu słuchawkowego.
Ucina początek fraz
W trybie ręcznym — zwiększ długość bufora.
Nagrania są odrzucane jako puste
Sieć neuronowa sprawdza każde nagranie pod kątem obecności mowy. Jeśli model nie wykryje głosu (na przykład nagrano jedynie hałas w tle lub muzykę), nagranie zostanie automatycznie odrzucone. Upewnij się, że Twój mikrofon jest prawidłowo skonfigurowany, a Twoja mowa jest wystarczająco wyraźna.