Modalità di registrazione
La modalità di registrazione definisce cosa succede quando si preme il pulsante di registrazione o il tasto di scelta rapida. In tutte le modalità, l'app invia solo i frammenti in cui viene rilevato il parlato per la trascrizione.
Automatico (VAD)
VAD è la soluzione migliore per conversazioni, interviste e chiamate regolari in cui il parlato può iniziare e interrompersi senza che tu gestisca ogni frammento.
Importante: è comunque necessario attivare VAD con il pulsante di registrazione o il tasto di scelta rapida. Dopo l'attivazione, l'app ascolta le sorgenti audio selezionate e rileva automaticamente la voce. Quando qualcuno parla, il frammento viene registrato. Dopo una pausa, il frammento viene chiuso e inviato alla trascrizione. Quando disattivi VAD, l'app interrompe l'analisi dell'audio.
Come funziona:
- Accendi il VAD
- L'app ascolta le sorgenti audio selezionate e cerca la voce
- Quando viene rilevato il parlato, viene avviato un frammento di registrazione
- Dopo una pausa, il frammento viene inviato per la trascrizione
- Se il parlato continua per un lungo periodo, la registrazione può essere suddivisa in parti
Manuale (Attiva/disattiva)
L'attivazione/disattivazione è per i casi in cui desideri scegliere tu stesso l'inizio e la fine di un frammento. La prima pressione del pulsante di registrazione o CTRL+R avvia la registrazione e la seconda pressione la interrompe e invia l'audio per la trascrizione.
Prima dell'inizio della registrazione, l'app mantiene un breve buffer in background. Se si preme leggermente il tasto di scelta rapida dopo l'inizio di una frase, è ancora possibile includere i primi secondi. Se il frammento finale non contiene parlato, viene scartato automaticamente.
Uno scatto (uno scatto)
One-shot è per le domande che desideri ascoltare per intero prima di chiedere una risposta. Non iniziare la registrazione in anticipo: attendere che l'altra persona finisca, quindi premere il pulsante di registrazione o CTRL+R. L'app prende l'audio più recente dal buffer, lo trascrive e lo utilizza per la risposta.
Questa modalità è utile quando non sai in anticipo quale momento sarà importante. Non registra un lungo segmento dall'inizio alla fine; richiede una breve istantanea dell'audio recente.
Selezione della modalità di registrazione
Apri le impostazioni (icona dell'ingranaggio nel menu laterale), sezione "Registrazione audio". Qui è possibile selezionare la modalità di registrazione e configurare altri parametri.
Tutte le impostazioni di registrazione
Le impostazioni di acquisizione si trovano nelle impostazioni dell'app sotto "Registrazione audio". Alcuni elementi vengono visualizzati solo per una modalità di registrazione, una sorgente audio, una piattaforma o una versione dell'app specifica.
Impostazioni di base
Sorgente audio è sempre visibile. Sceglie cosa registrare: audio di sistema + microfono, solo audio di sistema o solo microfono.
Modalità di registrazione è sempre visibile. Definisce il comportamento del pulsante di registrazione: VAD, Toggle o Oneshot.
Microfono appare quando la sorgente selezionata include l'audio del microfono. Puoi scegliere un dispositivo di input specifico qui. Se si mantiene "Default", verrà utilizzato il microfono predefinito del sistema.
Dispositivo di uscita appare su Windows quando la sorgente selezionata include l'audio del sistema. Sceglie gli altoparlanti o le cuffie di cui verrà registrato l'audio.
Sorgente audio
Audio di sistema + microfono è per chiamate e interviste: cattura sia la tua voce che l'audio dell'altra persona.
Solo audio di sistema cattura l'audio dell'app o dell'altoparlante. Il tuo microfono non è incluso.
Solo microfono cattura solo la tua voce. Usalo quando non hai bisogno dell'audio del sistema o quando l'audio del sistema è d'intralcio.
Impostazioni VAD
Spezzatura è nelle impostazioni VAD avanzate ed è attivo per impostazione predefinita. Suddivide i discorsi lunghi in file audio separati in modo che la trascrizione e la generazione delle risposte possano iniziare prima.
Durata del blocco appare nelle impostazioni VAD avanzate quando la suddivisione in blocchi è abilitata. Intervallo: da 5 a 15 secondi, predefinito 7 secondi. Limita la lunghezza massima di un frammento audio prima che venga inviato per la trascrizione.
Trigger di arresto della registrazione (microfono) viene visualizzato nelle impostazioni VAD avanzate quando la sorgente include l'audio del microfono. Intervallo: da 0,5 a 5 secondi, predefinito 0,5 secondi. Imposta la quantità di silenzio del microfono necessaria per terminare il frammento vocale corrente.
Trigger di arresto della registrazione (audio di sistema) appare nelle impostazioni VAD avanzate quando la sorgente include l'audio del sistema. Intervallo: da 0,5 a 5 secondi, predefinito 1 secondo. Imposta la quantità di silenzio audio di sistema necessaria per terminare il frammento vocale corrente.
Attiva/disattiva Impostazioni
Durata del buffer appare in Alterna. Intervallo: da 0 a 15 secondi, predefinito 4 secondi. Aggiunge alcuni secondi da prima della pressione all'inizio della registrazione, il che aiuta quando si preme il tasto di scelta rapida leggermente dopo l'inizio della frase.
Invia screenshot con audio viene visualizzato in Attiva/Disattiva ed è attivo per impostazione predefinita. Allega automaticamente gli screenshot della chat al frammento audio.
Controlla l'audio per il parlato si trova nelle impostazioni di commutazione avanzate ed è attivo per impostazione predefinita. La registrazione viene passata attraverso Silero VAD e i frammenti senza parlato vengono scartati. Disabilitalo solo se hai bisogno di inviare audio, inclusi silenzio e rumore.
Impostazioni Oneshot
Durata della cattura appare in Oneshot. Intervallo: da 5 a 60 secondi, predefinito 20 secondi. Imposta quanti ultimi secondi prendere dal buffer quando si preme il tasto di scelta rapida.
Cancella buffer dopo l'acquisizione appare in Oneshot ed è disattivato per impostazione predefinita. Se abilitato, cancella il buffer dopo ogni istantanea in modo che la pressione successiva non invii nuovamente l'audio già trascritto.
Invia screenshot con audio appare in Oneshot ed è attivo per impostazione predefinita. Allega automaticamente gli screenshot della chat al frammento audio.
Controlla l'audio per il parlato è nelle impostazioni Oneshot avanzate ed è attivo per impostazione predefinita. La registrazione viene passata attraverso Silero VAD e i frammenti senza parlato vengono scartati. Disabilitalo solo se hai bisogno di inviare audio, inclusi silenzio e rumore.
Domande frequenti
La registrazione viene attivata dal rumore
La rete neurale filtra bene i suoni non vocali, ma livelli elevati di rumore di fondo possono causare falsi trigger. Prova a ridurre la sensibilità del microfono nelle impostazioni di sistema o utilizza un auricolare.
Taglia l'inizio delle frasi
In modalità manuale: aumenta la lunghezza del buffer.
Le registrazioni vengono scartate perché vuote
La rete neurale controlla la presenza del parlato in ogni registrazione. Se il modello non rileva la voce (ad esempio, è stato registrato solo il rumore di fondo o la musica), la registrazione viene automaticamente scartata. Assicurati che il microfono sia configurato correttamente e che il tuo discorso sia sufficientemente chiaro.