Modos de Gravação
O modo de gravação define o que acontece quando carregas no botão de gravação ou na tecla de atalho. Em todos os modos, a aplicação envia apenas fragmentos onde a fala é detetada para transcrição.
Automático (VAD)
O VAD é ideal para conversas normais, entrevistas e chamadas, onde a fala pode começar e parar sem que tenhas de gerir cada fragmento.
Importante: ainda precisas de ligar o VAD com o botão de gravação ou tecla de atalho. Depois de ligado, a aplicação ouve as fontes de áudio selecionadas e deteta automaticamente a fala. Quando alguém fala, o fragmento é registado. Após uma pausa, o fragmento é fechado e enviado para transcrição. Quando desligas o VAD, a aplicação deixa de analisar o áudio.
Como funciona:
- Ligas o VAD
- A aplicação ouve as fontes áudio selecionadas e procura a fala
- Quando a fala é detetada, começa um fragmento de gravação
- Após uma pausa, o fragmento é enviado para transcrição
- Se a fala continuar durante muito tempo, a gravação pode ser dividida em partes
Manual (Toggle)
Toggle é para casos em que queres escolher o início e o fim de um fragmento tu próprio. A primeira pressão do botão de gravação ou Ctrl+R inicia a gravação, e a segunda pressão interrompe e envia o áudio para transcrição.
Antes de começar a gravação, a aplicação mantém um curto buffer em segundo plano. Se carregar na tecla de atalho ligeiramente após o início de uma frase, os primeiros segundos ainda podem ser incluídos. Se o fragmento final não contiver fala, este é descartado automaticamente.
One-shot (One-shot)
One-shot é para perguntas que queres ouvir na íntegra antes de pedir uma resposta. Não comece a gravar com antecedência: espere que a outra pessoa termine, depois carregue no botão de gravação ou Ctrl+R. A aplicação recolhe o áudio mais recente do buffer, transcreve-o e usa-o como resposta.
Este modo é útil quando não se sabe de antemão qual o momento que irá importar. Não grava um segmento longo de início a fim; Tira um breve instantâneo de áudio recente.
Seleção do Modo de Gravação
Abrir definições (ícone de engrenagem no menu lateral), secção "Gravação de Áudio". Aqui pode selecionar o modo de gravação e configurar outros parâmetros.
Todas as Definições de Gravação
As definições de captura estão nas definições da aplicação, em "Gravação de Áudio". Alguns itens aparecem apenas para um modo de gravação específico, fonte de áudio, plataforma ou versão da aplicação.
Configurações Básicas
A Fonte de Áudio está sempre visível. Escolhe o que gravar: áudio do sistema + microfone, áudio do sistema apenas ou apenas microfone.
Modo de Gravação está sempre visível. Define o comportamento dos botões de gravação: VAD, Toggle ou Oneshot.
Microfone aparece quando a fonte selecionada inclui áudio do microfone. Pode escolher um dispositivo de entrada específico aqui. Se mantiveres "Default", o microfone padrão do sistema é usado.
Dispositivo de Saída aparece no Windows quando a fonte selecionada inclui áudio do sistema. Escolhe as colunas ou auscultadores cujo áudio será gravado.
Fonte de Áudio
Áudio do sistema + microfone é para chamadas e entrevistas: capta tanto a tua voz como o áudio da outra pessoa.
Apenas o áudio do sistema capta o áudio da aplicação ou do altifalante. O teu microfone não está incluído.
Só o microfone capta apenas a tua voz. Usa-o quando não precisares de áudio do sistema ou quando o áudio do sistema atrapalhar.
Definições VAD
O chunking está nas definições avançadas do VAD e está ativado por defeito. Divide a fala longa em ficheiros de áudio separados para que a transcrição e a geração de respostas possam começar mais cedo.
Duração do Chunk aparece nas definições avançadas do VAD quando o chunking está ativado. Alcance: 5 a 15 segundos, padrão 7 segundos. Limita o comprimento máximo de um fragmento áudio antes de ser enviado para transcrição.
Recording Stop Trigger (microfone) aparece nas definições avançadas de VAD quando a fonte inclui áudio do microfone. Alcance: 0,5 a 5 segundos, padrão 0,5 segundos. Define quanto silêncio do microfone é necessário para terminar o fragmento de fala atual.
Recording Stop Trigger (áudio do sistema) aparece nas definições avançadas de VAD quando a fonte inclui áudio do sistema. Alcance: 0,5 a 5 segundos, padrão 1 segundo. Define quanto silêncio áudio do sistema é necessário para terminar o fragmento de fala atual.
Alternar Definições
Duração do Buffer aparece em Toggle. Alcance: 0 a 15 segundos, padrão 4 segundos. Adiciona alguns segundos desde antes da pressão até ao início da gravação, o que ajuda quando pressionas a tecla de atalho ligeiramente depois do início da frase.
Enviar capturas de ecrã com áudio aparece em Toggle e está ativado por defeito. Anexa automaticamente capturas de ecrã do chat ao fragmento de áudio.
Verificar áudio para voz está nas definições avançadas de Toggle e está ativado por defeito. A gravação é passada através do Silero VAD, e fragmentos sem fala são descartados. Desativa-o apenas se precisares de enviar algum áudio, incluindo silêncio e ruído.
Definições de Oneshot
Duração da Captura aparece em Oneshot. Intervalo: 5 a 60 segundos, padrão 20 segundos. Define quantos segundos mais recentes tirar do buffer quando pressionas a tecla de atalho.
Limpar buffer após a captura aparece no Oneshot e está desligado por defeito. Quando ativado, limpa o buffer após cada snapshot para que a próxima pressão não reenvie áudio já transcrito.
Enviar capturas de ecrã com áudio aparece no Oneshot e está ativado por defeito. Anexa automaticamente capturas de ecrã do chat ao fragmento de áudio.
Verificar o áudio para fala está nas definições avançadas do Oneshot e está ativado por defeito. A gravação é passada através do Silero VAD, e fragmentos sem fala são descartados. Desativa-o apenas se precisares de enviar algum áudio, incluindo silêncio e ruído.
Perguntas Frequentes
A gravação é acionada por ruído
A rede neural filtra bem os sons que não são de fala, mas níveis elevados de ruído de fundo podem causar falsos gatilhos. Tente reduzir a sensibilidade do microfone nas definições do sistema ou use um headset.
Corta o início das frases
Em modo manual — aumente o comprimento do buffer.
As gravações são descartadas como vazias
A rede neural verifica cada gravação quanto à presença da fala. Se o modelo não detetar voz (por exemplo, apenas ruído de fundo ou música foram gravados), a gravação é automaticamente descartada. Certifique-se de que o microfone está devidamente configurado e que a sua fala está suficientemente clara.