Sobes.tech

Grabación de audio

Preguntas sobre la grabación de audio

Modos de grabación

El modo de grabación define lo que sucede cuando presiona el botón de grabación o la tecla de acceso rápido. En todos los modos, la aplicación envía solo fragmentos donde se detecta voz para su transcripción.

Automático (VAD)

VAD es mejor para conversaciones, entrevistas y llamadas habituales en las que la conversación puede comenzar y detenerse sin que usted tenga que gestionar cada fragmento.

Importante: aún necesitas encender el VAD con el botón de grabación o la tecla de acceso rápido. Una vez activada, la aplicación escucha las fuentes de audio seleccionadas y detecta la voz automáticamente. Cuando alguien habla, el fragmento queda grabado. Después de una pausa, el fragmento se cierra y se envía para su transcripción. Cuando apagas VAD, la aplicación deja de analizar el audio.

Cómo funciona:

  1. Enciendes el VAD
  2. La aplicación escucha las fuentes de audio seleccionadas y busca voz.
  3. Cuando se detecta voz, se inicia un fragmento de grabación.
  4. Después de una pausa, el fragmento se envía para su transcripción.
  5. Si la conversación continúa durante mucho tiempo, la grabación se puede dividir en partes
VAD diagram: turn on, detect speech, record, and transcribe

Manual (alternar)

Alternar es para los casos en los que desea elegir usted mismo el inicio y el final de un fragmento. La primera pulsación del botón de grabación o Ctrl+R comienza a grabar, y la segunda pulsación lo detiene y envía el audio para su transcripción.

Antes de que comience la grabación, la aplicación mantiene un breve búfer de fondo. Si presiona la tecla de acceso rápido ligeramente después de que comienza una frase, aún se pueden incluir los primeros segundos. Si el fragmento final no contiene voz, se descarta automáticamente.

Start / Stop diagram: buffer, start, recording, stop, and transcription

Un disparo (One-shot)

One-shot es para preguntas que desea escuchar en su totalidad antes de pedir una respuesta. No empieces a grabar antes de tiempo: espera hasta que la otra persona termine, luego presiona el botón de grabación o Ctrl+R. La aplicación toma el audio más reciente del búfer, lo transcribe y lo usa como respuesta.

Este modo es útil cuando no se sabe de antemano qué momento será importante. No registra un segmento largo de principio a fin; toma una breve instantánea del audio reciente.

One-shot diagram: rolling buffer, last seconds, hotkey, and transcription

Seleccionar el modo de grabación

Abra configuración (icono de engranaje en el menú lateral), sección "Grabación de audio". Aquí puede seleccionar el modo de grabación y configurar otros parámetros.

Sobes Copilot voice recording settings

Todas las configuraciones de grabación

La configuración de captura se encuentra en la configuración de la aplicación en "Grabación de audio". Algunos elementos aparecen solo para un modo de grabación, fuente de audio, plataforma o versión de aplicación específicos.

Configuraciones básicas

Fuente de audio siempre es visible. Elige qué grabar: audio del sistema + micrófono, solo audio del sistema o solo micrófono.

Modo de grabación siempre es visible. Define el comportamiento del botón de grabación: VAD, Toggle o Oneshot.

micrófono Aparece cuando la fuente seleccionada incluye audio de micrófono. Puede elegir un dispositivo de entrada específico aquí. Si mantiene "Predeterminado", se utiliza el micrófono predeterminado del sistema.

Dispositivo de salida aparece en Windows cuando la fuente seleccionada incluye audio del sistema. Elige los altavoces o auriculares cuyo audio se grabará.

Fuente de audio

Sistema de audio + micrófono Es para llamadas y entrevistas: captura tanto tu voz como el audio de la otra persona.

Solo audio del sistema captura el audio de la aplicación o del altavoz. Su micrófono no está incluido.

Solo micrófono Capta sólo tu voz. Úselo cuando no necesite el audio del sistema o cuando el audio del sistema se interponga en su camino.

Configuración del VAD

fragmentación está en configuración avanzada de VAD y está activado de forma predeterminada. Divide discursos largos en archivos de audio separados para que la transcripción y la generación de respuestas puedan comenzar antes.

Duración del fragmento aparece en la configuración avanzada de VAD cuando la fragmentación está habilitada. Rango: de 5 a 15 segundos, por defecto 7 segundos. Limita la longitud máxima de un fragmento de audio antes de enviarlo para su transcripción.

Activador de parada de grabación (micrófono) aparece en la configuración avanzada de VAD cuando la fuente incluye audio de micrófono. Rango: 0,5 a 5 segundos, valor predeterminado 0,5 segundos. Establece cuánto silencio del micrófono se necesita para finalizar el fragmento de voz actual.

Activador de parada de grabación (audio del sistema) aparece en la configuración avanzada de VAD cuando la fuente incluye audio del sistema. Rango: 0,5 a 5 segundos, por defecto 1 segundo. Establece cuánto silencio de audio del sistema se necesita para finalizar el fragmento de voz actual.

Cambie la configuración avanzada de VAD solo cuando la grabación se detenga demasiado pronto, espere demasiado una pausa o envíe demasiados fragmentos adicionales.

Alternar configuración

Duración del búfer aparece en Alternar. Rango: 0 a 15 segundos, predeterminado 4 segundos. Agrega unos segundos desde antes de presionar hasta el comienzo de la grabación, lo que ayuda cuando presiona la tecla de acceso rápido ligeramente después de que comienza la frase.

Enviar capturas de pantalla con audio aparece en Alternar y está activado de forma predeterminada. Adjunta automáticamente capturas de pantalla del chat al fragmento de audio.

Verifique el audio para ver si hay voz está en la configuración avanzada de Alternar y está activado de forma predeterminada. La grabación se pasa por Silero VAD y se descartan los fragmentos sin voz. Desactívelo solo si necesita enviar algún audio, incluidos silencio y ruido.

Configuración de una sola vez

Duración de la captura aparece en Oneshot. Rango: de 5 a 60 segundos, por defecto 20 segundos. Establece cuántos últimos segundos se tomarán del búfer cuando presione la tecla de acceso rápido.

Borrar buffer después de la captura aparece en Oneshot y está desactivado de forma predeterminada. Cuando está habilitado, borra el búfer después de cada instantánea para que la siguiente pulsación no reenvíe el audio ya transcrito.

Enviar capturas de pantalla con audio aparece en Oneshot y está activado de forma predeterminada. Adjunta automáticamente capturas de pantalla del chat al fragmento de audio.

Verifique el audio para ver si hay voz está en la configuración avanzada de Oneshot y está activado de forma predeterminada. La grabación se pasa por Silero VAD y se descartan los fragmentos sin voz. Desactívelo solo si necesita enviar algún audio, incluidos silencio y ruido.


Preguntas frecuentes

Grabación de disparadores por ruido.

La red neuronal filtra bien los sonidos que no son del habla, pero los niveles elevados de ruido de fondo pueden provocar activaciones falsas. Intente reducir la sensibilidad del micrófono en la configuración del sistema o utilice unos auriculares.

Corta el comienzo de las frases.

En modo manual: aumente la longitud del búfer.

Las grabaciones se descartan como vacías.

La red neuronal comprueba la presencia de voz en cada grabación. Si el modelo no detecta voz (por ejemplo, solo se grabó ruido de fondo o música), la grabación se descarta automáticamente. Asegúrese de que su micrófono esté configurado correctamente y que su discurso sea lo suficientemente claro.