Sobes.tech

Enregistrement audio

Questions sur l'enregistrement audio

Modes d'enregistrement

Le mode d'enregistrement définit ce qui se passe lorsque vous appuyez sur le bouton d'enregistrement ou la touche de raccourci. Dans tous les modes, l'application envoie uniquement des fragments où la parole est détectée pour la transcription.

Automatique (VAD)

VAD est idéal pour les conversations, entretiens et appels réguliers où la parole peut commencer et s'arrêter sans que vous gériez chaque fragment.

Important : vous devez toujours activer VAD avec le bouton d'enregistrement ou le raccourci clavier. Une fois allumée, l'application écoute les sources audio sélectionnées et détecte automatiquement la parole. Quand quelqu'un parle, le fragment est enregistré. Après une pause, le fragment est fermé et envoyé pour transcription. Lorsque vous désactivez VAD, l'application arrête d'analyser l'audio.

Comment ça marche :

  1. Vous activez VAD
  2. L'application écoute les sources audio sélectionnées et recherche la parole
  3. Lorsque la parole est détectée, un fragment d'enregistrement démarre
  4. Après une pause, le fragment est envoyé pour transcription
  5. Si la parole continue pendant une longue période, l'enregistrement peut être divisé en morceaux
VAD diagram: turn on, detect speech, record, and transcribe

Manuel (basculer)

Toggle est destiné aux cas où vous souhaitez choisir vous-même le début et la fin d'un fragment. La première pression sur le bouton d'enregistrement ou Ctrl+R commence l'enregistrement, et la deuxième pression l'arrête et envoie l'audio pour transcription.

Avant le début de l'enregistrement, l'application conserve un court tampon d'arrière-plan. Si vous appuyez légèrement sur la touche de raccourci après le début d'une phrase, les premières secondes peuvent toujours être incluses. Si le fragment final ne contient pas de parole, il est automatiquement supprimé.

Start / Stop diagram: buffer, start, recording, stop, and transcription

Un coup (Oneshot)

Le one-shot est destiné aux questions que vous souhaitez entendre dans leur intégralité avant de demander une réponse. Ne démarrez pas l'enregistrement à l'avance : attendez que l'autre personne ait fini, puis appuyez sur le bouton d'enregistrement ou Ctrl+R. L'application prend le dernier audio du tampon, le transcrit et l'utilise pour la réponse.

Ce mode est utile lorsque l’on ne sait pas à l’avance quel moment sera important. Il n'enregistre pas un long segment de début à fin ; il prend un court instantané de l'audio récent.

One-shot diagram: rolling buffer, last seconds, hotkey, and transcription

Sélection du mode d'enregistrement

Ouvrez les paramètres (icône d'engrenage dans le menu latéral), section "Enregistrement audio". Ici, vous pouvez sélectionner le mode d'enregistrement et configurer d'autres paramètres.

Sobes Copilot voice recording settings

Tous les paramètres d'enregistrement

Les paramètres de capture se trouvent dans les paramètres de l'application sous « Enregistrement audio ». Certains éléments apparaissent uniquement pour un mode d'enregistrement, une source audio, une plate-forme ou une version d'application spécifique.

Paramètres de base

Source audio est toujours visible. Il choisit ce qu'il faut enregistrer : audio du système + microphone, audio du système uniquement ou microphone uniquement.

Mode d'enregistrement est toujours visible. Il définit le comportement du bouton d'enregistrement : VAD, Toggle ou Oneshot.

Micro apparaît lorsque la source sélectionnée inclut l’audio du microphone. Vous pouvez choisir ici un périphérique d'entrée spécifique. Si vous conservez « Par défaut », le microphone par défaut du système est utilisé.

Périphérique de sortie apparaît sous Windows lorsque la source sélectionnée inclut l’audio du système. Il choisit les haut-parleurs ou les écouteurs dont l'audio sera enregistré.

Source audio

Système audio + microphone est destiné aux appels et aux entretiens : il capture à la fois votre voix et le son de l'autre personne.

Audio du système uniquement capture le son de l'application ou du haut-parleur. Votre microphone n'est pas inclus.

Micro uniquement capture uniquement votre voix. Utilisez-le lorsque vous n'avez pas besoin de l'audio du système ou lorsque l'audio du système vous gêne.

Paramètres du VAD

Morceau est dans les paramètres avancés du VAD et est activé par défaut. Il divise les longs discours en fichiers audio distincts afin que la transcription et la génération de réponses puissent commencer plus tôt.

Durée du morceau apparaît dans les paramètres avancés du VAD lorsque la segmentation est activée. Plage : 5 à 15 secondes, 7 secondes par défaut. Il limite la longueur maximale d'un fragment audio avant qu'il ne soit envoyé pour transcription.

Déclencheur d'arrêt d'enregistrement (microphone) apparaît dans les paramètres avancés du VAD lorsque la source inclut l’audio du microphone. Plage : 0,5 à 5 secondes, par défaut 0,5 seconde. Il définit la quantité de silence du microphone nécessaire pour terminer le fragment de parole en cours.

Déclencheur d'arrêt d'enregistrement (audio du système) apparaît dans les paramètres avancés du VAD lorsque la source inclut l’audio du système. Plage : 0,5 à 5 secondes, par défaut 1 seconde. Il définit la quantité de silence audio système nécessaire pour terminer le fragment de parole en cours.

Modifiez les paramètres avancés du VAD uniquement lorsque l'enregistrement s'arrête trop tôt, attend trop longtemps une pause ou envoie trop de fragments supplémentaires.

Basculer les paramètres

Durée du tampon apparaît dans Basculer. Plage : 0 à 15 secondes, 4 secondes par défaut. Il ajoute quelques secondes entre avant la pression et le début de l'enregistrement, ce qui est utile lorsque vous appuyez légèrement sur la touche de raccourci après le début de la phrase.

Envoyer des captures d'écran avec audio apparaît dans Toggle et est activé par défaut. Il joint automatiquement des captures d'écran du chat au fragment audio.

Vérifier l'audio pour la parole est dans les paramètres de bascule avancés et est activé par défaut. L'enregistrement passe par Silero VAD et les fragments sans parole sont supprimés. Désactivez-le uniquement si vous devez envoyer du son, y compris du silence et du bruit.

Paramètres ponctuels

Durée de capture apparaît dans Oneshot. Plage : 5 à 60 secondes, 20 secondes par défaut. Il définit le nombre de dernières secondes à extraire du tampon lorsque vous appuyez sur la touche de raccourci.

Effacer le tampon après la capture apparaît dans Oneshot et est désactivé par défaut. Lorsqu'il est activé, il efface le tampon après chaque instantané afin que la prochaine pression ne renvoie pas l'audio déjà transcrit.

Envoyer des captures d'écran avec audio apparaît dans Oneshot et est activé par défaut. Il joint automatiquement des captures d'écran du chat au fragment audio.

Vérifier l'audio pour la parole est dans les paramètres avancés de Oneshot et est activé par défaut. L'enregistrement passe par Silero VAD et les fragments sans parole sont supprimés. Désactivez-le uniquement si vous devez envoyer du son, y compris du silence et du bruit.


Foire aux questions

L'enregistrement déclenche le bruit

Le réseau neuronal filtre bien les sons non vocaux, mais des niveaux de bruit de fond élevés peuvent provoquer de faux déclenchements. Essayez de réduire la sensibilité du microphone dans les paramètres système ou utilisez un casque.

Coupe le début des phrases

En mode manuel : augmentez la longueur du tampon.

Les enregistrements sont rejetés comme vides

Le réseau neuronal vérifie la présence vocale de chaque enregistrement. Si le modèle ne détecte pas la voix (par exemple, seul un bruit de fond ou de la musique a été enregistré), l'enregistrement est automatiquement supprimé. Assurez-vous que votre microphone est correctement configuré et que votre discours est suffisamment clair.