Sobes.tech

Audio-opname

Vragen over audio-opname

Opnamemodi

De opnamemodus bepaalt wat er gebeurt als je op de opnameknop of sneltoets drukt. In alle modi stuurt de app alleen fragmenten waar spraak wordt gedetecteerd voor transcriptie.

Automatisch (VAD)

VAD is het beste voor gewone gesprekken, interviews en gesprekken waarbij spraak kan beginnen en stoppen zonder dat je elk fragment hoeft te beheren.

Belangrijk: je moet VAD nog steeds aanzetten met de opnameknop of sneltoets. Nadat deze is ingeschakeld, luistert de app naar de geselecteerde audiobronnen en detecteert automatisch spraak. Wanneer iemand spreekt, wordt het fragment opgenomen. Na een pauze wordt het fragment gesloten en voor transcriptie gestuurd. Wanneer je VAD uitzet, stopt de app met het analyseren van audio.

Hoe het werkt:

  1. Je zet VAD aan
  2. De app luistert naar de geselecteerde audiobronnen en zoekt naar spraak
  3. Wanneer spraak wordt gedetecteerd, begint een opnamefragment
  4. Na een pauze wordt het fragment ter transcriptie gestuurd
  5. Als spraak lang doorgaat, kan de opname worden opgesplitst in stukken
VAD diagram: turn on, detect speech, record, and transcribe

Handmatig (Schakel)

Toggle is voor gevallen waarin je zelf het begin en einde van een fragment wilt kiezen. De eerste druk op de opnameknop of Ctrl+R start de opname, en de tweede druk stopt het en stuurt de audio naar transcriptie.

Voordat de opname begint, houdt de app een korte achtergrondbuffer bij. Als je de sneltoets net na het begin van een frase indrukt, kunnen de eerste seconden nog steeds worden opgenomen. Als het laatste fragment geen spraak bevat, wordt het automatisch weggegooid.

Start / Stop diagram: buffer, start, recording, stop, and transcription

One-shot (Oneshot)

One-shot is voor vragen die je volledig wilt horen voordat je om een antwoord vraagt. Begin niet van tevoren met opnemen: wacht tot de ander klaar is, druk dan op de opnameknop of Ctrl+R. De app neemt het nieuwste geluid uit de buffer, transcribeert het en gebruikt het als antwoord.

Deze modus is handig als je van tevoren niet weet welk moment van belang zal zijn. Het neemt geen lang segment van start tot stop op; Het maakt een korte momentopname van recente audio.

One-shot diagram: rolling buffer, last seconds, hotkey, and transcription

Opnamemodus selecteren

Open instellingen (tandwielpictogram in het zijmenu), sectie "Audio Recording". Hier kun je de opnamemodus selecteren en andere parameters configureren.

Sobes Copilot voice recording settings

Alle opname-instellingen

Opname-instellingen staan in de app-instellingen onder "Audio Recording". Sommige items verschijnen alleen voor een specifieke opnamemodus, audiobron, platform of app-versie.

Basisinstellingen

Audio Source is altijd zichtbaar. Het kiest wat er wordt opgenomen: systeemaudio + microfoon, alleen systeemaudio, of alleen microfoon.

Opnamemodus is altijd zichtbaar. Het definieert het gedrag van de opnameknop: VAD, Toggle of Oneshot.

Microfoon verschijnt wanneer de geselecteerde bron microfoonaudio bevat. Je kunt hier een specifiek invoerapparaat kiezen. Als je "Default" aanhoudt, wordt de standaard microfoon van het systeem gebruikt.

Uitvoerapparaat verschijnt op Windows wanneer de geselecteerde bron systeemaudio bevat. Het kiest de luidsprekers of koptelefoons waarvan het geluid wordt opgenomen.

Audiobron

Systeemaudio + microfoon is voor gesprekken en interviews: het vangt zowel jouw stem als het geluid van de ander op.

Alleen systeemaudio neemt app- of luidsprekergeluid op. Je microfoon zit niet bij je.

Alleen microfoon vangt alleen je stem op. Gebruik het wanneer je geen systeemaudio nodig hebt of wanneer systeemaudio in de weg zit.

VAD-instellingen

Chunking staat in geavanceerde VAD-instellingen en staat standaard aan. Het splitst lange spraak op in aparte audiobestanden zodat transcriptie en antwoordgeneratie eerder kunnen beginnen.

Chunk Duration verschijnt in geavanceerde VAD-instellingen wanneer chunking is ingeschakeld. Bereik: 5 tot 15 seconden, standaard 7 seconden. Het beperkt de maximale lengte van één audiofragment voordat het wordt verzonden voor transcriptie.

Recording Stop Trigger (microfoon) verschijnt in geavanceerde VAD-instellingen wanneer de bron microfoonaudio bevat. Bereik: 0,5 tot 5 seconden, standaard 0,5 seconden. Het bepaalt hoeveel microfoonstilte nodig is om het huidige spraakfragment af te maken.

Recording Stop Trigger (systeemaudio) verschijnt in geavanceerde VAD-instellingen wanneer de bron systeemaudio bevat. Bereik: 0,5 tot 5 seconden, standaard 1 seconde. Het stelt in hoeveel systeem-audio stilte nodig is om het huidige spraakfragment af te maken.

Verander geavanceerde VAD-instellingen alleen als de opname te vroeg stopt, te lang wacht op een pauze, of te veel extra fragmenten stuurt.

Instellingen wisselen

Buffer Duration verschijnt in Toggle. Bereik: 0 tot 15 seconden, standaard 4 seconden. Het voegt een paar seconden toe van voor het drukken tot het begin van de opname, wat helpt als je de sneltoets net na het begin van de frase indrukt.

Screenshots met audio sturen verschijnt in Toggle en staat standaard aan. Het voegt automatisch screenshots van de chat toe aan het audiofragment.

Audio controleren op spraak staat in de geavanceerde Toggle-instellingen en staat standaard aan. De opname wordt door Silero VAD gestuurd, en fragmenten zonder spraak worden weggegooid. Schakel het alleen uit als je audio moet sturen, inclusief stilte en ruis.

Oneshot-instellingen

Capture Duration verschijnt in Oneshot. Bereik: 5 tot 60 seconden, standaard 20 seconden. Het stelt in hoeveel laatste seconden je van de buffer moet nemen wanneer je op de sneltoets drukt.

Clear buffer after capture verschijnt in Oneshot en staat standaard uit. Wanneer ingeschakeld, wordt de buffer na elke snapshot verwijderd zodat de volgende druk niet de reeds getranscribeerde audio opnieuw verzendt.

Screenshots sturen met audio verschijnt in Oneshot en staat standaard aan. Het voegt automatisch screenshots van de chat toe aan het audiofragment.

Check audio for speech staat in de geavanceerde Oneshot-instellingen en staat standaard aan. De opname wordt door Silero VAD gestuurd, en fragmenten zonder spraak worden weggegooid. Schakel het alleen uit als je audio moet sturen, inclusief stilte en ruis.


Veelgestelde vragen

Opname van triggers uit ruis

Het neurale netwerk filtert niet-spraakgeluiden goed, maar hoge achtergrondruisniveaus kunnen valse triggers veroorzaken. Probeer de microfoongevoeligheid in de systeeminstellingen te verminderen of gebruik een headset.

Snijdt het begin van frases af

In handmatige modus — vergroot de bufferlengte.

Opnames worden als leeg weggegooid

Het neurale netwerk controleert elke opname op spraakaanwezigheid. Als het model geen stem detecteert (bijvoorbeeld alleen achtergrondgeluid of muziek is opgenomen), wordt de opname automatisch verwijderd. Zorg dat je microfoon goed is ingesteld en je spraak duidelijk genoeg is.