Sobes.tech

Audioaufnahme

Fragen zur Audioaufnahme

Aufnahmemodi

Der Aufnahmemodus definiert, was passiert, wenn Sie die Aufnahmetaste oder den Hotkey drücken. In allen Modi sendet die App nur Fragmente zur Transkription, in denen Sprache erkannt wird.

Automatisch (VAD)

VAD eignet sich am besten für regelmäßige Gespräche, Interviews und Anrufe, bei denen die Sprache beginnen und aufhören kann, ohne dass Sie jedes einzelne Fragment verwalten müssen.

Wichtig: Sie müssen VAD weiterhin mit der Aufnahmetaste oder dem Hotkey einschalten. Nach dem Einschalten hört die App die ausgewählten Audioquellen und erkennt Sprache automatisch. Wenn jemand spricht, wird das Fragment aufgezeichnet. Nach einer Pause wird das Fragment geschlossen und zur Transkription gesendet. Wenn Sie VAD ausschalten, beendet die App die Audioanalyse.

So funktioniert es:

  1. Sie schalten VAD ein
  2. Die App hört sich die ausgewählten Audioquellen an und sucht nach Sprache
  3. Wenn Sprache erkannt wird, beginnt ein Aufnahmefragment
  4. Nach einer Pause wird das Fragment zur Transkription gesendet
  5. Wenn das Sprechen über einen längeren Zeitraum andauert, kann die Aufnahme in Abschnitte aufgeteilt werden
VAD diagram: turn on, detect speech, record, and transcribe

Manuell (umschalten)

Die Option „Umschalten“ eignet sich für Fälle, in denen Sie den Anfang und das Ende eines Fragments selbst auswählen möchten. Das erste Drücken der Aufnahmetaste bzw Strg+R startet die Aufnahme, beim zweiten Drücken stoppt sie und sendet den Ton zur Transkription.

Bevor die Aufnahme beginnt, hält die App einen kurzen Hintergrundpuffer. Wenn Sie den Hotkey kurz nach Beginn einer Phrase drücken, können die ersten Sekunden noch eingefügt werden. Wenn das letzte Fragment keine Sprache enthält, wird es automatisch verworfen.

Start / Stop diagram: buffer, start, recording, stop, and transcription

One-Shot (Oneshot)

One-Shot ist für Fragen gedacht, die Sie vollständig hören möchten, bevor Sie nach einer Antwort fragen. Starten Sie die Aufnahme nicht vorzeitig: Warten Sie, bis die andere Person fertig ist, und drücken Sie dann die Aufnahmetaste oder Strg+R. Die App entnimmt dem Puffer die neuesten Audiodaten, transkribiert sie und verwendet sie für die Antwort.

Dieser Modus ist nützlich, wenn Sie nicht im Voraus wissen, welcher Moment wichtig ist. Es wird kein langes Start-Stopp-Segment aufgezeichnet. Es wird ein kurzer Schnappschuss des aktuellen Audiomaterials erstellt.

One-shot diagram: rolling buffer, last seconds, hotkey, and transcription

Aufnahmemodus auswählen

Öffnen Sie die Einstellungen (Zahnradsymbol im Seitenmenü), Abschnitt „Audioaufnahme“. Hier können Sie den Aufnahmemodus auswählen und weitere Parameter konfigurieren.

Sobes Copilot voice recording settings

Alle Aufnahmeeinstellungen

Die Aufnahmeeinstellungen finden Sie in den App-Einstellungen unter „Audioaufnahme“. Einige Elemente werden nur für einen bestimmten Aufnahmemodus, eine bestimmte Audioquelle, eine bestimmte Plattform oder eine bestimmte App-Version angezeigt.

Grundeinstellungen

Audioquelle ist immer sichtbar. Es wählt aus, was aufgenommen werden soll: Systemaudio + Mikrofon, nur Systemaudio oder nur Mikrofon.

Aufnahmemodus ist immer sichtbar. Es definiert das Verhalten der Aufnahmetaste: VAD, Toggle oder Oneshot.

Mikrofon erscheint, wenn die ausgewählte Quelle Mikrofon-Audio enthält. Hier können Sie ein bestimmtes Eingabegerät auswählen. Wenn Sie „Standard“ beibehalten, wird das Standardmikrofon des Systems verwendet.

Ausgabegerät wird unter Windows angezeigt, wenn die ausgewählte Quelle Systemaudio enthält. Es wählt die Lautsprecher oder Kopfhörer aus, deren Audio aufgezeichnet werden soll.

Audioquelle

Systemaudio + Mikrofon ist für Anrufe und Interviews geeignet: Es erfasst sowohl Ihre Stimme als auch den Ton der anderen Person.

Nur System-Audio Erfasst App- oder Lautsprecher-Audio. Ihr Mikrofon ist nicht im Lieferumfang enthalten.

Nur Mikrofon erfasst nur Ihre Stimme. Verwenden Sie es, wenn Sie kein Systemaudio benötigen oder wenn Systemaudio im Weg ist.

VAD-Einstellungen

Chunking befindet sich in den erweiterten VAD-Einstellungen und ist standardmäßig aktiviert. Lange Redebeiträge werden in separate Audiodateien aufgeteilt, sodass die Transkription und Antwortgenerierung früher beginnen kann.

Chunk-Dauer wird in den erweiterten VAD-Einstellungen angezeigt, wenn Chunking aktiviert ist. Bereich: 5 bis 15 Sekunden, Standard 7 Sekunden. Es begrenzt die maximale Länge eines Audiofragments, bevor es zur Transkription gesendet wird.

Aufnahme-Stopp-Trigger (Mikrofon) wird in den erweiterten VAD-Einstellungen angezeigt, wenn die Quelle Mikrofonaudio enthält. Bereich: 0,5 bis 5 Sekunden, Standard 0,5 Sekunden. Hier wird festgelegt, wie viel Mikrofonstille erforderlich ist, um das aktuelle Sprachfragment zu beenden.

Aufnahme-Stopp-Trigger (Systemaudio) wird in den erweiterten VAD-Einstellungen angezeigt, wenn die Quelle Systemaudio enthält. Bereich: 0,5 bis 5 Sekunden, Standard 1 Sekunde. Es legt fest, wie viel System-Audio-Stille erforderlich ist, um das aktuelle Sprachfragment zu beenden.

Ändern Sie die erweiterten VAD-Einstellungen nur, wenn die Aufnahme zu früh stoppt, zu lange auf eine Pause wartet oder zu viele zusätzliche Fragmente sendet.

Einstellungen umschalten

Pufferdauer erscheint in Toggle. Bereich: 0 bis 15 Sekunden, Standard 4 Sekunden. Es werden ein paar Sekunden von vor dem Drücken bis zum Beginn der Aufnahme hinzugefügt, was hilfreich ist, wenn Sie den Hotkey kurz nach Beginn der Phrase drücken.

Senden Sie Screenshots mit Audio erscheint in „Toggle“ und ist standardmäßig aktiviert. Es fügt dem Audiofragment automatisch Screenshots aus dem Chat hinzu.

Überprüfen Sie den Ton auf Sprache befindet sich in den erweiterten Toggle-Einstellungen und ist standardmäßig aktiviert. Die Aufnahme wird durch Silero VAD geleitet und Fragmente ohne Sprache werden verworfen. Deaktivieren Sie es nur, wenn Sie Audio, einschließlich Stille und Rauschen, senden müssen.

Oneshot-Einstellungen

Aufnahmedauer erscheint in Oneshot. Bereich: 5 bis 60 Sekunden, Standard 20 Sekunden. Es legt fest, wie viele letzte Sekunden aus dem Puffer entnommen werden sollen, wenn Sie den Hotkey drücken.

Puffer nach der Erfassung löschen erscheint in Oneshot und ist standardmäßig deaktiviert. Wenn diese Option aktiviert ist, wird der Puffer nach jedem Schnappschuss gelöscht, sodass beim nächsten Drücken nicht bereits transkribierte Audiodaten erneut gesendet werden.

Senden Sie Screenshots mit Audio erscheint in Oneshot und ist standardmäßig aktiviert. Es fügt dem Audiofragment automatisch Screenshots aus dem Chat hinzu.

Überprüfen Sie den Ton auf Sprache befindet sich in den erweiterten Oneshot-Einstellungen und ist standardmäßig aktiviert. Die Aufnahme wird durch Silero VAD geleitet und Fragmente ohne Sprache werden verworfen. Deaktivieren Sie es nur, wenn Sie Audio, einschließlich Stille und Rauschen, senden müssen.


Häufig gestellte Fragen

Aufnahme wird durch Lärm ausgelöst

Das neuronale Netzwerk filtert Nicht-Sprachgeräusche gut, hohe Hintergrundgeräuschpegel können jedoch zu Fehlauslösungen führen. Versuchen Sie, die Mikrofonempfindlichkeit in den Systemeinstellungen zu reduzieren oder ein Headset zu verwenden.

Schneidet den Satzanfang ab

Im manuellen Modus: Erhöhen Sie die Pufferlänge.

Aufzeichnungen werden als leer verworfen

Das neuronale Netzwerk prüft jede Aufnahme auf Sprachpräsenz. Wenn das Modell keine Stimme erkennt (z. B. wurden nur Hintergrundgeräusche oder Musik aufgenommen), wird die Aufnahme automatisch verworfen. Stellen Sie sicher, dass Ihr Mikrofon richtig konfiguriert ist und Ihre Sprache klar genug ist.