Aufnahmemodi
Der Aufnahmemodus definiert, was passiert, wenn Sie die Aufnahmetaste oder den Hotkey drücken. In allen Modi sendet die App nur Fragmente zur Transkription, in denen Sprache erkannt wird.
Automatisch (VAD)
VAD eignet sich am besten für regelmäßige Gespräche, Interviews und Anrufe, bei denen die Sprache beginnen und aufhören kann, ohne dass Sie jedes einzelne Fragment verwalten müssen.
Wichtig: Sie müssen VAD weiterhin mit der Aufnahmetaste oder dem Hotkey einschalten. Nach dem Einschalten hört die App die ausgewählten Audioquellen und erkennt Sprache automatisch. Wenn jemand spricht, wird das Fragment aufgezeichnet. Nach einer Pause wird das Fragment geschlossen und zur Transkription gesendet. Wenn Sie VAD ausschalten, beendet die App die Audioanalyse.
So funktioniert es:
- Sie schalten VAD ein
- Die App hört sich die ausgewählten Audioquellen an und sucht nach Sprache
- Wenn Sprache erkannt wird, beginnt ein Aufnahmefragment
- Nach einer Pause wird das Fragment zur Transkription gesendet
- Wenn das Sprechen über einen längeren Zeitraum andauert, kann die Aufnahme in Abschnitte aufgeteilt werden
Manuell (umschalten)
Die Option „Umschalten“ eignet sich für Fälle, in denen Sie den Anfang und das Ende eines Fragments selbst auswählen möchten. Das erste Drücken der Aufnahmetaste bzw Strg+R startet die Aufnahme, beim zweiten Drücken stoppt sie und sendet den Ton zur Transkription.
Bevor die Aufnahme beginnt, hält die App einen kurzen Hintergrundpuffer. Wenn Sie den Hotkey kurz nach Beginn einer Phrase drücken, können die ersten Sekunden noch eingefügt werden. Wenn das letzte Fragment keine Sprache enthält, wird es automatisch verworfen.
One-Shot (Oneshot)
One-Shot ist für Fragen gedacht, die Sie vollständig hören möchten, bevor Sie nach einer Antwort fragen. Starten Sie die Aufnahme nicht vorzeitig: Warten Sie, bis die andere Person fertig ist, und drücken Sie dann die Aufnahmetaste oder Strg+R. Die App entnimmt dem Puffer die neuesten Audiodaten, transkribiert sie und verwendet sie für die Antwort.
Dieser Modus ist nützlich, wenn Sie nicht im Voraus wissen, welcher Moment wichtig ist. Es wird kein langes Start-Stopp-Segment aufgezeichnet. Es wird ein kurzer Schnappschuss des aktuellen Audiomaterials erstellt.
Aufnahmemodus auswählen
Öffnen Sie die Einstellungen (Zahnradsymbol im Seitenmenü), Abschnitt „Audioaufnahme“. Hier können Sie den Aufnahmemodus auswählen und weitere Parameter konfigurieren.
Alle Aufnahmeeinstellungen
Die Aufnahmeeinstellungen finden Sie in den App-Einstellungen unter „Audioaufnahme“. Einige Elemente werden nur für einen bestimmten Aufnahmemodus, eine bestimmte Audioquelle, eine bestimmte Plattform oder eine bestimmte App-Version angezeigt.
Grundeinstellungen
Audioquelle ist immer sichtbar. Es wählt aus, was aufgenommen werden soll: Systemaudio + Mikrofon, nur Systemaudio oder nur Mikrofon.
Aufnahmemodus ist immer sichtbar. Es definiert das Verhalten der Aufnahmetaste: VAD, Toggle oder Oneshot.
Mikrofon erscheint, wenn die ausgewählte Quelle Mikrofon-Audio enthält. Hier können Sie ein bestimmtes Eingabegerät auswählen. Wenn Sie „Standard“ beibehalten, wird das Standardmikrofon des Systems verwendet.
Ausgabegerät wird unter Windows angezeigt, wenn die ausgewählte Quelle Systemaudio enthält. Es wählt die Lautsprecher oder Kopfhörer aus, deren Audio aufgezeichnet werden soll.
Audioquelle
Systemaudio + Mikrofon ist für Anrufe und Interviews geeignet: Es erfasst sowohl Ihre Stimme als auch den Ton der anderen Person.
Nur System-Audio Erfasst App- oder Lautsprecher-Audio. Ihr Mikrofon ist nicht im Lieferumfang enthalten.
Nur Mikrofon erfasst nur Ihre Stimme. Verwenden Sie es, wenn Sie kein Systemaudio benötigen oder wenn Systemaudio im Weg ist.
VAD-Einstellungen
Chunking befindet sich in den erweiterten VAD-Einstellungen und ist standardmäßig aktiviert. Lange Redebeiträge werden in separate Audiodateien aufgeteilt, sodass die Transkription und Antwortgenerierung früher beginnen kann.
Chunk-Dauer wird in den erweiterten VAD-Einstellungen angezeigt, wenn Chunking aktiviert ist. Bereich: 5 bis 15 Sekunden, Standard 7 Sekunden. Es begrenzt die maximale Länge eines Audiofragments, bevor es zur Transkription gesendet wird.
Aufnahme-Stopp-Trigger (Mikrofon) wird in den erweiterten VAD-Einstellungen angezeigt, wenn die Quelle Mikrofonaudio enthält. Bereich: 0,5 bis 5 Sekunden, Standard 0,5 Sekunden. Hier wird festgelegt, wie viel Mikrofonstille erforderlich ist, um das aktuelle Sprachfragment zu beenden.
Aufnahme-Stopp-Trigger (Systemaudio) wird in den erweiterten VAD-Einstellungen angezeigt, wenn die Quelle Systemaudio enthält. Bereich: 0,5 bis 5 Sekunden, Standard 1 Sekunde. Es legt fest, wie viel System-Audio-Stille erforderlich ist, um das aktuelle Sprachfragment zu beenden.
Einstellungen umschalten
Pufferdauer erscheint in Toggle. Bereich: 0 bis 15 Sekunden, Standard 4 Sekunden. Es werden ein paar Sekunden von vor dem Drücken bis zum Beginn der Aufnahme hinzugefügt, was hilfreich ist, wenn Sie den Hotkey kurz nach Beginn der Phrase drücken.
Senden Sie Screenshots mit Audio erscheint in „Toggle“ und ist standardmäßig aktiviert. Es fügt dem Audiofragment automatisch Screenshots aus dem Chat hinzu.
Überprüfen Sie den Ton auf Sprache befindet sich in den erweiterten Toggle-Einstellungen und ist standardmäßig aktiviert. Die Aufnahme wird durch Silero VAD geleitet und Fragmente ohne Sprache werden verworfen. Deaktivieren Sie es nur, wenn Sie Audio, einschließlich Stille und Rauschen, senden müssen.
Oneshot-Einstellungen
Aufnahmedauer erscheint in Oneshot. Bereich: 5 bis 60 Sekunden, Standard 20 Sekunden. Es legt fest, wie viele letzte Sekunden aus dem Puffer entnommen werden sollen, wenn Sie den Hotkey drücken.
Puffer nach der Erfassung löschen erscheint in Oneshot und ist standardmäßig deaktiviert. Wenn diese Option aktiviert ist, wird der Puffer nach jedem Schnappschuss gelöscht, sodass beim nächsten Drücken nicht bereits transkribierte Audiodaten erneut gesendet werden.
Senden Sie Screenshots mit Audio erscheint in Oneshot und ist standardmäßig aktiviert. Es fügt dem Audiofragment automatisch Screenshots aus dem Chat hinzu.
Überprüfen Sie den Ton auf Sprache befindet sich in den erweiterten Oneshot-Einstellungen und ist standardmäßig aktiviert. Die Aufnahme wird durch Silero VAD geleitet und Fragmente ohne Sprache werden verworfen. Deaktivieren Sie es nur, wenn Sie Audio, einschließlich Stille und Rauschen, senden müssen.
Häufig gestellte Fragen
Aufnahme wird durch Lärm ausgelöst
Das neuronale Netzwerk filtert Nicht-Sprachgeräusche gut, hohe Hintergrundgeräuschpegel können jedoch zu Fehlauslösungen führen. Versuchen Sie, die Mikrofonempfindlichkeit in den Systemeinstellungen zu reduzieren oder ein Headset zu verwenden.
Schneidet den Satzanfang ab
Im manuellen Modus: Erhöhen Sie die Pufferlänge.
Aufzeichnungen werden als leer verworfen
Das neuronale Netzwerk prüft jede Aufnahme auf Sprachpräsenz. Wenn das Modell keine Stimme erkennt (z. B. wurden nur Hintergrundgeräusche oder Musik aufgenommen), wird die Aufnahme automatisch verworfen. Stellen Sie sicher, dass Ihr Mikrofon richtig konfiguriert ist und Ihre Sprache klar genug ist.