Wie erstellt man einen train/val/test-Split und einen Benchmark? Wie teilt man die Daten richtig auf?
Machine Learning / AI
Erzählen Sie mir von der Aufgabe der Aussprachebewertung: Wie geht man bei der Verbesserung des Modells vor, das Fehler in der Aussprache von Phonemen und Lauten erkennt?
Haben Sie LR in einem kleinen Auto gefunden, die Batch-Größe ist im Cluster um das 1000-fache gestiegen. Sollte man LR ändern?
Was tun, wenn der Test bereits verwendet wurde und ein schlechtes Ergebnis zeigte?
Wann train, validation, test und benchmark verwenden?
Es gibt viele Hyperparameter des Optimierers, 10.000 Experimente, wenig Zeit aber viele Ressourcen. Welche Ansätze gibt es, um die optimale Kombination zu finden?
Wie trainieren wir das Phonem-Klassifikationsmodell? Was ist im Ziel?
Was wird neben dem Audio-Embedding in den Klassifikator eingespeist?
Welche Klassifizierungsaufgabe lösen wir bei der Bewertung der Aussprache von Phonemen?
Welche Ideen können ausprobiert werden, um eine genaue Ausrichtung der Phoneme zu erreichen?
Wann muss man den Test wechseln? Wie unterscheidet man zwischen einem Fall, in dem der Test veraltet ist, und einem Fall, in dem der Test durch mehrfachen Gebrauch erschöpft ist?
Wie erkennt man in der Praxis, dass ein Test erschöpft ist oder dass eine Verteilungsverschiebung stattgefunden hat?
Wenn die Batch-Größe größer ist, wird der Gradient kleiner oder größer?
Wie man eine erzwungene Ausrichtung macht — bestimmen, welcher Phonem von welcher Sekunde bis zu welcher Sekunde klingt?
Warum ist zufällig besser als Gitter, selbst in 2D: Vergleich zwischen einem 100x100 Gitter und 10.000 zufälligen Punkten?
Sind Lernrate und Batch-Größe unabhängige Parameter? Gibt es eine Verbindung zwischen ihnen?
Wie markiert man Audiodaten?
Wie geht man bei der Ausrichtung eines einzelnen Wortes nach Phonemen vor? Wie verwendet man wav2vec2, um genaue Grenzen der Phoneme zu erhalten?
Wie man das Training auf der eigenen Domain angeht? Was tun mit dem Generalmodell?
Wie trainiert man das Modell? Seq-to-seq ist teuer, es gibt viele Hyperparameter. Wie macht man das?