Как да създадем разделяне train/val/test и бенчмарк? Как правилно да разделим данните?
Machine Learning / AI
Разкажи за задачата по оценка на произношението: как да подходиш към подобряване на модела, който определя грешки в произношението на фонемите и звуците?
Намериха LR на малка кола, размерът на партидата се увеличи 1000 пъти в клъстера. Трябва ли да променя LR?
Какво да правите, ако тестът вече е бил използван и е показал лош резултат?
Каква задача за класификация решаваме при оценката на произношението на фонемите?
Кога да използвате train, validation, test и benchmark?
Има много хиперпараметри на оптимизатора, 10 000 експеримента, малко време, но много ресурси. Какви подходи има за търсене на оптималната комбинация?
Как обучаваме модела за класификация на фонемите? Какво има в целта?
Какво влиза в класификатора освен аудио ембединг?
Какви идеи могат да бъдат опитани за точно подравняване на фонемите?
Как на практика да почувствате, че тестът е изчерпан или е настъпила промяна в разпределението?
Кога трябва да смените теста? Как да различите случай, когато тестът е остарял, от случай, когато тестът е изгорял поради многократна употреба?
Ако размерът на батча е по-голям, градиентът ще бъде по-малък или по-голям?
Как да направите принудително съгласуване — да определите от коя до коя секунда звучи всяка фонема?
Скоростта на обучение и размерът на партидата са независими параметри? Има ли връзка между тях?
Мрежа 100x100 срещу 10000 случайни точки — защо случайният е по-добър от мрежата дори и в 2D?
Как да подходите към обучението на вашия домейн? Какво да правите с общия модел?
Как да маркираме аудио данни?
Как да обучим модела? Seq-to-seq е скъп, има много хиперпараметри. Как да го направим?
Как да подходите към подравняването на една дума по фонеми? Как да използваме wav2vec2 за получаване на точни граници на фонемите?