Eğitim/doğrulama/test bölünmesi ve kıyaslama nasıl oluşturulur? Verileri nasıl doğru şekilde bölmeliyiz?
Machine Learning / AI
Telaffuz değerlendirme görevi hakkında bana bilgi ver: Sesler ve fonemlerdeki hataları tespit eden modeli nasıl geliştirebilirsiniz?
Küçük bir araçta LR buldular, küme içinde batch boyutu 1000 kat arttı. LR'yi değiştirmeli mi?
Test zaten kullanıldıysa ve kötü sonuç gösterdiyse ne yapılmalı?
Ne zaman train, validation, test ve benchmark kullanmalı?
Optimizörün birçok hiperparametresi var, 10.000 deneme, az zaman ama çok kaynak. En iyi kombinasyonu bulmak için hangi yaklaşımlar kullanılabilir?
Fonem sınıflandırma modelini nasıl eğitiyoruz? Hedefte ne var?
Sınıflayıcıya ses gömme dışında ne girer?
Sesli harflerin telaffuzunu değerlendirirken hangi sınıflandırma görevini çözüyoruz?
Fonemlerin kesin hizalanması için hangi fikirler denenebilir?
Test ne zaman değiştirilmelidir? Testin güncel olmama durumu ile çoklu kullanım nedeniyle tükenmiş olma durumunu nasıl ayırt edebilirsiniz?
Pratikte testin tükendiğini veya dağılım kaymasının gerçekleştiğini nasıl fark edebilirsiniz?
Batch boyutu daha büyükse, gradyan daha mı küçük yoksa daha mı büyük olur?
Zorunlu hizalama nasıl yapılır — her fonemin hangi saniyeden hangi saniyeye kadar seslendiğini belirlemek?
100x100 ızgarası ile 10000 rastgele nokta — neden rastgele 2D'de bile ızgaradan daha iyidir?
Öğrenme Hızı ve Toplu Boyutu bağımsız parametreler mi? Aralarında bir bağlantı var mı?
Ses verilerini nasıl etiketlersiniz?
Bir kelimenin fonemlere göre hizalanmasına nasıl yaklaşılır? wav2vec2 nasıl kullanılır, doğru fonem sınırları almak için?
Kendi alanınızda eğitime nasıl yaklaşmalısınız? Genel modelle ne yapmalı?
Model nasıl eğitilir? Seq-to-seq maliyetli, birçok hiperparametre var. Nasıl yapılır?