Hoe maak je een train/val/test split en een benchmark? Hoe verdeel je de gegevens correct?
Machine Learning / AI
Vertel me over de taak van de uitspraakbeoordeling: hoe pak je het verbeteren van het model aan dat fouten in de uitspraak van fonemen en geluiden detecteert?
Ze vonden LR op een kleine auto, de batchgrootte is in de cluster 1000 keer toegenomen. Moet de LR worden gewijzigd?
Wat te doen als de test al is gebruikt en een slecht resultaat heeft getoond?
Wanneer train, validation, test en benchmark gebruiken?
Er zijn veel hyperparameters van de optimizer, 10.000 experimenten, weinig tijd maar veel middelen. Welke benaderingen zijn er om de optimale combinatie te vinden?
Wat gaat er naast de audio-embedding in de classifier?
Hoe trainen we het fonemclassificatiemodel? Wat zit er in de target?
Welke classificatietaak lossen we op bij het beoordelen van de uitspraak van fonemen?
Welke ideeën kunnen worden geprobeerd voor een nauwkeurige afstemming van fonemen?
Wanneer moet je de test vervangen? Hoe onderscheid je een geval waarin de test verouderd is van een geval waarin de test is uitgeput door herhaald gebruik?
Hoe merk je in de praktijk dat een test op is of dat er een distributieverschuiving heeft plaatsgevonden?
Als de batchgrootte groter is, wordt de gradient dan kleiner of groter?
Rooster 100x100 vs 10000 willekeurige punten — waarom is random zelfs in 2D beter dan een rooster?
Hoe doe je een gedwongen uitlijning — bepalen vanaf welke seconde tot welke seconde elke fonem klinkt?
Zijn de leersnelheid en batchgrootte onafhankelijke parameters? Is er een verband tussen hen?
Hoe markeer je audiogegevens?
Hoe pak je training aan op je eigen domein? Wat doe je met het algemene model?
Hoe pak je het uitlijnen van één woord op fonemen aan? Hoe gebruik je wav2vec2 om nauwkeurige grenzen van fonemen te krijgen?
Hoe het model trainen? Seq-to-seq is duur, er zijn veel hyperparameters. Hoe doe je dat?