როგორ შევქმნათ train/val/test განაწილება და ბენჩმარკი? როგორ დავყოფთ მონაცემებს სწორად?
Machine Learning / AI
სიტყვის წარმოთქმის შეფასების დავალების შესახებ ისაუბრე: როგორ მიუდგეთ მოდელის გაუმჯობესებას, რომელიც ამჩნევს ფონემებისა და ხმების წარმოთქმის შეცდომებს?
პატარა მანქანაზე LR იპოვეს, კლასტერში batch ზომა 1000 ჯერ გაიზარდა. უნდა შეიცვალოს LR?
თუ ტესტი უკვე გამოყენებულია და ცუდი შედეგი აჩვენა, რა უნდა გავაკეთოთ?
როდის გამოიყენება train, validation, test და benchmark?
მეტია ჰიპერპარამეტრები ოპტიმიზატორისთვის, 10,000 ექსპერიმენტი, ცოტა დრო მაგრამ ბევრი რესურსი. რა მიდგომები არსებობს ოპტიმალური კომბინაციის ძიებისთვის?
რას შედის კლასიფიკატორში აუდიოს ემბედინგის გარდა?
როგორ ვასწავლით ფონემების კლასიფიკაციის მოდელს? რა არის მიზანში?
რომელ კლასიფიკაციის დავალებას ვხსნით ფონემების წარმოთქმის შეფასებისას?
რა იდეებს შეიძლება სცადოთ ფონემების ზუსტი განლაგებისთვის?
როდის უნდა შეიცვალოს ტესტი? როგორ განვსაზღვროთ შემთხვევა, როდესაც ტესტი მოძველებულია და შემთხვევა, როდესაც ტესტი დაიწვა მრავალჯერადი გამოყენების გამო?
როგორ იგრძნოთ პრაქტიკაში, რომ ტესტი ამოწურულია ან მოხდა განაწილების ცვლილება?
თუ ბეტჩის ზომა დიდია, გრადიენტი იქნება პატარა თუ დიდი?
რატომ არის შემთხვევითი უკეთესი, თუნდაც 2D-ში: შედარება 100x100 გრაფიკსა და 10,000 შემთხვევით წერტილებს შორის?
როგორ გავაკეთოთ ძალადობრივი შესაბამისობა — განსაზღვროთ, რომელი ფონემა რომელ წამიდან რომელ წამამდე ჟღერს?
სწავლების სიჩქარე და პარტიის ზომა დამოუკიდებელი პარამეტრებია? არსებობს მათ შორის კავშირი?
როგორ მონიშნოთ აუდიო მონაცემები?
როგორ მივუდგეთ ჩვენს დომენზე სწავლას? რა უნდა გავაკეთოთ ზოგად მოდელთან?
როგორ მივუდგეთ ერთ სიტყვას ფონემების შესაბამისობას? როგორ გამოვიყენოთ wav2vec2 ზუსტი ფონემების საზღვრების მისაღებად?
როგორ ვასწავლოთ მოდელი? Seq-to-seq ძვირი ღირს, ბევრი ჰიპერპარამეტრი არსებობს. როგორ გავაკეთოთ ეს?