Po naujos modelio versijos vidutinė kokybės įvertinimas išaugo, tačiau redaktoriai sako, kad teisinių ir finansinių temų atsakymai žymiai pablogėjo. Kokį vizualizaciją darytumėte pirmiausia, kad nuspręstumėte, ar sustabdyti leidybą?
Machine Learning / AI
Pateikite pavyzdį, kai neteisingas BatchNorm naudojimas `eval()` režimu sukėlė klaidų prognozėse.
Praktinė užduotis Koks artefaktų rinkinys leidžia sąžiningai atkurti dviejų LoRA paleidimų palyginimą? - Tik galutinė kokybės lentelė. - Commit su kodu ir galutinės metrikos ekrano nuotrauka. - Eksperimento kodas ir konfigūracijos failas. - Kodas, duomenų hash, pagrindinis modelis, LoRA konfigūracija, priklausomybės ir paleidimo komanda. - Tik nuoroda į Git šaką. - Kodas, LoRA parametrai, pagrindinio modelio versija ir priklausomybės.
Kaip paprastai valdote duomenų ir modelių versijas tokiuose eksperimentuose?
Ar šiuo metu vyksta pokalbiai didelėse technologijų įmonėse, kaip Yandex ar Alfa?
Praktinė užduotis SQL užklausa 80 milijonų pranešimų sukuria dubliavimus po JOIN. Kokią veiksmą geriausia pradėti pirmiausia? - Patikrinti JOIN kardinalumą, raktus ir vykdymo planą prieš optimizaciją. - Sukurti indeksą viename jungimo lauke. - Eksportuoti rezultatą į CSV ir pašalinti dubliavimus Python. - Visada pridėti DISTINCT prie visų stulpelių. - Pridėti DISTINCT po rezultatų patikrinimo pavyzdyje. - Patikrinti jungimo raktus ir abiejų lentelių unikalumą.
Ar planuojate toliau likti Filipinuose ar persikelti į kitą šalį?
Ar galite išsamiau papasakoti, kas jums atrodė "prislėgta" klausimuose ir kaip tai paveikė jūsų požiūrį į pokalbį?
Ar turite patirties dirbant visiškai anglų kalbos komandoms?
Ar turite patirties su pokalbiais su DI?
Ar turite pasiūlymų rankose arba galutinius etapus kituose įmonėse?
Kaip kiekybiškai įvertintumėte išmetamųjų teršalų poveikį modelio metrikoms, pavyzdžiui, tikslumui ar F1 balui?
Kaip optimizuotumėte jungimo raktų indeksus, kad sumažintumėte dublikatus ir pagreitintumėte užklausą?
Įsivaizduokite, kad dirbate su modeliu PyTorch ir po jo perjungimo į vertinimo režimą eval() matote, kad metrikos fiksuotame 10 000 pavyzdžių testų rinkinyje keičiasi kiekvieno paleidimo metu. Fiksuojate atsitiktinių skaičių generatorių pradinę būseną, kad būtų galima pakartoti: kur dar gali būti paslėpta pokyčių priežastis? Paaiškinkite Dropout, BatchNorm ir torch.no_grad() vaidmenį ir įvardinkite metrikas su slenksčiais, kuriais patikrinsite rezultatų stabilumą.
Praktinė užduotis AI siūlo mokyti LoRA visus 2 milijonus nevalytų dialogų. Kuris kandidato atsakymas yra brandžiausias? - Pasitikėti AI: didelis korpusas pats išlygins klaidas. - Pirmiausia pakeisti promptą, nekeičiant duomenų. - Mokyti LoRA išvalytoje dalyje ir palyginti su pagrindiniu modeliu. - Prieš mokymą patikrinti atsitiktinį žymėjimo pavyzdį. - Pirmiausia patikrinti duomenis ir kokybę pagal temas atskirame rinkinyje, tada ribotai mokyti LoRA. - Mokyti visame korpuse, bet sumažinti LoRA rangą.
Įvertinkite savo anglų kalbą atskirai skaitymo/rakymo ir pokalbio lygiu pagal CEFR lygius.
Kaip tiksliai naudotumėte `EXPLAIN`, kad nustatytumėte našumo problemas šiame užklausoje?
Koks formalizacijos formatas jums yra patogiausias: GPH, IP ar TК?
Klausimų generavimui didelis kalbos modelis sunkiai išlaiko stilių retomis temomis. DI pagalbininkas siūlo nedelsiant paleisti LoRA visame istorinės korpuso iš 2 milijonų dialogų, tačiau žymėjimas yra iš dalies triukšmingas. Kuriose situacijose nepasitikėtumėte šia patarimu ir ką pirmiausia pasirinktumėte?
Dialogų lentelėje yra 80 milijonų pranešimų, o analitinė užklausa vertinimo rinkiniui trunka 25 minutes ir kartais grąžina dublikatus klausimo-atsakymo porų. Ką pirmiausia ištaisytumėte ir kodėl?