Po novej verzi modela se povprečna ocena kakovosti zvišala, vendar uredniki pravijo, da so odgovori na pravne in finančne teme postali opazno slabši. Katero vizualizacijo bi naredili najprej, da se odločite, ali ustaviti izdajo?
Machine Learning / AI
Uveďte príklad, keď nesprávne použitie BatchNorm v režime `eval()` spôsobilo chyby v predpovediach.
Praktická úloha Aký súbor artefaktov umožňuje spravodlivé porovnanie dvoch spustení LoRA? - Len konečná tabuľka kvality. - Commit s kódom a snímkou obrazovky konečnej metriky. - Kód a konfiguračný súbor experimentu. - Kód, hash dát, základný model, konfigurácia LoRA, závislosti a príkaz na spustenie. - Len odkaz na vetvu Git. - Kód, parametre LoRA, verzia základného modelu a závislosti.
Ako zvyčajne spravujete verzie údajov a modelov v takýchto experimentoch?
Existujú aktuálne pohovory vo veľkých technologických spoločnostiach, ako je Yandex alebo Alfa?
Praktická úloha SQL dotaz na 80 miliónov správ vytvára duplicitné záznamy po JOIN. Akú akciu je najlepšie začať ako prvú? - Skontrolovať kardinalitu JOIN, kľúče a plán vykonávania pred optimalizáciou. - Vytvoriť index na jednom poli spojenia. - Exportovať výsledok do CSV a odstrániť duplikáty v Pythone. - Vždy pridávať DISTINCT ku všetkým stĺpcom. - Pridať DISTINCT po kontrole výsledku na vzorke. - Skontrolovať kľúče spojenia a jedinečnosť oboch tabuliek.
Plánujete naďalej zostať na Filipínach alebo sa presťahovať do inej krajiny?
Môžete podrobnejšie opísať, čo vám na otázkach prišlo "dusivé" a ako to ovplyvnilo vaše vnímanie pohovoru?
Máte skúsenosti s prácou v úplne anglicky hovoriacich tímov?
Máte skúsenosti s pohovormi s AI?
Máte ponuky v rukách alebo finálne fázy v iných spoločnostiach?
Ako bi kvantitativno ocenili vpliv emisij na metrike modela, na primer accuracy ali F1-score?
Ako by ste optimalizovali indexy na spojovacích kľúčoch, aby ste znížili duplikáty a zrýchlili dopyt?
Predstavte si, že pracujete s modelom v PyTorch a po jeho prepnutí do režimu hodnotenia eval() vidíte, že metriky na pevne stanovenom testovom súbore 10 000 príkladov sa pri každom spustení menia. Fixujete počiatočný stav generátorov náhodných čísel pre reprodukovateľnosť: kde ešte môže byť zdroj zmien skrytý? Vysvetlite úlohu Dropout, BatchNorm a torch.no_grad() a uveďte metriky s prahmi, podľa ktorých overíte stabilitu výsledkov.
Praktická úloha AI navrhuje trénovať LoRA na všetkých 2 miliónoch nezpracovaných dialógov. Aká je najzrelšia odpoveď kandidáta? - Dôvera v AI: veľký korpus sám vyrovná chyby. - Najskôr zmeniť prompt bez zmeny údajov. - Vytrénovať LoRA na očistenom časti a porovnať ju s základným modelom. - Pred tréningom skontrolovať náhodný vzorku označení. - Najskôr skontrolovať údaje a kvalitu podľa tém na samostatnom sete, potom obmedzene trénovať LoRA. - Trénovať na celom korpuse, ale znížiť rad LoRA.
Ohodnoťte svoj anglický jazyk samostatne pre čítanie/písanie a konverzáciu podľa úrovní CEFR.
Ako by ste presne použili `EXPLAIN` na identifikáciu problémov s výkonom v tomto dopyte?
Aký formát formalizácie vám najviac vyhovuje: GPH, IP alebo TК?
Pri generiranju vprašanj ima velik jezikovni model težave pri ohranjanju sloga na redkih temah. AI asistent predlaga takojšnje zagon LoRA na celotnem zgodovinskem korpusu 2 milijona dialogov, vendar je označevanje delno šumovito. Kje mu ne bi zaupali in kaj bi izbrali najprej?
V tabuľke dialógov je 80 miliónov správ, a analytický dopyt pre hodnotiaci súbor trvá 25 minút a niekedy vracia duplikáty párov otázka-odpoveď. Čo by ste opravili ako prvé a prečo?