Senior
Kādus LLM novērtējuma bāzes jūs zināt (MMLU, BBH, GSM8K, HumanEval)?
sobes.tech AI
Atbilde no AI
Galvenie rādītāji, novērtējot lielos valodu modeļus (LLM):
- MMLU (Massive Multitask Language Understanding) — pārbauda modeļa zināšanas plašā akadēmisko un profesionālo disciplīnu spektrā.
- BBH (Big Bench Hard) — sarežģītu uzdevumu kopums, kas prasa domāšanu un visaptverošu izpratni.
- GSM8K (Vidusskolas matemātika 8K) — vidusskolas līmeņa matemātikas uzdevumi, kas pārbauda modeļa spēju risināt aritmētiskas un loģiskas problēmas.
- HumanEval — programmēšanas uzdevumu kopums, kas novērtē modeļa spēju ģenerēt pareizu un funkcionālu kodu.
Šie rādītāji palīdz objektīvi salīdzināt dažādu LLM kvalitāti un iespējas dažādās jomās.