Sobes.tech
Senior

Kādus LLM novērtējuma bāzes jūs zināt (MMLU, BBH, GSM8K, HumanEval)?

sobes.tech AI

Atbilde no AI

Galvenie rādītāji, novērtējot lielos valodu modeļus (LLM):

  • MMLU (Massive Multitask Language Understanding) — pārbauda modeļa zināšanas plašā akadēmisko un profesionālo disciplīnu spektrā.
  • BBH (Big Bench Hard) — sarežģītu uzdevumu kopums, kas prasa domāšanu un visaptverošu izpratni.
  • GSM8K (Vidusskolas matemātika 8K) — vidusskolas līmeņa matemātikas uzdevumi, kas pārbauda modeļa spēju risināt aritmētiskas un loģiskas problēmas.
  • HumanEval — programmēšanas uzdevumu kopums, kas novērtē modeļa spēju ģenerēt pareizu un funkcionālu kodu.

Šie rādītāji palīdz objektīvi salīdzināt dažādu LLM kvalitāti un iespējas dažādās jomās.