Sobes.tech
Senior

Milliseid LLM hindamise kriteeriume teate (MMLU, BBH, GSM8K, HumanEval)?

sobes.tech AI

Vastus AI-lt

Suurte keelemudelite (LLM) hindamise põhivõrdlused:

  • MMLU (Massive Multitask Language Understanding) — testib mudeli teadmisi laiaulatuses akadeemilistes ja professionaalsetes valdkondades.
  • BBH (Big Bench Hard) — keeruliste ülesannete kogum, mis nõuab mõtlemist ja põhjalikku arusaamist.
  • GSM8K (Koolimatemaatika 8K) — keskkooli tasemel matemaatikaülesanded, mis kontrollivad mudeli võimet lahendada aritmeetilisi ja loogilisi probleeme.
  • HumanEval — programmeerimisülesannete kogum, mis hindab mudeli võimet genereerida õiget ja toimivat koodi.

Need võrdlused aitavad objektiivselt võrrelda erinevate LLM-ide kvaliteeti ja võimalusi erinevates valdkondades.