Sobes.tech
Senior

Aké benchmarky hodnotenia LLM poznáte (MMLU, BBH, GSM8K, HumanEval)?

sobes.tech AI

Odpoveď od AI

Hlavné benchmarky na hodnotenie veľkých jazykových modelov (LLM):

  • MMLU (Massive Multitask Language Understanding) — testuje znalosti modelu v širokom spektre akademických a profesionálnych disciplín.
  • BBH (Big Bench Hard) — súbor zložitých úloh, ktoré vyžadujú uvažovanie a komplexné porozumenie.
  • GSM8K (Matematika na základnej škole 8K) — matematické úlohy na úrovni strednej školy, ktoré overujú schopnosť modelu riešiť aritmetické a logické problémy.
  • HumanEval — súbor programovacích úloh na hodnotenie schopnosti modelu generovať správny a funkčný kód.

Tieto benchmarky pomáhajú objektívne porovnávať kvalitu a schopnosti rôznych LLM v rôznych oblastiach.