Sobes.tech
Senior

Jaké benchmarky hodnocení LLM znáte (MMLU, BBH, GSM8K, HumanEval)?

sobes.tech AI

Odpověď od AI

Hlavní benchmarky pro hodnocení velkých jazykových modelů (LLM):

  • MMLU (Massive Multitask Language Understanding) — testuje znalosti modelu v širokém spektru akademických a profesních disciplín.
  • BBH (Big Bench Hard) — soubor složitých úkolů vyžadujících uvažování a komplexní porozumění.
  • GSM8K (Matematika na základní škole 8K) — matematické úlohy na úrovni střední školy, ověřující schopnost modelu řešit aritmetické a logické problémy.
  • HumanEval — soubor programovacích úkolů pro hodnocení schopnosti modelu generovat správný a funkční kód.

Tyto benchmarky pomáhají objektivně porovnávat kvalitu a schopnosti různých LLM v různých oblastech.