Senior
Jaké benchmarky hodnocení LLM znáte (MMLU, BBH, GSM8K, HumanEval)?
sobes.tech AI
Odpověď od AI
Hlavní benchmarky pro hodnocení velkých jazykových modelů (LLM):
- MMLU (Massive Multitask Language Understanding) — testuje znalosti modelu v širokém spektru akademických a profesních disciplín.
- BBH (Big Bench Hard) — soubor složitých úkolů vyžadujících uvažování a komplexní porozumění.
- GSM8K (Matematika na základní škole 8K) — matematické úlohy na úrovni střední školy, ověřující schopnost modelu řešit aritmetické a logické problémy.
- HumanEval — soubor programovacích úkolů pro hodnocení schopnosti modelu generovat správný a funkční kód.
Tyto benchmarky pomáhají objektivně porovnávat kvalitu a schopnosti různých LLM v různých oblastech.