Senior
Aké benchmarky hodnotenia LLM poznáte (MMLU, BBH, GSM8K, HumanEval)?
sobes.tech AI
Odpoveď od AI
Hlavné benchmarky na hodnotenie veľkých jazykových modelov (LLM):
- MMLU (Massive Multitask Language Understanding) — testuje znalosti modelu v širokom spektre akademických a profesionálnych disciplín.
- BBH (Big Bench Hard) — súbor zložitých úloh, ktoré vyžadujú uvažovanie a komplexné porozumenie.
- GSM8K (Matematika na základnej škole 8K) — matematické úlohy na úrovni strednej školy, ktoré overujú schopnosť modelu riešiť aritmetické a logické problémy.
- HumanEval — súbor programovacích úloh na hodnotenie schopnosti modelu generovať správny a funkčný kód.
Tieto benchmarky pomáhajú objektívne porovnávať kvalitu a schopnosti rôznych LLM v rôznych oblastiach.