Senior
Milyen LLM értékelési benchmarkokat ismer (MMLU, BBH, GSM8K, HumanEval)?
sobes.tech MI
Válasz az MI-től
Nagy nyelvi modellek (LLM) értékeléséhez fő benchmarkok:
- MMLU (Massive Multitask Language Understanding) — a modell tudását széles körű akadémiai és szakmai területeken teszteli.
- BBH (Big Bench Hard) — összetett feladatok halmaza, amelyek megfontolást és átfogó megértést igényelnek.
- GSM8K (Általános Iskola Matematika 8K) — középiskolai szintű matematikai problémák, amelyek a modell aritmetikai és logikai képességeit vizsgálják.
- HumanEval — programozási feladatok halmaza, amelyek a modell helyes és működő kód generálási képességét értékelik.
Ezek a benchmarkok segítenek objektíven összehasonlítani különböző LLM-ek minőségét és képességeit különböző területeken.