Sobes.tech
Senior

Milyen LLM értékelési benchmarkokat ismer (MMLU, BBH, GSM8K, HumanEval)?

sobes.tech MI

Válasz az MI-től

Nagy nyelvi modellek (LLM) értékeléséhez fő benchmarkok:

  • MMLU (Massive Multitask Language Understanding) — a modell tudását széles körű akadémiai és szakmai területeken teszteli.
  • BBH (Big Bench Hard) — összetett feladatok halmaza, amelyek megfontolást és átfogó megértést igényelnek.
  • GSM8K (Általános Iskola Matematika 8K) — középiskolai szintű matematikai problémák, amelyek a modell aritmetikai és logikai képességeit vizsgálják.
  • HumanEval — programozási feladatok halmaza, amelyek a modell helyes és működő kód generálási képességét értékelik.

Ezek a benchmarkok segítenek objektíven összehasonlítani különböző LLM-ek minőségét és képességeit különböző területeken.