Sobes.tech
Senior

Hansı LLM qiymətləndirmə meyarlarını bilirsiniz (MMLU, BBH, GSM8K, HumanEval)?

sobes.tech Süni İntellekt

AI-dan cavab

Böyük Dil Modellərini (LLM) qiymətləndirmək üçün əsas meyarlar:

  • MMLU (Massive Multitask Language Understanding) — modelin akademik və peşə sahələrində biliklərini yoxlayır.
  • BBH (Big Bench Hard) — mürəkkəb və geniş düşünmə və anlayış tələb edən tapşırıqlar toplusu.
  • GSM8K (Orta Məktəb Riyaziyyatı 8K) — orta məktəb səviyyəsində riyazi problemlər, modelin arifmetik və məntiqi tapşırıqları həll etmək qabiliyyətini yoxlayır.
  • HumanEval — düzgün və işlək kod yaratmaq qabiliyyətini qiymətləndirmək üçün proqramlaşdırma tapşırıqları toplusu.

Bu meyarlar müxtəlif sahələrdə müxtəlif LLM-lərin keyfiyyət və imkanlarını obyektiv şəkildə müqayisə etməyə kömək edir.