Senior
Hansı LLM qiymətləndirmə meyarlarını bilirsiniz (MMLU, BBH, GSM8K, HumanEval)?
sobes.tech Süni İntellekt
AI-dan cavab
Böyük Dil Modellərini (LLM) qiymətləndirmək üçün əsas meyarlar:
- MMLU (Massive Multitask Language Understanding) — modelin akademik və peşə sahələrində biliklərini yoxlayır.
- BBH (Big Bench Hard) — mürəkkəb və geniş düşünmə və anlayış tələb edən tapşırıqlar toplusu.
- GSM8K (Orta Məktəb Riyaziyyatı 8K) — orta məktəb səviyyəsində riyazi problemlər, modelin arifmetik və məntiqi tapşırıqları həll etmək qabiliyyətini yoxlayır.
- HumanEval — düzgün və işlək kod yaratmaq qabiliyyətini qiymətləndirmək üçün proqramlaşdırma tapşırıqları toplusu.
Bu meyarlar müxtəlif sahələrdə müxtəlif LLM-lərin keyfiyyət və imkanlarını obyektiv şəkildə müqayisə etməyə kömək edir.