Sobes.tech
Senior

რომელ LLM შეფასების ბენჩმარკებს იცნობთ (MMLU, BBH, GSM8K, HumanEval)?

sobes.tech AI

პასუხი AI-სგან

დიდი ენის მოდელების (LLM) შეფასების ძირითადი ბენჩმარკები:

  • MMLU (Massive Multitask Language Understanding) — ტესტავს მოდელის ცოდნას ფართო სპექტრში აკადემიური და პროფესიული დისციპლინების სფეროებში.
  • BBH (Big Bench Hard) — რთული დავალებების ნაკრები, რომლებიც მოითხოვს ლოგიკას და კომპლექსურ გაგებას.
  • GSM8K (სკოლის გრაფიკი მათემატიკა 8K) — საშუალო სკოლის დონეზე მათემატიკური პრობლემები, რომლებიც ამოწმებს მოდელის უნარს არტმეტიკული და ლოგიკური პრობლემების გადაჭრის.
  • HumanEval — პროგრამირების დავალებების ნაკრები, რომელიც აფასებს მოდელის უნარს შექმნას სწორი და ფუნქციონირებადი კოდი.

ეს ბენჩმარკები ეხმარება ობიექტურად შეადაროს სხვადასხვა LLM-ების ხარისხი და შესაძლებლობები სხვადასხვა სფეროებში.