Sobes.tech
Senior

Koje benchmarkove ocene LLM poznajete (MMLU, BBH, GSM8K, HumanEval)?

sobes.tech АИ

Одговор од АИ

Osnovni benchmarkovi za ocenu velikih jezičkih modela (LLM):

  • MMLU (Massive Multitask Language Understanding) — testira znanje modela u širokom spektru akademskih i profesionalnih disciplina.
  • BBH (Big Bench Hard) — skup složenih zadataka koji zahtevaju razmišljanje i sveobuhvatno razumevanje.
  • GSM8K (Matematika za Osnovnu i Srednju Školu 8K) — matematički zadaci srednjoškolskog nivoa koji proveravaju sposobnost modela da rešava aritmetičke i logičke probleme.
  • HumanEval — skup programerskih zadataka za ocenu sposobnosti modela da generiše tačan i funkcionalan kod.

Ovi benchmarkovi pomažu objektivno da se uporede kvalitet i mogućnosti različitih LLM u različitim oblastima.