Senior
Koje benchmarkove ocene LLM poznajete (MMLU, BBH, GSM8K, HumanEval)?
sobes.tech АИ
Одговор од АИ
Osnovni benchmarkovi za ocenu velikih jezičkih modela (LLM):
- MMLU (Massive Multitask Language Understanding) — testira znanje modela u širokom spektru akademskih i profesionalnih disciplina.
- BBH (Big Bench Hard) — skup složenih zadataka koji zahtevaju razmišljanje i sveobuhvatno razumevanje.
- GSM8K (Matematika za Osnovnu i Srednju Školu 8K) — matematički zadaci srednjoškolskog nivoa koji proveravaju sposobnost modela da rešava aritmetičke i logičke probleme.
- HumanEval — skup programerskih zadataka za ocenu sposobnosti modela da generiše tačan i funkcionalan kod.
Ovi benchmarkovi pomažu objektivno da se uporede kvalitet i mogućnosti različitih LLM u različitim oblastima.