Sobes.tech
Senior

Jakie benchmarki oceny LLM znasz (MMLU, BBH, GSM8K, HumanEval)?

sobes.tech AI

Odpowiedź od AI

Główne benchmarki do oceny dużych modeli językowych (LLM):

  • MMLU (Massive Multitask Language Understanding) — testuje wiedzę modelu w szerokim zakresie dziedzin akademickich i zawodowych.
  • BBH (Big Bench Hard) — zestaw trudnych zadań wymagających rozumowania i kompleksowego pojmowania.
  • GSM8K (Matematyka Szkolna 8K) — zadania matematyczne na poziomie szkoły średniej, sprawdzające zdolność modelu do rozwiązywania problemów arytmetycznych i logicznych.
  • HumanEval — zestaw zadań programistycznych do oceny zdolności modelu do generowania poprawnego i działającego kodu.

Te benchmarki pomagają obiektywnie porównywać jakość i możliwości różnych LLM w różnych dziedzinach.