Senior
Jakie benchmarki oceny LLM znasz (MMLU, BBH, GSM8K, HumanEval)?
sobes.tech AI
Odpowiedź od AI
Główne benchmarki do oceny dużych modeli językowych (LLM):
- MMLU (Massive Multitask Language Understanding) — testuje wiedzę modelu w szerokim zakresie dziedzin akademickich i zawodowych.
- BBH (Big Bench Hard) — zestaw trudnych zadań wymagających rozumowania i kompleksowego pojmowania.
- GSM8K (Matematyka Szkolna 8K) — zadania matematyczne na poziomie szkoły średniej, sprawdzające zdolność modelu do rozwiązywania problemów arytmetycznych i logicznych.
- HumanEval — zestaw zadań programistycznych do oceny zdolności modelu do generowania poprawnego i działającego kodu.
Te benchmarki pomagają obiektywnie porównywać jakość i możliwości różnych LLM w różnych dziedzinach.