Sobes.tech
Senior
31

Какие бенчмарки оценки LLM вы знаете (MMLU, BBH, GSM8K, HumanEval)?

Сұралған компаниялар
Ростелеком
VK CloudVK Cloud

AI-дан жауап

sobes.tech AI

Основные бенчмарки для оценки больших языковых моделей (LLM):

  • MMLU (Massive Multitask Language Understanding) — тестирует знания модели по широкому спектру академических и профессиональных дисциплин.
  • BBH (Big Bench Hard) — набор сложных задач, требующих рассуждений и комплексного понимания.
  • GSM8K (Grade School Math 8K) — задачи по математике уровня средней школы, проверяющие способность модели решать арифметические и логические задачи.
  • HumanEval — набор программных задач для оценки способности модели генерировать корректный и работающий код.

Эти бенчмарки помогают объективно сравнивать качество и возможности различных LLM в разных областях.