Sobes.tech
Senior

Que benchmarks de avaliação de LLM conhece (MMLU, BBH, GSM8K, HumanEval)?

sobes.tech IA

Resposta da IA

Principais benchmarks para avaliar grandes modelos de linguagem (LLM):

  • MMLU (Compreensão de Linguagem Multitarefa Massiva) — testa o conhecimento do modelo numa vasta gama de disciplinas académicas e profissionais.
  • BBH (Grande Banco de Testes Difíceis) — conjunto de tarefas complexas que requerem raciocínio e compreensão abrangente.
  • GSM8K (Matemática do Ensino Fundamental 8K) — problemas matemáticos de nível escolar que verificam a capacidade do modelo de resolver problemas aritméticos e lógicos.
  • HumanEval — conjunto de tarefas de programação para avaliar a capacidade do modelo de gerar código correto e funcional.

Estes benchmarks ajudam a comparar objetivamente a qualidade e as capacidades de diferentes LLM em várias áreas.