Senior
Que benchmarks de avaliação de LLM conhece (MMLU, BBH, GSM8K, HumanEval)?
sobes.tech IA
Resposta da IA
Principais benchmarks para avaliar grandes modelos de linguagem (LLM):
- MMLU (Compreensão de Linguagem Multitarefa Massiva) — testa o conhecimento do modelo numa vasta gama de disciplinas académicas e profissionais.
- BBH (Grande Banco de Testes Difíceis) — conjunto de tarefas complexas que requerem raciocínio e compreensão abrangente.
- GSM8K (Matemática do Ensino Fundamental 8K) — problemas matemáticos de nível escolar que verificam a capacidade do modelo de resolver problemas aritméticos e lógicos.
- HumanEval — conjunto de tarefas de programação para avaliar a capacidade do modelo de gerar código correto e funcional.
Estes benchmarks ajudam a comparar objetivamente a qualidade e as capacidades de diferentes LLM em várias áreas.