Quais são as métricas de qualidade do código para code-LLM (pass@k)?
sobes.tech IA
Resposta da IA
A métrica pass@k é utilizada para avaliar a qualidade dos modelos de geração de código (code-LLM). Ela mostra a probabilidade de que pelo menos uma das k variantes geradas seja correta (passando nos testes).
Por exemplo, pass@1 é a probabilidade de que a primeira variante gerada seja correta, e pass@10 é a probabilidade de que entre 10 variantes haja uma correta.
Esta métrica é especialmente útil quando o modelo gera várias soluções possíveis, permitindo avaliar a eficácia da geração considerando a diversidade e qualidade.
Formalmente, se de n variantes geradas, m passam nos testes, então pass@k é calculado com a fórmula (quando n > k):
pass@k = 1 - \frac{{\binom{n-m}{k}}}{{\binom{n}{k}}}
onde (\binom{a}{b}) é o coeficiente binomial.
Assim, pass@k reflete a probabilidade de sucesso ao escolher k tentativas de entre n soluções geradas.