Sobes.tech
Senior

Quais são as métricas de qualidade do código para code-LLM (pass@k)?

sobes.tech IA

Resposta da IA

A métrica pass@k é utilizada para avaliar a qualidade dos modelos de geração de código (code-LLM). Ela mostra a probabilidade de que pelo menos uma das k variantes geradas seja correta (passando nos testes).

Por exemplo, pass@1 é a probabilidade de que a primeira variante gerada seja correta, e pass@10 é a probabilidade de que entre 10 variantes haja uma correta.

Esta métrica é especialmente útil quando o modelo gera várias soluções possíveis, permitindo avaliar a eficácia da geração considerando a diversidade e qualidade.

Formalmente, se de n variantes geradas, m passam nos testes, então pass@k é calculado com a fórmula (quando n > k):

pass@k = 1 - \frac{{\binom{n-m}{k}}}{{\binom{n}{k}}}

onde (\binom{a}{b}) é o coeficiente binomial.

Assim, pass@k reflete a probabilidade de sucesso ao escolher k tentativas de entre n soluções geradas.