Milyen kódminőségi metrikák vannak a code-LLM (pass@k) számára?
sobes.tech MI
Válasz az MI-től
A pass@k metrika a kódgeneráló modellek (code-LLM) minőségének értékelésére szolgál. Megmutatja annak valószínűségét, hogy a generált k variánsból legalább az egyik helyes (átmegy a teszteken).
Például, a pass@1 annak a valószínűségét jelenti, hogy az első generált változat helyes, a pass@10 pedig annak a valószínűségét, hogy a 10 változat között van helyes.
Ez a metrika különösen hasznos, amikor a modell több megoldási variánst generál, és lehetővé teszi a generálás hatékonyságának értékelését a sokféleség és a minőség figyelembevételével.
Formálisan, ha n generált változatból m megfelelt a teszteknek, akkor a pass@k a következő képlettel számítandó (amikor n > k):
pass@k = 1 - \frac{{\binom{n-m}{k}}}{{\binom{n}{k}}}
ahol (\binom{a}{b}) a binomiális együttható.
Így a pass@k tükrözi a siker valószínűségét, amikor k próbálkozást választunk n generált megoldásból.