Milliseid mõõdikuid kasutatakse dialoogide hindamiseks (BLEU, perplexity, inimeste hindamine)?
sobes.tech AI
Vastus AI-lt
BLEU (Kakskeelne hindamise meetod) — automaatne mõõdik, algselt välja töötatud masintõlke kvaliteedi hindamiseks. See võrdleb n-gramme referentsvastusega ja mõõdab sarnasust. Dialoogides aitab BLEU hinnata, kui lähedal on genereeritud vastus oodatule, kuid ei arvesta konteksti ega vastuste mitmekesisust.
Perplexity — mõõdik, mis näitab, kui hästi keelemudel ennustab sõnade jada. Mida madalam on perplexity, seda paremini mudel teksti ennustab. Dialoogides peegeldab perplexity mudeli võimet genereerida tõenäolisi ja loomulikke vastuseid.
Inimese hindamine — subjektiivne dialoogide kvaliteedi hindamine, kus eksperdid või kasutajad hindavad vastuseid vastavuse, informatiivsuse, loomulikkuse ja järjepidevuse alusel. See on kõige usaldusväärsem hindamismeetod, kuna automaatsed mõõdikud ei peegelda alati dialoogi kvaliteeti inimese vaatenurgast.