Диалогдорду ба баалоо үчүн кайсы метрикалар колдонулат (BLEU, perplexity, адамдык баалоо)?
sobes.tech AI
AIден жооп
BLEU (Ики тилдүү баалоо) — автоматтык өлчөм, башында машиналык которуунун сапатын баалоо үчүн иштелип чыккан. Ал n-граммдарды референс жооп менен салыштырып, окшоштугун өлчөйт. Диалогдордо BLEU чыгарылган жооптун күтүлгөнгө канчалык жакын экенин баалоого жардам берет, бирок контекст жана жооптордун ар түрдүүлүгүн эске албайт.
Perplexity — тил моделинин сөздөрдүн тизмегин канчалык жакшы болжай турганын көрсөтүүчү өлчөм. Perplexity төмөн болсо, модел текстти жакшы болжайт. Диалогдордо, perplexity моделдин мүмкүн болуучу жана табигый жоопторду түзүү жөндөмүн чагылдырат.
Адам баалоо — диалогдордун сапатын субъективдүү баалоо, анда эксперттер же колдонуучулар жоопторду тиешелүүлүк, маалыматтуулук, табигийлик жана туруктуулук сыяктуу критерийлер боюнча баалашат. Бул автоматтык өлчөмдөр ар дайым диалогдун сапатын адам көз карашынан чагылдырбай калышы мүмкүн болгондуктан, эң ишенимдүү баалоо ыкмасы.