Junior — Middle
Wat is BLEU en in welke taken wordt het toegepast? Welke problemen heeft deze metriek?
sobes.tech AI
Antwoord van AI
BLEU (Bilingual Evaluation Understudy) is een metriek om de kwaliteit van automatische vertalingen en andere tekstgeneratietaken te beoordelen. Het meet hoe goed de gegenereerde tekst overeenkomt met een of meerdere referentievertalingen op basis van de overeenkomst van n-grammen.
Belangrijkste kenmerken van BLEU:
- Berekent de precisie van n-grammen (meestal van 1 tot 4).
- Voert een straf in voor te korte vertalingen (kortingsfactor).
Problemen met BLEU:
- Neemt geen semantische nabijheid in overweging, alleen de exacte overeenkomst van woorden.
- Is gevoelig voor stijl en formuleringen, wat de beoordeling van goede maar parafraseerde vertalingen kan onderwaarderen.
- Is minder informatief voor korte zinnen.
Wordt toegepast bij automatische vertaling, samenvatting van teksten en andere NLP-taken waar de beoordeling van de kwaliteit van gegenereerde tekst belangrijk is.