Mit mutat a figyelemvektor a transzformátorokban?
sobes.tech MI
Válasz az MI-től
A figyelmi vektor a transzformátorokban megmutatja, hogy a modell mennyire "figyel" minden szóra (vagy tokenre) a bemeneti sorozatban, amikor egy adott kimeneti tokent dolgoz fel. Egyszerűbben fogalmazva, ezek súlyok, amelyek meghatározzák, hogy az egyes bemeneti elemek mennyire fontosak az aktuális lépéshez.
Például, egy mondat fordításakor a transzformátorban minden szóhoz számított figyelmi vektor mutatja, hogy mely szavak a bemeneti mondatban a legrelevánsabbak ennek a szó generálásához. Ez lehetővé teszi a modell számára, hogy figyelembe vegye a kontextust és a szavak közötti függőségeket, még akkor is, ha azok távol vannak egymástól.
A figyelmi vektor egy számokból (súlyokból) álló halmaz, amelyeket általában softmax-szal normalizálnak, ahol a nagyobb értékek nagyobb jelentőséget mutatnak a megfelelő bemeneti token számára az aktuális lépésben.
Példa: ha a modell a "river bank" kontextusában fordítja a "bank" szót, a figyelmi vektor kiemelheti a "river" és "bank" szavakat a bemenetben, hogy helyesen értelmezze a jelentést.