Quelle est la différence entre self-attention et cross-attention, et à quoi sert chacun ?
sobes.tech IA
Réponse de l'IA
Auto-attention — c'est un mécanisme où les éléments d'une séquence d'entrée interagissent entre eux pour calculer des poids d'importance. Chaque élément 'regarde attentivement' tous les autres éléments de la même séquence pour comprendre lesquels sont plus importants pour l'étape en cours. C'est un composant clé dans les transformateurs pour traiter des séquences, par exemple dans les modèles de langage.
Attention croisée — est utilisée lorsqu'il y a deux séquences différentes : l'une sert de requête (query), et l'autre comme clés et valeurs (key, value). L'attention croisée permet au modèle de se concentrer sur les parties pertinentes de la deuxième séquence lors du traitement de la première. Par exemple, dans les tâches de traduction ou de génération de texte, l'attention croisée relie la sortie du décodeur à celle de l'encodeur.
En résumé :
- L'auto-attention aide le modèle à prendre en compte le contexte au sein d'une même séquence.
- L'attention croisée relie deux séquences différentes, permettant à l'une de prendre en compte l'information de l'autre.
Exemple : dans un transformateur pour la traduction, l'auto-attention est appliquée à l'intérieur de l'encodeur et du décodeur, tandis que l'attention croisée est appliquée entre l'encodeur et le décodeur.