Senior
Parle-moi de LoRA : qu'est-ce que c'est, comment il s'entraîne et comment il fonctionne lors de l'inférence ?
sobes.tech IA
Réponse de l'IA
LoRA (Adaptation à faible rang) est une méthode d’adaptation de grands réseaux neuronaux en entraînant un petit nombre de paramètres, ce qui permet d’affiner efficacement les modèles sans réentraînement complet.
Comment ça fonctionne :
- Dans le modèle original, les poids de la couche sont représentés sous forme de matrices.
- LoRA ajoute à ces matrices des corrections de faible rang (décomposition en deux petites matrices).
- Pendant l’entraînement, seules ces matrices de faible rang sont mises à jour, tandis que les poids originaux restent figés.
Entraînement :
- Seul un petit nombre de paramètres est entraîné, ce qui réduit les ressources et le temps d’entraînement.
- Permet d’adapter rapidement le modèle à de nouvelles tâches ou données.
Inférence :
- Pendant l’inférence, les corrections des matrices LoRA sont ajoutées aux poids originaux, créant un modèle adapté.
- Cela augmente légèrement le calcul, tout en conservant l’efficacité et la compacité.
On peut l’imaginer ainsi : si la matrice de poids originale est W, le poids final après LoRA est W + BA, où B et A sont des matrices de faible rang, entraînables séparément.