Wat is LoRA en waarom werkt het (laag-rang hypothese)?
sobes.tech AI
Antwoord van AI
LoRA (Low-Rank Adaptation) is een methode voor het fijn afstellen van grote taalmodellen (LLM) die het mogelijk maakt om het model efficiënt aan te passen aan nieuwe taken met minimale middelen.
Het idee is gebaseerd op de low-rank hypothese: de veranderingen in de gewichten van een groot model tijdens de aanpassing kunnen worden benaderd door matrices van lage rang. In plaats van alle parameters van het model bij te werken, voegt LoRA kleine matrices van lage rang toe aan de bestaande gewichten, waarbij alleen deze worden getraind.
Dit vermindert aanzienlijk het aantal te trainen parameters en het geheugen dat nodig is om het aangepaste model op te slaan, terwijl de kwaliteit en flexibiliteit van de afstelling behouden blijven.
Zo werkt het ongeveer:
# Stel dat W de oorspronkelijke gewichtsmatrix is
# LoRA voegt twee matrices A en B van lage rang r toe
# Bijgewerkte gewichten: W' = W + B @ A
# Tijdens de training worden alleen A en B bijgewerkt, W blijft vast
Op deze manier maakt LoRA het mogelijk om grote modellen snel en efficiënt aan te passen zonder volledige hertraining.