Sobes.tech
Senior

Vertel me over LoRA: wat is het, hoe wordt het getraind en hoe werkt het bij inferentie?

sobes.tech AI

Antwoord van AI

LoRA (Low-Rank Adaptation) is een methode voor het aanpassen van grote neurale netwerken door een klein aantal parameters te trainen, waardoor modellen efficiënt kunnen worden bijgesteld zonder volledige hertraining.

Hoe het werkt:

  • In het originele model worden de gewichten van de laag weergegeven als matrices.
  • LoRA voegt aan deze matrices laag-rangige correcties toe (ontleding in twee kleine matrices).
  • Tijdens de training worden alleen deze laag-rangige matrices bijgewerkt, terwijl de originele gewichten bevroren blijven.

Training:

  • Alleen een klein aantal parameters wordt getraind, wat de resource- en tijdsvereisten vermindert.
  • Maakt snelle aanpassing van het model mogelijk aan nieuwe taken of gegevens.

Inferentie:

  • Tijdens inferentie worden de correcties uit de LoRA-matrices opgeteld bij de originele gewichten, waardoor een aangepast model ontstaat.
  • Dit verhoogt de berekeningen licht, maar behoudt de efficiëntie en compactheid.

Je kunt het zo voorstellen: als de originele gewichtsmatrix W is, dan is het uiteindelijke gewicht na LoRA W + BA, waarbij B en A matrices van laag-rang zijn die apart worden getraind.