Sobes.tech
Senior

Erzähle mir von LoRA: Was ist das, wie wird es trainiert und wie funktioniert es bei der Inferenz?

sobes.tech KI

Antwort von AI

LoRA (Low-Rank-Adaptation) ist eine Methode zur Anpassung großer neuronaler Netze durch das Training einer kleinen Anzahl von Parametern, was eine effiziente Feinabstimmung der Modelle ohne vollständiges Retraining ermöglicht.

Funktionsweise:

  • Im ursprünglichen Modell werden die Gewichte der Schicht als Matrizen dargestellt.
  • LoRA fügt diesen Matrizen Korrekturen mit niedrigem Rang hinzu (Zerlegung in zwei kleine Matrizen).
  • Während des Trainings werden nur diese Matrizen mit niedrigem Rang aktualisiert, während die ursprünglichen Gewichte eingefroren bleiben.

Training:

  • Es werden nur wenige Parameter trainiert, was die Ressourcen- und Zeitanforderungen reduziert.
  • Ermöglicht eine schnelle Anpassung des Modells an neue Aufgaben oder Daten.

Inference:

  • Während der Inferenz werden die Korrekturen aus den LoRA-Matrizen zu den ursprünglichen Gewichten addiert, um ein angepasstes Modell zu erstellen.
  • Dies erhöht die Berechnungen nur geringfügig, erhält aber die Effizienz und Kompaktheit.

Man kann es sich so vorstellen: Wenn die ursprüngliche Gewichtsmatrix W ist, ist das endgültige Gewicht nach LoRA W + BA, wobei B und A separate, trainierbare Matrizen niedrigen Rangs sind.