Senior
Erzähle mir von LoRA: Was ist das, wie wird es trainiert und wie funktioniert es bei der Inferenz?
sobes.tech KI
Antwort von AI
LoRA (Low-Rank-Adaptation) ist eine Methode zur Anpassung großer neuronaler Netze durch das Training einer kleinen Anzahl von Parametern, was eine effiziente Feinabstimmung der Modelle ohne vollständiges Retraining ermöglicht.
Funktionsweise:
- Im ursprünglichen Modell werden die Gewichte der Schicht als Matrizen dargestellt.
- LoRA fügt diesen Matrizen Korrekturen mit niedrigem Rang hinzu (Zerlegung in zwei kleine Matrizen).
- Während des Trainings werden nur diese Matrizen mit niedrigem Rang aktualisiert, während die ursprünglichen Gewichte eingefroren bleiben.
Training:
- Es werden nur wenige Parameter trainiert, was die Ressourcen- und Zeitanforderungen reduziert.
- Ermöglicht eine schnelle Anpassung des Modells an neue Aufgaben oder Daten.
Inference:
- Während der Inferenz werden die Korrekturen aus den LoRA-Matrizen zu den ursprünglichen Gewichten addiert, um ein angepasstes Modell zu erstellen.
- Dies erhöht die Berechnungen nur geringfügig, erhält aber die Effizienz und Kompaktheit.
Man kann es sich so vorstellen: Wenn die ursprüngliche Gewichtsmatrix W ist, ist das endgültige Gewicht nach LoRA W + BA, wobei B und A separate, trainierbare Matrizen niedrigen Rangs sind.