Linformer nedir ve neden lineer karmaşıklık başarabiliyor?
sobes.tech yapay zeka
AI'dan gelen yanıt
Linformer, dikkat hesaplamanın kare (O(n²)) karmaşıklığını doğrusal (O(n)) hale getiren bir dönüştürme mimarisidir.
Linformer'ın temel fikri, dikkat matrisini düşük dereceli bir temsille yaklaşıklaştırmaktır. Tüm token çiftleri arasında tam dikkat hesaplamak yerine, Linformer anahtarları ve değerleri eğitilebilir doğrusal projeksiyonlar kullanarak daha düşük boyutlu bir uzaya projekte eder.
Bu, şunlara izin verir:
- Anahtarların ve değerlerin boyutunu küçültmek,
- Matris çarpımında hesaplama sayısını azaltmak,
- Bellek kullanımını düşürmek.
Bu şekilde, sabit bir projeksiyon boyutu kullanılarak doğrusal karmaşıklık elde edilir; bu boyut, giriş dizisinin uzunluğuna bağlı değildir, bu da Linformer'ı uzun metinler ve büyük diziler için verimli kılar.
Yaklaşık olarak şöyle düşünülebilir:
- Dikkat hesaplaması yerine: Attention(Q, K, V) = softmax(QKᵀ / sqrt(d)) V
- Linformer hesaplar: Attention(Q, E K, F V), burada E ve F, K ve V'nin boyutunu azaltan eğitilebilir projeksiyon matrisleridir.
Bu, hesaplamaları basitleştirir ve karmaşıklığı O(n) seviyesine indirir.