Middle — Senior
Mi az a GELU és miért jobb, mint a ReLU a transzformátorokban?
sobes.tech MI
Válasz az MI-től
GELU (Gauss-hiba lineáris egység) egy aktiválási függvény, amelyet gyakran használnak transzformátorokban és más modern neurális hálózatokban. A klasszikus ReLU-hoz képest simább, és figyelembe veszi az aktiválás valószínűségi jellegét.
A GELU közelítő képlete így néz ki:
[ \text{GELU}(x) = x \cdot \Phi(x) ]
ahol ( \Phi(x) ) a standard normális eloszlás kumulatív eloszlásfüggvénye.
A GELU előnyei a ReLU-hoz képest:
- Simaság: A GELU folytonos és differenciálható, ez javítja a tanulást.
- Stokaszticitás: A GELU figyelembe veszi a neuron aktiválási valószínűségét, segítve a modellt a zaj és bizonytalanság jobb kezelésében.
- Jobb adatszintézis: NLP feladatokban és transzformátoroknál a GELU hatékonyabb tanulást és jobb modellminőséget eredményez.
Példa a PyTorch-ban való használatra:
import torch
import torch.nn.functional as F
def gelu(x):
return 0.5 * x * (1 + torch.tanh(torch.sqrt(torch.tensor(2 / 3.1415)) * (x + 0.044715 * x ** 3)))
x = torch.tensor([-1.0, 0.0, 1.0])
print(gelu(x))
Így a GELU simább és informatívabb aktiválást biztosít, mint a ReLU, ami fontos a komplex modellek, például transzformátorok esetében.