Sobes.tech
Middle — Senior

Mi az a GELU és miért jobb, mint a ReLU a transzformátorokban?

sobes.tech MI

Válasz az MI-től

GELU (Gauss-hiba lineáris egység) egy aktiválási függvény, amelyet gyakran használnak transzformátorokban és más modern neurális hálózatokban. A klasszikus ReLU-hoz képest simább, és figyelembe veszi az aktiválás valószínűségi jellegét.

A GELU közelítő képlete így néz ki:

[ \text{GELU}(x) = x \cdot \Phi(x) ]

ahol ( \Phi(x) ) a standard normális eloszlás kumulatív eloszlásfüggvénye.

A GELU előnyei a ReLU-hoz képest:

  • Simaság: A GELU folytonos és differenciálható, ez javítja a tanulást.
  • Stokaszticitás: A GELU figyelembe veszi a neuron aktiválási valószínűségét, segítve a modellt a zaj és bizonytalanság jobb kezelésében.
  • Jobb adatszintézis: NLP feladatokban és transzformátoroknál a GELU hatékonyabb tanulást és jobb modellminőséget eredményez.

Példa a PyTorch-ban való használatra:

import torch
import torch.nn.functional as F

def gelu(x):
    return 0.5 * x * (1 + torch.tanh(torch.sqrt(torch.tensor(2 / 3.1415)) * (x + 0.044715 * x ** 3)))

x = torch.tensor([-1.0, 0.0, 1.0])
print(gelu(x))

Így a GELU simább és informatívabb aktiválást biztosít, mint a ReLU, ami fontos a komplex modellek, például transzformátorok esetében.