Qu'est-ce qu'un bloc résiduel?
sobes.tech IA
Réponse de l'IA
Le bloc résiduel est un élément architectural des réseaux neuronaux, introduit dans ResNet, qui aide à lutter contre le problème de la disparition des gradients lors de l’entraînement de réseaux très profonds.
L’idée du bloc résiduel est que, au lieu d’apprendre une fonction de mappage ( H(x) ) directe, le bloc apprend une correction ( F(x) = H(x) - x ), c’est-à-dire le résiduel. En fin de compte, la sortie du bloc est calculée comme :
[ \text{sortie} = F(x) + x ]
où :
- ( x ) est l’entrée du bloc,
- ( F(x) ) est le résultat de plusieurs couches (par exemple, convolution, activations).
Cela permet au gradient de passer plus facilement à travers les couches, améliorant l’apprentissage des modèles profonds.
Exemple d’un bloc résiduel simple (pseudocode) :
import torch
import torch.nn as nn
class ResidualBlock(nn.Module):
def __init__(self, channels):
super().__init__()
self.conv1 = nn.Conv2d(channels, channels, kernel_size=3, padding=1)
self.bn1 = nn.BatchNorm2d(channels)
self.relu = nn.ReLU()
self.conv2 = nn.Conv2d(channels, channels, kernel_size=3, padding=1)
self.bn2 = nn.BatchNorm2d(channels)
def forward(self, x):
residual = x
out = self.conv1(x)
out = self.bn1(out)
out = self.relu(out)
out = self.conv2(out)
out = self.bn2(out)
out += residual # ajout de l’entrée (connexion de saut)
out = self.relu(out)
return out
Ainsi, les blocs résiduels permettent de construire des réseaux très profonds sans dégradation de la qualité de l’apprentissage.