Sobes.tech
Senior

Quel type d'U-Net est utilisé dans Stable Diffusion ? Quelles sont ses caractéristiques par rapport à un U-Net classique ?

sobes.tech IA

Réponse de l'IA

Dans Stable Diffusion, une version modifiée de l’architecture U-Net est utilisée, adaptée aux tâches de modélisation par diffusion d’images.

Caractéristiques de cet U-Net par rapport au classique :

  • Données d’entrée : Au lieu d’images normales, une image bruitée est fournie avec une étape temporelle de diffusion (niveau de bruit), qui est encodée et fournie au réseau.
  • Injection temporelle : Des mécanismes pour prendre en compte l’étape temporelle (embedding temporel) sont ajoutés à l’architecture, permettant au modèle de considérer le degré de bruit.
  • Utilisation de l’attention : Certains couches du U-Net intègrent des mécanismes d’attention (auto-attention), améliorant la capacité du modèle à capturer des dépendances globales dans l’image.
  • Blocs modifiés : Au lieu de blocs convolutionnels standards, des blocs ResNet avec normalisation et activation sont utilisés, optimisés pour un apprentissage stable.

Ainsi, U-Net dans Stable Diffusion est une architecture spécialisée qui combine une structure classique avec des mécanismes supplémentaires pour traiter le bruit et les étapes temporelles, ce qui est crucial pour les modèles de génération d’images par diffusion.