Deep learning : architectures et entraînement
Un réseau profond empile des transformations différentiables et apprend leurs paramètres par descente de gradient. Toute la difficulté pratique tient à ce que ce gradient traverse correctement des dizaines de couches.
Mis à jour le 2 juin 2026
Rétropropagation, en une idée
Un réseau est une composition de fonctions paramétrées. On mesure l'écart entre sa sortie et la cible par une fonction de perte, puis on calcule la dérivée de cette perte par rapport à chaque paramètre. La règle de dérivation en chaîne permet de propager cette dérivée de la sortie vers l'entrée en une seule passe arrière, d'où le nom. Chaque paramètre est ensuite déplacé d'un pas dans la direction opposée à son gradient.
Les deux pathologies historiques de ce mécanisme sont l'évanouissement et l'explosion du gradient. Quand le signal traverse de nombreuses couches, il est multiplié à chaque étape : légèrement inférieur à un, il s'annule ; légèrement supérieur, il diverge. Les connexions résiduelles, qui ajoutent l'entrée d'un bloc à sa sortie, offrent au gradient un chemin direct et sont la raison pour laquelle des réseaux de plusieurs centaines de couches s'entraînent.
La normalisation joue le second rôle : recentrer et remettre à l'échelle les activations à l'intérieur du réseau stabilise la distribution vue par chaque couche et autorise des taux d'apprentissage plus élevés. La normalisation par lot dépend de la taille du lot, la normalisation par couche n'en dépend pas, ce qui explique la domination de la seconde dans les architectures séquentielles.
Trois familles qui couvrent la majorité des usages
Les réseaux convolutifs exploitent deux hypothèses fortes sur les images : une caractéristique utile à un endroit l'est ailleurs, et l'information pertinente est locale. Le partage de poids qui en découle réduit massivement le nombre de paramètres et confère une robustesse naturelle aux translations. Ils restent le choix par défaut lorsque les données d'entraînement sont limitées.
Les transformers remplacent l'hypothèse de localité par l'attention : chaque position pondère explicitement toutes les autres. Cette généralité a un prix, un coût quadratique en longueur de séquence et un appétit en données bien supérieur, et un avantage décisif, une parallélisation complète de l'entraînement. Ils dominent aujourd'hui le texte et gagnent du terrain sur l'image.
Les modèles génératifs par diffusion procèdent autrement : ils apprennent à retirer progressivement le bruit d'un signal bruité. En partant de bruit pur et en itérant, on obtient un échantillon nouveau. C'est le mécanisme derrière la génération d'images de haute qualité, et il se transpose au son et à la vidéo.
- Fonction d'activation
- Non-linéarité appliquée après chaque couche. Sans elle, l'empilement de couches linéaires resterait équivalent à une seule couche linéaire.
- Abandon
- Désactivation aléatoire de neurones pendant l'entraînement. Empêche le réseau de dépendre d'un chemin unique et agit comme un ensemble implicite.
Apprentissage par transfert : le levier qui change les ordres de grandeur
Réentraîner un réseau depuis zéro suppose un volume de données et un budget de calcul que peu de projets possèdent. Le transfert consiste à repartir d'un modèle pré-entraîné sur un grand corpus générique, puis à l'adapter à la tâche cible. Les premières couches, qui encodent des motifs génériques, sont conservées ; les dernières, spécifiques à la tâche d'origine, sont remplacées.
Deux régimes coexistent. L'extraction de caractéristiques gèle le réseau et n'entraîne que la tête de classification : rapide, robuste, adapté aux très petits jeux de données. Le réglage fin dégèle tout ou partie du réseau avec un taux d'apprentissage réduit : plus performant quand on dispose de quelques milliers d'exemples, plus exposé à l'oubli catastrophique.
Sur les grands modèles, les méthodes à faible rang comme LoRA ont rendu cette adaptation abordable : plutôt que de mettre à jour tous les poids, on apprend de petites matrices additionnelles. Le nombre de paramètres entraînés chute de plusieurs ordres de grandeur, et les adaptateurs obtenus se chargent et se permutent à la demande.
Faire tenir un modèle dans une contrainte de latence
La quantification réduit la précision numérique des poids, typiquement de 32 bits à 8 ou 4 bits. Le gain en mémoire et en bande passante est direct, la perte de qualité souvent marginale si la quantification est appliquée avec un jeu de calibration représentatif. C'est la première optimisation à tenter.
La distillation entraîne un modèle compact à reproduire les sorties d'un modèle plus grand. Contrairement à la quantification, elle demande une phase d'entraînement, mais elle permet de choisir librement l'architecture cible et d'atteindre des tailles bien plus faibles.
L'élagage supprime les poids ou les canaux dont la contribution est négligeable. Efficace en théorie, il ne se traduit en gain de vitesse réel que si le matériel sait exploiter la structure obtenue : élaguer sans structure produit des matrices creuses que la plupart des accélérateurs traitent à la même vitesse que les matrices pleines.
Questions fréquentes
—Pourquoi les GPU sont-ils indispensables ?
Parce que l'entraînement se réduit à des multiplications de matrices, une opération massivement parallélisable. Un GPU exécute des milliers d'opérations simultanées là où un CPU en exécute quelques dizaines. Les accélérateurs plus récents ajoutent des unités dédiées aux formats de faible précision, ce qui creuse encore l'écart.
—Comment choisir le taux d'apprentissage ?
En le cherchant empiriquement : une brève montée exponentielle du taux sur quelques centaines d'itérations révèle la zone où la perte descend le plus vite. On retient une valeur légèrement inférieure au point de divergence, associée à un échauffement puis une décroissance progressive.
—Un réseau profond est-il forcément une boîte noire ?
Il est opaque par défaut, pas irréductiblement. Les cartes de saillance, les valeurs de Shapley et l'analyse des activations donnent des indications exploitables. Elles restent des approximations locales : elles expliquent une prédiction, pas le modèle entier.
Interroger cette page plutôt que la relire
Le contenu ci-dessus est indexé. Posez une question à l'assistant : il citera les passages exacts de cette page, et vous pourrez les ouvrir surlignés.
Ouvrir l'assistant