← Comprendre les Réseaux de Neurones
🎚️ Phase 5 · 1 jour

Hyperparamètres et rétropropagation

🎯 Ce que tu retiens : Le « frein » de l'apprentissage

L'idée, avant la formule

Le réseau fait une prédiction. Il la compare à la vraie réponse. Il se demande : « quels poids ont le plus contribué à mon erreur ? » Il les ajuste un peu. Puis il recommence 10 000 fois.

C'est tout. Le reste n'est que la façon de calculer « un peu ».

📖 Vocabulaire - français / anglais

  • hyperparamètre ↔ *hyperparameter* (un réglage que TU choisis : taux, nb de neurones, époques)
  • dérivée ↔ *derivative* (la pente : à quel point la sortie change quand l'entrée bouge)
  • gradient ↔ *gradient* (la direction dans laquelle réduire l'erreur)

Exercice 5.1 - La rétropropagation en français

✍️ À toi de jouer

Reprends le code de la Phase 3 et regarde cette ligne :

delta2 = erreur * derivee_sigmoide(sortie)

Question : pourquoi multiplie-t-on l'erreur par la dérivée de la sigmoïde ?

Besoin d'un indice ?

La sigmoïde est « plate » près de 0 et de 1, et « raide » vers 0.5. Si la prédiction est déjà très confiante, on ne veut pas beaucoup l'ajuster. La dérivée dit « à quel point la sigmoïde est sensible ici ».

Voir la réponse
  • Prédiction 0.99, réponse 1 → erreur 0.01, et la dérivée en 0.99 est minuscule → delta ≈ 0. Le réseau dit : « je suis déjà sûr, je n'ajuste presque pas. »
  • Prédiction 0.5, réponse 1 → erreur 0.5, et la dérivée en 0.5 est grande (0.25) → delta grand. Le réseau dit : « je ne sais pas, j'ajuste beaucoup ! »

La leçon : la dérivée sert de frein. Elle empêche le réseau de paniquer quand il est déjà proche de la bonne réponse.

Le tableau des boutons à tourner

BoutonCe qu'il règleExpérience
Taux d'apprentissageLa taille du pas20.0 = explosion · 0.000001 = sommeil · 0.5 = juste
Neurones cachésLa capacité1 = trop bête · 100 = risque de sur-entraînement
ÉpoquesLe nombre de répétitions100 = pas assez · 100 000 = il mémorise

✍️ À toi de jouer

Monte les neurones cachés à 100 et les époques à 100 000, sur seulement 4 fleurs. L'erreur sur ces 4 fleurs devient minuscule. Teste ensuite sur une 5ᵉ fleur jamais vue. Que se passe-t-il ?

Voir la réponse

Parfait sur les 4 fleurs d'entraînement (il les connaît par cœur), mais souvent faux sur la 5ᵉ inconnue : il a mémorisé au lieu d'apprendre la règle générale.

C'est le sur-entraînement (*overfitting*). Un réseau trop gros, entraîné trop longtemps sur trop peu de données, devient un perroquet. La bonne IA généralise à du neuf.