L'idée, avant la formule
Le réseau fait une prédiction. Il la compare à la vraie réponse. Il se demande : « quels poids ont le plus contribué à mon erreur ? » Il les ajuste un peu. Puis il recommence 10 000 fois.
C'est tout. Le reste n'est que la façon de calculer « un peu ».
📖 Vocabulaire - français / anglais
- hyperparamètre ↔ *hyperparameter* (un réglage que TU choisis : taux, nb de neurones, époques)
- dérivée ↔ *derivative* (la pente : à quel point la sortie change quand l'entrée bouge)
- gradient ↔ *gradient* (la direction dans laquelle réduire l'erreur)
Exercice 5.1 - La rétropropagation en français
✍️ À toi de jouer
Reprends le code de la Phase 3 et regarde cette ligne :
delta2 = erreur * derivee_sigmoide(sortie)
Question : pourquoi multiplie-t-on l'erreur par la dérivée de la sigmoïde ?
Besoin d'un indice ?
La sigmoïde est « plate » près de 0 et de 1, et « raide » vers 0.5. Si la prédiction est déjà très confiante, on ne veut pas beaucoup l'ajuster. La dérivée dit « à quel point la sigmoïde est sensible ici ».
Voir la réponse
- Prédiction 0.99, réponse 1 → erreur 0.01, et la dérivée en 0.99 est minuscule →
delta≈ 0. Le réseau dit : « je suis déjà sûr, je n'ajuste presque pas. » - Prédiction 0.5, réponse 1 → erreur 0.5, et la dérivée en 0.5 est grande (0.25) →
deltagrand. Le réseau dit : « je ne sais pas, j'ajuste beaucoup ! »
La leçon : la dérivée sert de frein. Elle empêche le réseau de paniquer quand il est déjà proche de la bonne réponse.
Le tableau des boutons à tourner
| Bouton | Ce qu'il règle | Expérience |
|---|---|---|
| Taux d'apprentissage | La taille du pas | 20.0 = explosion · 0.000001 = sommeil · 0.5 = juste |
| Neurones cachés | La capacité | 1 = trop bête · 100 = risque de sur-entraînement |
| Époques | Le nombre de répétitions | 100 = pas assez · 100 000 = il mémorise |
✍️ À toi de jouer
Monte les neurones cachés à 100 et les époques à 100 000, sur seulement 4 fleurs. L'erreur sur ces 4 fleurs devient minuscule. Teste ensuite sur une 5ᵉ fleur jamais vue. Que se passe-t-il ?
Voir la réponse
Parfait sur les 4 fleurs d'entraînement (il les connaît par cœur), mais souvent faux sur la 5ᵉ inconnue : il a mémorisé au lieu d'apprendre la règle générale.
C'est le sur-entraînement (*overfitting*). Un réseau trop gros, entraîné trop longtemps sur trop peu de données, devient un perroquet. La bonne IA généralise à du neuf.