1. EXECUTION: Pred = 2 × 0.50 = 1.0
2. ERREUR: Err = 10 - 1.0 = 9.0
3. RETROPROPAGATION: Grad = 9.0 × -2 = -18.0
4. MISE À JOUR: W = 0.50 - (-18.0 × 0.05) = 1.40
On cherche à minimiser la fonction d'erreur (Loss) définie par :
$$ E = \frac{1}{2}(\text{Cible} - \text{Sortie})^2 $$
Pour ajuster le poids, on calcule la dérivée de $E$ par rapport à $w$ via la règle de la chaîne :
$$ \frac{\partial E}{\partial w} = \underbrace{(\text{Sortie} - \text{Cible})}_{\text{dérivée ext.}} \times \underbrace{(\text{Entrée})}_{\text{dérivée int.}} $$
L'apprentissage utilise la
règle de la chaîne pour dériver la fonction composée $(v \circ u(w))$ :
$$ (v \circ u(w))' = v'(u(w)) \times u'(w) $$
Dans notre neurone, cela se décompose ainsi :
- Fonction interne $u(w) = \text{Entrée} \times w$ :
Sa dérivée $u'(w)$ est l'Entrée.
- Fonction externe $v(u) = \frac{1}{2}(\text{Cible} - u)^2$ :
Sa dérivée $v'(u)$ est $(\text{Sortie} - \text{Cible})$, soit $-\text{Erreur}$.
En multipliant ces deux dérivées, on obtient la pente (le gradient) :
$$ \frac{\partial E}{\partial w} = \underbrace{-(\text{Erreur})}_{v'(u)} \times \underbrace{\text{Entrée}}_{u'(w)} $$
C'est ce calcul qui permet à l'étape 3 de déterminer la direction et la force de la correction.