40 verrauschte Punkte · Startmodell F₀ = Mittelwert · Regressionsbäume (Tiefe 2, Split-Kriterium: Varianzreduktion / MSE) · Lernrate η = 0,5 · kein Bootstrap – jeder Baum sieht alle Punkte, aber ein neues Ziel
Was zeigt diese Demo?
1 · Start: die dümmste Vorhersage
Das Startmodell F₀ sagt für jedes x einfach den Mittelwert aller y-Werte vorher – eine waagerechte Linie. Der Abstand jedes Punktes zu dieser Linie ist sein Residuum: r = y − F(x), also „das, was noch fehlt“.
2 · Bäume fitten Residuen, nicht y
Jeder neue Baum wird auf die Residuen trainiert – nicht auf die Originaldaten! Ein Regressionsbaum sucht Schwellenwerte für x, die die Streuung (Varianz) der Residuen möglichst stark senken, und sagt pro Blatt den Mittelwert vorher. Das Ergebnis ist eine Treppenfunktion mit maximal 4 Stufen (Tiefe 2).
3 · Update mit Lernrate
Die Baumvorhersage wird nicht voll übernommen, sondern gedämpft addiert: Fneu = Falt + η · Baum(x) mit η = 0,5. Kleine Schritte statt großer Sprünge – das verhindert, dass ein einzelner Baum das Modell dominiert. Danach werden die Residuen neu berechnet (sie schrumpfen!) und der nächste Baum trainiert.
4 · Die Summe macht das Modell
Kein Baum allein sagt y vorher – erst die Summe aller Beiträge: F(x) = ȳ + η·h₁(x) + η·h₂(x) + … In der Formelzeile kannst du einzelne Zwischenstände anklicken und im großen Plot sehen, wie sich das Modell Schicht für Schicht an die Daten anschmiegt.
Unterschied zu Bagging / Random Forest
Bagging: viele Bäume parallel auf verschiedenen Bootstrap-Samples, alle sagen y vorher, am Ende wird gemittelt (→ Varianz sinkt). Boosting: Bäume nacheinander auf denselben Daten, jeder korrigiert die Restfehler der Vorgänger (→ Bias sinkt). Hinweis: Diese Demo zeigt Gradient Boosting. AdaBoost arbeitet anders (Umgewichtung von Punkten statt Residuen-Fitting).
Ausprobieren
Wähle die Sinus-Funktion: Ein einzelner Baum mit 4 Stufen kann eine ganze Schwingung gar nicht abbilden – aber die Summe von 4 Bäumen kommt erstaunlich nah heran. Vergleiche den MSE nach jedem Schritt.
1 · Daten & Gesamtmodell F(x)
Datenpunktewahre FunktionModell F(x)Residuen
Zwischenstand anklicken → der große Plot zeigt das Modell bis zu diesem Term.
2 · Boosting-Schritte: jeder Baum fittet die aktuellen Residuen
Didaktische Demo · Regressionsbaum: Split minimiert die gewichtete Varianz der Kindknoten (≡ maximale MSE-Reduktion), Blattvorhersage = Mittelwert. Gradient Boosting mit quadratischem Verlust: Pseudo-Residuen = gewöhnliche Residuen. · iludis.de