Zum Inhalt
Alle Apps

Gradient Descent (3D)

Über diese App

Verlustfläche einer echten Geradenanpassung in 3D: θ ← θ − η∇L mit Stabilitätsgrenze 2/λmax, zwei Täler und ein Sattel, GD, Momentum und Adam im Rennen, SGD-Rauschen und die Gerade im Modell-Panel.

Wie Gradientenabstieg funktioniert

Beim Training eines Modells wird ein Verlust L(θ) minimiert, der misst, wie schlecht die Parameter θ zu den Daten passen. Gradientenabstieg geht dafür schrittweise gegen den Gradienten: θ ← θ − η∇L. Die Lernrate η bestimmt die Schrittlänge. Ist sie zu klein, kriecht das Verfahren; ist sie zu groß, schießt jeder Schritt über das Tal hinaus. Für eine quadratische Fläche bleibt der einfache Gradientenabstieg nur stabil, solange η < 2/λmax gilt, wobei λmax die größte Krümmung ist. Lokale Minima und Sattelpunkte haben ebenfalls Gradient null und können das Verfahren aufhalten.

Was die App zeigt

Drei Verlustlandschaften stehen zur Wahl: der Geradenfit mit L(w, b) = 1/(2n) · Σ (w·xᵢ + b − yᵢ)², eine Fläche mit zwei Tälern und ein Sattel. Ein Ball rollt Schritt für Schritt bergab, ein Pfeil zeigt Richtung und Länge des Schritts. Das Panel „Werte“ nennt Verlust, Schrittzahl, Gefälle ‖∇L‖ und den Abstand zum Minimum, eine Trainingskurve zeigt den Verlust je Schritt. Beim Geradenfit dreht und verschiebt sich die Gerade im Panel „Modell“, bis sie mit der Lösung der kleinsten Quadrate übereinstimmt.

Selbst ausprobieren

Schiebe die Lernrate von winzig bis zu groß und beobachte, wann der Ball kriecht, schwingt oder aus der Landschaft fliegt; die App nennt die Stabilitätsgrenze für GD. Lass GD, Momentum und Adam um die Wette laufen. Starte im Zwei-Täler-Modus „In der Falle“ und schalte dann auf „Hochdimensional“: Mit einer dritten Gewichtsrichtung z wird das lokale Minimum zum Sattel, und der Ball findet hinaus. Am Sattel hilft das Rauschen im Gradienten (SGD) oder ein Start knapp neben dem Grat.

Häufige Fragen

Was ist Gradientenabstieg?
Gradientenabstieg ist ein Optimierungsverfahren, das eine Funktion minimiert, indem es wiederholt einen Schritt gegen ihren Gradienten macht: θ ← θ − η∇L. Der Gradient zeigt in die Richtung des steilsten Anstiegs, sein Gegenteil also bergab. Neuronale Netze werden fast immer mit Varianten dieses Verfahrens trainiert.
Was passiert, wenn die Lernrate zu groß ist?
Bei zu großer Lernrate springt jeder Schritt über das Minimum hinaus. Zuerst schwingen die Parameter hin und her, oberhalb einer Stabilitätsgrenze wachsen die Sprünge und der Verlust steigt, das Training divergiert. Für eine quadratische Verlustfläche liegt diese Grenze bei η = 2/λmax.
Was ist der Unterschied zwischen Momentum und Adam?
Momentum sammelt frühere Gradienten in einer Geschwindigkeit v und nimmt so Schwung mit, was flache Täler schneller durchquert. Adam führt gleitende Mittel von Gradient und Gradientenquadrat und teilt jede Richtung durch ihre typische Gradientengröße. Dadurch sind Adams Schritte fast unabhängig davon, wie steil der Hang ist.
Was kann ich in dieser App ausprobieren?
Du wählst Landschaft, Verfahren, Lernrate und Startpunkt und siehst den Ball live über die 3D-Fläche rollen. Du kannst alle drei Verfahren gegeneinander antreten lassen, SGD-Rauschen zuschalten und im hochdimensionalen Modus sehen, wie ein lokales Minimum zum Sattel wird.

Fach: Neuronale Netze

Mehr aus Neuronale Netze

Eine VisuApp von heyprof: interaktiv, kostenlos im Browser, ohne Anmeldung. Was ist eine VisuApp? · Alle Apps