Zum Inhalt
Alle Apps

Transformer 3D

Über diese App

Die GPT-2-Architektur begehbar: Residual-Strom durch 12 Blöcke, maskierte Attention als Brücken, MLP d → 4d → d, Unembedding und Softmax, ein Token nach dem anderen; Parameter je Bauteil und GPT-3 im Vergleich.

Der Aufbau von GPT-2

GPT-2 small zerlegt Text in Tokens aus einem Vokabular von 50.257 Einträgen. Jedes Token wird über eine Embedding-Tabelle zu einem Vektor mit d = 768 Zahlen, dazu kommt ein gelerntes Positions-Embedding. Dieser Residual-Strom durchläuft 12 gleich gebaute Blöcke: Jede Teilschicht liest ihn über eine LayerNorm und addiert ihr Ergebnis, x ← x + Attn(LN(x)), dann x ← x + MLP(LN(x)). Nur in der maskierten Attention tauschen Positionen Information aus, das MLP weitet jede Position einzeln von d auf 4d auf und zurück.

Was die App zeigt

Jedes Token hat eine eigene Spur, den Residual-Strom. Die 12 Blöcke liegen als Brücken darüber, die Attention überspannt alle Spuren, das Gitter auf ihr ist die kausale Maske. Am Ende wird nur die letzte Position über Unembedding und Softmax zu Wahrscheinlichkeiten für das nächste Token. Ein Klick auf ein Bauteil erklärt im Panel „Baustein“, was es tut und wie viele Parameter es hat. Ohne Modell zeigt die App Beispielwerte; am Rechner lässt sich echtes GPT-2 (124 M) im Browser laden.

Selbst ausprobieren

Starte einen „Durchlauf“, auf Wunsch in Zeitlupe, und verfolge ein Token vom Embedding bis zur Softmax. „Nächstes Token“ hängt das Ergebnis an und zeigt die autoregressive Schleife. Schalte die kausale Maske aus: Dann sieht jede Position auch spätere Tokens, wie bei einem Encoder. Im Panel „Modell“ zählst du die Parameter, rund 12·L·d² für die Blöcke plus Embeddings, und wechselst auf GPT-3 mit 96 Blöcken und d = 12.288.

Häufige Fragen

Wie ist ein Transformer wie GPT aufgebaut?
Ein GPT-Modell besteht aus Embedding-Tabellen für Tokens und Positionen, einem Stapel gleich gebauter Blöcke und einer Ausgabeschicht. Jeder Block enthält eine maskierte Self-Attention und ein MLP, jeweils mit LayerNorm davor und einer Residual-Addition danach. Am Ende werden die Werte der letzten Position per Softmax zu Wahrscheinlichkeiten für das nächste Token.
Was ist der Residual-Strom?
Der Residual-Strom ist der Vektor jeder Position, der vom Embedding bis zum Ausgang durchläuft. Jede Teilschicht liest ihn und addiert ihr Ergebnis, ersetzt wird nichts. So sammelt der Strom die Beiträge aller Blöcke, und im Training fließt der Gradient ungehindert durch das ganze Netz.
Wozu dient die kausale Maske in der Attention?
Die kausale Maske sorgt dafür, dass jede Position nur auf sich selbst und frühere Positionen achtet. Gewichte für spätere Positionen werden vor der Softmax auf −∞ gesetzt und damit null. So kann ein Modell im Training an allen Positionen gleichzeitig das nächste Token üben, ohne abzuschreiben.
Was kann ich in dieser App ausprobieren?
Du schickst Tokens durch das 3D-Modell von GPT-2, klickst Bauteile an und liest ihre Funktion und Parameterzahl. Du schaltest die kausale Maske aus, vergleichst GPT-2 small mit GPT-3 und kannst am Rechner echtes GPT-2 laden.

Fach: Neuronale Netze

Mehr aus Neuronale Netze

Eine VisuApp von heyprof: interaktiv, kostenlos im Browser, ohne Anmeldung. Was ist eine VisuApp? · Alle Apps