Zum Inhalt
Alle Apps

Die Temperatur-Schraube

Über diese App

Logits werden per softmax(z/T) zur Verteilung: Temperatur, Greedy, Sampling, Top-k und Top-p mit sichtbarer Abschnittslinie, Entropie, Entscheidungsbaum der Generierung und Schleifen bei T = 0.

Von Logits zu Wahrscheinlichkeiten

Ein Sprachmodell gibt für jedes mögliche nächste Token eine Zahl aus, das Logit z. Die Softmax macht daraus Wahrscheinlichkeiten. Die Temperatur T teilt alle Logits vorher: p = softmax(z/T). Für T → 0 landet alle Masse auf Platz 1, T = 1 lässt die Verteilung unverändert, großes T macht sie flach; die Rangfolge bleibt immer gleich. Danach wählt eine Dekodierstrategie: Greedy nimmt stets das wahrscheinlichste Token, Sampling würfelt aus der ganzen Verteilung, Top-k nur unter den k besten, Top-p (Nucleus Sampling) unter der kleinsten Spitzengruppe mit Gesamtmasse ≥ p.

Was die App zeigt

Für fünf deutsche Prompts, etwa „Es war einmal eine“, zeigt die App zwölf Kandidaten mit Logit und Wahrscheinlichkeit. Eine gestrichelte Linie markiert, wo Top-k oder Top-p abschneiden, ein Massenstreifen zeigt die gezogene Zufallszahl. Dazu kommen Entropie H(p), die wirksame Auswahl 2^H und die Masse im Topf. Rechts wächst der Text Token für Token, ein Baum zeigt die nicht gewählten Alternativen. Die Logits sind von Hand erstellt und dienen der Veranschaulichung; ein echtes Modell hat zehntausende Kandidaten.

Selbst ausprobieren

Schiebe die Temperatur zwischen 0 und 3 und beobachte, wie die Balken steiler oder flacher werden, ohne die Reihenfolge zu ändern. Wechsle zwischen Greedy, Sampling, Top-k und Top-p und stelle k oder p ein. Klicke im Baum auf eine Alternative, um abzuzweigen und zu sehen, wie eine frühe Wahl den Rest verändert. Der Knopf „Vergleich“ stellt Greedy bei T = 0, Top-p 0,9 bei T = 0,7 und Sampling bei T = 1 und T = 2,2 nebeneinander, mit Wiederholungsschleife und abwegigen Tokens.

Häufige Fragen

Was bedeutet die Temperatur bei ChatGPT und anderen LLMs?
Die Temperatur steuert, wie zufällig ein Sprachmodell das nächste Token wählt. Die Logits werden vor der Softmax durch T geteilt: Kleine Werte machen die Verteilung spitz und die Ausgabe vorhersehbar, große Werte machen sie flach und die Ausgabe vielfältiger, aber auch fehleranfälliger. Die Reihenfolge der Kandidaten ändert sich dabei nicht.
Was ist der Unterschied zwischen Top-k und Top-p?
Top-k würfelt immer unter einer festen Anzahl k der wahrscheinlichsten Tokens. Top-p, auch Nucleus Sampling genannt, nimmt die kleinste Gruppe der wahrscheinlichsten Tokens, deren Wahrscheinlichkeiten zusammen mindestens p ergeben. Dadurch passt sich die Größe der Auswahl bei Top-p an die Form der Verteilung an.
Warum wiederholt sich Greedy-Dekodierung oft?
Greedy-Dekodierung wählt immer das wahrscheinlichste Token und ist deshalb vollständig deterministisch. Gerät der Text einmal in eine Folge, nach der dieselbe Fortsetzung wieder am wahrscheinlichsten ist, entsteht eine Schleife. Sampling mit moderater Temperatur oder Top-p bricht solche Wiederholungen eher auf.
Was kann ich in dieser App ausprobieren?
Du stellst Temperatur, Strategie, k und p ein und ziehst Token für Token. Ein Entscheidungsbaum zeigt die Alternativen und erlaubt Abzweigungen, und der Vergleich zeigt vier Einstellungen nebeneinander für denselben Prompt.

Fach: Neuronale Netze

Mehr aus Neuronale Netze

Eine VisuApp von heyprof: interaktiv, kostenlos im Browser, ohne Anmeldung. Was ist eine VisuApp? · Alle Apps