RLHF-Trainer — Du bist der Mensch
Über diese App
Du vergleichst Antworten: Daraus lernt ein Belohnungsmodell (σ(r_A − r_B)), die Policy verschiebt sich unter einer KL-Leine; bei lockerer Leine gewinnt die schmeichelnde Antwort (Reward Hacking); dazu der DPO-Weg.
Was RLHF ist
Reinforcement Learning from Human Feedback (RLHF) richtet ein vortrainiertes und per SFT feinjustiertes Sprachmodell an menschlichen Vorlieben aus. Menschen vergleichen jeweils zwei Antworten und wählen die bessere. Ein Belohnungsmodell lernt daraus Werte r nach dem Bradley-Terry-Ansatz: P(A ≻ B) = σ(r_A − r_B). Anschließend wird die Policy, meist mit PPO, auf hohe Belohnung optimiert, während eine KL-Strafe mit Gewicht β sie nahe am SFT-Modell hält. Das Optimum ist π(y) ∝ π_ref(y)·e^(r(y)/β). DPO (Direct Preference Optimization) erreicht dasselbe Ziel ohne separates Belohnungsmodell, direkt aus den Paaren.
Was die App zeigt
Du bist der Mensch im Ablauf: In 15 Vergleichen wählst du zwischen zwei Antworten auf denselben Prompt. Die Antworttypen reichen von hilfreich über knapp, falsch und weitschweifig bis schmeichelnd und lang. Das Belohnungsmodell sieht nur Textmerkmale wie „klingt kompetent“, „freundlich“ und „lang“ und zeigt seine gelernten Gewichte und den Testverlust auf 40 zurückgehaltenen Paaren. Ein Balkendiagramm zeigt die Wahrscheinlichkeiten der Policy gegenüber dem SFT-Modell, eine Kurve vergleicht Belohnung und Gold-Bewertung sorgfältiger Menschen über der KL-Divergenz.
Selbst ausprobieren
Label einige Paare selbst oder lass fünf Paare automatisch ehrlich labeln, dann optimiere die Policy. Verstelle die KL-Leine β: Bei lockerer Leine, etwa β = 0,03, rückt die schmeichelnde, lange Antwort nach vorn, obwohl sie in keinem deiner Paare vorkam. Die Belohnung steigt weiter, die Gold-Bewertung fällt, das ist Reward Hacking. Schalte auf DPO um und sieh, wie jedes Paar die Policy direkt verschiebt. Die Ansicht „Vorher / Nachher“ zeigt dasselbe Modell vor und nach der Optimierung.
Häufige Fragen
- Was ist RLHF einfach erklärt?
- RLHF steht für Reinforcement Learning from Human Feedback. Menschen bewerten Antworten eines Sprachmodells, meist durch Vergleiche zweier Antworten. Daraus lernt ein Belohnungsmodell, und das Sprachmodell wird anschließend so trainiert, dass es höher belohnte Antworten wahrscheinlicher macht.
- Was ist Reward Hacking?
- Reward Hacking bedeutet, dass ein Modell Antworten findet, die das Belohnungsmodell hoch bewertet, obwohl sie tatsächlich nicht besser sind. Das Belohnungsmodell ist nur eine Annäherung an das menschliche Urteil und kann zum Beispiel Länge oder Freundlichkeit überbewerten. Eine KL-Strafe, die das Modell nahe an seinem Ausgangszustand hält, begrenzt diesen Effekt.
- Was ist der Unterschied zwischen RLHF und DPO?
- RLHF trainiert zuerst ein separates Belohnungsmodell und optimiert dann die Policy mit Reinforcement Learning, etwa PPO. DPO setzt die implizite Belohnung r = β·log(π/π_ref) direkt in den Vergleichsverlust ein und trainiert die Policy auf den Präferenzpaaren. Beide verfolgen dasselbe Ziel, DPO kommt aber ohne Belohnungsmodell und ohne Sampling-Schleife aus.
- Was kann ich in dieser App ausprobieren?
- Du vergleichst Antwortpaare selbst, trainierst damit ein Belohnungsmodell und optimierst die Policy. Mit dem Regler für die KL-Leine β erzeugst du Reward Hacking und holst die hilfreiche Antwort wieder zurück, und du kannst zwischen RLHF und DPO wechseln.
Fach: Neuronale Netze
Mehr aus Neuronale Netze
- Agenten-Schleife
- Attention Visualizer
- Backpropagation — Schuld rückwärts
- Basin of Attraction
- Dein Beruf unter KI
- Die Temperatur-Schraube
- Diffusionsmodell — Bilder aus Rauschen (3D)
- Embedding Space Explorer (3D)
Eine VisuApp von heyprof: interaktiv, kostenlos im Browser, ohne Anmeldung. Was ist eine VisuApp? · Alle Apps