Zum Inhalt
Alle Apps

RAG — Suche nach Bedeutung

Über diese App

Retrieval-Augmented Generation Schritt für Schritt: Chunks, Embeddings, Suche nach Kosinus, BM25 oder hybrid, Top-k-Schnitt, Prompt mit Token-Budget und Antwort mit Quellen; Fehltreffer führen zu Halluzination.

Wie RAG funktioniert

Retrieval-Augmented Generation (RAG) lässt ein Sprachmodell nachschlagen, bevor es antwortet. Dokumente werden in Abschnitte, sogenannte Chunks, zerlegt, und jeder Chunk bekommt ein Embedding, einen Vektor seiner Bedeutung. Auch die Frage wird eingebettet. Die Suche nimmt die Chunks mit der höchsten Kosinus-Ähnlichkeit bis zu einer Grenze Top-k und kopiert sie mit der Frage in den Prompt. Das Modell antwortet daraus und kann die Quellen nennen. Fehlt der passende Chunk im Prompt, antwortet es aus seinem Trainingswissen und kann dabei halluzinieren.

Was die App zeigt

Die App zeigt die fünf Schritte Zerlegen, Einbetten, Abrufen, Anreichern und Antworten am Beispiel eines Hilfe-Centers. Die Chunks liegen als Punkte auf einer Kugel, gruppiert nach Themen wie Vertrag, Bezahlung, Technik und Datenschutz. Ein Ranking listet alle Chunks mit Kosinus- und BM25-Wert, eine Linie markiert den Top-k-Schnitt. Rechts füllt sich ein Kontextfenster mit 256 Tokens. Die Embeddings sind handgemachte Spielzeug-Vektoren mit 16 Konzept-Achsen, und die Antwort setzt Sätze aus dem Prompt zusammen, statt ein echtes Sprachmodell zu fragen.

Selbst ausprobieren

Probiere die Beispielfragen, die Fälle wie Synonyme, Mehrdeutigkeit, Fehlercodes oder Grenzfälle abdecken, oder tippe eine eigene Frage. Vergleiche die Suchmodi: Die Stichwortsuche (BM25) findet „Fahrzeug“ nicht, wenn nach „Auto“ gefragt wird, trifft aber exakte Codes wie E-217; die Bedeutungssuche verhält sich umgekehrt, „Hybrid“ verbindet beide Ranglisten. Stelle Top-k zwischen 1 und 6 und die Chunk-Größe auf Satz, Absatz oder Dokument und beobachte, wann die Antwort belegt, unvollständig oder halluziniert ist.

Häufige Fragen

Was ist RAG bei KI?
RAG steht für Retrieval-Augmented Generation. Ein Sprachmodell bekommt vor dem Antworten passende Textstellen aus einer Dokumentensammlung in den Prompt, die per Suche ausgewählt wurden. So kann es Fragen zu Inhalten beantworten, die nicht in seinen Trainingsdaten stehen, und die Quellen angeben.
Was ist der Unterschied zwischen semantischer Suche und BM25?
BM25 ist ein klassisches Stichwortverfahren, das Chunks nach gemeinsamen Wörtern mit der Frage bewertet. Es findet keine Synonyme, trifft aber exakte Begriffe und Codes zuverlässig. Semantische Suche vergleicht Embeddings per Kosinus-Ähnlichkeit und findet bedeutungsgleiche Formulierungen, kann aber bei exakten Bezeichnern danebenliegen. Hybride Suche kombiniert beide Ranglisten.
Warum halluziniert ein RAG-System trotzdem?
Ein RAG-System halluziniert, wenn der Chunk mit der Antwort nicht im Prompt landet. Das passiert, wenn die Suche ihn nicht findet, wenn er unter dem Top-k-Schnitt liegt oder wenn er nicht mehr ins Token-Budget passt. Das Modell füllt die Lücke dann mit plausiblem Wissen aus dem Training.
Was kann ich in dieser App ausprobieren?
Du stellst Beispiel- oder eigene Fragen, wählst Stichwort-, Bedeutungs- oder Hybridsuche, Top-k und Chunk-Größe. Du siehst das Ranking, den zusammengesetzten Prompt mit Token-Budget und ob die Antwort durch Quellen belegt ist.

Fach: Neuronale Netze

Mehr aus Neuronale Netze

Eine VisuApp von heyprof: interaktiv, kostenlos im Browser, ohne Anmeldung. Was ist eine VisuApp? · Alle Apps