Self-RAG: Die Architektur, die ihre eigenen Antworten hinterfragt
6. MĂ€rz 2025
Externe Evaluatoren prĂŒfen die Antwort erst, wenn sie schon geschrieben ist. Self-RAG verlagert die Kritik in das Modell selbst â ĂŒber spezielle Reflexions-Tokens, mit denen das LLM seinen eigenen Output wĂ€hrend der Generierung bewertet.
Was es ist
Beim Training lernt das Modell vier Steuer-Tokens: Retrieve (muss ich ĂŒberhaupt etwas abrufen?), ISREL (sind die Treffer relevant?), ISSUP (decken die Belege meine Aussage?), ISUSE (ist die Antwort nĂŒtzlich?). Diese Tokens funktionieren wie ein innerer Monolog, der jede Stufe der Antwort prĂŒft, bevor sie den Nutzer erreicht.
Wie es funktioniert
Der Prozess verlĂ€uft in mehreren Schritten. ZunĂ€chst generiert das Modell ein Retrieve-Token, das angibt, ob Retrieval nötig ist. Falls ja, werden Dokumente abgerufen und jedes einzeln mit einem ISREL-Token bewertet (relevant oder nicht). FĂŒr jedes relevante Dokument generiert das Modell eine Teilantwort und prĂŒft mit ISSUP, ob diese durch das Dokument gestĂŒtzt wird. AbschlieĂend bewertet ISUSE die GesamtqualitĂ€t der Antwort. Nur wenn alle PrĂŒfungen bestanden werden, wird die Antwort an den Nutzer ausgegeben.

StÀrken
Self-RAG erreicht eine deutlich höhere faktische Genauigkeit als Standard-RAG, weil es irrelevante Dokumente und ungestĂŒtzte Aussagen aktiv aussortiert. Das Modell vermeidet unnötige Retrieval-Aufrufe, wenn die Frage aus dem Trainingswissen beantwortbar ist, was Latenz und Kosten spart. Die Reflexions-Tokens bieten auĂerdem hervorragende ErklĂ€rbarkeit â man kann genau nachvollziehen, warum das Modell bestimmte Dokumente akzeptiert oder abgelehnt hat.
SchwÀchen
Der gröĂte Nachteil ist der Trainingsaufwand. Self-RAG erfordert ein speziell feinabgestimmtes Modell, das die Reflexions-Tokens korrekt generieren kann. Dies macht es deutlich aufwĂ€ndiger als Architektur-basierte AnsĂ€tze, die mit jedem LLM funktionieren. AuĂerdem kann eine zu strenge Selbstbewertung dazu fĂŒhren, dass das Modell korrekte Antworten verwirft, weil es sie nicht vollstĂ€ndig durch Dokumente belegen kann.
Wann Sie es einsetzen sollten
Self-RAG eignet sich fĂŒr Anwendungen, bei denen faktische Genauigkeit oberste PrioritĂ€t hat und Sie bereit sind, in das Training eines spezialisierten Modells zu investieren. Es ist besonders wirkungsvoll in WissensdomĂ€nen mit gemischten Anforderungen â wenn manche Fragen Retrieval benötigen und andere nicht.
