Conversational RAG: Ihrem System das Erinnern beibringen
3. MĂ€rz 2025
Standard RAG behandelt jede Frage isoliert â und stolpert, sobald ein Nutzer eine Folgefrage stellt. Conversational RAG fĂŒgt eine Erinnerungsschicht hinzu, die den bisherigen Dialog in jede Suche einbezieht.
Was es ist
Wenn ein Nutzer erst nach "Kubernetes" fragt und dann "Wie skaliert es?" tippt, muss das System verstehen, dass sich "es" auf Kubernetes bezieht. Conversational RAG löst diese BezĂŒge auf, indem es den GesprĂ€chsverlauf in jeden Retrieval-Schritt einspeist â eine Memory-Komponente hĂ€lt dabei den Zustand zwischen den Dialogrunden.
Wie es funktioniert
Der SchlĂŒsselmechanismus ist die Frage-Umformulierung (Query Rewriting). Bevor die Vektorsuche ausgefĂŒhrt wird, nimmt ein LLM die aktuelle Frage und den bisherigen GesprĂ€chsverlauf und formuliert eine eigenstĂ€ndige Suchanfrage. Aus "Wie skaliert es?" wird dann "Wie skaliert Kubernetes?". Diese umformulierte Anfrage wird eingebettet und fĂŒr die Vektorsuche verwendet. Der Rest der Pipeline bleibt identisch mit Standard RAG.

StÀrken
Es ermöglicht natĂŒrliche, mehrstufige Dialoge. Nutzer können sich in ein Thema vertiefen, ohne bei jeder Frage den vollstĂ€ndigen Kontext wiederholen zu mĂŒssen. Die Implementierung ist vergleichsweise einfach: Man fĂŒgt lediglich einen Query-Rewriting-Schritt vor dem bestehenden Retrieval ein.
SchwÀchen
Der zusĂ€tzliche LLM-Aufruf fĂŒr die Umformulierung erhöht die Latenz und die Kosten. Bei langen GesprĂ€chen kann der Kontext das Token-Limit ĂŒberschreiten, weshalb eine intelligente Zusammenfassung oder ein Sliding-Window-Ansatz nötig wird. AuĂerdem kann eine fehlerhafte Umformulierung die Retrieval-QualitĂ€t verschlechtern statt verbessern.
Wann Sie es einsetzen sollten
Verwenden Sie Conversational RAG, sobald Ihre Anwendung mehrstufige Dialoge unterstĂŒtzen soll â etwa in Chatbots, Support-Systemen oder interaktiven Wissensportalen. Es ist der natĂŒrliche nĂ€chste Schritt nach Standard RAG und in den meisten produktiven Chat-Anwendungen unverzichtbar. FĂŒr einen test können sie diesen Chat benutzen.
Quellen
Liu et al. â ChatQA: Surpassing GPT-4 on Conversational QA and RAG (2024)
Qu et al. â Open-Retrieval Conversational Question Answering (2020)
