Adaptive RAG: Aufwand an KomplexitÀt anpassen
5. MĂ€rz 2025
Nicht jede Anfrage verdient denselben Aufwand. Adaptive RAG sortiert Fragen nach Schwierigkeit und schickt jede ĂŒber den gĂŒnstigsten Pfad â von der direkten Antwort des LLM bis zur mehrstufigen Recherche.
Was es ist
Ein vorgelagerter Klassifikator ordnet jede eingehende Anfrage einer KomplexitĂ€tsstufe zu. Eine BegrĂŒĂung beantwortet das LLM direkt, eine Faktfrage geht durch Standard-RAG, eine mehrteilige analytische Frage löst mehrstufiges Retrieval oder eine Websuche aus. So vermeidet das System unnötigen Aufwand, ohne bei den schwierigen FĂ€llen AntwortqualitĂ€t zu opfern.
Wie es funktioniert
Ein Query-Classifier â oft ein kleines, feinabgestimmtes Modell oder ein Prompt-basierter Classifier â analysiert jede eingehende Anfrage und ordnet sie einer KomplexitĂ€tsstufe zu. FĂŒr einfache Faktenfragen ("Wann wurde Python veröffentlicht?") kann das LLM direkt aus seinem Trainingswissen antworten. FĂŒr domĂ€nenspezifische Fragen wird Standard-RAG ausgelöst. FĂŒr mehrdeutige oder komplexe Fragen, die mehrere Quellen erfordern, kommt mehrstufiges Retrieval mit Query Decomposition zum Einsatz.

StÀrken
Die gröĂte StĂ€rke ist die Effizienz: Einfache Fragen werden schnell und kostengĂŒnstig beantwortet, ohne die Vektordatenbank zu belasten. Gleichzeitig erhalten schwierige Fragen die zusĂ€tzliche Verarbeitungstiefe, die sie benötigen. Dies fĂŒhrt zu einer besseren Nutzererfahrung mit niedrigerer durchschnittlicher Latenz und reduzierten Kosten pro Anfrage.
SchwÀchen
Die QualitĂ€t hĂ€ngt stark vom Classifier ab. Eine Fehlklassifizierung kann dazu fĂŒhren, dass komplexe Fragen zu oberflĂ€chlich bearbeitet werden oder einfache Fragen unnötig aufwĂ€ndige Pipelines durchlaufen. Der Classifier selbst muss trainiert oder sorgfĂ€ltig gepromptet werden, was zusĂ€tzlichen Entwicklungsaufwand bedeutet. AuĂerdem steigt die SystemkomplexitĂ€t durch die multiplen Pfade erheblich.
Wann Sie es einsetzen sollten
Adaptive RAG lohnt sich, wenn Ihr System ein breites Spektrum an Anfragen bedient â von trivialen Faktenfragen bis hin zu komplexen Analyseaufgaben. Wenn Ihre Nutzerbasis heterogen ist und Sie Kosten und Latenz optimieren wollen, ohne bei schwierigen Fragen QualitĂ€t einzubĂŒĂen, ist dies eine ausgezeichnete Wahl.
