Standard RAG: Das Fundament, das man nicht ĂŒberspringen sollte
2. MĂ€rz 2025
Bevor Sie ĂŒber exotische RAG-Varianten nachdenken, mĂŒssen Sie das Fundament beherrschen. Standard RAG ist die einfachste Pipeline und der MaĂstab, an dem alle weiterfĂŒhrenden Muster gemessen werden.
Was es ist
Standard RAG verbindet eine Vektordatenbank mit einem Sprachmodell ĂŒber drei Schritte: die Anfrage einbetten, semantisch Ă€hnliche Dokumente abrufen, die Antwort daraus generieren. Das Dokument-Corpus wird vorab in Chunks aufgeteilt, in Vektoren umgewandelt und in einer Datenbank wie Qdrant, Pinecone oder Weaviate abgelegt. Mehr Magie steckt nicht dahinter â und genau das macht es zum richtigen Einstiegspunkt.
Wie es funktioniert
Die Pipeline besteht aus drei Schritten. Erstens wird die Benutzeranfrage mit demselben Embedding-Modell eingebettet, das auch fĂŒr die Dokumente verwendet wurde. Zweitens wird eine Ăhnlichkeitssuche (typischerweise Cosine Similarity oder Dot Product) in der Vektordatenbank durchgefĂŒhrt, um die Top-k relevantesten Chunks zu finden. Drittens werden diese Chunks zusammen mit der ursprĂŒnglichen Frage als Kontext an das LLM ĂŒbergeben, das eine fundierte Antwort generiert.

StÀrken
Standard RAG ist einfach zu implementieren und zu debuggen. Die lineare Pipeline macht jeden Schritt nachvollziehbar. Es funktioniert hervorragend fĂŒr AnwendungsfĂ€lle mit einem einzigen Wissensbereich â etwa eine Produktdokumentation, ein Handbuch oder eine FAQ-Sammlung. Die Latenz ist vorhersagbar, da nur ein Retrieval-Schritt und ein LLM-Aufruf erfolgen.
SchwÀchen
Die gröĂte SchwĂ€che ist die fehlende QualitĂ€tskontrolle nach dem Retrieval. Wenn die Vektorsuche irrelevante Chunks zurĂŒckgibt, verarbeitet das LLM sie trotzdem â was zu Halluzinationen oder fehlerhaften Antworten fĂŒhren kann. AuĂerdem fehlt die FĂ€higkeit, mehrdeutige oder kontextabhĂ€ngige Fragen aufzulösen, da kein GesprĂ€chsverlauf berĂŒcksichtigt wird.
Wann Sie es einsetzen sollten
Beginnen Sie immer mit Standard RAG. Es ist das Fundament, auf dem alle anderen Muster aufbauen. Wenn die AntwortqualitĂ€t ausreicht und Ihre Nutzer keine Folgefragen stellen, brauchen Sie nichts Komplexeres. Messen Sie Precision und Recall Ihrer Retrieval-Ergebnisse â erst wenn diese unter Ihren Schwellenwerten liegen, sollten Sie zu fortgeschritteneren Mustern greifen.
Quellen
Lewis et al. â Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (2020)
