Was ist Retrieval-Augmented Generation?
Definition, Funktionsweise, Nutzen, Grenzen und Beispiele von RAG.
Artikel lesen →Von der einfachen Vektorsuche zu robusteren Architekturmustern: Hybrid Retrieval, Reranking, MMR-Diversität, Graph-RAG und Guardrails. Die Bausteine sind eine Zielarchitektur – welche davon sinnvoll sind, muss für Daten, Risiken und Fragen evaluiert werden.
Nicht jede Anwendung benötigt jede Stufe. Zusätzliche Komplexität muss einen messbaren Qualitäts- oder Sicherheitsgewinn liefern.
HTML-Boilerplate entfernen, strukturbewusstes Chunking (300–600 Tokens, 10–20 % Overlap, an Überschriften orientiert), Deduplizierung per content_hash und Anreicherung mit Metadaten (URL, Titel, Abschnitt, Importdatum).
Parallele dichte Vektorsuche (pgvector / Embeddings) und lexikalische Volltextsuche (Postgres FTS, BM25-artig). Beide Ranglisten werden per Reciprocal Rank Fusion (RRF) kombiniert – robust gegen Synonyme und exakte Begriffe.
Harter Mandantenfilter (knowledge_space_id) serverseitig erzwungen, Relevanzschwelle, Zugriffskontrolle (ACL): Nutzer sehen nur Chunks, für die sie berechtigt sind. Kein Cross-Space-Leak.
Kandidaten werden nicht nur nach Ähnlichkeit, sondern über mehrere gewichtete Signale neu sortiert (siehe Gewichtungstabelle unten): semantische Relevanz, Keyword-Treffer, Quellenqualität, Aktualität, Autorität und Nutzer-Feedback.
Maximal Marginal Relevance (λ) balanciert Relevanz gegen Redundanz; ein Cap pro Quelldokument verhindert, dass eine einzige Seite das Kontextfenster dominiert.
Optional: LLM-basiertes Re-Ranking (Cross-Encoder), Contextual Compression (irrelevante Sätze kürzen), Query Expansion / Multi-Query und Konfliktauflösung bei widersprüchlichen Quellen.
Token-Budget-Management, „lost in the middle“-Anordnung (beste Chunks an Anfang/Ende), nummerierter Quellen-Kontext und gehärteter Systemprompt: Kontext = Daten, keine Befehle.
Nachgelagerte Prüfung: Es werden nur tatsächlich bereitgestellte Quellen zitiert, PII wird maskiert, der Systemprompt nie offengelegt, und bei fehlender Grundlage greift das deterministische No-Answer-Gate.
Offline-Metriken (Precision, Recall, Groundedness/Faithfulness, Citation Accuracy, No-Answer Accuracy) auf einem Golden-Set, Betriebsmetriken (Latenz, Error-Rate, Token-Cost) via Micrometer und ein Nutzer-Feedback-Loop (EWMA), der zurück in Stufe 4 fliesst.
Das folgende Schema ist ein bewusst illustratives Beispiel, keine universelle Empfehlung. Gewichte müssen auf einem Golden Set kalibriert werden.
Semantische Relevanz aus dem Embedding-Abgleich (Kosinus-Ähnlichkeit).
Keyword-Vorkommen (BM25 / Postgres FTS) – wichtig für exakte Begriffe & Codes.
Parsing-Qualität & Review-Status des Quelldokuments.
Exponentieller Altersabfall – frische Inhalte werden bevorzugt.
Verlinkungen & Zitierungshäufigkeit der Quelle.
Vergangenes Daumen-Feedback, geglättet per EWMA.
Maximal Marginal Relevance steuert die Balance zwischen Relevanz (λ = 1.0) und Redundanzvermeidung (λ = 0.0). Ein typischer Wert von ca. 0.7 liefert relevante, aber vielfältige Chunks – so wird das Kontextfenster nicht mit Duplikaten gefüllt.
Wenn Beziehungen zwischen Entitäten wichtig sind, ergänzt ein Wissensgraph die Vektorsuche.
Reine Vektorsuche findet ähnliche Textstellen, aber keine Mehrschritt-Zusammenhänge (Multi-Hop). Ein Wissensgraph modelliert Entitäten (Personen, Produkte, Verträge) und ihre Beziehungen explizit. So lassen sich Fragen beantworten wie „Welche Verträge hängen an Lieferant X, der wiederum Standort Y beliefert?“.
Mit Spring AI heute machbar: Spring AI liefert die Abstraktionen für Embeddings, VectorStore und Chat-Modelle anbieterunabhängig. Der Graph-Layer (z. B. Neo4j oder eine Property-Graph-Erweiterung in PostgreSQL) wird als zusätzliche Retrieval-Quelle eingebunden und per RRF mit der Vektorsuche fusioniert.
Qualität wird gemessen, nicht vermutet – als Merge-Gate und im laufenden Betrieb.
Werden die erwarteten Quell-Chunks gefunden – und nur die relevanten?
Ist jede Aussage durch einen Chunk gedeckt, ohne Halluzination?
Werden nur bereitgestellte Quellen korrekt indexiert zitiert?
Wird bei themenfremden Fragen korrekt der No-Answer-Satz geliefert?
p50/p95 je Stufe und Kosten pro Anfrage – via Micrometer/Actuator.
Daumen-Feedback fliesst geglättet zurück ins Multi-Signal-Scoring.
Wir bauen produktionsreife RAG-Systeme mit Spring AI – on-premise oder auf Schweizer Infrastruktur.