Dieser Leitfaden richtet sich an Architekten und Engineering Leads, die die Retrieval-Pipeline hinter einem mitarbeiterseitigen Assistenten entwerfen. Er erläutert die Entscheidungen und ihre sinnvollen Standardwerte. Wenn Sie die technische Umsetzung wünschen, besuchen Sie unseren Enterprise-Knowledge-und-RAG-Service; für die Produktansicht besuchen Sie den KI-Wissensassistenten. Wissensassistenten sind einer der KI-Schritte, die in unserem KI-Automatisierungsleitfaden für Geschäftsprozesse behandelt werden.
Inhalt dieses Leitfadens
- Warum Retrieval die Qualität bestimmt
- Die Pipeline-Entscheidungen auf einen Blick
- Ingestion und Chunking
- Retrieval: Keyword, Vektor oder hybrid
- Berechtigungen: vor dem Modell filtern
- Aktualität und Löschung
- Fundierte Antworten und Ablehnungen
- Ein RAG-System evaluieren
- RAG, langer Kontext, Fine-tuning oder Suche: Alternativen und Auswahlkriterien
- KI in der RAG-Pipeline
- Was an Liefernachweisen existiert und was nicht
- Grenzen dieses Leitfadens
- Häufig gestellte Fragen
- Nächster Schritt
Warum Retrieval die Qualität bestimmt
Retrieval-augmented Generation, eingeführt von Lewis und Kollegen im Jahr 2020, kombiniert ein Sprachmodell mit einem externen Index: Das System findet zunächst die für eine Frage relevanten Passagen und fordert das Modell dann auf, aus diesen zu antworten. Für Unternehmenswissen ist das doppelt relevant. Das Modell wurde nie auf Ihren Verträgen oder Verfahren trainiert, und diese Dokumente ändern sich jede Woche.
Die Konsequenz ist leicht zu übersehen: Wenn ein Assistent eine falsche Antwort gibt, liegt die Ursache meist vor dem Modell. Die richtige Passage wurde nie indiziert, wurde an der falschen Stelle aufgeteilt, unterhalb von Rauschen eingestuft oder herausgefiltert. Ein Modellwechsel behebt das selten. Die nachfolgenden Entscheidungen sind der Ort, an dem Qualität gewonnen oder verloren wird.
Die Pipeline-Entscheidungen auf einen Blick
| Phase | Entscheidung | Sinnvoller Standard | Überprüfen, wenn |
|---|---|---|---|
| Ingestion | Was aufgenommen wird und mit welchen Metadaten | Nur genehmigte Quellen, jeweils mit Verantwortlichem, Zugriffsrechten und letztem Aktualisierungsdatum | Eine Quelle hat keinen Verantwortlichen oder keine zuverlässigen Datumsangaben |
| Chunking | Wo Dokumente aufgeteilt werden | Aufteilen nach der eigenen Struktur des Dokuments (Überschriften, Abschnitte, Tabellenzeilen) und den Überschriftenpfad beibehalten | Antworten benötigen vollständige Verfahren oder lange Tabellen |
| Retrieval | Wie Kandidaten gefunden werden | Hybrides Keyword- und Vektor-Retrieval, zusammengeführt durch Rank Fusion | Anfragen bestehen fast ausschließlich aus Codes und Namen oder fast ausschließlich aus Paraphrasen |
| Reranking | Welche Kandidaten das Modell erreichen | Ein Reranker bewertet die Kandidaten und behält eine kurze, diverse Auswahl | Latenz- oder Kostenlimits sind eng |
| Berechtigungen | Wer welche Passage sehen darf | Filterung nach den Rechten des Anfragenden innerhalb der Retrieval-Abfrage | Quellen haben keine maschinenlesbaren Zugriffsrechte |
| Generierung | Wie die Antwort gebildet wird | Nur aus den Passagen antworten, jede Aussage belegen, ablehnen wenn nicht belegt | Nutzer benötigen Berechnungen über Live-Daten |
| Evaluierung | Wie Qualität nachgewiesen wird | Eine Menge echter Fragen mit erwarteten Quellen, bei jeder Änderung ausgeführt | Die Fragemischung verschiebt sich |
Ingestion und Chunking
Beginnen Sie mit einer Quelleninventur statt mit einem Crawl. Erfassen Sie für jedes System den Verantwortlichen, das Zugriffsmodell, die Aktualisierungshäufigkeit und ob es die aktuelle Version der Wahrheit enthält. Duplikate und veraltete Kopien sind die häufigste Ursache für selbstbewusst falsche Antworten – entscheiden Sie daher, welche Quelle vorrangig ist, bevor Sie irgendetwas indizieren.
Chunking ist die Entscheidung mit dem größten Einfluss auf das Retrieval. Fenster fester Größe sind einfach, aber sie zerschneiden Verfahren und Tabellen in der Mitte. Strukturbewusstes Chunking teilt nach Überschriften, Listenelementen oder Tabellenzeilen auf und speichert den Überschriftenpfad zu jedem Chunk, sodass eine Passage mit dem Titel "Rückerstattungen > Beschädigte Waren > Außerhalb der EU" eigenständig gefunden und zitiert werden kann. Für lange Verfahren indizieren Sie kleine Chunks zum Abgleich, übergeben dem Modell aber den übergeordneten Abschnitt, damit die Antwort die vollständige Schritteliste sieht. Behalten Sie Dokumentmetadaten bei jedem Chunk: Quelle, Verantwortlicher, Zugriffsrechte, Version und Datum.
Retrieval: Keyword, Vektor oder hybrid
Vektor-Retrieval findet Passagen, die dasselbe in anderen Worten ausdrücken. Keyword-Retrieval findet exakte Treffer: Produktcodes, Vertragsnummern, Namen und internen Jargon, den Embeddings verwischen. Unternehmensfragen mischen beides – deshalb ist hybrides Retrieval der sinnvolle Standard. Die Dokumentation von Microsoft für seinen Suchdienst beschreibt das gängige Muster: Volltextsuche und Vektor-Abfragen parallel ausführen und die beiden Ranglisten durch reciprocal rank fusion zusammenführen.
Ein Reranker liest dann jeden Kandidaten zusammen mit der Frage und ordnet sie neu. Er ist langsamer als das Erstphasen-Retrieval, läuft daher nur auf den Kandidaten, und ist oft die kostengünstigste einzelne Verbesserung der Antwortqualität. Halten Sie den endgültigen Satz kurz und divers. Liu und Kollegen zeigten in "Lost in the Middle", dass Modelle Informationen am Anfang und Ende eines langen Kontexts besser verwenden als Informationen in der Mitte – mehr Kontext ist also nicht automatisch besser.
Berechtigungen: vor dem Modell filtern
Ein Assistent darf niemals ein Dokument zitieren, das der Anfragende nicht öffnen dürfte. Setzen Sie das im Retrieval durch, nicht im Prompt: Speichern Sie Zugriffsrechte bei jedem Chunk, übergeben Sie die Identität und Gruppen des Anfragenden in die Suchabfrage, und entfernen Sie alles, was sie nicht sehen dürfen, vor der Generierung. Eine Filterung nach der Generierung oder die Aufforderung an das Modell, eingeschränkte Inhalte zurückzuhalten, gibt Informationen durch Zusammenfassungen und Hinweise preis.
OWASP listet Vektor- und Embedding-Schwachstellen als LLM08 in seinem 2025 Top 10 für LLM-Anwendungen auf, einschließlich unbefugtem Zugriff über den Index, Cross-Tenant-Leaks in gemeinsam genutzten Vektor-Stores und vergifteten Inhalten. Die empfohlenen Maßnahmen entsprechen diesem Design: feingranularer, berechtigungsbasierter Zugriff auf den Vektor-Store, validierte Ingestion aus vertrauenswürdigen Quellen, nach Zugriffsebene klassifizierte Inhalte und unveränderliche Retrieval-Protokolle. Wenn ein Assistent nicht nur antworten, sondern auch handeln kann, gelten zusätzlich die Kontrollen aus unserem KI-Agentensicherheitsleitfaden.
Aktualität und Löschung
Unternehmenswissen ändert sich, und der Index muss folgen. Re-indizieren Sie bei Änderungsereignissen, sofern das Quellsystem diese bereitstellt, und nach einem Zeitplan, wo dies nicht der Fall ist. Speichern Sie das letzte Aktualisierungsdatum bei jedem Chunk und zeigen Sie es neben der Quellenangabe an, damit ein Nutzer sehen kann, dass eine Richtlinienpassage zwei Jahre alt ist. Löschung ist ebenso wichtig wie Aktualisierungen: Wenn ein Dokument zurückgezogen oder der Zugang einer Person widerrufen wird, muss der Index dies innerhalb der in Ihrer Datenrichtlinie versprochenen Zeit widerspiegeln, und die Aufbewahrung von Fragen und Antworten benötigt eine eigene Regelung.
Fundierte Antworten und Ablehnungen
Der Generierungsschritt ist ein Vertrag: aus den Passagen antworten, jede Aussage einer Passage zuordnen und „Ich weiß es nicht“ sagen, wenn die Passagen keine Antwort stützen, mit Verweis auf den Dokumentverantwortlichen. Das NIST Generative AI Profile nennt Konfabulation – die selbstbewusste Aussage falscher Inhalte – unter den Kernrisiken generativer KI; Quellenangaben und Ablehnungen sind die Möglichkeit, wie Nutzer dies überprüfen. Für regulierte Themen wie Personal, Recht oder Finanzen leiten Sie Antworten an eine Überprüfungswarteschlange weiter, statt direkt zu antworten.
Ein RAG-System evaluieren
-
Echte Fragen sammeln
Nehmen Sie diese aus Tickets, Chat-Protokollen und Interviews, nicht aus den Dokumenten, und erfassen Sie die Quelle, die jede Frage beantworten sollte.
-
Retrieval separat bewerten
Prüfen Sie für jede Frage, ob die erwartete Quelle im abgerufenen Satz enthalten ist und wie hoch sie eingestuft ist. Die meisten Fehler zeigen sich hier.
-
Die Antwort bewerten
Prüfen Sie die Treue zu den Passagen, die Relevanz zur Frage und ob Quellenangaben auf die richtige Quelle verweisen. Das Ragas-Framework schlug referenzfreie Maße entlang dieser Dimensionen vor; menschliche Überprüfung einer Stichprobe bleibt notwendig.
-
Ablehnungen und Berechtigungen testen
Fügen Sie Fragen hinzu, die keine Antwort in den Quellen haben, und Fragen, die ein Testnutzer nicht beantwortet sehen darf.
-
Den Satz bei jeder Änderung ausführen
Änderungen an Chunking, Ranking, Prompt und Modell verschieben alle Ergebnisse; veröffentlichen Sie nur, wenn der Satz standhält.
-
Aus der Produktion lernen
Unbeantwortete und schlecht bewertete Fragen zeigen Dokumentverantwortlichen, was fehlt, und fließen in den nächsten Testsatz ein.
RAG, langer Kontext, Fine-tuning oder Suche: Alternativen und Auswahlkriterien
-
RAG
- Gut geeignet für
- Große, sich ändernde, berechtigungsbasierte Dokumentenmengen mit Quellenangaben
- Schwach bei
- Erfordert Arbeit bei Ingestion, Berechtigungen und Evaluierung
- Wählen, wenn
- Antworten müssen aus vielen sich ändernden Quellen stammen
-
Long-context-Prompting
- Gut geeignet für
- Wenige vollständig gelesene Dokumente
- Schwach bei
- Kosten pro Frage, Aufmerksamkeit auf die Mitte, Berechtigungen
- Wählen, wenn
- Das gesamte Korpus passt in einen Prompt und für eine Zielgruppe
-
Fine-tuning
- Gut geeignet für
- Ton, Format und Domänenvokabular
- Schwach bei
- Aktuelle Fakten, Quellenangaben, Zugriffskontrolle
- Wählen, wenn
- Stil wichtiger als aktuelle Fakten
-
Enterprise-Suche
- Gut geeignet für
- Dokumente schnell finden
- Schwach bei
- Eine Antwort synthetisieren
- Wählen, wenn
- Personen brauchen das Dokument, keine Zusammenfassung
Vier Kriterien entscheiden: wie oft sich das Wissen ändert, ob verschiedene Personen unterschiedliche Dokumente sehen dürfen, ob Antworten auf eine Quelle zurückführbar sein müssen und wie viele Dokumente beteiligt sind. In der Praxis kombinieren sich die Ansätze: RAG für Fakten, ein leichtes Fine-tuning oder Anweisungen für das Format und Suche als Fallback. Die Auswahl, welches Wissensproblem zuerst gelöst werden soll, ist Teil einer Enterprise-KI-Readiness-Bewertung.
KI in der RAG-Pipeline
KI erscheint an mehreren Punkten der Pipeline, nicht nur in der endgültigen Antwort: Embedding-Modelle für die Vektorsuche, Reranker, optionales Query-Rewriting und Modelle, die Antworten während der Evaluierung bewerten. Jedes ist eine Komponente, die versioniert und getestet werden muss. Netbase arbeitet mit den wichtigsten kommerziellen und Open-Source-KI-Modellen zusammen, projektweise ausgewählt, und baut Pipelines so, dass das Modell ausgetauscht werden kann, ohne alles neu zu indizieren. Die Chat-Oberfläche kann vom KI-Chatbot und WorkChat-Integrator in der Netbase-Produktmodul-Bibliothek aus starten, und Daten- und Modellentscheidungen werden in unserem Daten- und KI-Stack behandelt. Jeder der folgenden Punkte gibt an, wie ausgereift er bei Netbase ist.
-
Ausgeliefert (anonymisierter Kunde): RAG-Wissensassistent
Ein retrieval-augmentierter Assistent über Unternehmenswissen, ausgeliefert für einen nicht genannten Kunden.
-
Wachstumsfähigkeit: NLP und generative KI für fundierte Antworten
Retrieval, Antwortentwurf und Evaluierung über Unternehmenswissen über diesen Datensatz hinaus; noch nicht mit einem veröffentlichten Fall verknüpft.
Was an Liefernachweisen existiert und was nicht
- Was existiert. Netbase hat retrieval-augmentierte Wissensassistenten, Dokumenten-KI und MLOps-Pipelines für nicht genannte Kunden ausgeliefert; der anonymisierte RAG-Datensatz beschreibt die Art des Systems und die Rolle von Netbase. Die Auslieferung folgt den Sicherheitspraktiken von Netbase, einschließlich rollenbasierter Zugriffskontrolle, MFA für Admin-Dashboards, TLS im Transit und AES im Ruhezustand, Sicherheitscode-Reviews und Schwachstellen-Scans.
- Was nicht existiert. Der Datensatz veröffentlicht keinen Kundennamen, keine Korpusgröße, keine Genauigkeit, keine Adoptions- oder Zeitersparnis-Zahlen – daher werden hier keine genannt. Die Standards auf dieser Seite sind Designempfehlungen, keine gemessenen Ergebnisse aus diesem Projekt.
Grenzen dieses Leitfadens
- Die Standards eignen sich für interne Assistenten über Dokumente und Aufzeichnungen einer Organisation; öffentliche Chatbots, mandantenfähige Produkte und regulierte Beratung erfordern weitere Kontrollen.
- Forschungsarbeiten und Herstellerdokumentation werden für Methoden zitiert, nicht als Empfehlungen; die Retrieval-Qualität hängt von Ihren Inhalten ab und muss anhand Ihrer Fragen gemessen werden.
- Personenbezogene Daten im Index bringen datenschutzrechtliche Pflichten mit sich, die dieser Leitfaden nicht ersetzt; holen Sie rechtlichen Rat ein, wo die DSGVO oder andere Datenschutzgesetze gelten.
Den nächsten Schritt mit einem Netbase-Berater planen
Häufig gestellte Fragen
Es gibt keine einheitliche Größe. Teilen Sie nach der eigenen Struktur des Dokuments auf, behalten Sie den Überschriftenpfad bei jedem Chunk bei und testen Sie Größen anhand Ihres Evaluierungssatzes; die richtige Antwort unterscheidet sich zwischen Richtlinien, Verträgen und Tickets.
In der Regel nicht. Unternehmensfragen mischen Bedeutung und exakte Begriffe wie Codes und Namen, daher ist hybrides Keyword- und Vektor-Retrieval mit einem Reranker der sicherere Standard.
Speichern Sie Zugriffsrechte bei jedem Chunk und filtern Sie nach den Rechten des Anfragenden innerhalb der Retrieval-Abfrage, bevor das Modell irgendetwas sieht, und testen Sie dann mit Nutzern, die bestimmte Antworten nicht sehen dürfen.
Fine-tuning gestaltet Stil und Vokabular, hält Fakten aber nicht aktuell, zitiert keine Quellen und respektiert keine Zugriffsrechte. Für sich änderndes Unternehmenswissen ist RAG die Basis und Fine-tuning eine optionale Ergänzung.
Nächster Schritt
Teilen Sie die Quellen, die Ihre Mitarbeiter heute durchsuchen, wer was sehen darf und zehn echte Fragen, und wir werden eine Lösungsüberprüfung buchen, um das Retrieval-Design und seinen Evaluierungssatz zu skizzieren. Sie können auch KI-Automatisierung und Agenten oder weitere Netbase-Einblicke ansehen.
Verwandte Leistungen und Lösungen
KI-Automatisierung und Agenten, die Menschen die Kontrolle lassen
Netbase entwickelt KI-Automatisierung und KI-Agenten für Operations-Teams, die repetitive, mehrstufige Arbeit durch Software erledigen lassen wollen, während Menschen die Kontrolle über die wesentlichen Entscheidungen behalten. Wir kombinieren regelbasierte Workflow-Automatisierung mit KI-Schritten, wo sie einen Mehrwert bieten, gestalten die menschlichen Freigabepunkte von Anfang an mit ein und messen den Rückfluss gegen eine Baseline, die vor dem Build ermittelt wird.
Mehr erfahren
Enterprise-KI-Wissensassistenten: RAG-Engineering mit Zugriffssteuerung
Netbase entwickelt Retrieval-Augmented Generation (RAG) über Unternehmenswissen: Ingestion, Suche, Berechtigungsprüfungen, zitierte Antworten und Evaluation, damit ein Sprachmodell aus Ihren eigenen Dokumenten und Systemen antworten kann. Es ist eine Wachstumskompetenz mit Zugriffssteuerung und Evaluation, die ab dem ersten Prototyp integriert sind; Netbase hat einen RAG-Wissensassistenten für einen nicht namentlich genannten Kunden geliefert.
Mehr erfahren
KI-Wissensassistent: Antworten aus Unternehmenswissen mit Quellen und Zugangskontrolle
Ein KI-Wissensassistent ist ein internes Werkzeug, das Mitarbeiterfragen aus den eigenen Dokumenten und Systemen des Unternehmens beantwortet, jede Antwort mit Quellen belegt und jeder Person nur das zeigt, was sie sehen darf. Netbase JSC bietet ihn als Wachstumsfähigkeit an, von Beginn des Pilotprojekts an mit Retrieval, Evaluierung und menschlicher Prüfung konzipiert, und hat ihn für einen nicht namentlich genannten Kunden realisiert.
Mehr erfahren
Projekt besprechen
Netbase JSC unterstützt Organisationen bei der Konzeption, Entwicklung, Modernisierung und dem Betrieb digitaler Produkte und KI-gestützter Geschäftssysteme.+84 937 869 689
91 Nguyen Chi Thanh, Dong Da, Hanoi, Vietnam
In Kontakt treten
Sagen Sie uns, was Sie aufbauen, modernisieren oder betreiben möchten.