Lokale RAG-Systeme

RAG lokal betreiben
Antwort mit Quelle, ohne Cloud.

RAG heißt auf Deutsch: erst suchen, dann antworten. Das Modell erfindet nichts, es liest die Stellen, die die Suche gefunden hat. Genau deshalb funktioniert es lokal so gut: Das Wissen kommt aus Ihren Dateien, nicht aus dem Internet.

Für wen
Jeder Betrieb mit Dokumentenbestand, der Antworten mit Beleg braucht
Aufwand
15 Arbeitstage bis zur Spezifikation
Förderung
Wird für Ihr Bundesland geprüft
Datenhaltung
Komplett auf Ihrem Server, nichts geht nach außen
Erster Schritt
Dreißig Minuten Erstgespräch per Video

RAG steht für Retrieval Augmented Generation. Das System sucht zuerst in Ihren eigenen Dokumenten die passenden Abschnitte und legt sie dem Sprachmodell vor. Das Modell antwortet nur daraus und nennt die Fundstelle. Lokal betrieben laufen Suche, Index und Modell auf einem Server im Haus, ohne Cloud im Datenpfad. Das ist der Unterschied zwischen einer belegten Antwort und einem gut klingenden Satz.

Stand: September 2026

Ein Dokumentenstapel unter einer Glasglocke, ein Kupferfaden führt von oben genau in ein bestimmtes Blatt
Die Unterlagen bleiben liegen, wo sie liegen. Gelesen wird darin, kopiert wird nichts, und die Antwort nennt das Blatt, aus dem sie stammt.

Der Engpass

Warum die meisten RAG-Projekte an der Suche scheitern

Fast alle Aufmerksamkeit geht ins Sprachmodell, fast alle Qualität kommt aus der Suche. Findet die Suche den falschen Abschnitt, hilft das beste Modell nicht. Deshalb messen wir zuerst die Suche an einem Testsatz mit bekannten Fundstellen und stellen Zerlegung, Embedding und Reranker ein. Erst danach reden wir über Modelle.

Wo RAG in der Praxis gut wird und wo es scheitert

Sie bekommen mit RAG keine klügere KI, sondern eine, die Ihren Bestand kennt. Das Verfahren zerlegt Ihre Dokumente in Abschnitte, sucht bei jeder Frage die passenden heraus und gibt sie dem Modell mit. Das Modell formuliert dann aus dem, was da steht, statt aus dem, was es einmal gelernt hat.

Die Qualität entscheidet sich nicht am Modell, sondern an der Zerlegung. Zu kleine Abschnitte verlieren den Zusammenhang, zu große verwässern die Suche. Bei Tabellen, Plänen und gescannten Dokumenten kommt hinzu, dass die Reihenfolge im Text nicht der Reihenfolge auf der Seite entspricht, und dann findet das System zwar etwas, aber nicht das Richtige.

Der zweite Stolperstein sind Versionen. Wenn Entwurf, Zwischenstand und Endfassung nebeneinander im Bestand liegen, antwortet das System aus dem, was es zuerst findet. Deshalb gehört zur Einrichtung die Entscheidung, was gültig ist und was Archiv, und diese Entscheidung kann Ihnen kein System abnehmen.

Sechs Bausteine, aus denen ein lokales RAG-System besteht

So sieht die Kette aus, die aus einer Frage eine belegte Antwort macht. Jeder Baustein läuft im Haus.

01 · Was hereinkommt

  • Datei-Wächter: neue und geänderte Dokumente in Ablage, Postfach und Programmen werden erkannt
  • Parsing und Texterkennung: PDF, Word, Tabellen und Scans werden zu Text mit Struktur

02 · Was daraus wird

  • Zerlegung: Dokumente werden in Abschnitte geschnitten, Tabellen bleiben zusammen
  • Embeddings und Index: jeder Abschnitt bekommt eine Bedeutungsposition in der Vektordatenbank

03 · Was danach anders ist

  • Suche und Reranker: erst breit, dann eng, am Ende bleiben die zwei bis fünf passenden Stellen
  • Antwort mit Fundstelle: das Sprachmodell formuliert nur aus diesen Stellen, alles andere wird als unbelegt markiert

Was wir dafür entwickeln

  1. 1

    Büro-Gedächtnis: Ihr KI-Gedächtnis, das genau diese Kette im Haus betreibt

    Büro-Gedächtnis im Detail
  2. 2

    Post-Lotse: Posteingang, damit neue Mails und Anhänge sofort im Index landen

    Post-Lotse im Detail
  3. 3

    Kundenablage: CRM, damit die Suche weiß, zu welchem Kunden ein Dokument gehört

    Kundenablage im Detail

Die Qualität entscheidet sich an der Zerlegung Ihrer Dokumente, nicht am Modell.

PhoenixOne AI

Für wen sich das lohnt

Geschäftsführung
Sie wollen Antworten, denen jemand glaubt. Fundstelle unter jeder Antwort ist der Unterschied.
IT und Administration
Sechs Bausteine in Containern, dokumentiert, mit Update-Konzept ohne Internetzwang.
Fachabteilung
Sie fragen in normalem Deutsch, öffnen das Original und prüfen. Nichts wird Ihnen abgenommen, nur das Suchen.

So entsteht ein lokales RAG-System

  1. Schritt 1

    Daten- und Netz-Audit

    Was liegt wo, wie viele Scans, welche Rechtegruppen, welcher Serverraum. Fünfzehn Arbeitstage, am Ende die Spezifikation für Server und Software.

  2. Schritt 2

    Aufbau im getrennten Netz

    Server im eigenen Netzsegment, Modell lauffähig, Anmeldung über Ihr Active Directory, erster Test mit hundert echten Dokumenten.

  3. Schritt 3

    Einlesen, Härten, Betrieb

    Bestand einlesen, Rechte vererben, Sicherheitsprüfung durch Dritte, Pilot mit einer Abteilung, dann Betrieb mit monatlichem Bericht.

Häufig gefragt

Was ist der Unterschied zu einer Volltextsuche?

Die Volltextsuche findet Wörter, RAG findet Bedeutung und formuliert eine Antwort mit Fundstelle. Beides zusammen ist am stärksten, deshalb suchen wir hybrid.

Muss das Modell dafür trainiert werden?

Nein, das ist der Kern von RAG. Neue Dokumente sind nach der Indexierung sofort nutzbar, ohne Training und ohne Wartezeit.

Kann RAG auch halluzinieren?

Deutlich weniger, weil das Modell aus vorgelegten Stellen antwortet. Was nicht belegt ist, wird als unbelegt markiert, und die Fundstelle lässt sich prüfen.

Läuft das wirklich komplett lokal?

Ja. Parsing, Texterkennung, Embeddings, Vektordatenbank und Sprachmodell laufen auf Ihrem Server. Kein Cloud-Dienst im Datenpfad.

Gibt es Fördermittel für lokale KI?

Oft ja. Ob ein Zuschuss oder ein Darlehen greift, hängt an Ihrem Bundesland, an der Betriebsgröße und am Vorhaben. Hardware zählt in der Regel mit, wenn sie Teil des Vorhabens ist. Wir prüfen das vor dem Termin und sagen Ihnen, ob sich der Antragsaufwand lohnt.

Verwandte Seiten

Programme, mit denen Sie arbeiten

Zu jedem steht, was sich anbinden lässt, was dabei herauskommt und wo die Grenze liegt.

Alle Programme →

Sehen wir uns Ihren Bestand an.

Dreißig Minuten, per Video oder Telefon. Danach wissen Sie, ob lokale KI bei Ihnen trägt und was der erste Schritt ist.