
Lokale KI · Dokumentensuche
KI-Dokumentensuche im Haus
den Fileserver fragen statt durchklicken.
Das Dokument ist da. Es liegt irgendwo in dreißig Jahren Projektordnern, heißt Scan_0417.pdf und niemand weiß mehr, in welchem Jahr. Lokale Dokumentensuche findet es über das, was drinsteht.
- Für wen
- Betriebe mit großem Fileserver, vielen Scans und langer Suchzeit
- Aufwand
- 15 Arbeitstage bis zur Spezifikation
- Förderung
- Wird für Ihr Bundesland geprüft
- Datenhaltung
- Index und Scans bleiben auf Ihrem Server im getrennten Netz
- Erster Schritt
- Dreißig Minuten Erstgespräch per Video
Kurz gesagt
Lokale KI-Dokumentensuche findet nicht Dateinamen, sondern Inhalte: Sie fragen in Ihren Worten, die KI antwortet aus dem Fileserver mit Fundstelle, Seite und Absatz. Gescannte PDFs werden vorher per Texterkennung lesbar gemacht, oft achtzig Prozent eines Bestands. Hybrid-Suche aus Bedeutung und Stichwort trifft auch Bauteilnummern und Aktenzeichen. Rechte aus dem Active Directory gelten vor jeder Antwort.
Stand: September 2026

Warum die Windows-Suche bei Scans aufgibt
Auf den Fileservern, die wir sehen, sind oft achtzig Prozent der PDFs gescannt: Bilder von Text, für jede Suche unsichtbar. Dazu Dateinamen wie Scan_0417 und Ordner, die nach Jahren, nicht nach Themen sortiert sind. Die Windows-Suche findet dort nichts, und die Fachkraft klickt sich durch. In einem laufenden Projekt mit mehreren hunderttausend Dokumenten war die Texterkennung der größte Einzelposten der Einführung und zugleich der größte Gewinn, weil der Bestand danach zum ersten Mal lesbar war.
Warum Ihre Suche heute nicht findet
Sie suchen mit den Werkzeugen, die Sie haben, nach Dateinamen und nach exakten Wörtern. Das findet, was Sie schon kennen. Was es nicht findet, ist die Antwort auf eine Frage, die niemand als Dateiname formuliert hat: die Auflage aus einem Projekt, dessen Namen Sie vergessen haben, in einer Mail, deren Absender Sie nicht mehr wissen.
Eine inhaltliche Suche schließt diese Lücke, aber nur, wenn drei Dinge stimmen: Die Dokumente sind als Text vorhanden und nicht nur als Bild, die Rechte greifen schon bei der Suche, und es ist klar, welcher Stand gilt. Fehlt eines davon, findet das System zwar etwas, aber nicht verlässlich das Richtige.
Deshalb beginnt jedes Projekt mit einer Bestandsaufnahme: Was liegt wo, in welchem Format, mit welchen Rechten. Das ist unspektakulär und entscheidet über das Ergebnis mehr als jede spätere Einstellung.
Ihre Suche findet, was Sie schon kennen. Nicht das, wonach Sie eigentlich fragen.
Sechs Suchen, die heute Stunden kosten
Aus Audits mit Fileservern zwischen einer und zehn Millionen Dateien. Das sind die Suchen, bei denen die Zeit verschwindet.
- Den unterschriebenen Vertrag zu einem Kunden, der als Scan mit Zahlennamen in einem Jahresordner liegt
- Alle Prüfberichte, in denen ein bestimmter Bauteiltyp oder eine Seriennummer vorkommt, über alle Projekte
- Den Bescheid der Behörde mit der Auflage, die jetzt bei der Abnahme wieder auftaucht
- Die letzte Fassung eines Dokuments, von dem sieben Versionen in vier Ordnern liegen
- Jede Mail und jedes Protokoll, in dem eine bestimmte Zusage an den Auftraggeber gemacht wurde
- Was in einem Ordner mit vierhundert Dateien eigentlich drin ist, als Zusammenfassung in zehn Zeilen
Für wen sich das lohnt
Sekretariat und Assistenz
Sie suchen für alle anderen. Danach fragen die anderen selbst, und Sie bekommen die Zeit zurück.
Fachabteilung
Sie brauchen den Prüfbericht von damals, jetzt, während der Kunde am Telefon ist. Die Suche liefert ihn mit Seite und Absatz.
IT-Leitung
Sie fürchten, dass ein Index die Rechte aushebelt. Die Rechte werden aus dem Ordner in jeden Abschnitt vererbt und vor jeder Antwort geprüft, und der Leak-Test beweist es.
Was wir dafür entwickeln
- 1
Büro-Gedächtnis: Ihr KI-Gedächtnis, dessen Fundament die Dokumentensuche mit Texterkennung ist
Büro-Gedächtnis im Detail - 2
Projekt- und Fristen-Radar: Projektstand und Rechnungen, gespeist aus Bescheiden und Verträgen, die die Suche gefunden hat
Projekt- und Fristen-Radar im Detail - 3
Kundenablage: CRM: erfassen, wer hereinkommt, verknüpft mit allen Dokumenten zu diesem Kunden
Kundenablage im Detail
So wird der Fileserver durchsuchbar
Schritt 1
Bestand vermessen
Wie viele Dateien, welche Formate, wie viel gescannt, welche Rechtegruppen. Eine Stichprobe von hundert Dateien zeigt die Qualität der Scans.
Schritt 2
Texterkennung und Index
Scans werden lokal per OCR lesbar, Layout und Tabellen erhalten, Abschnitte gebildet, Embeddings gerechnet, Rechte aus dem Ordner vererbt. Läuft nachts über Wochen.
Schritt 3
Testsatz und Pilot
Fünfzig Suchen mit bekanntem Ergebnis. Erst wenn die Trefferquote stimmt, bekommt die erste Abteilung Zugang.
◆Fachwörter auf dieser Seite
Erklärt im Glossar
Im Detail als Fachartikel
Häufig gefragt
Wie gut ist die Texterkennung bei alten Scans?
Bei sauberen Bürodokumenten sehr gut. Bei schiefen, blassen oder handschriftlichen Scans schlechter. Die Stichprobe im Audit zeigt, was zu erwarten ist, und schlechte Scans werden markiert statt verschwiegen.
Findet die Suche auch Zahlen und Aktenzeichen?
Ja, über den Stichwortteil der Hybrid-Suche. Reine Bedeutungssuche würde eine Seriennummer verfehlen, deshalb laufen beide zusammen und ein Reranker sortiert die Treffer.
Was ist mit Dateien, die jemand nicht sehen darf?
Sie tauchen für diese Person nicht auf, auch nicht als Treffer ohne Inhalt. Die Rechte kommen aus dem Active Directory, werden in jeden Abschnitt vererbt und vor jeder Antwort gefiltert.
Wie lange dauert das Einlesen von einer Million Dateien?
Wochen, nicht Tage, vor allem wegen der Texterkennung. Es läuft nachts im Hintergrund, und die Suche ist ab dem ersten eingelesenen Ordner nutzbar.
Gibt es Fördermittel für lokale KI?
Oft ja. Ob ein Zuschuss oder ein Darlehen greift, hängt an Ihrem Bundesland, an der Betriebsgröße und am Vorhaben. Hardware zählt in der Regel mit, wenn sie Teil des Vorhabens ist. Wir prüfen das vor dem Termin und sagen Ihnen, ob sich der Antragsaufwand lohnt.
Verwandte Seiten
Programme, mit denen Sie arbeiten
Zu jedem steht, was sich anbinden lässt, was dabei herauskommt und wo die Grenze liegt.
- DateiablageDen Bestand lesen, wie er ist, und über den Inhalt auffindbar machen
- DMS einführenVorhandenes System anbinden, oder ohne starten und später entscheiden
- SharePointBibliotheken über den Inhalt erschließen, Berechtigungen bleiben wie sie sind
- NextcloudEigene Ablage erschließen, der Weg bleibt vollständig im Haus
- DocuWareDas Archiv beantwortet Fragen, nicht nur Suchbegriffe
Sehen wir uns Ihren Bestand an.
Dreißig Minuten, per Video oder Telefon. Danach wissen Sie, ob lokale KI bei Ihnen trägt und was der erste Schritt ist.