
Altbestand
Texterkennung für gescannte Akten
aus Bildern werden durchsuchbare Dokumente.
In jedem Audit dieselbe Zahl: Ein großer Teil der PDFs auf dem Server enthält keinen Text, sondern Bilder von Text. Für jede Suche sind diese Dokumente unsichtbar, auch für eine KI.
- Für wen
- Betriebe mit Altbeständen aus der Zeit vor der digitalen Ablage
- Aufwand
- 15 Arbeitstage bis zur Spezifikation
- Förderung
- Wird für Ihr Bundesland geprüft
- Datenhaltung
- Komplett auf Ihrem Server, nichts geht nach außen
- Erster Schritt
- Dreißig Minuten Erstgespräch per Video
Kurz gesagt
Texterkennung, kurz OCR, wandelt gescannte Seiten in durchsuchbaren Text um. In den meisten Betrieben betrifft das einen großen Teil der Altakten, die dadurch für Suche und KI überhaupt erst sichtbar werden. Lokal läuft die Erkennung auf Ihrem Server, mit einem zweiten Verfahren für schlechte Scans. Die Originaldatei bleibt unverändert, der Text kommt in den Index.
Stand: September 2026

Sechs Bestände, die durch Texterkennung sichtbar werden
Aus Daten-Audits. In fast jedem Betrieb liegt der größte ungenutzte Schatz in diesen Ordnern.
01 · Was hereinkommt
- Eingescannte Bescheide, Genehmigungen und Behördenpost aus zwanzig Jahren
- Alte Prüfberichte und Messprotokolle, die nur als Papier vorlagen
02 · Was daraus wird
- Verträge und Nachträge mit handschriftlichen Ergänzungen am Rand
- Zeichnungen mit Schriftfeld, aus denen Bauteil, Stand und Maßstab gelesen werden
03 · Was danach anders ist
- Rechnungen und Lieferscheine, für Rückfragen zu alten Vorgängen
- Protokolle und Notizen aus der Zeit vor dem gemeinsamen Laufwerk
Für wen sich das lohnt
Geschäftsführung
Zwanzig Jahre Bestand nutzbar zu machen ist der Punkt, an dem lokale KI sich meist rechnet.
IT und Administration
Rechenlast im Hintergrund, planbar über Nacht. Originale werden nicht verändert.
Sachbearbeitung
Sie finden das Dokument von 2009, ohne den Ordner zu kennen.
Was Texterkennung leisten kann und was nicht
Gut gescannte Seiten werden nahezu fehlerfrei erkannt, schiefe Kopien von Kopien nicht. Handschrift gelingt bei klarer Schrift oft, bei Notizen am Rand selten. Deshalb arbeiten wir mit zwei Verfahren und markieren unsichere Stellen, statt sie zu verschweigen. Und wir sagen im Audit ehrlich, welcher Teil des Bestands lesbar wird und welcher nicht.
Was mit gescannten Unterlagen passiert
Ein großer Teil Ihres Bestands ist vermutlich Bild und nicht Text: eingescannte Verträge, abfotografierte Pläne, Protokolle als PDF ohne Textebene. Für ein Suchsystem sind das leere Seiten, solange Sie sie nicht lesbar machen lassen. Die Texterkennung ist deshalb kein Zusatz, sondern Voraussetzung.
Die Erkennungsqualität schwankt stark mit der Vorlage. Sauberer Druck wird nahezu fehlerfrei erkannt, ein Fax von 1998 nicht, und Handschrift bleibt schwierig. Bei Tabellen und Plänen kommt hinzu, dass die räumliche Anordnung Bedeutung trägt, die in einer reinen Textausgabe verlorengeht.
Deshalb gehört zur Einrichtung eine Stichprobe: fünfzig typische Dokumente aus Ihrem Bestand, durch die Erkennung geschickt und geprüft. Erst danach lässt sich sagen, welcher Teil Ihres Archivs wirklich durchsuchbar wird und welcher besser über Metadaten erschlossen wird.
Was wir dafür entwickeln
Für ein Suchsystem ist ein Scan ohne Textebene eine leere Seite.
So werden Ihre Scans lesbar
- Schritt 1
Probe
Wir nehmen hundert typische Dokumente aus Ihrem Bestand und messen, wie gut die Erkennung wird. Erst danach der große Lauf.
- Schritt 2
Massenlauf
Der Bestand wird im Hintergrund verarbeitet, aktive Projekte zuerst, Archiv danach. Die Originale bleiben unberührt.
- Schritt 3
Laufender Betrieb
Neue Scans werden automatisch erkannt und indexiert, ohne dass jemand etwas anstößt.
◆Fachwörter auf dieser Seite
Erklärt im Glossar
Was Betriebe an dieser Stelle fragen
Einwand
Verändert die Texterkennung unsere PDFs?
Auf Wunsch schreiben wir eine durchsuchbare Textebene in eine Kopie. Im Standard bleibt das Original unangetastet und der Text landet nur im Index.
Einwand
Erkennt das System Handschrift?
Klare Handschrift oft, schnelle Notizen selten. Unsichere Stellen werden markiert, damit niemand eine falsche Lesart für eine Tatsache hält.
Einwand
Wie lange dauert der erste Durchlauf?
Bei hunderttausenden Seiten mehrere Tage im Hintergrund. Wir beginnen mit dem Teil, der täglich gebraucht wird.
Einwand
Läuft die Erkennung wirklich lokal?
Ja, auf Ihrem Server. Kein Dokument geht zu einem Cloud-Dienst, auch nicht zur Erkennung.
Einwand
Gibt es Fördermittel für lokale KI?
Oft ja. Ob ein Zuschuss oder ein Darlehen greift, hängt an Ihrem Bundesland, an der Betriebsgröße und am Vorhaben. Hardware zählt in der Regel mit, wenn sie Teil des Vorhabens ist. Wir prüfen das vor dem Termin und sagen Ihnen, ob sich der Antragsaufwand lohnt.
Verwandte Seiten
- Lokale DokumentensucheDen Fileserver in Ihren Worten fragen und die Fundstelle bekommen, inklusive Scans, mit Rechten
- Bilder und Pläne durchsuchenMultimodale Modelle lesen Pläne, Fotos und Skizzen und machen sie mit Quelle durchsuchbar
- BrandschutzplanungBrandschutzkonzepte, Nachweise und Objektakten sicherheitsrelevanter Gebäude im eigenen Netz
Programme, mit denen Sie arbeiten
Zu jedem steht, was sich anbinden lässt, was dabei herauskommt und wo die Grenze liegt.
Sehen wir uns Ihren Bestand an.
Dreißig Minuten, per Video oder Telefon. Danach wissen Sie, ob lokale KI bei Ihnen trägt und was der erste Schritt ist.