Altbestand

Texterkennung für gescannte Akten
aus Bildern werden durchsuchbare Dokumente.

In jedem Audit dieselbe Zahl: Ein großer Teil der PDFs auf dem Server enthält keinen Text, sondern Bilder von Text. Für jede Suche sind diese Dokumente unsichtbar, auch für eine KI.

Für wen
Betriebe mit Altbeständen aus der Zeit vor der digitalen Ablage
Aufwand
15 Arbeitstage bis zur Spezifikation
Förderung
Wird für Ihr Bundesland geprüft
Datenhaltung
Komplett auf Ihrem Server, nichts geht nach außen
Erster Schritt
Dreißig Minuten Erstgespräch per Video

Kurz gesagt

Texterkennung, kurz OCR, wandelt gescannte Seiten in durchsuchbaren Text um. In den meisten Betrieben betrifft das einen großen Teil der Altakten, die dadurch für Suche und KI überhaupt erst sichtbar werden. Lokal läuft die Erkennung auf Ihrem Server, mit einem zweiten Verfahren für schlechte Scans. Die Originaldatei bleibt unverändert, der Text kommt in den Index.

Stand: September 2026

Ein Dokumentenstapel unter einer Glasglocke, ein Kupferfaden führt von oben genau in ein bestimmtes Blatt
Die Unterlagen bleiben liegen, wo sie liegen. Gelesen wird darin, kopiert wird nichts, und die Antwort nennt das Blatt, aus dem sie stammt.

Sechs Bestände, die durch Texterkennung sichtbar werden

Aus Daten-Audits. In fast jedem Betrieb liegt der größte ungenutzte Schatz in diesen Ordnern.

01 · Was hereinkommt

  • Eingescannte Bescheide, Genehmigungen und Behördenpost aus zwanzig Jahren
  • Alte Prüfberichte und Messprotokolle, die nur als Papier vorlagen

02 · Was daraus wird

  • Verträge und Nachträge mit handschriftlichen Ergänzungen am Rand
  • Zeichnungen mit Schriftfeld, aus denen Bauteil, Stand und Maßstab gelesen werden

03 · Was danach anders ist

  • Rechnungen und Lieferscheine, für Rückfragen zu alten Vorgängen
  • Protokolle und Notizen aus der Zeit vor dem gemeinsamen Laufwerk

Für wen sich das lohnt

Geschäftsführung

Zwanzig Jahre Bestand nutzbar zu machen ist der Punkt, an dem lokale KI sich meist rechnet.

IT und Administration

Rechenlast im Hintergrund, planbar über Nacht. Originale werden nicht verändert.

Sachbearbeitung

Sie finden das Dokument von 2009, ohne den Ordner zu kennen.

Was Texterkennung leisten kann und was nicht

Gut gescannte Seiten werden nahezu fehlerfrei erkannt, schiefe Kopien von Kopien nicht. Handschrift gelingt bei klarer Schrift oft, bei Notizen am Rand selten. Deshalb arbeiten wir mit zwei Verfahren und markieren unsichere Stellen, statt sie zu verschweigen. Und wir sagen im Audit ehrlich, welcher Teil des Bestands lesbar wird und welcher nicht.

Was mit gescannten Unterlagen passiert

Ein großer Teil Ihres Bestands ist vermutlich Bild und nicht Text: eingescannte Verträge, abfotografierte Pläne, Protokolle als PDF ohne Textebene. Für ein Suchsystem sind das leere Seiten, solange Sie sie nicht lesbar machen lassen. Die Texterkennung ist deshalb kein Zusatz, sondern Voraussetzung.

Die Erkennungsqualität schwankt stark mit der Vorlage. Sauberer Druck wird nahezu fehlerfrei erkannt, ein Fax von 1998 nicht, und Handschrift bleibt schwierig. Bei Tabellen und Plänen kommt hinzu, dass die räumliche Anordnung Bedeutung trägt, die in einer reinen Textausgabe verlorengeht.

Deshalb gehört zur Einrichtung eine Stichprobe: fünfzig typische Dokumente aus Ihrem Bestand, durch die Erkennung geschickt und geprüft. Erst danach lässt sich sagen, welcher Teil Ihres Archivs wirklich durchsuchbar wird und welcher besser über Metadaten erschlossen wird.

Was wir dafür entwickeln

Büro-Gedächtnis: Ihr KI-Gedächtnis, in dem auch die alten Scans auffindbar werdenBüro-Gedächtnis im Detail
Post-Lotse: Posteingang, gescannte Briefpost gelesen und dem Vorgang zugeordnetPost-Lotse im Detail
Baustellen-Agent: Baustelle und Protokoll, Fotos und Handaufmaße mit Texterkennung erfasstBaustellen-Agent im Detail

Für ein Suchsystem ist ein Scan ohne Textebene eine leere Seite.

PhoenixOne AI

So werden Ihre Scans lesbar

  1. Schritt 1

    Probe

    Wir nehmen hundert typische Dokumente aus Ihrem Bestand und messen, wie gut die Erkennung wird. Erst danach der große Lauf.

  2. Schritt 2

    Massenlauf

    Der Bestand wird im Hintergrund verarbeitet, aktive Projekte zuerst, Archiv danach. Die Originale bleiben unberührt.

  3. Schritt 3

    Laufender Betrieb

    Neue Scans werden automatisch erkannt und indexiert, ohne dass jemand etwas anstößt.

◆Fachwörter auf dieser Seite

Erklärt im Glossar

Was Betriebe an dieser Stelle fragen

Einwand

Verändert die Texterkennung unsere PDFs?

Auf Wunsch schreiben wir eine durchsuchbare Textebene in eine Kopie. Im Standard bleibt das Original unangetastet und der Text landet nur im Index.

Einwand

Erkennt das System Handschrift?

Klare Handschrift oft, schnelle Notizen selten. Unsichere Stellen werden markiert, damit niemand eine falsche Lesart für eine Tatsache hält.

Einwand

Wie lange dauert der erste Durchlauf?

Bei hunderttausenden Seiten mehrere Tage im Hintergrund. Wir beginnen mit dem Teil, der täglich gebraucht wird.

Einwand

Läuft die Erkennung wirklich lokal?

Ja, auf Ihrem Server. Kein Dokument geht zu einem Cloud-Dienst, auch nicht zur Erkennung.

Einwand

Gibt es Fördermittel für lokale KI?

Oft ja. Ob ein Zuschuss oder ein Darlehen greift, hängt an Ihrem Bundesland, an der Betriebsgröße und am Vorhaben. Hardware zählt in der Regel mit, wenn sie Teil des Vorhabens ist. Wir prüfen das vor dem Termin und sagen Ihnen, ob sich der Antragsaufwand lohnt.

Verwandte Seiten

Programme, mit denen Sie arbeiten

Zu jedem steht, was sich anbinden lässt, was dabei herauskommt und wo die Grenze liegt.

Alle Programme →

Sehen wir uns Ihren Bestand an.

Dreißig Minuten, per Video oder Telefon. Danach wissen Sie, ob lokale KI bei Ihnen trägt und was der erste Schritt ist.