Lokale KI · Whisper

Whisper lokal betreiben
Sprache zu Text, ohne dass jemand mithört.

Ein Protokoll kostet fünf Stunden, wenn es jemand schreibt. Mit Whisper wird die Aufnahme im Haus zu Text, und ein Sprachmodell macht daraus das Protokoll. Nichts davon verlässt Ihren Server.

Für wen
Büros mit Besprechungen, Baustellen und Diktaten, die im Haus bleiben müssen
Aufwand
15 Arbeitstage bis zur Spezifikation
Förderung
Wird für Ihr Bundesland geprüft
Datenhaltung
Komplett auf Ihrem Server, nichts geht nach außen
Erster Schritt
Dreißig Minuten Erstgespräch per Video

Whisper large-v3 ist ein offenes Spracherkennungsmodell von OpenAI unter MIT-Lizenz, das lokal auf Ihrem Server läuft und Deutsch sehr gut versteht, auch mit Baustellenlärm und Dialekt. Aufnahmen von Besprechungen und Baustellen werden im Haus zu Text, ein Sprachmodell macht daraus Protokolle mit Aufgaben je Person. Keine Aufnahme geht in eine Cloud. Läuft neben dem Sprachmodell auf derselben Grafikkarte.

Stand: September 2026

Ein Silberregal mit fünf gleichen Glasmodulen, eines davon gleitet über eine Kupferschiene in den Schacht einer Maschine
Das Modell ist austauschbar, der Bestand nicht. Genau deshalb setzen wir auf offene Modelle: Sie tauschen es, ohne von vorn anzufangen.

Sechs Aufnahmen, die Whisper im Büro zu Text macht

Alle sechs laufen so in Betrieben, die wir betreuen. Die Aufnahme bleibt auf dem Server, der Text auch.

01 · Was hereinkommt

  • Baubesprechung aufgenommen, als Protokoll mit Aufgaben je Gewerk verteilt, am nächsten Morgen
  • Sprachnotiz von der Baustelle per Telefon, im Haus zu Text, dem Projekt zugeordnet

02 · Was daraus wird

  • Jour fixe mit Bauherr, Protokoll als Kurzfassung freigegeben, interne Punkte bleiben intern
  • Diktate für Gutachten, Berichte und Briefe, in Text mit Fachbegriffen, die das Modell kennt

03 · Was danach anders ist

  • Telefonate mit Einwilligung, Anliegen notiert, Rückruf eingetragen
  • Alte Aufnahmen aus dem Archiv durchsuchbar, weil der Text im Gedächtnis liegt

Der Engpass

Warum Spracherkennung in der Cloud oft nicht geht

In Besprechungen fallen Namen, Zahlen, Bauherrendaten und manchmal Vertrauliches. Ein Cloud-Dienst ist ein Auftragsverarbeiter, den viele Auftraggeber nicht erlauben, und die Einwilligung aller Teilnehmer bleibt trotzdem nötig. Lokal fällt der Auftragsverarbeiter weg, die Einwilligung nicht. Wir helfen mit einem Satz für den Anfang jeder Besprechung.

Was Spracherkennung im eigenen Haus leistet

Sie können Besprechungen, Diktate und Telefonnotizen im eigenen Netz in Text verwandeln, ohne dass eine Aufnahme das Haus verlässt. Für Aufnahmen mit Mandanten, Patienten oder Auftraggebern ist das der entscheidende Unterschied zu jedem Dienst, denn Einwilligung und Schweigepflicht lassen sich so sauber einhalten.

Die Qualität hängt an der Aufnahme mehr als am Modell. Ein Raum mit Hall und mehreren gleichzeitig Sprechenden ergibt einen unbrauchbaren Text, unabhängig von der Modellgröße. Ein einfaches Grenzflächenmikrofon in der Tischmitte bringt mehr als jede Aufrüstung.

Rechnen Sie mit Nacharbeit bei Fachbegriffen und Eigennamen. Diese lassen sich über eine Wortliste deutlich verbessern, und diese Liste wächst mit dem Gebrauch. Nach einigen Wochen ist der Rohtext so gut, dass ein Protokollentwurf daraus unmittelbar taugt.

Die Qualität hängt am Mikrofon, nicht am Modell.

Was wir dafür entwickeln

  1. 1

    Baustellen-Agent: Baustelle und Protokoll, Whisper macht aus Sprache Text, lokal

    Baustellen-Agent im Detail
  2. 2

    Post-Lotse: Posteingang, Sprachnachrichten und Anrufe als Text beim Vorgang

    Post-Lotse im Detail
  3. 3

    Büro-Gedächtnis: Ihr KI-Gedächtnis, in dem Protokolle und Diktate durchsuchbar liegen

    Büro-Gedächtnis im Detail

So kommt Whisper in Ihr Büro

  1. Schritt 1

    Daten- und Netz-Audit

    Was liegt wo, wie viele Scans, welche Rechtegruppen, welcher Serverraum. Fünfzehn Arbeitstage, am Ende die Spezifikation für Server und Software.

  2. Schritt 2

    Aufbau im getrennten Netz

    Server im eigenen Netzsegment, Modell lauffähig, Anmeldung über Ihr Active Directory, erster Test mit hundert echten Dokumenten.

  3. Schritt 3

    Einlesen, Härten, Betrieb

    Bestand einlesen, Rechte vererben, Sicherheitsprüfung durch Dritte, Pilot mit einer Abteilung, dann Betrieb mit monatlichem Bericht.

Für wen sich das lohnt

Bauleitung

Sie sprechen das Protokoll am Dienstag ein, am Mittwoch ist es verteilt. Aufnahme und Text bleiben im Haus.

Sachverständige und Gutachter

Sie diktieren, das Modell kennt Ihre Fachbegriffe, der Text landet im Gutachten.

Datenschutz

Kein Auftragsverarbeiter für Sprachdaten, Einwilligung geregelt, Aufnahmen löschbar auf Zuruf.

◆Fachwörter auf dieser Seite

Häufig gefragt

Versteht Whisper Dialekt und Baustellenlärm?

Erstaunlich gut. Sächsisch, Schwäbisch und laute Umgebungen kommen sauber durch, einzelne Fachbegriffe lernt das Sprachmodell aus Ihren Vorlagen.

Dürfen wir Besprechungen aufnehmen?

Mit Einwilligung aller Teilnehmer ja. Ein Satz am Anfang reicht, wir geben ihn Ihnen. Ohne Einwilligung nicht, auch nicht lokal.

Braucht Whisper eine eigene Grafikkarte?

Nein. Es läuft neben dem Sprachmodell auf derselben Karte und braucht wenig Speicher.

Wie schnell ist die Verarbeitung?

Eine Stunde Besprechung ist in wenigen Minuten Text, das Protokoll folgt direkt danach.

Gibt es Fördermittel für lokale KI?

Oft ja. Ob ein Zuschuss oder ein Darlehen greift, hängt an Ihrem Bundesland, an der Betriebsgröße und am Vorhaben. Hardware zählt in der Regel mit, wenn sie Teil des Vorhabens ist. Wir prüfen das vor dem Termin und sagen Ihnen, ob sich der Antragsaufwand lohnt.

Verwandte Seiten

Programme, mit denen Sie arbeiten

Zu jedem steht, was sich anbinden lässt, was dabei herauskommt und wo die Grenze liegt.

Alle Programme →

Sehen wir uns Ihren Bestand an.

Dreißig Minuten, per Video oder Telefon. Danach wissen Sie, ob lokale KI bei Ihnen trägt und was der erste Schritt ist.