Lokale KI · Modellwahl

Welches KI-Modell für Ihr Unternehmen
Ihr Testsatz entscheidet, nicht die Bestenliste.

Jede Woche erscheint ein neues Modell mit einer neuen Bestenliste. Für Ihr Büro zählt nur eines: Beantwortet es Ihre Fragen aus Ihren Dokumenten richtig, auf Deutsch, in brauchbarer Zeit. Das misst kein Benchmark, das misst Ihr Testsatz.

Für wen
Betriebe, die zwischen Qwen, gpt-oss, Mistral und Gemma schwanken
Aufwand
15 Arbeitstage bis zur Spezifikation
Förderung
Wird für Ihr Bundesland geprüft
Datenhaltung
Testsatz und Modelle laufen auf Ihrem Server, nicht bei uns
Erster Schritt
Dreißig Minuten Erstgespräch per Video

Kurz gesagt

Das richtige Modell entscheidet nicht die Bestenliste, sondern Ihr Testsatz: fünfzig echte Fragen aus Ihrem Alltag mit bekannter Antwort. Damit prüfen wir drei bis vier offene Modelle auf Deutsch, Quellentreue und Tempo auf Ihrer Hardware. Für die meisten Betriebe gewinnt ein Modell der Klasse um 120 Milliarden Parameter, das auf eine Profi-Grafikkarte passt.

Stand: September 2026

Ein Dokumentenstapel unter einer Glasglocke, ein Kupferfaden führt von oben genau in ein bestimmtes Blatt
Die Unterlagen bleiben liegen, wo sie liegen. Gelesen wird darin, kopiert wird nichts, und die Antwort nennt das Blatt, aus dem sie stammt.

Ein Modell, das plausibel danebenliegt, ist gefährlicher als eines, das nichts gefunden hat.

Sechs Fragen, die in jeden Testsatz gehören

Der Testsatz kommt aus Ihrem Alltag. Diese sechs Typen decken ab, woran Modelle unterschiedlich scheitern.

01 · Was hereinkommt

  • Eine Fachfrage, deren Antwort in einem einzigen Absatz eines bekannten Dokuments steht
  • Eine Frage, deren Antwort über drei Dokumente verteilt ist und zusammengeführt werden muss

02 · Was daraus wird

  • Eine Frage mit Tabelle als Quelle, etwa ein Wert aus einer Leistungsbeschreibung
  • Eine Frage, auf die es in Ihrem Bestand keine Antwort gibt, um zu sehen, ob das Modell erfindet

03 · Was danach anders ist

  • Eine Frage in Umgangssprache mit Tippfehlern, so wie sie um halb fünf getippt wird
  • Eine lange Zusammenfassung eines Protokolls mit zwanzig Seiten, geprüft auf Auslassungen

Warum die Bestenliste Sie in die Irre führt

Benchmarks messen englische Rätsel und Programmieraufgaben. Ihr Alltag ist deutscher Fachtext mit Tabellen, Scans und Abkürzungen. Ein Modell, das auf der Liste vorn liegt, kann bei Ihren Protokollen steif oder ungenau antworten. In unseren Tests lagen Qwen 3.5, gpt-oss 120B und Mistral Small 4 je nach Betrieb vorn, nie dasselbe Modell bei allen. Deshalb testen wir immer auf Ihrer Hardware mit Ihren Fragen.

Wie ein Testsatz aussieht, der wirklich entscheidet

Sie brauchen dafür keine Wissenschaft, sondern dreißig Fragen, deren richtige Antwort Sie kennen. Nehmen Sie echte Fragen aus dem Alltag, nicht ausgedachte: die Frage, die letzte Woche jemand im Flur gestellt hat, und die Unterlage, in der die Antwort steht.

Bewertet wird nicht, ob die Antwort schön klingt, sondern drei Dinge: Ist sie sachlich richtig, nennt sie die richtige Fundstelle, und erfindet sie nichts dazu. Der dritte Punkt ist der wichtigste, denn ein Modell, das plausibel danebenliegt, ist gefährlicher als eines, das zugibt, nichts gefunden zu haben.

Derselbe Testsatz dient später als Prüfung vor jedem Update. Wenn eine neue Version das Antwortverhalten ändert, sehen Sie es an denselben dreißig Fragen, bevor es im Betrieb auffällt. Damit wird aus einer einmaligen Auswahl ein dauerhaftes Werkzeug.

So wählen wir das Modell

  1. Schritt 1

    Testsatz erheben

    Fünfzig Fragen aus drei Abteilungen, jede mit der Stelle, wo die Antwort steht. Dauert zwei Termine mit Ihren Fachleuten.

  2. Schritt 2

    Drei bis vier Modelle laufen lassen

    Auf Ihrem Server, mit denselben Dokumenten, demselben Index. Wir bewerten Treffer, Quelle, Deutsch und Antwortzeit.

  3. Schritt 3

    Entscheiden und festhalten

    Ein Modell für Deutsch und lange Dokumente, bei Bedarf ein zweites für Tempo. Der Testsatz bleibt und prüft jedes spätere Update.

Was wir dafür entwickeln

Büro-Gedächtnis: Ihr KI-Gedächtnis, in dem das gewählte Modell aus Ihren Dokumenten antwortetBüro-Gedächtnis im Detail
Post-Lotse: Posteingang, bei dem ein schnelles zweites Modell die Vorsortierung übernimmtPost-Lotse im Detail
Kalkulations-Assistent: Angebote, für die das Modell Tabellen sicher lesen mussKalkulations-Assistent im Detail

Für wen sich das lohnt

Geschäftsführung
Sie wollen keine Glaubensfrage, sondern eine Entscheidung mit Zahlen. Der Testsatz liefert sie in einer Tabelle.
Fachabteilung
Sie schreiben die Fragen und kennen die richtigen Antworten. Damit werden Sie zum Maßstab, an dem sich jedes Modell messen muss.
IT-Leitung
Sie sehen, welches Modell auf Ihrer Karte wie schnell läuft. Keine Überraschung nach dem Go-live.

Häufig gefragt

Welches Modell ist das beste für Deutsch?

Mistral Small 4 schreibt das idiomatischste Deutsch, Qwen 3.5 ist bei langen Dokumenten und Bildern stark, gpt-oss 120B ist am schnellsten und stark bei Logik, im Deutschen etwas steifer. Welches bei Ihnen gewinnt, zeigt der Testsatz.

Warum nicht einfach das größte Modell?

Weil es nicht auf eine Karte passt. DeepSeek V4 zum Beispiel ist sehr groß und braucht mehrere Karten. Die Klasse um 120 Milliarden Parameter mit wenigen aktiven Experten ist der Sweet Spot: große Qualität, kleine Geschwindigkeit.

Reicht ein europäisches Modell wie Teuken oder EuroLLM?

Für einfache Aufgaben und als Compliance-Argument ja. Mit sieben bis neun Milliarden Parametern sind sie für anspruchsvolles Fachtext-RAG zu klein. Wir nehmen sie in den Test auf, wenn Sie es wünschen.

Müssen wir das Modell später wechseln?

Manchmal lohnt es sich. Weil der Testsatz bleibt, ist der Wechsel ein Nachmittag: neues Modell laden, Testsatz laufen lassen, vergleichen, entscheiden.

Gibt es Fördermittel für lokale KI?

Oft ja. Ob ein Zuschuss oder ein Darlehen greift, hängt an Ihrem Bundesland, an der Betriebsgröße und am Vorhaben. Hardware zählt in der Regel mit, wenn sie Teil des Vorhabens ist. Wir prüfen das vor dem Termin und sagen Ihnen, ob sich der Antragsaufwand lohnt.

Verwandte Seiten

Programme, mit denen Sie arbeiten

Zu jedem steht, was sich anbinden lässt, was dabei herauskommt und wo die Grenze liegt.

Alle Programme →

Sehen wir uns Ihren Bestand an.

Dreißig Minuten, per Video oder Telefon. Danach wissen Sie, ob lokale KI bei Ihnen trägt und was der erste Schritt ist.