
Lokale KI · Modellwahl
Welches KI-Modell für Ihr Unternehmen
Ihr Testsatz entscheidet, nicht die Bestenliste.
Jede Woche erscheint ein neues Modell mit einer neuen Bestenliste. Für Ihr Büro zählt nur eines: Beantwortet es Ihre Fragen aus Ihren Dokumenten richtig, auf Deutsch, in brauchbarer Zeit. Das misst kein Benchmark, das misst Ihr Testsatz.
- Für wen
- Betriebe, die zwischen Qwen, gpt-oss, Mistral und Gemma schwanken
- Aufwand
- 15 Arbeitstage bis zur Spezifikation
- Förderung
- Wird für Ihr Bundesland geprüft
- Datenhaltung
- Testsatz und Modelle laufen auf Ihrem Server, nicht bei uns
- Erster Schritt
- Dreißig Minuten Erstgespräch per Video
Kurz gesagt
Das richtige Modell entscheidet nicht die Bestenliste, sondern Ihr Testsatz: fünfzig echte Fragen aus Ihrem Alltag mit bekannter Antwort. Damit prüfen wir drei bis vier offene Modelle auf Deutsch, Quellentreue und Tempo auf Ihrer Hardware. Für die meisten Betriebe gewinnt ein Modell der Klasse um 120 Milliarden Parameter, das auf eine Profi-Grafikkarte passt.
Stand: September 2026

Ein Modell, das plausibel danebenliegt, ist gefährlicher als eines, das nichts gefunden hat.
Sechs Fragen, die in jeden Testsatz gehören
Der Testsatz kommt aus Ihrem Alltag. Diese sechs Typen decken ab, woran Modelle unterschiedlich scheitern.
01 · Was hereinkommt
- Eine Fachfrage, deren Antwort in einem einzigen Absatz eines bekannten Dokuments steht
- Eine Frage, deren Antwort über drei Dokumente verteilt ist und zusammengeführt werden muss
02 · Was daraus wird
- Eine Frage mit Tabelle als Quelle, etwa ein Wert aus einer Leistungsbeschreibung
- Eine Frage, auf die es in Ihrem Bestand keine Antwort gibt, um zu sehen, ob das Modell erfindet
03 · Was danach anders ist
- Eine Frage in Umgangssprache mit Tippfehlern, so wie sie um halb fünf getippt wird
- Eine lange Zusammenfassung eines Protokolls mit zwanzig Seiten, geprüft auf Auslassungen
Warum die Bestenliste Sie in die Irre führt
Benchmarks messen englische Rätsel und Programmieraufgaben. Ihr Alltag ist deutscher Fachtext mit Tabellen, Scans und Abkürzungen. Ein Modell, das auf der Liste vorn liegt, kann bei Ihren Protokollen steif oder ungenau antworten. In unseren Tests lagen Qwen 3.5, gpt-oss 120B und Mistral Small 4 je nach Betrieb vorn, nie dasselbe Modell bei allen. Deshalb testen wir immer auf Ihrer Hardware mit Ihren Fragen.
Wie ein Testsatz aussieht, der wirklich entscheidet
Sie brauchen dafür keine Wissenschaft, sondern dreißig Fragen, deren richtige Antwort Sie kennen. Nehmen Sie echte Fragen aus dem Alltag, nicht ausgedachte: die Frage, die letzte Woche jemand im Flur gestellt hat, und die Unterlage, in der die Antwort steht.
Bewertet wird nicht, ob die Antwort schön klingt, sondern drei Dinge: Ist sie sachlich richtig, nennt sie die richtige Fundstelle, und erfindet sie nichts dazu. Der dritte Punkt ist der wichtigste, denn ein Modell, das plausibel danebenliegt, ist gefährlicher als eines, das zugibt, nichts gefunden zu haben.
Derselbe Testsatz dient später als Prüfung vor jedem Update. Wenn eine neue Version das Antwortverhalten ändert, sehen Sie es an denselben dreißig Fragen, bevor es im Betrieb auffällt. Damit wird aus einer einmaligen Auswahl ein dauerhaftes Werkzeug.
So wählen wir das Modell
Schritt 1
Testsatz erheben
Fünfzig Fragen aus drei Abteilungen, jede mit der Stelle, wo die Antwort steht. Dauert zwei Termine mit Ihren Fachleuten.
Schritt 2
Drei bis vier Modelle laufen lassen
Auf Ihrem Server, mit denselben Dokumenten, demselben Index. Wir bewerten Treffer, Quelle, Deutsch und Antwortzeit.
Schritt 3
Entscheiden und festhalten
Ein Modell für Deutsch und lange Dokumente, bei Bedarf ein zweites für Tempo. Der Testsatz bleibt und prüft jedes spätere Update.
Was wir dafür entwickeln
Für wen sich das lohnt
- Geschäftsführung
- Sie wollen keine Glaubensfrage, sondern eine Entscheidung mit Zahlen. Der Testsatz liefert sie in einer Tabelle.
- Fachabteilung
- Sie schreiben die Fragen und kennen die richtigen Antworten. Damit werden Sie zum Maßstab, an dem sich jedes Modell messen muss.
- IT-Leitung
- Sie sehen, welches Modell auf Ihrer Karte wie schnell läuft. Keine Überraschung nach dem Go-live.
Häufig gefragt
Welches Modell ist das beste für Deutsch?
Mistral Small 4 schreibt das idiomatischste Deutsch, Qwen 3.5 ist bei langen Dokumenten und Bildern stark, gpt-oss 120B ist am schnellsten und stark bei Logik, im Deutschen etwas steifer. Welches bei Ihnen gewinnt, zeigt der Testsatz.
Warum nicht einfach das größte Modell?
Weil es nicht auf eine Karte passt. DeepSeek V4 zum Beispiel ist sehr groß und braucht mehrere Karten. Die Klasse um 120 Milliarden Parameter mit wenigen aktiven Experten ist der Sweet Spot: große Qualität, kleine Geschwindigkeit.
Reicht ein europäisches Modell wie Teuken oder EuroLLM?
Für einfache Aufgaben und als Compliance-Argument ja. Mit sieben bis neun Milliarden Parametern sind sie für anspruchsvolles Fachtext-RAG zu klein. Wir nehmen sie in den Test auf, wenn Sie es wünschen.
Müssen wir das Modell später wechseln?
Manchmal lohnt es sich. Weil der Testsatz bleibt, ist der Wechsel ein Nachmittag: neues Modell laden, Testsatz laufen lassen, vergleichen, entscheiden.
Gibt es Fördermittel für lokale KI?
Oft ja. Ob ein Zuschuss oder ein Darlehen greift, hängt an Ihrem Bundesland, an der Betriebsgröße und am Vorhaben. Hardware zählt in der Regel mit, wenn sie Teil des Vorhabens ist. Wir prüfen das vor dem Termin und sagen Ihnen, ob sich der Antragsaufwand lohnt.
Verwandte Seiten
Programme, mit denen Sie arbeiten
Zu jedem steht, was sich anbinden lässt, was dabei herauskommt und wo die Grenze liegt.
- TestsatzEchte Fragen mit bekannter Antwort, gemessen statt behauptet
- PilotbetriebEin Bereich, vier Wochen Alltag, feste Messpunkte
- AbnahmeMessbare Kriterien, vorher vereinbart, gemeinsam geprüft
- Anthropic APIClaude für lange Dokumente, Auswertung und sauberes Deutsch
- OpenAI APISprache, Bild und Stimme, wenn drei Arten Material zusammenkommen
Sehen wir uns Ihren Bestand an.
Dreißig Minuten, per Video oder Telefon. Danach wissen Sie, ob lokale KI bei Ihnen trägt und was der erste Schritt ist.