Lokale KI · gpt-oss
gpt-oss 120B lokal
schnelles Reasoning auf einer Grafikkarte.
OpenAI hat 2025 ein offenes Modell veröffentlicht, das auf einem Server im Haus läuft. Es ist das schnellste in seiner Klasse und braucht wenig Speicher. Im Deutschen klingt es etwas technischer als Qwen oder Mistral.
gpt-oss 120B ist das offene Modell von OpenAI unter Apache-Lizenz. Von 117 Milliarden Parametern rechnen pro Antwort nur etwa fünf, deshalb ist es sehr schnell und braucht auf einer Profi-Grafikkarte nur rund 60 Gigabyte. Es ist stark bei Logik, Zuordnung und strukturierten Aufgaben, im Deutschen etwas steifer. Wir setzen es meist als Zweitmodell für Lastspitzen neben Qwen ein.
Stand: September 2026

Wo gpt-oss nicht die erste Wahl ist
Für Briefe an Bauherren und Fachtexte klingt es im Deutschen technischer als Qwen oder Mistral, das merkt man bei längeren Texten. Und es liest kürzere Dokumente am Stück als Qwen. Deshalb läuft es bei uns meist als zweites Modell auf derselben Karte: Qwen für Sprache und Akten, gpt-oss für Tempo und Struktur.
Was offene Modelle aus dieser Linie im Alltag leisten
Sie bekommen damit ein Modell mit offener Lizenz, das für den gewerblichen Einsatz gedacht ist und in zwei Größen kommt. Die kleinere läuft auf einer einzelnen Karte, die größere braucht deutlich mehr Speicher und liefert dafür bei komplexeren Aufgaben spürbar bessere Ergebnisse.
Die Stärke liegt beim strukturierten Arbeiten: Anweisungen befolgen, Werkzeuge aufrufen, in vorgegebener Form antworten. Genau das braucht ein System, das Ihren Bestand liest und mit Fundstelle antworten soll, denn dabei zählt Verlässlichkeit im Format mehr als Eleganz im Ausdruck.
Im Deutschen ist die Qualität ordentlich, bei Fachsprache aus Bau und Verwaltung lohnt der Vergleich. Entscheiden Sie an Ihrem Testsatz, nicht an einer Rangliste, die mit englischen Aufgaben gemessen wurde.
Was wir dafür entwickeln
- 1
Post-Lotse: Posteingang, von gpt-oss in Sekunden dem Projekt zugeordnet
Post-Lotse im Detail - 2
Machbarkeits-Radar: Anfragen prüfen gegen Checklisten, strukturiert und schnell
Machbarkeits-Radar im Detail - 3
Büro-Gedächtnis: Ihr KI-Gedächtnis, mit gpt-oss als Zweitmodell für Lastspitzen
Büro-Gedächtnis im Detail
So kommt gpt-oss auf Ihren Server
- Schritt 1
Daten- und Netz-Audit
Was liegt wo, wie viele Scans, welche Rechtegruppen, welcher Serverraum. Fünfzehn Arbeitstage, am Ende die Spezifikation für Server und Software.
- Schritt 2
Aufbau im getrennten Netz
Server im eigenen Netzsegment, Modell lauffähig, Anmeldung über Ihr Active Directory, erster Test mit hundert echten Dokumenten.
- Schritt 3
Einlesen, Härten, Betrieb
Bestand einlesen, Rechte vererben, Sicherheitsprüfung durch Dritte, Pilot mit einer Abteilung, dann Betrieb mit monatlichem Bericht.
Sechs Aufgaben, bei denen gpt-oss glänzt
Aus unserer Modellprüfung. Wo es auf Tempo und saubere Struktur ankommt, war gpt-oss vorn.
- Posteingang klassifizieren: Projekt, Frist, Dringlichkeit, in Sekunden für hunderte Mails am Morgen
- Strukturierte Auszüge aus Bescheiden und Verträgen: Datum, Betrag, Frist, Beteiligte, als Tabelle
- Lastspitzen abfangen, wenn zwanzig Nutzer gleichzeitig fragen, ohne dass jemand wartet
- Prüflogik: Bauvorlagen gegen eine Checkliste halten und fehlende Punkte nennen
- Berechnungen und Plausibilitätsprüfungen in Kalkulationen nachvollziehen
- Rückfragen an das Gedächtnis in mehreren Schritten planen, wenn die erste Suche nichts findet
Bei einem System mit Fundstelle zählt Verlässlichkeit im Format mehr als Eleganz im Ausdruck.
Für wen sich das lohnt
- Geschäftsführung
- Sie wollen OpenAI-Qualität ohne OpenAI-Cloud. Das offene Modell läuft bei Ihnen, unter freier Lizenz.
- IT und Administration
- Wenig Speicher, hohe Geschwindigkeit, gut für viele gleichzeitige Nutzer. Läuft in einem Container mit vLLM.
- Sekretariat und Assistenz
- Der Posteingang ist morgens sortiert, weil dieses Modell schnell genug ist, hunderte Mails zu lesen.
◆Fachwörter auf dieser Seite
Erklärt im Glossar
Was Betriebe an dieser Stelle fragen
Einwand
Ist gpt-oss dasselbe wie ChatGPT?
Nein. ChatGPT läuft in der Cloud von OpenAI mit geschlossenen Modellen. gpt-oss ist ein offenes Modell, das OpenAI zum Download freigegeben hat. Es läuft bei Ihnen, ohne Verbindung nach außen.
Einwand
Warum nicht nur gpt-oss nehmen?
Weil sein Deutsch technischer klingt und es kürzere Dokumente am Stück liest. Für Briefe und lange Akten ist Qwen oder Mistral besser. Zwei Modelle auf einer Karte sind kein Luxus, sondern die Regel.
Einwand
Wie schnell ist es?
In unserer Prüfung das schnellste Modell seiner Klasse, weil pro Antwort nur ein kleiner Teil rechnet. Für zwanzig gleichzeitige Nutzer bleibt viel Reserve.
Einwand
Passt es auf eine kleinere Karte?
Mit rund 60 Gigabyte ist es das genügsamste der großen Modelle. Auf einer Spielkarte mit 32 Gigabyte läuft es trotzdem nicht in voller Qualität.
Einwand
Gibt es Fördermittel für lokale KI?
Oft ja. Ob ein Zuschuss oder ein Darlehen greift, hängt an Ihrem Bundesland, an der Betriebsgröße und am Vorhaben. Hardware zählt in der Regel mit, wenn sie Teil des Vorhabens ist. Wir prüfen das vor dem Termin und sagen Ihnen, ob sich der Antragsaufwand lohnt.
Verwandte Seiten
Programme, mit denen Sie arbeiten
Zu jedem steht, was sich anbinden lässt, was dabei herauskommt und wo die Grenze liegt.
Sehen wir uns Ihren Bestand an.
Dreißig Minuten, per Video oder Telefon. Danach wissen Sie, ob lokale KI bei Ihnen trägt und was der erste Schritt ist.