Grundlagen · 13. September 2026 · 6 min

Offene Modelle 2026: Was im eigenen Haus wirklich läuft, und warum die Modellwahl überschätzt wird

Qwen, DeepSeek, Llama, Mistral, Gemma, gpt-oss, GLM, Nemotron: Die Liste der offenen Modellfamilien ist länger und besser als je zuvor. Eine Einordnung, was sie unterscheidet, warum sie plötzlich auf kleiner Hardware laufen, und welche Entscheidung stattdessen zählt.

Von PhoenixOne TeamSitz Leipzig · Sachsen
Drei einfache Glaskörper, Würfel, Zylinder und Keil, zu einem stabilen Turm gestapelt
Bevor entschieden wird, muss klar sein, worüber gesprochen wird. Hier steht das Fundament, ohne Fachjargon und ohne Versprechen.

Das Feld im Herbst 2026

Wer heute ein System im eigenen Haus betreiben will, wählt aus einem Feld, das noch vor zwei Jahren überschaubar war und heute unübersichtlich ist. Die Familien, die ernsthaft in Frage kommen:

  • Qwen von Alibaba
  • DeepSeek
  • Llama von Meta
  • Mistral aus Europa
  • Gemma von Google
  • gpt-oss von OpenAI
  • GLM
  • Nemotron von NVIDIA

Wir nennen bewusst Familien und keine Versionsnummern. Jede konkrete Version ist in wenigen Wochen überholt, und ein Beitrag, der eine Nummer empfiehlt, ist schneller falsch als gelesen. Die Familien dagegen sind stabil genug, um über sie zu sprechen.

Was sie verbindet: Sie reichen bei vielen Aufgaben an die kommerziellen Cloud-Dienste heran, und zwar bei vollständiger Kontrolle über die Daten. Das ist die eigentliche Nachricht. Nicht dass ein offenes Modell irgendeinen Vergleichstest gewinnt, sondern dass der Abstand bei alltäglicher Arbeit so klein geworden ist, dass die Datenfrage schwerer wiegt als der Leistungsunterschied.

Wofür die Größe reicht, gemessen an Büro-Aufgaben

Modellgrößen sagen wenig, solange niemand sagt, wofür. An den Aufgaben eines Planungsbüros wird es greifbar:

  • Eine Frage an den Bestand („Was haben wir bei der Sanierung in der Karl-Liebknecht-Straße zur Feuchtigkeit im Keller festgehalten?") braucht vor allem eine gute Suche, nicht das größte Modell.
  • Ein Protokoll aus Stichworten ist Fleißarbeit und läuft auch lokal gut.
  • Ein Nachweis oder eine Abweichungsbegründung ist keine Modellaufgabe. Was dort steht, verantwortet ein Mensch mit Unterschrift.

Mixture-of-Experts, und warum Sie das interessiert

Fast alle Spitzenmodelle sind heute als Mixture-of-Experts aufgebaut. Der Begriff klingt nach Fachkonferenz, hat aber eine sehr praktische Folge für Ihre Anschaffungsentscheidung.

Klassisch gilt: Ein Modell mit sehr vielen Parametern rechnet bei jeder einzelnen Anfrage mit allen davon. Größer hieß deshalb immer auch teurer im Betrieb, langsamer und speicherhungriger. Ein Mixture-of-Experts ist anders aufgebaut. Es besteht aus vielen Teilbereichen, und eine vorgeschaltete Auswahl entscheidet je Anfrage, welche davon überhaupt gebraucht werden. Aktiv ist dann nur ein Bruchteil der Gesamtgröße.

Die Folge in einem Satz: Die Größe eines Modells sagt nicht mehr direkt, wie viel Grafikspeicher es braucht.

Das ist der Grund, warum lokale Systeme heute für Betriebe erreichbar sind, die vor zwei Jahren zurecht abgewinkt haben. Ein Modell, das nach seiner Gesamtgröße nach Rechenzentrum klingt, läuft je nach Bauart auf einer einzelnen, gut ausgestatteten Maschine.

Zwei Dinge gehören zur Ehrlichkeit dazu. Erstens muss das Modell trotzdem vollständig in den Speicher passen, auch wenn nur ein Teil davon rechnet. Der Speicherbedarf sinkt also nicht auf den aktiven Anteil, wohl aber der Rechenaufwand und damit die Geschwindigkeit. Zweitens lassen sich Modelle zusätzlich verkleinern, was Speicher spart und Genauigkeit kostet. Wo dieser Kompromiss richtig liegt, entscheidet ein Test an Ihren eigenen Fragen und keine allgemeine Empfehlung.

Was die Familien praktisch unterscheidet

Für die Auswahl reichen im Alltag drei Unterscheidungen.

Gemma von Google ist auf Geräte und Randbetrieb ausgelegt. Gemeint sind Umgebungen, in denen wenig Hardware zur Verfügung steht, also ein einzelner Arbeitsplatz, ein kleiner Server in einer Niederlassung, ein Gerät ohne dauerhafte Verbindung nach außen. Wo Sie eine sehr kleine Umgebung ausstatten, gehört diese Familie in die engere Wahl.

Mistral aus Europa ist stark im Mehrsprachigen. Für deutsche Fachtexte ist das relevanter, als es klingt. Viele Modelle sind überwiegend auf englischem Material entstanden und übersetzen intern, was sich an Formulierungen und gelegentlich an Fachbegriffen bemerkbar macht. Wer Verträge, Normen und Handbücher auf Deutsch verarbeitet, merkt den Unterschied.

Llama von Meta ist die im Unternehmensumfeld am weitesten verbreitete offene Familie. Der Vorteil liegt weniger im Modell selbst als in allem, was darum herum existiert: Werkzeuge, Anleitungen, Erfahrungswerte, Leute, die es schon einmal betrieben haben. Bei einem System, das jahrelang laufen soll, ist das ein Argument für sich.

Qwen, DeepSeek, GLM, gpt-oss und Nemotron decken das übrige Feld ab und wechseln sich in den Vergleichstests regelmäßig an der Spitze ab. Wer sie auf die engere Liste setzt, macht nichts falsch, sollte die Auswahl aber an eigenen Fragen entscheiden und nicht an einer Rangliste.

Die Entscheidung, die wirklich zählt

Jetzt der Teil, der in den meisten Beiträgen zu diesem Thema fehlt.

In einem lokalen Projekt ist die Modellwahl die am wenigsten wichtige Entscheidung, und sie bekommt regelmäßig die meiste Aufmerksamkeit. In Erstgesprächen wird über Familien und Vergleichswerte diskutiert, bevor irgendjemand gefragt hat, welche Dokumente überhaupt durchsuchbar sein sollen.

Was tatsächlich über Erfolg oder Misserfolg entscheidet, sind drei andere Dinge.

Die Suche. Bevor das Modell antwortet, muss etwas die passenden Stellen aus Ihren Unterlagen finden. Ist diese Suche schlecht, bekommt das beste Modell die falschen Textstellen vorgelegt und formuliert daraus eine gut klingende falsche Antwort. Praktisch jede enttäuschende Auskunft, die wir in Projekten untersucht haben, ging auf diesen Schritt zurück und nicht auf das Modell.

Die Zerlegung der Dokumente. Unterlagen werden in Abschnitte geteilt, bevor sie durchsuchbar werden. Wo diese Schnitte liegen, entscheidet, ob eine Antwort ihren Zusammenhang behält. Ein Vertrag, der mitten in einer Klausel getrennt wird, liefert eine halbe Klausel. Eine Tabelle ohne ihre Überschriften liefert Zahlen ohne Bedeutung. Diese Arbeit ist unglamourös und macht den Unterschied.

Der Testsatz. Fünfzig bis hundert echte Fragen aus Ihrem Büro, dazu die richtige Antwort und das Dokument, in dem sie steht. Ohne diesen Satz ist jede Aussage über Qualität ein Eindruck, der sich nach Tagesform ändert. Mit ihm wird der Wechsel auf ein neues Modell zu einer Messung, die an einem Nachmittag erledigt ist. Wir legen diesen Testsatz in jedem Projekt an, bevor über Technik gesprochen wird.

Warum das Modell austauschbar bleiben muss

Wer heute ein Modell wählt, wählt es für etwa sechs Monate, nicht für fünf Jahre. Das ist keine Kritik an den Herstellern, sondern der Takt, in dem sich dieses Feld bewegt.

Daraus folgt eine Bauvorgabe, die wir in jedem System einhalten: Das Modell ist eine Einstellung, keine Grundlage. Die Arbeit steckt in der Suche, in der Anbindung an Ihre bestehenden Programme und in den Regeln, wer welche Dokumente sehen darf. All das bleibt bestehen, wenn in einem halben Jahr eine bessere Familie erscheint.

Wer stattdessen ein System um eine bestimmte Modellversion herum entwickelt, zahlt zweimal: einmal für die Umsetzung und einmal für jeden Wechsel danach. Und der Wechsel kommt, spätestens dann, wenn ein Kunde oder eine Prüfung eine andere Verarbeitungsebene verlangt.

Die Prüffrage, die Sie jedem Anbieter stellen können, lautet deshalb: Wie lange dauert bei Ihnen ein Modellwechsel, und woran messen Sie danach, ob er etwas gebracht hat. Wer darauf keine klare Antwort hat, hat kein austauschbares System umgesetzt.

Ein pragmatischer Einstieg

Wenn Sie mit lokalen Modellen anfangen wollen, ist die Reihenfolge wichtiger als die Auswahl. Zuerst festlegen, welche Unterlagen durchsuchbar sein sollen und wer sie sehen darf. Dann den Testsatz mit echten Fragen anlegen. Dann ein Modell aus einer etablierten Familie anbinden und messen. Danach entscheiden, ob eine andere Familie bei Ihren Fragen besser abschneidet.

Diese Reihenfolge fühlt sich langsamer an als der Griff zur aktuellen Bestenliste. Sie ist es nicht. Sie ist nur der Teil, der Arbeit macht, und sie ist der Grund, warum manche Systeme nach zwei Jahren noch benutzt werden und andere nach zwei Monaten nicht mehr.

Stand: September 2026. Die Übersicht über das Feld stützt sich auf die Übersicht der offenen Modelle 2026. Die Einordnung und die Empfehlungen zur Reihenfolge stammen aus unseren eigenen Projekten.

Über die Autoren

PhoenixOne Team

Wir entwickeln KI-Infrastruktur für Planungsbüros. Seit zwei Jahren, mit über fünfzehn produktiven Systemen im Einsatz, von Dokument-Agenten im Bauhandwerk bis zu vollständigen AI-OS-Setups in der Industrie. Alle Projekte mit Festpreis, Team-Übergabe und EFRE-Förderung beantragt.

Unsere Artikel schreiben wir aus der Projekt-Praxis: mit gemessenen Zahlen, ohne Hype-Vokabeln. Keine einzelnen Autoren, sondern das gesamte Team als Quelle: Projektleiter, Entwickler, Förder-Spezialisten.

Sitz Leipzig · Projekte bundesweit·+15 Projekte live im Betrieb·Gegründet 2024

◆Fachwörter in diesem beitrag

◆Programme in diesem beitrag

◆Thema im Überblick

Lokale KI im eigenen Haus

Eigener Server, offene Modelle, kein Cloud-Dienst im Datenpfad.

Zur Hauptseite
Jetzt starten

Bereit, das auf Ihr Büro anzuwenden?

Ein KI-Audit zeigt in 5 Minuten, wo Ihr Büro steht und welche Automation den größten Hebel hat.

Kostenloses KI-Audit starten

Sächsischer Mittelstand, Sitz Leipzig, über 15 Projekte live im Betrieb

Weiterlesen