Das Feld im Herbst 2026
Wer heute ein System im eigenen Haus betreiben will, wählt aus einem Feld, das noch vor zwei Jahren überschaubar war und heute unübersichtlich ist. Die Familien, die ernsthaft in Frage kommen:
- Qwen von Alibaba
- DeepSeek
- Llama von Meta
- Mistral aus Europa
- Gemma von Google
- gpt-oss von OpenAI
- GLM
- Nemotron von NVIDIA
Wir nennen bewusst Familien und keine Versionsnummern. Jede konkrete Version ist in wenigen Wochen überholt, und ein Beitrag, der eine Nummer empfiehlt, ist schneller falsch als gelesen. Die Familien dagegen sind stabil genug, um über sie zu sprechen.
Was sie verbindet: Sie reichen bei vielen Aufgaben an die kommerziellen Cloud-Dienste heran, und zwar bei vollständiger Kontrolle über die Daten. Das ist die eigentliche Nachricht. Nicht dass ein offenes Modell irgendeinen Vergleichstest gewinnt, sondern dass der Abstand bei alltäglicher Arbeit so klein geworden ist, dass die Datenfrage schwerer wiegt als der Leistungsunterschied.
Wofür die Größe reicht, gemessen an Büro-Aufgaben
Modellgrößen sagen wenig, solange niemand sagt, wofür. An den Aufgaben eines Planungsbüros wird es greifbar:
- Eine Frage an den Bestand („Was haben wir bei der Sanierung in der Karl-Liebknecht-Straße zur Feuchtigkeit im Keller festgehalten?") braucht vor allem eine gute Suche, nicht das größte Modell.
- Ein Protokoll aus Stichworten ist Fleißarbeit und läuft auch lokal gut.
- Ein Nachweis oder eine Abweichungsbegründung ist keine Modellaufgabe. Was dort steht, verantwortet ein Mensch mit Unterschrift.
Mixture-of-Experts, und warum Sie das interessiert
Fast alle Spitzenmodelle sind heute als Mixture-of-Experts aufgebaut. Der Begriff klingt nach Fachkonferenz, hat aber eine sehr praktische Folge für Ihre Anschaffungsentscheidung.
Klassisch gilt: Ein Modell mit sehr vielen Parametern rechnet bei jeder einzelnen Anfrage mit allen davon. Größer hieß deshalb immer auch teurer im Betrieb, langsamer und speicherhungriger. Ein Mixture-of-Experts ist anders aufgebaut. Es besteht aus vielen Teilbereichen, und eine vorgeschaltete Auswahl entscheidet je Anfrage, welche davon überhaupt gebraucht werden. Aktiv ist dann nur ein Bruchteil der Gesamtgröße.
Die Folge in einem Satz: Die Größe eines Modells sagt nicht mehr direkt, wie viel Grafikspeicher es braucht.
Das ist der Grund, warum lokale Systeme heute für Betriebe erreichbar sind, die vor zwei Jahren zurecht abgewinkt haben. Ein Modell, das nach seiner Gesamtgröße nach Rechenzentrum klingt, läuft je nach Bauart auf einer einzelnen, gut ausgestatteten Maschine.
Zwei Dinge gehören zur Ehrlichkeit dazu. Erstens muss das Modell trotzdem vollständig in den Speicher passen, auch wenn nur ein Teil davon rechnet. Der Speicherbedarf sinkt also nicht auf den aktiven Anteil, wohl aber der Rechenaufwand und damit die Geschwindigkeit. Zweitens lassen sich Modelle zusätzlich verkleinern, was Speicher spart und Genauigkeit kostet. Wo dieser Kompromiss richtig liegt, entscheidet ein Test an Ihren eigenen Fragen und keine allgemeine Empfehlung.
Was die Familien praktisch unterscheidet
Für die Auswahl reichen im Alltag drei Unterscheidungen.
Gemma von Google ist auf Geräte und Randbetrieb ausgelegt. Gemeint sind Umgebungen, in denen wenig Hardware zur Verfügung steht, also ein einzelner Arbeitsplatz, ein kleiner Server in einer Niederlassung, ein Gerät ohne dauerhafte Verbindung nach außen. Wo Sie eine sehr kleine Umgebung ausstatten, gehört diese Familie in die engere Wahl.
Mistral aus Europa ist stark im Mehrsprachigen. Für deutsche Fachtexte ist das relevanter, als es klingt. Viele Modelle sind überwiegend auf englischem Material entstanden und übersetzen intern, was sich an Formulierungen und gelegentlich an Fachbegriffen bemerkbar macht. Wer Verträge, Normen und Handbücher auf Deutsch verarbeitet, merkt den Unterschied.
Llama von Meta ist die im Unternehmensumfeld am weitesten verbreitete offene Familie. Der Vorteil liegt weniger im Modell selbst als in allem, was darum herum existiert: Werkzeuge, Anleitungen, Erfahrungswerte, Leute, die es schon einmal betrieben haben. Bei einem System, das jahrelang laufen soll, ist das ein Argument für sich.
Qwen, DeepSeek, GLM, gpt-oss und Nemotron decken das übrige Feld ab und wechseln sich in den Vergleichstests regelmäßig an der Spitze ab. Wer sie auf die engere Liste setzt, macht nichts falsch, sollte die Auswahl aber an eigenen Fragen entscheiden und nicht an einer Rangliste.
Die Entscheidung, die wirklich zählt
Jetzt der Teil, der in den meisten Beiträgen zu diesem Thema fehlt.
In einem lokalen Projekt ist die Modellwahl die am wenigsten wichtige Entscheidung, und sie bekommt regelmäßig die meiste Aufmerksamkeit. In Erstgesprächen wird über Familien und Vergleichswerte diskutiert, bevor irgendjemand gefragt hat, welche Dokumente überhaupt durchsuchbar sein sollen.
Was tatsächlich über Erfolg oder Misserfolg entscheidet, sind drei andere Dinge.
Die Suche. Bevor das Modell antwortet, muss etwas die passenden Stellen aus Ihren Unterlagen finden. Ist diese Suche schlecht, bekommt das beste Modell die falschen Textstellen vorgelegt und formuliert daraus eine gut klingende falsche Antwort. Praktisch jede enttäuschende Auskunft, die wir in Projekten untersucht haben, ging auf diesen Schritt zurück und nicht auf das Modell.
Die Zerlegung der Dokumente. Unterlagen werden in Abschnitte geteilt, bevor sie durchsuchbar werden. Wo diese Schnitte liegen, entscheidet, ob eine Antwort ihren Zusammenhang behält. Ein Vertrag, der mitten in einer Klausel getrennt wird, liefert eine halbe Klausel. Eine Tabelle ohne ihre Überschriften liefert Zahlen ohne Bedeutung. Diese Arbeit ist unglamourös und macht den Unterschied.
Der Testsatz. Fünfzig bis hundert echte Fragen aus Ihrem Büro, dazu die richtige Antwort und das Dokument, in dem sie steht. Ohne diesen Satz ist jede Aussage über Qualität ein Eindruck, der sich nach Tagesform ändert. Mit ihm wird der Wechsel auf ein neues Modell zu einer Messung, die an einem Nachmittag erledigt ist. Wir legen diesen Testsatz in jedem Projekt an, bevor über Technik gesprochen wird.
Warum das Modell austauschbar bleiben muss
Wer heute ein Modell wählt, wählt es für etwa sechs Monate, nicht für fünf Jahre. Das ist keine Kritik an den Herstellern, sondern der Takt, in dem sich dieses Feld bewegt.
Daraus folgt eine Bauvorgabe, die wir in jedem System einhalten: Das Modell ist eine Einstellung, keine Grundlage. Die Arbeit steckt in der Suche, in der Anbindung an Ihre bestehenden Programme und in den Regeln, wer welche Dokumente sehen darf. All das bleibt bestehen, wenn in einem halben Jahr eine bessere Familie erscheint.
Wer stattdessen ein System um eine bestimmte Modellversion herum entwickelt, zahlt zweimal: einmal für die Umsetzung und einmal für jeden Wechsel danach. Und der Wechsel kommt, spätestens dann, wenn ein Kunde oder eine Prüfung eine andere Verarbeitungsebene verlangt.
Die Prüffrage, die Sie jedem Anbieter stellen können, lautet deshalb: Wie lange dauert bei Ihnen ein Modellwechsel, und woran messen Sie danach, ob er etwas gebracht hat. Wer darauf keine klare Antwort hat, hat kein austauschbares System umgesetzt.
Ein pragmatischer Einstieg
Wenn Sie mit lokalen Modellen anfangen wollen, ist die Reihenfolge wichtiger als die Auswahl. Zuerst festlegen, welche Unterlagen durchsuchbar sein sollen und wer sie sehen darf. Dann den Testsatz mit echten Fragen anlegen. Dann ein Modell aus einer etablierten Familie anbinden und messen. Danach entscheiden, ob eine andere Familie bei Ihren Fragen besser abschneidet.
Diese Reihenfolge fühlt sich langsamer an als der Griff zur aktuellen Bestenliste. Sie ist es nicht. Sie ist nur der Teil, der Arbeit macht, und sie ist der Grund, warum manche Systeme nach zwei Jahren noch benutzt werden und andere nach zwei Monaten nicht mehr.
Stand: September 2026. Die Übersicht über das Feld stützt sich auf die Übersicht der offenen Modelle 2026. Die Einordnung und die Empfehlungen zur Reihenfolge stammen aus unseren eigenen Projekten.
