Lokale KI · Qwen

Qwen lokal betreiben
Deutsch, lange Dokumente, Bilder, freie Lizenz.

Wenn wir heute ein Modell für ein deutsches Büro auf einen Server im Haus setzen, ist Qwen meist die erste Wahl. Es schreibt Deutsch ohne Stolpern, liest sehr lange Dokumente und versteht Bilder.

Qwen 3.5 ist ein offenes Sprachmodell mit Apache-Lizenz, das lokal auf einer Profi-Grafikkarte mit 96 Gigabyte läuft. Von 122 Milliarden Parametern rechnen pro Antwort nur zehn, deshalb ist es schnell und trägt etwa zwanzig Nutzer. Es schreibt sehr gutes Deutsch, liest Dokumente mit hunderten Seiten am Stück und beschreibt Bilder. Für Suche und Fachfragen ist es unser Standardmodell.

Stand: September 2026

Ein Silberregal mit fünf gleichen Glasmodulen, eines davon gleitet über eine Kupferschiene in den Schacht einer Maschine
Das Modell ist austauschbar, der Bestand nicht. Genau deshalb setzen wir auf offene Modelle: Sie tauschen es, ohne von vorn anzufangen.

Sechs Dinge, die Qwen im Büro gut macht

Aus unserer Modellprüfung an echten Fragen eines Ingenieurbüros. Qwen war in vier von sechs Kategorien vorn.

01 · Was hereinkommt

  • Fragen an Projektakten mit hunderten Seiten, Antwort mit Fundstelle, ohne dass das Dokument zerteilt werden muss
  • Zusammenfassungen von Bescheiden, Protokollen und Verträgen in gutem Deutsch, nicht in übersetztem Englisch

02 · Was daraus wird

  • Pläne, Fotos und gescannte Zeichnungen beschreiben, damit sie im Gedächtnis auffindbar werden
  • Erste Entwürfe für Schreiben und Berichte aus eigenen Vorlagen, mit Ihrer Tonlage

03 · Was danach anders ist

  • Zwanzig Nutzer gleichzeitig auf einer Karte, weil pro Antwort nur ein Teil des Modells rechnet
  • Austausch gegen ein Nachfolgemodell an einem Nachmittag, Ihre Daten und Ihr Index bleiben

Was wir dafür entwickeln

Büro-Gedächtnis: Ihr KI-Gedächtnis, mit Qwen als Standardmodell für Deutsch und lange AktenBüro-Gedächtnis im Detail
Baustellen-Agent: Baustelle und Protokoll, Fotos und Pläne von Qwen beschriebenBaustellen-Agent im Detail
Kalkulations-Assistent: Angebote aus eigenen Kalkulationen, gerechnet auf dem eigenen ModellKalkulations-Assistent im Detail

Der Engpass

Wo Qwen an seine Grenze kommt

Bei freiem Schreiben langer Fachtexte bleibt Qwen ein Entwurfsassistent, der Mensch schreibt fertig. Auf einer Spielkarte mit 32 Gigabyte läuft es nur stark verkleinert und verliert Qualität. Und wie jedes Modell antwortet es nur so gut, wie die Quelle ist: Ohne Gedächtnis mit Fundstelle bleibt es ein Chatbot, der klug klingt.

Wofür sich diese Modellfamilie im Betrieb eignet

Sie finden hier eine der breitesten offenen Modellfamilien: von kleinen Varianten, die auf einer bescheidenen Grafikkarte laufen, bis zu großen, die eine Profi-Karte voll auslasten. Das ist im Betrieb praktisch, weil Sie klein anfangen und später wechseln können, ohne die Werkzeugkette zu ändern.

Im Deutschen sind die größeren Varianten brauchbar bis gut, die kleinen schwächeln bei Fachsprache und langen Zusammenhängen. Bei deutschen Fachtexten mit Normbezügen und Behördensprache lohnt der Vergleich mit europäisch trainierten Modellen an Ihrem eigenen Testsatz.

Prüfen Sie vor der Entscheidung immer die Lizenz der konkreten Variante, denn innerhalb einer Familie können sich die Bedingungen unterscheiden. Für den gewerblichen Einsatz ist das kein Detail, sondern die Grundlage.

So kommt Qwen auf Ihren Server

  1. Schritt 1

    Daten- und Netz-Audit

    Was liegt wo, wie viele Scans, welche Rechtegruppen, welcher Serverraum. Fünfzehn Arbeitstage, am Ende die Spezifikation für Server und Software.

  2. Schritt 2

    Aufbau im getrennten Netz

    Server im eigenen Netzsegment, Modell lauffähig, Anmeldung über Ihr Active Directory, erster Test mit hundert echten Dokumenten.

  3. Schritt 3

    Einlesen, Härten, Betrieb

    Bestand einlesen, Rechte vererben, Sicherheitsprüfung durch Dritte, Pilot mit einer Abteilung, dann Betrieb mit monatlichem Bericht.

Innerhalb einer Modellfamilie können die Lizenzen abweichen. Prüfen Sie die Variante, nicht den Namen.

Für wen sich das lohnt

Geschäftsführung
Sie wollen ein Modell, das niemandem gehört und keine Preisänderung kennt. Apache-Lizenz heißt genau das.
IT und Administration
Sie betreiben es in einem Container mit vLLM, Updates als geprüfte Pakete, auch ohne Internet.
Fachplanung
Sie merken vom Modell nichts, außer dass die Antwort auf Deutsch kommt und die Fundstelle stimmt.

◆Fachwörter auf dieser Seite

Erklärt im Glossar

Häufig gefragt

Ist Qwen nicht ein chinesisches Modell?

Ja, entwickelt von Alibaba, veröffentlicht unter Apache-Lizenz. Lokal betrieben verlässt kein Byte Ihr Haus, damit ist die Herkunft datenschutzrechtlich zweitrangig. Wer es trotzdem nicht will, bekommt Mistral oder gpt-oss.

Welche Grafikkarte braucht Qwen?

Eine Profi-Karte mit 96 Gigabyte Speicher für die große Variante mit etwa zwanzig Nutzern. Kleinere Varianten laufen auf weniger Speicher, dann mit weniger Nutzern und weniger Kontext.

Wie gut ist das Deutsch wirklich?

Sehr gut, in unserer Prüfung gleichauf mit den großen Cloud-Modellen bei Zusammenfassungen und Fachfragen. Nur Mistral schreibt idiomatisch noch etwas natürlicher.

Können wir Qwen mit unseren Daten trainieren?

Man kann, muss aber meist nicht. Das Gedächtnis mit Quelle löst neunzig Prozent ohne Training. Feintuning ist ein eigener Schritt für sehr eigene Fachsprache.

Gibt es Fördermittel für lokale KI?

Oft ja. Ob ein Zuschuss oder ein Darlehen greift, hängt an Ihrem Bundesland, an der Betriebsgröße und am Vorhaben. Hardware zählt in der Regel mit, wenn sie Teil des Vorhabens ist. Wir prüfen das vor dem Termin und sagen Ihnen, ob sich der Antragsaufwand lohnt.

Verwandte Seiten

Sehen wir uns Ihren Bestand an.

Dreißig Minuten, per Video oder Telefon. Danach wissen Sie, ob lokale KI bei Ihnen trägt und was der erste Schritt ist.