Lokale KI · Nemotron
Nemotron lokal betreiben
vom Kartenhersteller, auf die Karte abgestimmt.
Der Hersteller der Grafikkarten veröffentlicht eigene Modelle, die auf seine Hardware abgestimmt sind. Nemotron ist interessant für sehr lange Dokumente und für Betriebe, die ohnehin im NVIDIA-Ökosystem arbeiten.
Nemotron 3 Super ist NVIDIAs offenes Sprachmodell mit 120 Milliarden Parametern, von denen pro Antwort zwölf rechnen. Es nutzt eine Mamba-Architektur, die sehr lange Dokumente effizient verarbeitet, und läuft auf einer Profi-Grafikkarte mit 96 Gigabyte. Die NVIDIA-Lizenz erlaubt kommerzielle Nutzung. Für deutsche Büros ist es eine Option neben Qwen, wenn lange Akten und NVIDIA-Werkzeuge im Vordergrund stehen.
Stand: September 2026

Sechs Fälle, in denen Nemotron passt
Aus unserer Modellprüfung und aus Betrieben, die NVIDIA-Werkzeuge schon einsetzen.
01 · Was hereinkommt
- Sehr lange Akten am Stück lesen, Verträge mit Anlagen, Genehmigungen mit hundert Seiten Auflagen
- Betriebe, die NVIDIA-Werkzeuge für Bildanalyse oder Simulation nutzen und ein Modell aus derselben Welt wollen
02 · Was daraus wird
- Fragen an das Gedächtnis mit Fundstelle, solide im Deutschen
- Zweitmodell für lange Kontexte neben einem schnellen Modell für Lastspitzen
03 · Was danach anders ist
- Bild- und Videodaten aus der Fertigung beschreiben, wo NVIDIA-Werkzeuge schon laufen
- Vergleichskandidat im Testsatz, wenn Kontextlänge das entscheidende Kriterium ist
Was wir dafür entwickeln
- 1
Büro-Gedächtnis: Ihr KI-Gedächtnis, mit Nemotron für sehr lange Akten
Büro-Gedächtnis im Detail - 2
Baustellen-Agent: Baustelle und Protokoll, Bilder aus der Fertigung beschrieben
Baustellen-Agent im Detail - 3
Kalkulations-Assistent: Angebote aus eigenen Kalkulationen, gerechnet auf dem eigenen Modell
Kalkulations-Assistent im Detail
Wo Nemotron nicht die erste Wahl ist
Die Lizenz ist nicht Apache, sondern eine eigene NVIDIA-Lizenz, die kommerzielle Nutzung erlaubt, aber gelesen werden will. Im Deutschen liegt es hinter Qwen und Mistral, und die Werkzeuglandschaft ist kleiner. Nemotron ist ein guter Kandidat, kein Standard.
Wofür auf Effizienz getrimmte Modelle taugen
Sie bekommen hier Modelle, die für den Betrieb auf konkreter Hardware optimiert wurden: Sie nutzen den Speicher besser aus und liefern bei gleicher Karte mehr Durchsatz. Für einen Betrieb mit festem Budget heißt das mehr gleichzeitige Nutzer auf derselben Maschine.
Der Preis dafür ist eine engere Bindung an die jeweilige Hardwaregeneration. Was heute gut passt, ist bei der nächsten Kartengeneration möglicherweise nicht mehr die beste Wahl. Das ist beherrschbar, wenn Sie den Wechsel von vornherein einplanen und nicht darauf bauen, dieselbe Einrichtung fünf Jahre unverändert zu fahren.
Vergleichen Sie deshalb nicht nur die Qualität der Antworten, sondern auch den Durchsatz auf Ihrer geplanten Karte. Beides gehört in denselben Test, und beides wird an Ihren eigenen Fragen gemessen. Eine Rangliste aus dem Netz sagt Ihnen weder, wie das Modell mit Ihrer Fachsprache umgeht, noch wie viele Ihrer Leute gleichzeitig damit arbeiten können.
So prüfen wir Nemotron gegen die anderen
Schritt 1
Daten- und Netz-Audit
Was liegt wo, wie viele Scans, welche Rechtegruppen, welcher Serverraum. Fünfzehn Arbeitstage, am Ende die Spezifikation für Server und Software.
Schritt 2
Aufbau im getrennten Netz
Server im eigenen Netzsegment, Modell lauffähig, Anmeldung über Ihr Active Directory, erster Test mit hundert echten Dokumenten.
Schritt 3
Einlesen, Härten, Betrieb
Bestand einlesen, Rechte vererben, Sicherheitsprüfung durch Dritte, Pilot mit einer Abteilung, dann Betrieb mit monatlichem Bericht.
Vergleichen Sie nicht nur die Antwortqualität, sondern den Durchsatz auf Ihrer geplanten Karte.
Für wen sich das lohnt
- IT und Administration
- Sie haben NVIDIA-Werkzeuge im Haus. Nemotron fügt sich ein, der Betrieb bleibt gleich.
- Fachplanung
- Sie arbeiten mit Akten, die hundert Seiten Anlagen haben. Dafür ist die Architektur gemacht.
- Geschäftsführung
- Sie wollen keine Modellwahl nach Gefühl. Nemotron tritt im Testsatz gegen Qwen an, Sie sehen die Antworten.
Häufig gefragt
Läuft Nemotron nur auf NVIDIA-Karten?
Es ist darauf abgestimmt, und die meisten lokalen KI-Server nutzen ohnehin NVIDIA-Karten. Auf anderer Hardware ist die Unterstützung dünner.
Was ist die Mamba-Architektur?
Ein anderer Aufbau als bei den meisten Modellen, der lange Texte mit weniger Speicher verarbeitet. Praktisch: sehr lange Akten ohne Zerteilen.
Ist die Lizenz ein Problem?
Für Mittelständler nicht, kommerzielle Nutzung ist erlaubt. Wir lesen sie trotzdem mit Ihnen, weil es keine Apache-Lizenz ist.
Wie gut ist das Deutsch?
Solide, aber hinter Qwen und Mistral. Für Briefe an Bauherren nehmen wir meist ein anderes Modell daneben.
Gibt es Fördermittel für lokale KI?
Oft ja. Ob ein Zuschuss oder ein Darlehen greift, hängt an Ihrem Bundesland, an der Betriebsgröße und am Vorhaben. Hardware zählt in der Regel mit, wenn sie Teil des Vorhabens ist. Wir prüfen das vor dem Termin und sagen Ihnen, ob sich der Antragsaufwand lohnt.
Verwandte Seiten
Qwen lokal
Das Allround-Modell für Deutsch, lange Dokumente und Bilder auf einer Grafikkarte
Hardware für lokale KI
Was ein KI-Server wirklich braucht: Grafikkarte, Speicher, Platten, Strom
Bilder und Pläne durchsuchen
Multimodale Modelle lesen Pläne, Fotos und Skizzen und machen sie mit Quelle durchsuchbar
Sehen wir uns Ihren Bestand an.
Dreißig Minuten, per Video oder Telefon. Danach wissen Sie, ob lokale KI bei Ihnen trägt und was der erste Schritt ist.