Lokale KI · Nemotron

Nemotron lokal betreiben
vom Kartenhersteller, auf die Karte abgestimmt.

Der Hersteller der Grafikkarten veröffentlicht eigene Modelle, die auf seine Hardware abgestimmt sind. Nemotron ist interessant für sehr lange Dokumente und für Betriebe, die ohnehin im NVIDIA-Ökosystem arbeiten.

Nemotron 3 Super ist NVIDIAs offenes Sprachmodell mit 120 Milliarden Parametern, von denen pro Antwort zwölf rechnen. Es nutzt eine Mamba-Architektur, die sehr lange Dokumente effizient verarbeitet, und läuft auf einer Profi-Grafikkarte mit 96 Gigabyte. Die NVIDIA-Lizenz erlaubt kommerzielle Nutzung. Für deutsche Büros ist es eine Option neben Qwen, wenn lange Akten und NVIDIA-Werkzeuge im Vordergrund stehen.

Stand: September 2026

Ein Silberregal mit fünf gleichen Glasmodulen, eines davon gleitet über eine Kupferschiene in den Schacht einer Maschine
Das Modell ist austauschbar, der Bestand nicht. Genau deshalb setzen wir auf offene Modelle: Sie tauschen es, ohne von vorn anzufangen.

Sechs Fälle, in denen Nemotron passt

Aus unserer Modellprüfung und aus Betrieben, die NVIDIA-Werkzeuge schon einsetzen.

01 · Was hereinkommt

  • Sehr lange Akten am Stück lesen, Verträge mit Anlagen, Genehmigungen mit hundert Seiten Auflagen
  • Betriebe, die NVIDIA-Werkzeuge für Bildanalyse oder Simulation nutzen und ein Modell aus derselben Welt wollen

02 · Was daraus wird

  • Fragen an das Gedächtnis mit Fundstelle, solide im Deutschen
  • Zweitmodell für lange Kontexte neben einem schnellen Modell für Lastspitzen

03 · Was danach anders ist

  • Bild- und Videodaten aus der Fertigung beschreiben, wo NVIDIA-Werkzeuge schon laufen
  • Vergleichskandidat im Testsatz, wenn Kontextlänge das entscheidende Kriterium ist

Was wir dafür entwickeln

  1. 1

    Büro-Gedächtnis: Ihr KI-Gedächtnis, mit Nemotron für sehr lange Akten

    Büro-Gedächtnis im Detail
  2. 2

    Baustellen-Agent: Baustelle und Protokoll, Bilder aus der Fertigung beschrieben

    Baustellen-Agent im Detail
  3. 3

    Kalkulations-Assistent: Angebote aus eigenen Kalkulationen, gerechnet auf dem eigenen Modell

    Kalkulations-Assistent im Detail

Wo Nemotron nicht die erste Wahl ist

Die Lizenz ist nicht Apache, sondern eine eigene NVIDIA-Lizenz, die kommerzielle Nutzung erlaubt, aber gelesen werden will. Im Deutschen liegt es hinter Qwen und Mistral, und die Werkzeuglandschaft ist kleiner. Nemotron ist ein guter Kandidat, kein Standard.

Wofür auf Effizienz getrimmte Modelle taugen

Sie bekommen hier Modelle, die für den Betrieb auf konkreter Hardware optimiert wurden: Sie nutzen den Speicher besser aus und liefern bei gleicher Karte mehr Durchsatz. Für einen Betrieb mit festem Budget heißt das mehr gleichzeitige Nutzer auf derselben Maschine.

Der Preis dafür ist eine engere Bindung an die jeweilige Hardwaregeneration. Was heute gut passt, ist bei der nächsten Kartengeneration möglicherweise nicht mehr die beste Wahl. Das ist beherrschbar, wenn Sie den Wechsel von vornherein einplanen und nicht darauf bauen, dieselbe Einrichtung fünf Jahre unverändert zu fahren.

Vergleichen Sie deshalb nicht nur die Qualität der Antworten, sondern auch den Durchsatz auf Ihrer geplanten Karte. Beides gehört in denselben Test, und beides wird an Ihren eigenen Fragen gemessen. Eine Rangliste aus dem Netz sagt Ihnen weder, wie das Modell mit Ihrer Fachsprache umgeht, noch wie viele Ihrer Leute gleichzeitig damit arbeiten können.

So prüfen wir Nemotron gegen die anderen

  1. Schritt 1

    Daten- und Netz-Audit

    Was liegt wo, wie viele Scans, welche Rechtegruppen, welcher Serverraum. Fünfzehn Arbeitstage, am Ende die Spezifikation für Server und Software.

  2. Schritt 2

    Aufbau im getrennten Netz

    Server im eigenen Netzsegment, Modell lauffähig, Anmeldung über Ihr Active Directory, erster Test mit hundert echten Dokumenten.

  3. Schritt 3

    Einlesen, Härten, Betrieb

    Bestand einlesen, Rechte vererben, Sicherheitsprüfung durch Dritte, Pilot mit einer Abteilung, dann Betrieb mit monatlichem Bericht.

Vergleichen Sie nicht nur die Antwortqualität, sondern den Durchsatz auf Ihrer geplanten Karte.

PhoenixOne AI

Für wen sich das lohnt

IT und Administration
Sie haben NVIDIA-Werkzeuge im Haus. Nemotron fügt sich ein, der Betrieb bleibt gleich.
Fachplanung
Sie arbeiten mit Akten, die hundert Seiten Anlagen haben. Dafür ist die Architektur gemacht.
Geschäftsführung
Sie wollen keine Modellwahl nach Gefühl. Nemotron tritt im Testsatz gegen Qwen an, Sie sehen die Antworten.

Häufig gefragt

Läuft Nemotron nur auf NVIDIA-Karten?

Es ist darauf abgestimmt, und die meisten lokalen KI-Server nutzen ohnehin NVIDIA-Karten. Auf anderer Hardware ist die Unterstützung dünner.

Was ist die Mamba-Architektur?

Ein anderer Aufbau als bei den meisten Modellen, der lange Texte mit weniger Speicher verarbeitet. Praktisch: sehr lange Akten ohne Zerteilen.

Ist die Lizenz ein Problem?

Für Mittelständler nicht, kommerzielle Nutzung ist erlaubt. Wir lesen sie trotzdem mit Ihnen, weil es keine Apache-Lizenz ist.

Wie gut ist das Deutsch?

Solide, aber hinter Qwen und Mistral. Für Briefe an Bauherren nehmen wir meist ein anderes Modell daneben.

Gibt es Fördermittel für lokale KI?

Oft ja. Ob ein Zuschuss oder ein Darlehen greift, hängt an Ihrem Bundesland, an der Betriebsgröße und am Vorhaben. Hardware zählt in der Regel mit, wenn sie Teil des Vorhabens ist. Wir prüfen das vor dem Termin und sagen Ihnen, ob sich der Antragsaufwand lohnt.

Verwandte Seiten

Sehen wir uns Ihren Bestand an.

Dreißig Minuten, per Video oder Telefon. Danach wissen Sie, ob lokale KI bei Ihnen trägt und was der erste Schritt ist.