Lokale KI · Gemma

Gemma lokal betreiben
viel Leistung auf wenig Speicher.

Nicht jedes Büro braucht ein Modell mit hundert Milliarden Parametern. Gemma ist ein dichtes Modell mittlerer Größe, das auf kleineren Karten läuft und für Suche, Zuordnung und kurze Texte erstaunlich viel leistet.

Für wen
Kleinere Büros mit begrenztem Serverbudget und klaren Aufgaben
Aufwand
15 Arbeitstage bis zur Spezifikation
Förderung
Wird für Ihr Bundesland geprüft
Datenhaltung
Komplett auf Ihrem Server, nichts geht nach außen
Erster Schritt
Dreißig Minuten Erstgespräch per Video

Kurz gesagt

Gemma 4 ist Googles offenes Sprachmodell unter Apache-Lizenz mit 31 Milliarden Parametern. Anders als die großen Mixture-of-Experts-Modelle rechnet es dicht, braucht deshalb nur rund 31 Gigabyte Speicher und läuft auf kleineren Profi-Karten. Für Suche mit Fundstelle, Zuordnung und kurze Texte reicht es vielen Büros. Bei sehr langen Akten und anspruchsvollen Fachtexten sind Qwen und Mistral vorn.

Stand: September 2026

Ein Silberregal mit fünf gleichen Glasmodulen, eines davon gleitet über eine Kupferschiene in den Schacht einer Maschine
Das Modell ist austauschbar, der Bestand nicht. Genau deshalb setzen wir auf offene Modelle: Sie tauschen es, ohne von vorn anzufangen.

Der Engpass

Wo Gemma an seine Grenze kommt

Bei Akten mit hunderten Seiten am Stück, bei anspruchsvollen Fachtexten und bei Bildern fehlt Gemma die Tiefe der großen Modelle. Für zwanzig gleichzeitige Nutzer braucht es trotzdem eine ordentliche Karte. Gemma ist die richtige Wahl, wenn die Aufgaben klar und der Server klein ist, nicht als Sparversion für ein großes Büro.

Wo kompakte Modelle ihre Stärke ausspielen

Sie bekommen hier vergleichsweise kleine Modelle, die auf bescheidener Hardware laufen und trotzdem brauchbare Ergebnisse liefern. Für Betriebe, die mit begrenztem Budget anfangen wollen, ist das ein realistischer Einstieg: Eine Karte der mittleren Klasse genügt für eine Handvoll Nutzer.

Die Grenze zeigt sich bei langen Zusammenhängen und bei Fachsprache. Eine Frage an ein Protokoll beantwortet ein solches Modell zuverlässig, eine Frage, die fünf lange Verträge gegeneinander hält, eher nicht. Das ist keine Schwäche, sondern eine Auslegungsfrage.

Sinnvoll ist deshalb oft eine Kombination: das kleine Modell für die Masse der einfachen Anfragen, ein größeres für die schwierigen. Welche Aufgabe zu welchem gehört, entscheidet Ihr Testsatz.

Was wir dafür entwickeln

  1. 1

    Post-Lotse: Posteingang, von Gemma schnell und genügsam zugeordnet

    Post-Lotse im Detail
  2. 2

    Büro-Gedächtnis: Ihr KI-Gedächtnis für kleinere Büros, mit Gemma auf kleinerer Karte

    Büro-Gedächtnis im Detail
  3. 3

    Kundenablage: CRM, erfassen, wer hereinkommt, ohne großes Modell

    Kundenablage im Detail

So prüfen wir, ob Gemma reicht

  1. Schritt 1

    Daten- und Netz-Audit

    Was liegt wo, wie viele Scans, welche Rechtegruppen, welcher Serverraum. Fünfzehn Arbeitstage, am Ende die Spezifikation für Server und Software.

  2. Schritt 2

    Aufbau im getrennten Netz

    Server im eigenen Netzsegment, Modell lauffähig, Anmeldung über Ihr Active Directory, erster Test mit hundert echten Dokumenten.

  3. Schritt 3

    Einlesen, Härten, Betrieb

    Bestand einlesen, Rechte vererben, Sicherheitsprüfung durch Dritte, Pilot mit einer Abteilung, dann Betrieb mit monatlichem Bericht.

Sechs Aufgaben, für die Gemma reicht

Aus Projekten mit kleineren Servern. Wo die Aufgaben klar umrissen sind, ist Gemma oft die wirtschaftlichere Wahl.

  • Suche im Gedächtnis mit Fundstelle für Büros bis etwa zehn Nutzer
  • Posteingang zuordnen und Fristen erkennen, schnell und genügsam
  • Kurze Zusammenfassungen von Mails, Protokollen und Bescheiden
  • Formulare und Bescheinigungen aus vorhandenen Daten vorbereiten
  • Zweitmodell auf demselben Server für einfache Aufgaben, damit das große Modell frei bleibt
  • Einstieg für Büros, die erst später auf eine große Karte aufrüsten wollen

Ein kleines Modell beantwortet eine Frage an ein Protokoll. Nicht eine an fünf Verträge.

Für wen sich das lohnt

Inhaberinnen und Inhaber kleiner Büros
Sie wollen lokale KI ohne großen Server. Gemma auf einer kleineren Karte ist der Einstieg, aufrüsten geht später.
IT und Administration
Dichtes Modell, wenig Speicher, einfacher Betrieb. Läuft neben einem großen Modell als Zweitmodell.
Sekretariat
Der Posteingang ist sortiert und die Bescheinigung vorbereitet, dafür braucht es kein Riesenmodell.

Was Betriebe an dieser Stelle fragen

Einwand

Reicht Gemma für ein ganzes Büro?

Für Büros bis etwa zehn Nutzer mit Suche, Zuordnung und kurzen Texten ja. Für lange Akten, Fachtexte und zwanzig Nutzer empfehlen wir ein großes Modell.

Einwand

Welche Hardware braucht Gemma?

Rund 31 Gigabyte Speicher für das Modell, dazu Reserve für Nutzer. Eine kleinere Profi-Karte reicht, eine Spielkarte nur für Einzeltests.

Einwand

Ist Gemma von Google nicht Cloud?

Gemma ist das offene Modell, das Google zum Download freigibt. Es läuft bei Ihnen, ohne Verbindung nach außen. Gemini ist die Cloud, Gemma nicht.

Einwand

Können wir später auf Qwen wechseln?

Ja, an einem Nachmittag, sobald die größere Karte da ist. Ihr Index und Ihre Daten bleiben.

Einwand

Gibt es Fördermittel für lokale KI?

Oft ja. Ob ein Zuschuss oder ein Darlehen greift, hängt an Ihrem Bundesland, an der Betriebsgröße und am Vorhaben. Hardware zählt in der Regel mit, wenn sie Teil des Vorhabens ist. Wir prüfen das vor dem Termin und sagen Ihnen, ob sich der Antragsaufwand lohnt.

Verwandte Seiten

Programme, mit denen Sie arbeiten

Zu jedem steht, was sich anbinden lässt, was dabei herauskommt und wo die Grenze liegt.

Alle Programme →

Sehen wir uns Ihren Bestand an.

Dreißig Minuten, per Video oder Telefon. Danach wissen Sie, ob lokale KI bei Ihnen trägt und was der erste Schritt ist.