Lokale KI · Gemma
Gemma lokal betreiben
viel Leistung auf wenig Speicher.
Nicht jedes Büro braucht ein Modell mit hundert Milliarden Parametern. Gemma ist ein dichtes Modell mittlerer Größe, das auf kleineren Karten läuft und für Suche, Zuordnung und kurze Texte erstaunlich viel leistet.
- Für wen
- Kleinere Büros mit begrenztem Serverbudget und klaren Aufgaben
- Aufwand
- 15 Arbeitstage bis zur Spezifikation
- Förderung
- Wird für Ihr Bundesland geprüft
- Datenhaltung
- Komplett auf Ihrem Server, nichts geht nach außen
- Erster Schritt
- Dreißig Minuten Erstgespräch per Video
Kurz gesagt
Gemma 4 ist Googles offenes Sprachmodell unter Apache-Lizenz mit 31 Milliarden Parametern. Anders als die großen Mixture-of-Experts-Modelle rechnet es dicht, braucht deshalb nur rund 31 Gigabyte Speicher und läuft auf kleineren Profi-Karten. Für Suche mit Fundstelle, Zuordnung und kurze Texte reicht es vielen Büros. Bei sehr langen Akten und anspruchsvollen Fachtexten sind Qwen und Mistral vorn.
Stand: September 2026

Der Engpass
Wo Gemma an seine Grenze kommt
Bei Akten mit hunderten Seiten am Stück, bei anspruchsvollen Fachtexten und bei Bildern fehlt Gemma die Tiefe der großen Modelle. Für zwanzig gleichzeitige Nutzer braucht es trotzdem eine ordentliche Karte. Gemma ist die richtige Wahl, wenn die Aufgaben klar und der Server klein ist, nicht als Sparversion für ein großes Büro.
Wo kompakte Modelle ihre Stärke ausspielen
Sie bekommen hier vergleichsweise kleine Modelle, die auf bescheidener Hardware laufen und trotzdem brauchbare Ergebnisse liefern. Für Betriebe, die mit begrenztem Budget anfangen wollen, ist das ein realistischer Einstieg: Eine Karte der mittleren Klasse genügt für eine Handvoll Nutzer.
Die Grenze zeigt sich bei langen Zusammenhängen und bei Fachsprache. Eine Frage an ein Protokoll beantwortet ein solches Modell zuverlässig, eine Frage, die fünf lange Verträge gegeneinander hält, eher nicht. Das ist keine Schwäche, sondern eine Auslegungsfrage.
Sinnvoll ist deshalb oft eine Kombination: das kleine Modell für die Masse der einfachen Anfragen, ein größeres für die schwierigen. Welche Aufgabe zu welchem gehört, entscheidet Ihr Testsatz.
Was wir dafür entwickeln
- 1
Post-Lotse: Posteingang, von Gemma schnell und genügsam zugeordnet
Post-Lotse im Detail - 2
Büro-Gedächtnis: Ihr KI-Gedächtnis für kleinere Büros, mit Gemma auf kleinerer Karte
Büro-Gedächtnis im Detail - 3
Kundenablage: CRM, erfassen, wer hereinkommt, ohne großes Modell
Kundenablage im Detail
So prüfen wir, ob Gemma reicht
Schritt 1
Daten- und Netz-Audit
Was liegt wo, wie viele Scans, welche Rechtegruppen, welcher Serverraum. Fünfzehn Arbeitstage, am Ende die Spezifikation für Server und Software.
Schritt 2
Aufbau im getrennten Netz
Server im eigenen Netzsegment, Modell lauffähig, Anmeldung über Ihr Active Directory, erster Test mit hundert echten Dokumenten.
Schritt 3
Einlesen, Härten, Betrieb
Bestand einlesen, Rechte vererben, Sicherheitsprüfung durch Dritte, Pilot mit einer Abteilung, dann Betrieb mit monatlichem Bericht.
Sechs Aufgaben, für die Gemma reicht
Aus Projekten mit kleineren Servern. Wo die Aufgaben klar umrissen sind, ist Gemma oft die wirtschaftlichere Wahl.
- Suche im Gedächtnis mit Fundstelle für Büros bis etwa zehn Nutzer
- Posteingang zuordnen und Fristen erkennen, schnell und genügsam
- Kurze Zusammenfassungen von Mails, Protokollen und Bescheiden
- Formulare und Bescheinigungen aus vorhandenen Daten vorbereiten
- Zweitmodell auf demselben Server für einfache Aufgaben, damit das große Modell frei bleibt
- Einstieg für Büros, die erst später auf eine große Karte aufrüsten wollen
Ein kleines Modell beantwortet eine Frage an ein Protokoll. Nicht eine an fünf Verträge.
Für wen sich das lohnt
- Inhaberinnen und Inhaber kleiner Büros
- Sie wollen lokale KI ohne großen Server. Gemma auf einer kleineren Karte ist der Einstieg, aufrüsten geht später.
- IT und Administration
- Dichtes Modell, wenig Speicher, einfacher Betrieb. Läuft neben einem großen Modell als Zweitmodell.
- Sekretariat
- Der Posteingang ist sortiert und die Bescheinigung vorbereitet, dafür braucht es kein Riesenmodell.
Was Betriebe an dieser Stelle fragen
Einwand
Reicht Gemma für ein ganzes Büro?
Für Büros bis etwa zehn Nutzer mit Suche, Zuordnung und kurzen Texten ja. Für lange Akten, Fachtexte und zwanzig Nutzer empfehlen wir ein großes Modell.
Einwand
Welche Hardware braucht Gemma?
Rund 31 Gigabyte Speicher für das Modell, dazu Reserve für Nutzer. Eine kleinere Profi-Karte reicht, eine Spielkarte nur für Einzeltests.
Einwand
Ist Gemma von Google nicht Cloud?
Gemma ist das offene Modell, das Google zum Download freigibt. Es läuft bei Ihnen, ohne Verbindung nach außen. Gemini ist die Cloud, Gemma nicht.
Einwand
Können wir später auf Qwen wechseln?
Ja, an einem Nachmittag, sobald die größere Karte da ist. Ihr Index und Ihre Daten bleiben.
Einwand
Gibt es Fördermittel für lokale KI?
Oft ja. Ob ein Zuschuss oder ein Darlehen greift, hängt an Ihrem Bundesland, an der Betriebsgröße und am Vorhaben. Hardware zählt in der Regel mit, wenn sie Teil des Vorhabens ist. Wir prüfen das vor dem Termin und sagen Ihnen, ob sich der Antragsaufwand lohnt.
Verwandte Seiten
Programme, mit denen Sie arbeiten
Zu jedem steht, was sich anbinden lässt, was dabei herauskommt und wo die Grenze liegt.
Sehen wir uns Ihren Bestand an.
Dreißig Minuten, per Video oder Telefon. Danach wissen Sie, ob lokale KI bei Ihnen trägt und was der erste Schritt ist.