
Lokale KI · Serving
vLLM oder Ollama
was zwanzig Nutzer gleichzeitig tragen.
Auf dem Laptop lief das Modell prima, im Betrieb wartet Montag früh jeder zwanzig Sekunden. Das ist der häufigste Grund, warum lokale KI enttäuscht, und er hat nichts mit dem Modell zu tun. Er liegt im Serving.
- Für wen
- Betriebe mit zehn bis dreißig Nutzern, die gleichzeitig fragen
- Aufwand
- 15 Arbeitstage bis zur Spezifikation
- Förderung
- Wird für Ihr Bundesland geprüft
- Datenhaltung
- Serving läuft als Container auf Ihrem Server, nicht extern
- Erster Schritt
- Dreißig Minuten Erstgespräch per Video
Kurz gesagt
Für mehrere Nutzer brauchen Sie vLLM. Es fasst Anfragen zu Stapeln zusammen und hält die Grafikkarte ausgelastet, sodass zwanzig Nutzer auf einer Profi-Karte mit 96 GB flüssig arbeiten. Ollama ist gut für den Einzeltest, bricht aber bei vier bis fünf parallelen Nutzern ein. Zwei Modelle auf einer Karte laufen zeitlich gemultiplext: eines für Deutsch, eines für Tempo.
Stand: September 2026

Der Engpass
Warum Ollama im Betrieb einbricht
Ollama ist ein hervorragendes Werkzeug, um ein Modell in fünf Minuten auf dem Laptop zu testen. Genau dafür ist es gemacht: ein Nutzer, eine Anfrage nach der anderen. Bei vier bis fünf parallelen Nutzern beginnt die Warteschlange, bei zehn ist das System unbenutzbar. Wir haben es in Tests gesehen und in Projekten, die andere so eingerichtet hatten. Deshalb: Ollama zum Ausprobieren, vLLM für den Betrieb, beides auf derselben Hardware.
Was passiert, wenn mehrere gleichzeitig fragen
Sie merken den Unterschied zwischen einem und zehn Nutzern nicht an der Rechenleistung, sondern am Speicher. Jede laufende Anfrage belegt Platz auf der Grafikkarte, und ist er voll, warten die weiteren. Das äußert sich nicht als Fehler, sondern als Antwort, die plötzlich dreimal so lange dauert.
Deshalb wird nicht nach Kopfzahl dimensioniert, sondern nach gleichzeitigen Anfragen. Von dreißig Leuten fragen selten mehr als drei zur selben Sekunde, aber wenn morgens alle gleichzeitig anfangen, ist die Spitze höher als der Durchschnitt. Diese Spitze bestimmt die Auslegung.
Praktisch lässt sich viel über die Warteschlange lösen: Anfragen werden gebündelt verarbeitet, und die Antwort beginnt zu erscheinen, bevor sie fertig ist. Das fühlt sich schneller an und nutzt die Maschine besser aus als jede Vergrößerung.
Zu wenig Speicher äußert sich nicht als Fehler, sondern als Antwort, die dreimal so lange dauert.
Sechs Dinge, die vLLM anders macht
Das ist der Unterschied zwischen einem Testwerkzeug und einem Serving-System.
- Batching: Anfragen mehrerer Nutzer werden gemeinsam gerechnet, die Karte steht nie still
- Speicherverwaltung für den Kontext, damit zwanzig offene Gespräche mit langen Dokumenten in 96 GB passen
- Warteschlange mit Vorrang: kurze Fragen überholen die Zusammenfassung eines Protokolls mit hundert Seiten
- Kennzahlen für Prometheus: Anfragen pro Sekunde, Wartezeit, Auslastung, sichtbar in Grafana
- Zwei Modelle im Wechsel auf einer Karte: eines für Deutsch und lange Dokumente, eines für Tempo unter Last
- Standard-Schnittstelle, sodass Chat-Oberfläche, n8n und Ihre Programme dasselbe ansprechen
Für wen sich das lohnt
- IT-Leitung
- Sie haben Ollama getestet und fragen, warum es im Betrieb nicht reicht. Diese Seite ist die Antwort, das Serving der Weg.
- Geschäftsführung
- Sie wollen, dass zwanzig Leute es nutzen und niemand wartet. Das ist eine Frage des Servings, nicht der zweiten Karte.
- Fachabteilung
- Sie wollen morgens um acht dieselbe Antwortzeit wie nachmittags um drei. Batching und Vorrang sorgen dafür.
Was wir dafür entwickeln
So richten wir das Serving ein
- Schritt 1
Lasttest mit Ihren Zahlen
Wie viele Nutzer, wie lange Dokumente, wie viele Anfragen zur Stoßzeit. Daraus die Kontextgröße und die Zahl der Modelle.
- Schritt 2
vLLM als Container
Modell laden, Speicher aufteilen, Warteschlange und Vorrang einstellen, Kennzahlen an Prometheus. Zweites Modell, wenn der Lasttest es verlangt.
- Schritt 3
Last fahren, dann Pilot
Simulierte zwanzig Nutzer, dann echte drei. Erst wenn die Wartezeit unter der Schwelle bleibt, kommt die nächste Abteilung.
Was Betriebe an dieser Stelle fragen
Einwand
Reicht eine Grafikkarte für zwanzig Nutzer?
Eine Profi-Karte mit 96 GB und vLLM ja, für Suche, Fragen und Zusammenfassungen. Bei mehreren Power-Usern mit Agentenketten oder mehr als dreißig Nutzern empfehlen wir eine zweite Karte.
Einwand
Wie laufen zwei Modelle auf einer Karte?
Zeitlich gemultiplext: Die Karte wechselt zwischen beiden, je nach Anfrage. Eines für Deutsch und lange Dokumente, eines für Tempo. Der Wechsel kostet Sekundenbruchteile und ist im Alltag nicht spürbar.
Einwand
Können wir Ollama zum Testen behalten?
Ja, gern, auf dem Laptop oder als Testcontainer. Für den Betrieb läuft vLLM. Beide sprechen dieselbe Schnittstelle, sodass sich für die Oberfläche nichts ändert.
Einwand
Was ist mit einer Spielkarte mit 32 GB?
Sie trägt eine Einzelsuche mit einem kleinen Modell. Für Mehrbenutzer und ein Modell der Klasse um 120 Milliarden Parameter reicht der Speicher nicht, unabhängig vom Serving.
Einwand
Gibt es Fördermittel für lokale KI?
Oft ja. Ob ein Zuschuss oder ein Darlehen greift, hängt an Ihrem Bundesland, an der Betriebsgröße und am Vorhaben. Hardware zählt in der Regel mit, wenn sie Teil des Vorhabens ist. Wir prüfen das vor dem Termin und sagen Ihnen, ob sich der Antragsaufwand lohnt.
Verwandte Seiten
Programme, mit denen Sie arbeiten
Zu jedem steht, was sich anbinden lässt, was dabei herauskommt und wo die Grenze liegt.
Sehen wir uns Ihren Bestand an.
Dreißig Minuten, per Video oder Telefon. Danach wissen Sie, ob lokale KI bei Ihnen trägt und was der erste Schritt ist.