Lokale KI · Embeddings
Embedding-Modelle lokal
das unsichtbare Modell hinter jeder guten Suche.
Wenn eine KI-Antwort schlecht ist, liegt es selten am Sprachmodell. Meist hat die Suche die falschen Abschnitte gefunden. Dafür ist das Embedding-Modell zuständig, und das läuft lokal genauso gut wie in der Cloud.
Kurz gesagt
Ein Embedding-Modell verwandelt Textabschnitte in Zahlenreihen, sogenannte Vektoren, damit die Suche Bedeutung statt nur Stichwörter findet. Lokal setzen wir BGE-M3 ein, mehrsprachig und stark für deutsche Fachtexte, dazu einen Reranker, der die gefundenen Abschnitte nach Passung sortiert. Beide laufen auf Ihrem Server neben dem Sprachmodell. Hier entsteht die Qualität der Antwort, mehr als im Sprachmodell.
Stand: September 2026

Sechs Dinge, die ein gutes Embedding-Modell ausmacht
Aus dem Aufbau lokaler Wissensdatenbanken. Der Unterschied zwischen findet und findet nicht liegt hier.
01 · Was hereinkommt
- Bedeutungssuche: Frosttiefe findet auch das Fundamentdetail, in dem nur Gründungstiefe steht
- Mehrsprachig: deutsche Frage findet den englischen Prüfbericht des Zulieferers
02 · Was daraus wird
- Hybrid: Bedeutung plus Stichwort, damit Projektnummern und Normbezeichnungen exakt treffen
- Reranker: von zwanzig Treffern die zwei, die wirklich passen, bevor das Sprachmodell liest
03 · Was danach anders ist
- Rechte im Vektor: jeder Abschnitt trägt, wer ihn sehen darf, gefiltert vor der Antwort
- Neuindexierung über Nacht, wenn Dokumente dazukommen, ohne dass jemand etwas anstößt
Was wir dafür entwickeln
Warum das Sprachmodell nicht retten kann, was die Suche verfehlt
Das Sprachmodell antwortet nur aus dem, was die Suche ihm gibt. Findet sie den falschen Abschnitt, ist die Antwort falsch, egal wie gut das Modell ist. Deshalb messen wir die Suche am Testsatz getrennt vom Sprachmodell und stellen Zerlegung, Embedding und Reranker ein, bevor wir über Modelle reden.
Warum dieser stille Baustein die Suche entscheidet
Sie merken von diesem Modell nichts, und es bestimmt trotzdem, ob die Suche etwas taugt. Es übersetzt Ihre Dokumente und Ihre Frage in eine vergleichbare Form, und wie gut es das für deutsche Fachsprache tut, entscheidet, ob die Frage nach der Abnahmeniederschrift das Protokoll findet oder das Angebot.
Überwiegend englisch trainierte Modelle schneiden bei deutschen Fachtexten deutlich schlechter ab. Weil man davon im Betrieb nichts sieht, sondern nur schlechtere Treffer bekommt, gehört dieser Baustein ausdrücklich in den Testsatz, und zwar mit denselben Fragen wie das Sprachmodell.
Ein Wechsel später ist möglich, kostet aber ein vollständiges Neueinlesen des Bestands. Bei großen Archiven ist das eine Nacht Rechenzeit. Deshalb wird diese Entscheidung vor dem ersten vollständigen Durchlauf getroffen.
So stellen wir die Suche ein
Schritt 1
Testsatz für die Suche
Fünfzig Fragen mit bekannter Fundstelle. Gemessen wird, ob die richtige Stelle unter den ersten Treffern ist.
Schritt 2
Zerlegung und Embedding
Abschnittsgröße, Überlappung, Tabellen als Ganzes. Dann BGE-M3 mit Hybrid-Suche, gemessen am Testsatz.
Schritt 3
Reranker und Rechte
Reranker dazu, Rechtefilter vor der Antwort, Berechtigungs-Leak-Test. Erst dann sieht das Sprachmodel die Treffer.
Von einem schlechten Embedding-Modell sehen Sie nichts. Sie bekommen nur schlechtere Treffer.
Für wen sich das lohnt
- IT und Administration
- Zwei kleine Modelle neben dem großen, wenig Speicher, viel Wirkung. Läuft in Containern.
- Fachplanung
- Sie merken es daran, dass die Fundstelle stimmt, auch wenn Sie andere Worte benutzt haben als das Dokument.
- Geschäftsführung
- Sie zahlen nicht für ein größeres Sprachmodell, wenn die Suche das Problem ist. Wir messen, wo es hakt.
◆Fachwörter auf dieser Seite
Erklärt im Glossar
Im Detail als Fachartikel
Häufig gefragt
Was ist ein Embedding?
Eine Zahlenreihe, die die Bedeutung eines Textabschnitts beschreibt. Ähnliche Bedeutung, ähnliche Zahlen. So findet die Suche Sinn statt nur Wörter.
Warum BGE-M3?
Mehrsprachig, offen lizenziert, stark für deutsche Fachtexte und lokal betreibbar. Es gibt Alternativen, wir messen am Testsatz.
Was macht der Reranker?
Er liest die zwanzig besten Treffer noch einmal genau und sortiert sie nach Passung zur Frage. Das hebt die Quellengenauigkeit deutlich.
Braucht das viel Rechenleistung?
Wenig. Beide Modelle sind klein und laufen neben dem Sprachmodell auf derselben Karte.
Gibt es Fördermittel für lokale KI?
Oft ja. Ob ein Zuschuss oder ein Darlehen greift, hängt an Ihrem Bundesland, an der Betriebsgröße und am Vorhaben. Hardware zählt in der Regel mit, wenn sie Teil des Vorhabens ist. Wir prüfen das vor dem Termin und sagen Ihnen, ob sich der Antragsaufwand lohnt.
Verwandte Seiten
Sehen wir uns Ihren Bestand an.
Dreißig Minuten, per Video oder Telefon. Danach wissen Sie, ob lokale KI bei Ihnen trägt und was der erste Schritt ist.