Lokale KI · Embeddings

Embedding-Modelle lokal
das unsichtbare Modell hinter jeder guten Suche.

Wenn eine KI-Antwort schlecht ist, liegt es selten am Sprachmodell. Meist hat die Suche die falschen Abschnitte gefunden. Dafür ist das Embedding-Modell zuständig, und das läuft lokal genauso gut wie in der Cloud.

Kurz gesagt

Ein Embedding-Modell verwandelt Textabschnitte in Zahlenreihen, sogenannte Vektoren, damit die Suche Bedeutung statt nur Stichwörter findet. Lokal setzen wir BGE-M3 ein, mehrsprachig und stark für deutsche Fachtexte, dazu einen Reranker, der die gefundenen Abschnitte nach Passung sortiert. Beide laufen auf Ihrem Server neben dem Sprachmodell. Hier entsteht die Qualität der Antwort, mehr als im Sprachmodell.

Stand: September 2026

Ein Silberregal mit fünf gleichen Glasmodulen, eines davon gleitet über eine Kupferschiene in den Schacht einer Maschine
Das Modell ist austauschbar, der Bestand nicht. Genau deshalb setzen wir auf offene Modelle: Sie tauschen es, ohne von vorn anzufangen.

Sechs Dinge, die ein gutes Embedding-Modell ausmacht

Aus dem Aufbau lokaler Wissensdatenbanken. Der Unterschied zwischen findet und findet nicht liegt hier.

01 · Was hereinkommt

  • Bedeutungssuche: Frosttiefe findet auch das Fundamentdetail, in dem nur Gründungstiefe steht
  • Mehrsprachig: deutsche Frage findet den englischen Prüfbericht des Zulieferers

02 · Was daraus wird

  • Hybrid: Bedeutung plus Stichwort, damit Projektnummern und Normbezeichnungen exakt treffen
  • Reranker: von zwanzig Treffern die zwei, die wirklich passen, bevor das Sprachmodell liest

03 · Was danach anders ist

  • Rechte im Vektor: jeder Abschnitt trägt, wer ihn sehen darf, gefiltert vor der Antwort
  • Neuindexierung über Nacht, wenn Dokumente dazukommen, ohne dass jemand etwas anstößt

Was wir dafür entwickeln

Büro-Gedächtnis: Ihr KI-Gedächtnis, dessen Trefferqualität aus Embedding und Reranker kommtBüro-Gedächtnis im Detail
Kundenablage: CRM, erfassen, wer hereinkommt, mit Bedeutungssuche über alte KontakteKundenablage im Detail
Normenrecherche als Teil des Gedächtnisses: Fundstelle statt Vermutung, weil die Suche trifft

Warum das Sprachmodell nicht retten kann, was die Suche verfehlt

Das Sprachmodell antwortet nur aus dem, was die Suche ihm gibt. Findet sie den falschen Abschnitt, ist die Antwort falsch, egal wie gut das Modell ist. Deshalb messen wir die Suche am Testsatz getrennt vom Sprachmodell und stellen Zerlegung, Embedding und Reranker ein, bevor wir über Modelle reden.

Warum dieser stille Baustein die Suche entscheidet

Sie merken von diesem Modell nichts, und es bestimmt trotzdem, ob die Suche etwas taugt. Es übersetzt Ihre Dokumente und Ihre Frage in eine vergleichbare Form, und wie gut es das für deutsche Fachsprache tut, entscheidet, ob die Frage nach der Abnahmeniederschrift das Protokoll findet oder das Angebot.

Überwiegend englisch trainierte Modelle schneiden bei deutschen Fachtexten deutlich schlechter ab. Weil man davon im Betrieb nichts sieht, sondern nur schlechtere Treffer bekommt, gehört dieser Baustein ausdrücklich in den Testsatz, und zwar mit denselben Fragen wie das Sprachmodell.

Ein Wechsel später ist möglich, kostet aber ein vollständiges Neueinlesen des Bestands. Bei großen Archiven ist das eine Nacht Rechenzeit. Deshalb wird diese Entscheidung vor dem ersten vollständigen Durchlauf getroffen.

So stellen wir die Suche ein

  1. Schritt 1

    Testsatz für die Suche

    Fünfzig Fragen mit bekannter Fundstelle. Gemessen wird, ob die richtige Stelle unter den ersten Treffern ist.

  2. Schritt 2

    Zerlegung und Embedding

    Abschnittsgröße, Überlappung, Tabellen als Ganzes. Dann BGE-M3 mit Hybrid-Suche, gemessen am Testsatz.

  3. Schritt 3

    Reranker und Rechte

    Reranker dazu, Rechtefilter vor der Antwort, Berechtigungs-Leak-Test. Erst dann sieht das Sprachmodel die Treffer.

Von einem schlechten Embedding-Modell sehen Sie nichts. Sie bekommen nur schlechtere Treffer.

PhoenixOne AI

Für wen sich das lohnt

IT und Administration
Zwei kleine Modelle neben dem großen, wenig Speicher, viel Wirkung. Läuft in Containern.
Fachplanung
Sie merken es daran, dass die Fundstelle stimmt, auch wenn Sie andere Worte benutzt haben als das Dokument.
Geschäftsführung
Sie zahlen nicht für ein größeres Sprachmodell, wenn die Suche das Problem ist. Wir messen, wo es hakt.

◆Fachwörter auf dieser Seite

Im Detail als Fachartikel

Häufig gefragt

Was ist ein Embedding?

Eine Zahlenreihe, die die Bedeutung eines Textabschnitts beschreibt. Ähnliche Bedeutung, ähnliche Zahlen. So findet die Suche Sinn statt nur Wörter.

Warum BGE-M3?

Mehrsprachig, offen lizenziert, stark für deutsche Fachtexte und lokal betreibbar. Es gibt Alternativen, wir messen am Testsatz.

Was macht der Reranker?

Er liest die zwanzig besten Treffer noch einmal genau und sortiert sie nach Passung zur Frage. Das hebt die Quellengenauigkeit deutlich.

Braucht das viel Rechenleistung?

Wenig. Beide Modelle sind klein und laufen neben dem Sprachmodell auf derselben Karte.

Gibt es Fördermittel für lokale KI?

Oft ja. Ob ein Zuschuss oder ein Darlehen greift, hängt an Ihrem Bundesland, an der Betriebsgröße und am Vorhaben. Hardware zählt in der Regel mit, wenn sie Teil des Vorhabens ist. Wir prüfen das vor dem Termin und sagen Ihnen, ob sich der Antragsaufwand lohnt.

Verwandte Seiten

Sehen wir uns Ihren Bestand an.

Dreißig Minuten, per Video oder Telefon. Danach wissen Sie, ob lokale KI bei Ihnen trägt und was der erste Schritt ist.