Embedding

Ein Embedding ist eine numerische Darstellung eines Begriffs, Satzes oder Dokuments, die es Computern ermöglicht, semantische Ähnlichkeiten zu berechnen.

Embeddings sind die Basis für semantische Suche: Wenn ein Mitarbeiter nach "Kündigung eines Vertrags" sucht, findet das System auch Dokumente mit "fristlose Kündigung" oder "Vertrag beenden".

KI-Mitarbeiter nutzen Embeddings, um aus großen Dokumentenmengen die passenden Inhalte zu einem konkreten Fall zu finden.

Worin es sich unterscheidet

Vektor-Datenbank: Das Embedding ist die Darstellung eines Textes als Zahlenreihe. Die Vektor-Datenbank ist der Ort, an dem diese Zahlenreihen gespeichert und durchsucht werden. Das eine ist der Inhalt, das andere das Regal.

Token: Token sind die Einheiten, in die ein Text zur Verarbeitung zerlegt wird. Ein Embedding entsteht aus einem ganzen Textabschnitt und beschreibt dessen Bedeutung als Ganzes.

Was das für einen mittelständischen Betrieb bedeutet

Embeddings sind der Grund, warum eine moderne Suche auch dann trifft, wenn ein anderer Begriff verwendet wurde als im Dokument. Für Betriebe mit gewachsener Ablage ist das der praktische Nutzen.

Die Qualität hängt an der Aufteilung der Dokumente. Zu große Abschnitte verwässern die Bedeutung, zu kleine verlieren den Zusammenhang.

Wenn sich Dokumente ändern, müssen die betroffenen Abschnitte neu aufbereitet werden. Ohne diese Pflege veraltet die Suche unbemerkt.

Aus Embeddings lassen sich Inhalte in Teilen rekonstruieren, sie sind deshalb wie die Originaldokumente zu schützen.

Ein Beispiel aus dem Alltag

In einer Hausverwaltung liegen Mietverträge aus mehreren Jahrzehnten, mit wechselnden Formulierungen für dieselbe Sache, etwa Kleinreparaturklausel, Bagatellschadenregelung oder Instandhaltung geringen Umfangs.

Über Embeddings findet eine Suche nach Kleinreparaturen alle drei Varianten, obwohl der Wortlaut abweicht. Die Sachbearbeitung sucht nicht mehr nach der richtigen Formulierung, sondern nach dem Sachverhalt.

Häufige Fragen

Brauche ich dafür besondere Hardware?

Für die üblichen Datenmengen im Mittelstand nicht. Die Aufbereitung erfolgt über einen Dienst, gespeichert wird in einer Datenbank, wie sie ohnehin betrieben wird.

Kann man aus Embeddings die Originaltexte wiederherstellen?

In Teilen ja, eine vollständige Rekonstruktion ist unüblich. Deshalb gelten für diese Daten dieselben Schutz- und Zugriffsregeln wie für die Dokumente selbst.

Was passiert, wenn ein Dokument geändert wird?

Der betroffene Abschnitt muss neu aufbereitet werden. Gut gebaute Systeme erledigen das automatisch, sobald sich eine Datei in der Ablage ändert.

Funktioniert das auch über Sprachen hinweg?

Mit mehrsprachigen Verfahren ja, eine deutsche Frage kann ein englisches Dokument finden. Für Betriebe mit internationalen Lieferanten ist das ein praktischer Vorteil.

Synonyme und verwandte Begriffe

Vektoreinbettung · Semantische Repräsentation