Vektor-Datenbank
Eine Vektor-Datenbank speichert Embeddings und ermöglicht die schnelle Suche nach inhaltlich ähnlichen Dokumenten oder Texten.
Sie wird häufig in RAG-Systemen eingesetzt, damit KI-Mitarbeiter firmenspezifisches Wissen gezielt abrufen können, ohne das gesamte Dokument durchlesen zu müssen.
Bekannte Vektor-Datenbanken sind Pinecone, Weaviate, Chroma und pgvector für PostgreSQL.
Worin es sich unterscheidet
Embedding: Embeddings sind die gespeicherten Inhalte, die Vektor-Datenbank ist der Speicher- und Suchort dafür. Ohne Embeddings hat die Datenbank nichts zu durchsuchen.
ERP-System: Eine klassische Datenbank im ERP sucht nach exakten Werten wie Kundennummer oder Datum. Eine Vektor-Datenbank sucht nach inhaltlicher Ähnlichkeit. Beide werden nebeneinander betrieben, sie ersetzen sich nicht.
Was das für einen mittelständischen Betrieb bedeutet
In den meisten Projekten ist die Vektor-Datenbank ein unauffälliger Baustein im Hintergrund. Sie ist selten eine strategische Entscheidung, sondern eine technische.
Für die üblichen Dokumentenmengen reicht häufig eine Erweiterung der bereits vorhandenen Datenbank aus, ein zusätzliches System ist nicht zwingend.
Wichtig ist der Betriebsort, weil dort Inhalte aus Ihren Dokumenten liegen. Dieselben Anforderungen wie an die Dateiablage sind anzulegen.
Zugriffsrechte müssen mitgeführt werden, sonst umgeht die Suche die Berechtigungen der Ablage.
Ein Beispiel aus dem Alltag
Ein Maschinenbauer speichert Wartungsberichte, Prüfprotokolle und Rückfragen von Kunden. Ein Servicetechniker möchte wissen, ob ein bestimmtes Störungsbild schon einmal aufgetreten ist.
Die Vektor-Datenbank liefert die inhaltlich ähnlichsten Berichte, auch wenn die Störung damals anders beschrieben wurde. Der Techniker bekommt Vergleichsfälle statt einer Trefferliste nach Stichwort.
Häufige Fragen
Muss ich dafür eine zusätzliche Software kaufen?
Nicht unbedingt. Für viele Betriebe genügt eine Erweiterung der vorhandenen Datenbank. Eigene Produkte lohnen sich erst bei sehr großen Beständen oder hoher Abfragelast.
Wo liegen die Daten?
Dort, wo die Datenbank betrieben wird, wahlweise in der EU oder im eigenen Haus. Das ist eine Entscheidung, die vor dem Aufbau getroffen und dokumentiert werden sollte.
Wie groß darf der Dokumentenbestand sein?
Übliche Bestände aus mehreren Jahrzehnten sind technisch unkritisch. Die Grenze liegt in der Praxis eher bei der Pflege als bei der Speichergröße.
Sieht jeder Mitarbeiter alle Dokumente in der Suche?
Nur, wenn es falsch eingerichtet ist. Die Rechte aus der Ablage müssen in der Suche abgebildet werden, sonst entsteht ein Zugriff, den es vorher nicht gab.
Synonyme und verwandte Begriffe
Vector Database · Vektorspeicher