Embeddings einfach erklärt: Wie aus Text Zahlen werden
Ein Embedding ist eine Liste von Zahlen, die die Bedeutung eines Textes abbildet: Zwei Sätze, die dasselbe meinen, erhalten ähnliche Zahlen, auch wenn sie kaum ein Wort gemeinsam haben. Genau darauf beruht die semantische Suche, die „Kann ich mein Geld zurückbekommen?“ auf einer Seite mit dem Titel „Erstattungsrichtlinie“ findet. Dieser Beitrag erklärt Embeddings ohne Fachchinesisch, rechnet ein Beispiel zur Kosinus-Ähnlichkeit vor, das Sie mit dem Taschenrechner prüfen können, und zeigt die Grenzen, die Sie kennen sollten, bevor Sie darauf aufbauen.
Was ist ein Embedding? Die kurze Antwort
Computer können hervorragend Zahlen vergleichen, aber schlecht Bedeutungen. Für eine klassische Stichwortsuche sind „Pkw“ und „Auto“ zwei verschiedene Zeichenketten und damit zwei verschiedene Dinge, solange niemand eine Synonymliste gepflegt hat. Embeddings lösen das Problem, indem sie Text so in Zahlen übersetzen, dass die Bedeutung erhalten bleibt.
Ein Embedding-Modell liest ein Wort, einen Satz oder einen Absatz und gibt eine Zahlenliste fester Länge aus, etwa 768 oder 1.024 Werte. Diese Liste heißt Vektor. Das Modell ist so trainiert, dass Texte mit ähnlicher Bedeutung Vektoren erhalten, die in ähnliche Richtungen zeigen, während Texte zu völlig anderen Themen weit voneinander entfernt liegen.
Eine Analogie: die Landkarte der Bedeutungen
Stellen Sie sich eine riesige Landkarte vor, auf der jeder Satz eine Stecknadel hat. Sätze über Rückerstattungen sammeln sich in einem Viertel, Sätze über Parkplätze in einem anderen, Sätze über die Umsatzsteuer noch woanders. Ein Embedding sind schlicht die Koordinaten eines Satzes auf dieser Karte. Um passende Dokumente zu einer Frage zu finden, setzt man eine Nadel für die Frage und schaut, welche Nadeln in der Nähe stecken.
Der Unterschied zum Straßenatlas: Diese Karte hat nicht zwei, sondern Hunderte oder Tausende Dimensionen. Bedeutung hat eben mehr Richtungen als Nord und Ost, etwa Thema, Tonfall, Fachgebiet, Förmlichkeit und viele feinere Nuancen. Vorstellen kann sich diesen Raum niemand, aber Abstände und Winkel werden darin genauso berechnet wie auf Papier.
Wie aus Text ein Vektor wird
- Tokenisierung. Der Text wird in kleine Einheiten zerlegt: ganze Wörter, Wortteile, Satzzeichen. Ein typisch deutsches Kompositum wie „Kündigungsschutzklage“ wird dabei in mehrere Stücke zerlegt.
- Kodierung im Kontext. Ein trainiertes neuronales Netz liest die Tokens samt ihrer Umgebung. „Bank“ in „auf der Bank im Park“ und in „Konto bei der Bank“ erhält in modernen Modellen eine unterschiedliche Darstellung.
- Zusammenfassung zu einem Vektor. Die internen Darstellungen werden zu einer einzigen Zahlenliste für den ganzen Text verdichtet, meist auf die Länge 1 normiert. Dieser Vektor ist das Embedding.
Woher nimmt das Modell sein Gespür für Bedeutung? Aus dem Training mit sehr großen Textmengen und einer alten Erkenntnis der Sprachwissenschaft: Wörter, die in ähnlichen Zusammenhängen vorkommen, bedeuten oft Ähnliches. Ein prägendes frühes Beispiel ist word2vec, 2013 im Artikel Efficient Estimation of Word Representations in Vector Space vorgestellt, das jedem Wort einen Vektor zuordnete. Heutige Satz-Embedding-Modelle kodieren ganze Absätze, sodass eine Frage und der Absatz mit der Antwort nah beieinander liegen können, selbst wenn sie kaum Vokabular teilen.
Die Dimensionen haben keine Namen
Man möchte glauben, Dimension 12 stehe für „Geld“ und Dimension 40 für „Recht“. In echten Modellen ist keine einzelne Zahl für Menschen lesbar; die Bedeutung verteilt sich über alle Werte. Das ist ein Grund, warum sich Vektorsuche schwer nachvollziehen lässt.
Kosinus-Ähnlichkeit an einem Rechenbeispiel
Wie misst man, wie nah sich zwei Vektoren sind? Am häufigsten mit der Kosinus-Ähnlichkeit, die den Winkel zwischen den Vektoren betrachtet. Zeigen beide in dieselbe Richtung, ergibt sich 1. Stehen sie senkrecht aufeinander (kein Zusammenhang), ergibt sich 0. Bei entgegengesetzter Richtung sind es -1, wobei Text-Embeddings in der Praxis meist zwischen 0 und 1 liegen.
Die Formel: Man multipliziert die Vektoren Stelle für Stelle, addiert die Ergebnisse (das Skalarprodukt) und teilt durch das Produkt ihrer Längen. Rechnen wir das mit Spielzeug-Vektoren aus nur drei Dimensionen durch. Zur Anschaulichkeit tun wir so, als bedeuteten die drei Zahlen „Geld“, „Rückgabe eines Kaufs“ und „Ort“. Echte Modelle beschriften ihre Dimensionen nicht, die Rechnung ist aber dieselbe.
Drei Spielzeug-Embeddings
| Text | Geld | Rückgabe | Ort |
|---|---|---|---|
| A: „Wie bekomme ich eine Erstattung?“ | 0,9 | 0,8 | 0,1 |
| B: „Kann ich mein Geld zurückbekommen?“ | 0,8 | 0,9 | 0,2 |
| C: „Wo kann ich parken?“ | 0,1 | 0,2 | 0,9 |
- Skalarprodukt A·B = 0,9 × 0,8 + 0,8 × 0,9 + 0,1 × 0,2 = 0,72 + 0,72 + 0,02 = 1,46.
- Längen. |A| = √(0,81 + 0,64 + 0,01) = √1,46 ≈ 1,208; |B| = √(0,64 + 0,81 + 0,04) = √1,49 ≈ 1,221.
- Kosinus A, B = 1,46 ÷ (1,208 × 1,221) ≈ 1,46 ÷ 1,475 ≈ 0,99: praktisch dieselbe Frage, obwohl die Sätze fast keine Wörter teilen.
- Skalarprodukt A·C = 0,09 + 0,16 + 0,09 = 0,34; |C| = √(0,01 + 0,04 + 0,81) = √0,86 ≈ 0,927.
- Kosinus A, C = 0,34 ÷ (1,208 × 0,927) ≈ 0,34 ÷ 1,120 ≈ 0,30: ein ganz anderes Thema.
Das ist das ganze Prinzip der semantischen Suche. Jeder Abschnitt Ihrer Dokumente wird einmal in ein Embedding umgerechnet, die Frage zum Zeitpunkt der Suche ebenfalls; dann werden die Abschnitte mit den höchsten Werten zurückgegeben. Bei Millionen Abschnitten wird der Einzelvergleich langsam. Dafür gibt es spezialisierte Indexe und Vektordatenbanken, die die nächsten Nachbarn näherungsweise, aber sehr schnell finden.
Mehrsprachige Embeddings
Manche Modelle werden mit vielen Sprachen gleichzeitig trainiert, oft mit Satzpaaren und deren Übersetzungen. So landen „Erstattungsrichtlinie“, „refund policy“ und „politique de remboursement“ an derselben Stelle der Karte. Eine Frage auf Deutsch kann dann einen englischen Abschnitt finden, was etwa für Mittelständler mit englischsprachigen Herstellerhandbüchern interessant ist.
Die Qualität schwankt allerdings. Modelle funktionieren meist am besten in den Sprachen, die in ihren Trainingsdaten stark vertreten waren; seltene Sprachen, Dialekte und Fachvokabular sind weniger verlässlich. Wenn sprachübergreifende Suche für Sie wichtig ist, testen Sie sie mit echten Fragen in jeder Sprache.
Grenzen von Embeddings und semantischer Suche
- Exakte Kennungen. Paragrafen wie „§ 622 BGB“, Artikelnummern, Rechnungsnummern oder Fehlercodes tragen für ein Modell wenig „Bedeutung“. Die semantische Suche liefert dann womöglich etwas Verwandtes statt des exakten Treffers, den eine Stichwortsuche sofort fände.
- Verneinung. „Von der Garantie abgedeckt“ und „nicht von der Garantie abgedeckt“ behandeln dasselbe Thema, ihre Vektoren können sehr ähnlich sein. Ähnlichkeit misst thematische Nähe, nicht inhaltliche Übereinstimmung.
- Fachjargon und neue Begriffe. Ein Produktname vom letzten Monat oder ein Branchenkürzel kann schlecht abgebildet sein, wenn das Modell ihn im Training nie gesehen hat.
- Lange Abschnitte verschwimmen. Ein einziger Vektor für einen langen Text mittelt viele Gedanken; ein konkretes Detail kann darin untergehen.
- Vektoren hängen am Modell. Vektoren aus zwei verschiedenen Modellen sind nicht vergleichbar. Ein Modellwechsel bedeutet, alle Dokumente neu zu berechnen.
- Schwer erklärbar. Bei einer Stichwortsuche sieht man, warum ein Treffer fehlt. Bei einer Vektorsuche lässt sich ein seltsames Ergebnis selten begründen.
- Datenschutz. Ein Embedding ist keine Anonymisierung. Forschungsarbeiten haben gezeigt, dass sich Text aus seinem Vektor teilweise rekonstruieren lässt. Im Sinne der DSGVO sollten Embeddings personenbezogener Dokumente deshalb wie personenbezogene Daten behandelt werden, mit denselben Schutzmaßnahmen, die etwa das BSI für die Ausgangsdaten empfiehlt.
Keine dieser Grenzen ist ein Ausschlusskriterium. Sie erklären aber, warum viele Produktivsysteme auf hybride Suche setzen und semantische Ähnlichkeit mit klassischer Volltextsuche kombinieren, damit sowohl Umschreibungen als auch exakte Begriffe gefunden werden.
Brauchen Sie überhaupt Embeddings?
Wenn Sie ein RAG-System bauen, also eine KI, die aus Ihren Dokumenten antwortet, sind Embeddings ein Weg, die passenden Abschnitte zu finden, aber nicht der einzige. Die richtige Wahl hängt von Ihren Dokumenten ab und davon, wie Fragen gestellt werden.
Embeddings oder Volltextsuche?
| Situation | Embeddings | Volltextsuche |
|---|---|---|
| Nutzer formulieren ganz anders als die Dokumente | Sehr hilfreich | Ausreichend mit Anfrageerweiterung |
| Dokumente voller Paragrafen und Nummern | Teilweise | Ja, und präziser |
| Jedes Ergebnis muss begründbar sein | Schwierig | Einfach |
| Riesiger, wenig strukturierter Bestand | Sehr hilfreich | Möglich mit gutem Ranking |
| Möglichst wenig Infrastruktur | Modell plus Vektorindex | In gängigen Datenbanken eingebaut |
Es gibt einen oft übersehenen Mittelweg: Man behält die Volltextsuche, lässt aber vorher ein Sprachmodell die Frage um Schlüsselwörter und Synonyme erweitern. Aus „Geld zurückbekommen“ wird eine Suche, die auch „Erstattung“, „Rückerstattung“ und „Gutschrift“ umfasst. So erhält man einen Großteil des semantischen Nutzens, ohne einen einzigen Vektor zu speichern. Genau so arbeitet Kopik: Kopik nutzt keine Embeddings und keine Vektordatenbank, sondern eine hybride Suche aus Volltext und semantischer Erweiterung der Suchbegriffe. Die Frage wird dabei in die Sprache der Dokumente erweitert, sodass auch Fragen in einer anderen Sprache die richtigen Abschnitte finden.
Wer sich für Embeddings entscheidet, sollte die Gesamtkosten einplanen: Speicher, Indexierung, Neuberechnung bei jeder Dokumentänderung und bei Modellwechseln. Was dabei wirklich anfällt, zeigt unser Beitrag zu Vektordatenbank-Kosten, und wie RAG Schritt für Schritt funktioniert erklärt, wo die Suche im Gesamtablauf sitzt.
Checkliste, bevor Sie sich auf Embeddings verlassen
- Sammeln Sie 20 bis 30 echte Fragen und prüfen Sie, ob der richtige Abschnitt unter den ersten Treffern ist.
- Nehmen Sie Fragen mit exakten Nummern, Namen und Paragrafen auf, nicht nur vage Fragen.
- Testen Sie Paare, die sich nur durch eine Verneinung unterscheiden („förderfähig“ und „nicht förderfähig“).
- Testen Sie jede unterstützte Sprache einzeln.
- Dokumentieren Sie das verwendete Embedding-Modell, damit Sie wissen, wann neu indexiert werden muss.
- Schützen Sie Vektoren wie die Quelldokumente: gleiche Zugriffsrechte, gleiche Aufbewahrungsfristen.
Sie möchten keine Infrastruktur betreiben? Bei Kopik laden Sie PDFs, Word-Dateien, Text oder Markdown hoch und erhalten eine Wissensdatenbank, die mit zitierten Abschnitten antwortet: auf der Website, per REST-API oder aus MCP-Clients wie Claude, Cursor oder ChatGPT. Das Anlegen einer Datenbank ist kostenlos.
Dokumente durchsuchen, ohne Vektoren zu verwalten
Laden Sie Ihre Dateien hoch und erhalten Sie eine Wissensdatenbank, die die richtigen Abschnitte findet und mit Quellen antwortet. Kostenlos anlegen.
Häufige Fragen
Was ist der Unterschied zwischen einem Embedding und einem Vektor?
Ein Vektor ist einfach eine geordnete Liste von Zahlen. Ein Embedding ist ein Vektor, den ein Modell erzeugt, um die Bedeutung von etwas darzustellen, etwa eines Satzes oder Bildes. Jedes Embedding ist ein Vektor, aber nicht jeder Vektor ist ein Embedding.
Ab welchem Kosinus-Wert sind zwei Texte ähnlich?
Einen allgemeingültigen Schwellenwert gibt es nicht. Die Wertebereiche unterscheiden sich je nach Modell: 0,8 kann bei einem Modell sehr gut und bei einem anderen mittelmäßig sein. Vergleichen Sie die Werte für dieselbe Frage untereinander und kalibrieren Sie Schwellen mit eigenen Testfragen.
Gibt es ein deutsches Wort für Embedding?
Gelegentlich liest man „Einbettung“ oder „Vektoreinbettung“. In der Praxis hat sich der englische Begriff Embedding durchgesetzt, auch in deutschsprachiger Fachliteratur.
Sind Embeddings personenbezogene Daten nach DSGVO?
Wenn sie aus personenbezogenen Dokumenten berechnet wurden, sollten Sie vorsichtshalber davon ausgehen, da sich Text teilweise rekonstruieren lässt. Wenden Sie dieselben Sicherheits-, Lösch- und Zugriffsregeln an wie für die Ausgangsdaten und holen Sie im Einzelfall fachkundigen Rat ein.
Verwendet Kopik Embeddings?
Nein. Kopik indexiert Abschnitte mit Volltextsuche und erweitert jede Frage vor der Suche um Schlüsselwörter und Synonyme in der Sprache der Dokumente. Das deckt Umschreibungen und Fragen in anderen Sprachen ab, ohne Vektoren zu speichern.
Den Kopik-Newsletter abonnieren
Neue Wissensdatenbanken, RAG-Leitfäden und Produktneuheiten. Eine E-Mail alle ein bis zwei Wochen, Abmeldung mit einem Klick.
Mit dem Abonnement stimmen Sie dem Erhalt unseres Newsletters zu. Ihre Adresse wird nie weitergegeben.