Hybrid Search: Warum BM25 und Vektorsuche gemeinsam RAG-Abrufe gewinnen
Hybrid Search kombiniert BM25-Volltextsuche mit Vektorsuche, damit ein RAG-System sowohl exakte Begriffe (Artikelnummern, Normen, Eigennamen) als auch sinngemäß ähnliche Formulierungen zuverlässig findet. Reine Vektorsuche übersieht oft exakte Codes und Zahlen, reine Volltextsuche versteht keine Synonyme oder Umschreibungen. Mit Reciprocal Rank Fusion (RRF) werden beide Ranglisten zu einer kombinierten Trefferliste verschmolzen, ohne dass Sie Gewichte manuell kalibrieren müssen. Das Ergebnis: deutlich präzisere Antworten, gerade bei technischen, juristischen oder normativen Dokumenten.
Was ist Hybrid Search und warum reicht eine Methode allein nicht?
Bei RAG (Retrieval-Augmented Generation) sucht das System zunächst passende Textpassagen in Ihren Dokumenten, bevor ein Sprachmodell daraus eine Antwort formuliert. Dieser Suchschritt, das Retrieval, entscheidet maßgeblich über die Qualität der Antwort: Findet er die falschen Passagen, liefert auch das beste Modell eine falsche oder ungenaue Antwort. Lange Zeit gab es für diesen Schritt zwei getrennte Lager: klassische Volltextsuche mit Algorithmen wie BM25 und moderne Vektorsuche auf Basis von Embeddings. Beide haben Stärken, die sich fast perfekt ergänzen, und Schwächen, die sich fast perfekt überschneiden. Hybrid Search nutzt genau das aus: Es führt beide Suchen parallel aus und verschmilzt die Ergebnisse zu einer gemeinsamen Rangliste.
BM25: Die Stärken der klassischen Volltextsuche
BM25 (Best Matching 25) ist ein Ranking-Algorithmus, der seit Jahrzehnten in Suchmaschinen und Dokumentenmanagementsystemen eingesetzt wird. Er bewertet, wie oft ein Suchbegriff in einem Dokument vorkommt (Termfrequenz), gewichtet das aber gegen die Häufigkeit des Begriffs im gesamten Korpus (inverse Dokumentfrequenz) und berücksichtigt die Dokumentlänge. Praktisch heißt das: Ein seltener, spezifischer Begriff wie eine Normbezeichnung oder eine Artikelnummer zieht eine Passage weit nach oben, selbst wenn sie sonst wenig mit der Frage zu tun hat.
Genau darin liegt die Stärke von BM25 für professionelle Dokumente: technische Handbücher, Verträge, Normen und Produktkataloge sind voll von exakten Bezeichnern. Wer nach „DIN EN 1090-1“, „Fehlercode E42“ oder einer bestimmten Vertragsklausel wie „§ 9 Abs. 3“ sucht, erwartet, dass genau diese Zeichenfolge gefunden wird, nicht eine thematisch ähnliche Passage. BM25 macht hier kaum Fehler, solange der Begriff wörtlich im Dokument steht. Seine Schwäche: Er versteht keine Synonyme, keine Umschreibungen und keine andere Wortstellung. Wer „Kettenspannung einstellen“ eingibt, aber das Dokument schreibt „Spiel der Antriebskette justieren“, findet mit reiner Volltextsuche nichts.
Vektorsuche: Semantik statt exakter Wörter
Vektorsuche löst genau dieses Problem. Dokumente und Anfragen werden in Embeddings umgewandelt, numerische Vektoren, die Bedeutung statt Zeichenfolgen abbilden. Zwei Sätze mit unterschiedlichen Wörtern, aber ähnlichem Sinn, liegen im Vektorraum nah beieinander. Gespeichert und durchsucht werden diese Vektoren in einer Vektordatenbank, die per Ähnlichkeitssuche die nächstgelegenen Passagen zu einer Frage findet.
Das macht Vektorsuche stark bei natürlichsprachlichen, umgangssprachlichen oder umformulierten Fragen. Eine Frage wie „Was muss ich beachten, bevor ich meinen Traktor für den Winter wegstelle?“ findet eine Passage, die von „Einwinterung“, „Stilllegung“ oder „Konservierung des Motors“ spricht, ohne dass die exakten Wörter übereinstimmen. Die Schwäche zeigt sich bei genau den Fällen, in denen BM25 glänzt: exakte Codes, Zahlen, kurze Eigennamen. Ein Embedding-Modell behandelt „PT-800“ und „PT-500“ oft als sehr ähnlich, weil die umgebenden Wörter fast identisch sind, obwohl es sich um zwei verschiedene Produkte mit unterschiedlichen technischen Daten handelt. Dieses Verwischen exakter Details ist eine der häufigeren Ursachen für Halluzinationen, wenn ein Sprachmodell aus der falschen, aber ähnlich klingenden Passage zitiert.
Wo beide Methoden einzeln scheitern: Beispiele aus der Praxis
BM25 vs. Vektorsuche bei typischen Anfragen
| Anfrage | Nur BM25 | Nur Vektorsuche | Hybrid Search |
|---|---|---|---|
| „Fehlercode E42 Bedeutung“ | Findet exakte Stelle zuverlässig | Oft verwechselt mit ähnlichen Codes E40-E45 | Exakter Treffer plus Kontextabschnitt |
| „Warum startet die Säge kalt, aber nicht warm?“ | Scheitert, wenn Dokument andere Formulierung nutzt | Findet thematisch passende Fehlerbehebung | Beide Signale verstärken den richtigen Treffer |
| „Anzugsdrehmoment Vorbau Carbon“ | Gut, wenn Tabelle exakt diese Begriffe enthält | Findet ähnliche, aber falsche Bauteile | Kombiniert Tabellenwert mit Kontext |
| „Pflichtausrüstung Motorrad Frankreich“ | Schwach bei Umschreibungen wie „Vorschriften“ | Gut bei Synonymen und Umformulierungen | Deckt Fachbegriff und Umschreibung ab |
Das Muster wiederholt sich in fast jeder professionellen Wissensdatenbank: Produktnummern, Normen, Gesetzesparagrafen und technische Kürzel brauchen exakte Volltextsuche. Natürlichsprachliche Fragen, Synonyme und Umschreibungen brauchen semantisches Verständnis. Ein System, das nur eines von beidem beherrscht, liefert in der Hälfte der Fälle unvollständige oder falsche Treffer, und zwar oft unbemerkt, weil die generierte Antwort trotzdem flüssig klingt.
Chunking beeinflusst beide Methoden
Wie Sie Dokumente in Abschnitte zerlegen, wirkt sich direkt auf BM25 und Vektorsuche aus: zu große Chunks verwässern beide Signale, zu kleine Chunks zerreißen Zusammenhänge. Mehr dazu in unserem Artikel zu Chunking-Strategien für RAG.
Reciprocal Rank Fusion (RRF): So verschmelzen Sie zwei Ranglisten
Die naheliegende Idee, die Scores beider Suchmethoden einfach zu addieren, scheitert an einem technischen Problem: BM25-Scores und Vektor-Ähnlichkeitswerte bewegen sich auf völlig unterschiedlichen Skalen und sind nicht direkt vergleichbar. Ein BM25-Score von 8,3 sagt nichts darüber aus, wie er sich zu einer Kosinus-Ähnlichkeit von 0,74 verhält. Jede Normalisierung dieser Skalen ist fehleranfällig und muss für jeden Dokumentenbestand neu kalibriert werden.
Reciprocal Rank Fusion umgeht dieses Problem elegant, indem sie nicht die Scores, sondern nur die Rangpositionen (Rank) verwendet. Für jedes Dokument wird aus beiden Ranglisten ein kombinierter Score berechnet nach der Formel: Score = 1 / (k + Rang in Liste A) + 1 / (k + Rang in Liste B). Die Konstante k (häufig 60) dämpft den Einfluss sehr niedriger Ränge, sodass ein Dokument, das in beiden Listen weit oben steht, einen deutlich höheren kombinierten Score erhält als eines, das nur in einer Liste ganz oben, in der anderen aber gar nicht auftaucht.
Ein Rechenbeispiel
Angenommen, eine Passage steht in der BM25-Rangliste auf Platz 1 und in der Vektorsuche-Rangliste auf Platz 5. Eine andere Passage steht in BM25 auf Platz 20 (fast irrelevant), dafür in der Vektorsuche auf Platz 1. Mit k = 60 ergibt sich für die erste Passage ein RRF-Score von 1/61 + 1/65 ≈ 0,0318, für die zweite 1/80 + 1/61 ≈ 0,0289. Die erste Passage gewinnt knapp, weil sie in beiden Listen solide platziert ist, nicht nur in einer. Taucht eine dritte Passage in beiden Listen auf den vorderen Plätzen auf (zum Beispiel Rang 2 und Rang 3), übertrifft sie beide: 1/62 + 1/63 ≈ 0,0323. Genau dieser Effekt macht RRF so robust: Konsistenz über beide Methoden hinweg wird belohnt, einseitige Ausreißer werden gedämpft.
- RRF braucht keine Skalierung oder Normalisierung der Rohscores.
- Die Konstante k lässt sich grob festlegen und muss selten pro Datensatz angepasst werden.
- Das Verfahren ist rechnerisch günstig und lässt sich auf mehr als zwei Ranglisten erweitern.
- Dokumente, die nur in einer Liste auftauchen, werden nicht ausgeschlossen, aber niedriger gewichtet.
Hybrid Search in der Praxis: Checkliste für professionelle Dokumente
Wenn Sie eine eigene Wissensdatenbank aufbauen oder eine bestehende Lösung bewerten, lohnt sich ein kurzer Realitätscheck anhand Ihrer tatsächlichen Dokumente und Fragen.
- Testen Sie mit mindestens fünf Anfragen, die exakte Begriffe enthalten (Artikelnummer, Paragraf, Norm, Fehlercode).
- Testen Sie mit mindestens fünf Anfragen in natürlicher, umgangssprachlicher Formulierung ohne die exakten Fachbegriffe des Dokuments.
- Prüfen Sie, ob beide Anfragetypen die erwartete Passage unter den Top-3-Treffern liefern.
- Achten Sie auf zitierte Passagen in der Antwort, nicht nur auf den generierten Text: So lässt sich eine KI-Antwort anhand ihrer Quellen prüfen.
- Beobachten Sie, ob kurze, präzise Chunks oder strukturbewusstes Chunking die Trefferqualität verbessern.
- Vermeiden Sie Systeme, bei denen Sie manuell Gewichte zwischen Volltext- und Vektorsuche justieren müssen, ohne RRF oder ein ähnliches rangbasiertes Verfahren.
Hybrid Search bei Kopik
Auf Kopik läuft hinter jeder Wissensdatenbank standardmäßig eine hybride Suche: Volltextsuche wird mit semantischer Keyword-Erweiterung kombiniert, sodass sowohl exakte Fachbegriffe als auch umschriebene Fragen zuverlässig die richtigen Passagen finden. Jede Antwort wird mit den zitierten Quellpassagen aus Ihren hochgeladenen Dokumenten belegt, oder Sie fragen direkt im „Passages“-Modus nur die Rohtreffer ab, wenn Sie das Ranking in Ihrer eigenen Anwendung weiterverarbeiten möchten. Sie können eine Wissensdatenbank kostenlos erstellen, indem Sie PDF-, Word-, Text- oder Markdown-Dateien hochladen: Kopik übernimmt Extraktion, Chunking und Indexierung automatisch. Die Abfrage läuft wahlweise über die Website, die REST-API mit API-Schlüsseln oder einen MCP-Server, den Sie direkt aus Claude, Cursor oder ChatGPT heraus nutzen können, wie im Artikel zum Verbinden von Claude, Cursor oder ChatGPT mit einer Wissensdatenbank beschrieben.
Hybrid Search selbst ausprobieren
Erstellen Sie in wenigen Minuten eine eigene Wissensdatenbank und testen Sie, wie exakte Begriffe und umgangssprachliche Fragen gemeinsam zuverlässig beantwortet werden.
Fazit
BM25 und Vektorsuche lösen unterschiedliche Teile desselben Problems. Für professionelle Dokumente mit exakten Bezeichnern und gleichzeitig natürlichsprachlichen Fragen ist keine der beiden Methoden allein ausreichend. Reciprocal Rank Fusion bietet einen pragmatischen, gut untersuchten Weg, beide Ranglisten ohne manuelle Kalibrierung zu kombinieren, und sollte bei jeder RAG-Implementierung für ernsthafte Anwendungsfälle Standard sein, nicht nachträgliche Optimierung.
Häufige Fragen
Was ist der Unterschied zwischen BM25 und Vektorsuche?
BM25 ist ein Volltextsuche-Algorithmus, der Dokumente anhand exakter Wortübereinstimmungen und deren Häufigkeit bewertet. Vektorsuche vergleicht Embeddings, numerische Repräsentationen von Bedeutung, und findet dadurch auch Passagen, die thematisch passen, ohne dieselben Wörter zu verwenden.
Warum ist Reciprocal Rank Fusion besser als eine gewichtete Summe der Scores?
BM25-Scores und Vektor-Ähnlichkeitswerte liegen auf unterschiedlichen, nicht direkt vergleichbaren Skalen. Eine gewichtete Summe erfordert fehleranfällige Normalisierung. RRF nutzt nur die Rangposition in jeder Liste und ist dadurch robust, ohne dass Gewichte pro Datensatz neu kalibriert werden müssen.
Brauche ich Hybrid Search auch bei einer kleinen Wissensdatenbank?
Ja, sobald Ihre Dokumente sowohl exakte Bezeichner (Artikelnummern, Paragrafen, Codes) als auch Fließtext enthalten, den Nutzer mit eigenen Worten abfragen, profitieren Sie von Hybrid Search, unabhängig von der Dokumentenanzahl.
Wie wirkt sich das Chunking auf Hybrid Search aus?
Zu große Chunks verwässern sowohl den BM25-Score als auch die Vektor-Ähnlichkeit, zu kleine Chunks zerreißen den Kontext. Strukturbewusstes oder semantisches Chunking verbessert in der Regel beide Suchmethoden gleichzeitig, siehe unseren Artikel zu Chunking-Strategien für RAG.
Unterstützt Kopik Hybrid Search von Haus aus?
Ja, jede auf Kopik erstellte Wissensdatenbank nutzt standardmäßig eine Kombination aus Volltextsuche und semantischer Keyword-Erweiterung, ohne dass Sie Gewichte oder Fusionsverfahren manuell konfigurieren müssen.
Kann ich bei Hybrid Search nur die Rohpassagen ohne generierte Antwort erhalten?
Ja, viele Plattformen, darunter Kopik, bieten einen reinen Passagen-Modus an, bei dem Sie die Top-Treffer der hybriden Suche direkt erhalten, um sie in einer eigenen Anwendung weiterzuverarbeiten.
Den Kopik-Newsletter abonnieren
Neue Wissensdatenbanken, RAG-Leitfäden und Produktneuheiten. Eine E-Mail alle ein bis zwei Wochen, Abmeldung mit einem Klick.
Mit dem Abonnement stimmen Sie dem Erhalt unseres Newsletters zu. Ihre Adresse wird nie weitergegeben.