RAG Benchmarks: Einbettungsmodelle, Vektordatenbanken und Reranker
RAG verbessert die LLM-Zuverlässigkeit, indem Antworten auf externe Daten gestützt werden. Wir benchmarken den RAG-Stack hinsichtlich Embedding-Modellen, Rerankern, Vektor-Datenbanken, Frameworks und Bewertungstools in Bezug auf Retrieval-Genauigkeit, Latenz und Qualität.
RAG Benchmarks: Einbettungsmodelle, Vektordatenbanken und Reranker erkunden
RAG-Frameworks: LangChain vs. LangGraph vs. LlamaIndex
Wir haben 5 RAG-Frameworks gebenchmarkt: LangChain, LangGraph, LlamaIndex, Haystack und DSPy, indem wir denselben agentischen RAG-Workflow mit standardisierten Komponenten erstellt haben: identische Modelle (GPT-4.1-mini), Embeddings (BGE-small), Retriever (Qdrant) und Tools (Tavily-Websuche). Dadurch werden der tatsächliche Overhead und die Token-Effizienz jedes Frameworks isoliert. Der Benchmark bestand aus 100 Anfragen, wobei jedes Framework den gesamten Satz 100…
Reranker-Benchmark: Top 8 Modelle im Vergleich
Wir haben 8 Reranker-Modelle auf ~145k englischen Amazon-Rezensionen getestet, um zu messen, wie stark eine Reranking-Stufe das Dense Retrieval verbessert. Wir haben Top-100-Kandidaten mit multilingual-e5-base abgerufen, sie mit jedem Modell neu gerankt und die Top-10-Ergebnisse anhand von 300 Anfragen bewertet, von denen sich jede auf konkrete Details aus ihrer Quell-Rezension bezieht. Der beste Reranker erhöhte…
Beste RAG Tools, Frameworks und Bibliotheken
RAG verbessert LLM-Antworten, indem es sie auf externe Daten stützt, statt nur auf das, was das Modell im Training auswendig gelernt hat. Wir haben die Komponenten, aus denen ein RAG-System besteht, einem Benchmark unterzogen und die Ergebnisse an einem Ort zusammengeführt, mit einem praktischen Leitfaden zur Auswahl jedes Teils des Stacks. Siehe unsere Benchmark-Ergebnisse für…
Multimodale Embedding-Modelle: Apple vs Meta vs OpenAI
Multimodale Embedding-Modelle erkennen Objekte hervorragend, haben aber Schwierigkeiten mit Beziehungen. Aktuelle Modelle tun sich schwer, „Telefon auf einer Karte“ von „Karte auf einem Telefon“ zu unterscheiden. Wir haben 7 führende Modelle über MS-COCO und Winoground einem Benchmark unterzogen, um diese spezifische Einschränkung zu messen. Um einen fairen Vergleich zu gewährleisten, haben wir jedes Modell unter…
Agentic RAG-Benchmark: Multidatenbank-Routing über 36 LLMs
Wir haben 36 große Sprachmodelle beim Cross-Database-Routing getestet. Jedes Modell erhält eine natürlichsprachliche Frage und 11 SQL-Datenbanken, die auf Absatzebene beschrieben sind, und muss dann entscheiden, welche Datenbank die Antwort enthält, bevor es SQL schreibt. Die 11 Datenbanken wurden aus 80 BIRD-SQL-Kandidaten ausgewählt, indem ihre Beschreibungseinbettungen geclustert wurden, sodass die Kandidaten semantisch nahe beieinander liegen…
Top 10 Multilinguale Embedding-Modelle für RAG
Wir haben 10 multilinguale Embedding-Modelle anhand von ~606k Amazon-Bewertungen in 6 Sprachen (Deutsch, Englisch, Spanisch, Französisch, Japanisch, Chinesisch) verglichen. Wir haben 1.800 Abfragen (300 pro Sprache) generiert, die jeweils konkrete Details aus der ursprünglichen Bewertung referenzieren. Modelle, die für die Suche trainiert wurden (Trennung von Abfrage und Dokument), übertreffen größere Modelle, die für allgemeine Textähnlichkeit…