Benchmarks RAG: Modelos de Incorporação, Bancos de Dados Vetoriais e Rerankers
RAG melhora a LLM confiabilidade ao fundamentar as respostas em dados externos. Avaliamos a pilha RAG em modelos de incorporação, reordenadores, bancos de dados vetoriais, frameworks e ferramentas de avaliação em precisão de recuperação, latência e qualidade.
Explore Benchmarks RAG: Modelos de Incorporação, Bancos de Dados Vetoriais e Rerankers
RAG Frameworks: LangChain vs LangGraph vs LlamaIndex
Avaliamos 5 RAG frameworks: LangChain, LangGraph, LlamaIndex, Haystack e DSPy, construindo o mesmo fluxo de trabalho agêntico RAG com componentes padronizados: modelos idênticos (GPT-4.1-mini), embeddings (BGE-small), retriever (Qdrant) e ferramentas (busca na web Tavily). Isso isola a sobrecarga real e a eficiência de tokens de cada framework. O benchmark consistiu em 100 consultas, com cada…
Benchmark de Reranker: Comparação dos 8 Principais Modelos
Avaliamos 8 modelos de reranker em ~145k avaliações da Amazon em inglês para medir o quanto uma etapa de reranking melhora a recuperação densa. Recuperamos os top-100 candidatos com multilingual-e5-base, reordenamos com cada modelo e avaliamos os top-10 resultados em relação a 300 consultas, cada uma referenciando detalhes concretos da avaliação de origem. O melhor…
Melhores RAG Ferramentas, Frameworks e Bibliotecas
RAG melhora as respostas de LLM ao fundamentá-las em dados externos em vez de apenas no que o modelo memorizou no treinamento. Fizemos benchmark dos componentes dos quais um sistema RAG é construído e reunimos os resultados em um só lugar, com um guia prático para escolher cada parte da stack. Veja nossos resultados de…
Modelos de Embedding Multimodal: Apple vs Meta vs OpenAI
Modelos de embedding multimodal se destacam na identificação de objetos, mas têm dificuldade com relações. Os modelos atuais têm dificuldade para distinguir “telefone em cima de um mapa” de “mapa em cima de um telefone”. Fizemos benchmark de 7 modelos líderes nos conjuntos MS-COCO e Winoground para medir essa limitação específica. Para garantir uma comparação…
Agentic RAG Benchmark: Roteamento Multi-Banco de Dados entre 36 LLMs
Fizemos um benchmark de 36 grandes modelos de linguagem em roteamento entre bases de dados. Cada modelo recebe uma pergunta em linguagem natural e 11 bases de dados SQL descritas em parágrafo, e depois tem de decidir qual base contém a resposta antes de escrever qualquer SQL. As 11 bases de dados foram extraídas de…
Os 10 melhores modelos de embedding multilíngues para RAG
Avaliamos 10 modelos de embedding multilíngues em aproximadamente 606k avaliações da Amazon em 6 idiomas (alemão, inglês, espanhol, francês, japonês, chinês). Geramos 1.800 consultas (300 por idioma), cada uma referenciando detalhes concretos da avaliação de origem. Modelos treinados para busca (separação entre consulta e documento) superam modelos maiores treinados para similaridade textual geral: e5_base (110M…