Serviços
Contate-nos

Benchmarks de Embeddings

Benchmarks transparentes de modelos de embeddings baseados nas próprias avaliações de recuperação da AIMultiple sobre modelos de embeddings comerciais e de código aberto em três domínios RAG empresariais. Ver a metodologia.

MELHOR MODELO
voyage-3.5
nDCG@3 0.943
Melhor custo-benefício
pplx-0.6b
$0.0040 / 1M
Maior modelo
KaLM-Gemma3-12B
11.8B parâmetros
Cobertura
29 modelos
3 domínios de recuperação · 87 avaliações
Benchmarks de modelos de embeddings (nDCG@3)

Classificação

Todos os modelos de embeddings avaliados, ordenados pela média nDCG@3 nos três domínios.

Filtrar e ordenar
#
Modelo
nDCG@3
CUAD (legal)
TechQA (support)
MedRAG (health)
1
voyage-3.5
voyage-3.5
Voyage AI
0.943
0.9100.9650.954
2
voyage-4-large
voyage-4-large
Voyage AI
0.942
0.8730.9660.986
3
gemini-2-preview
gemini-2-preview
Google
0.932
0.8960.9300.969
4
nvidia-nemotron-8b
nvidia-nemotron-8b
NVIDIA
0.925
0.8600.9520.963
5
gemini-001
gemini-001
Google
0.922
0.8980.8860.981
6
voyage-4-lite
voyage-4-lite
Voyage AI
0.921
0.8590.9480.956
7
voyage-law-2
voyage-law-2
Voyage AI
0.919
0.9130.9020.941
8
SFR-Embedding-2_R
SFR-Embedding-2_R
Salesforce
0.905
0.8420.9110.962
9
jina-v5-text-small
jina-v5-text-small
Jina AI
0.895
0.8360.8970.952
10
harrier-oss-0.6b
harrier-oss-0.6b
Microsoft
0.891
0.8720.8410.961
Página 1 de 3

Preço$0.060
Parâmetros-
LançamentoMai 2025
CUAD (legal)
0.91
TechQA (support)
0.965
MedRAG (health)
0.954

Preço$0.120
Parâmetros-
LançamentoJan 2026
CUAD (legal)
0.873
TechQA (support)
0.966
MedRAG (health)
0.986

Preço$0.200
Parâmetros-
LançamentoMar 2026
CUAD (legal)
0.896
TechQA (support)
0.93
MedRAG (health)
0.969

Preço$0.022
Parâmetros7.5B
LançamentoOut 2025
CUAD (legal)
0.86
TechQA (support)
0.952
MedRAG (health)
0.963

Preço$0.150
Parâmetros-
LançamentoJul 2025
CUAD (legal)
0.898
TechQA (support)
0.886
MedRAG (health)
0.981

Preço$0.020
Parâmetros-
LançamentoJan 2026
CUAD (legal)
0.859
TechQA (support)
0.948
MedRAG (health)
0.956

Preço$0.120
Parâmetros-
LançamentoAbr 2024
CUAD (legal)
0.913
TechQA (support)
0.902
MedRAG (health)
0.941

Preço$0.041
Parâmetros7.1B
LançamentoJun 2024
CUAD (legal)
0.842
TechQA (support)
0.911
MedRAG (health)
0.962

Preço$0.0066
Parâmetros1.6B
LançamentoAbr 2026
CUAD (legal)
0.836
TechQA (support)
0.897
MedRAG (health)
0.952

Preço$0.012
Parâmetros596M
LançamentoMar 2026
CUAD (legal)
0.872
TechQA (support)
0.841
MedRAG (health)
0.961
Página 1 de 3
Benchmarks de modelos de embeddings por data de lançamento
nDCG@3 em relação à data de lançamento de cada modelo
Preço vs. precisão de recuperação
Custo efetivo em relação ao nDCG@3. Os modelos comerciais são precificados pela tabela da sua API e os auto-hospedados pelo custo de GPU amortizado de executá-los numa única H100.
Metodologia

Como os benchmarks de modelos de embeddings são construídos

Os benchmarks de modelos de embeddings pontuam cada modelo pelo nDCG@3, a proporção de consultas em que o documento correto aparece entre os 3 primeiros resultados, e calculam a média da sua posição nos três domínios de recuperação em que foi avaliado. Cada benchmark abaixo alimenta essa pontuação.

Atualizações recentes

Atualizações recentes

Últimas alterações aos Benchmarks de modelos de embeddings, à cobertura de modelos e à metodologia de benchmark da AIMultiple.

Jina AI

jina-v5-text-small

Novo modelo adicionado aos Benchmarks de modelos de embeddings.

Microsoft

harrier-oss-0.6b

Novo modelo adicionado aos Benchmarks de modelos de embeddings.

Google

gemini-2-preview

Novo modelo adicionado aos Benchmarks de modelos de embeddings.

Voyage AI

voyage-4-large

Novo modelo adicionado aos Benchmarks de modelos de embeddings.

Explore Embeddings

Modelos de Embedding: OpenAI vs Gemini vs Voyage

Embeddings
Benchmark
31 Ago

Fizemos benchmark de 15 modelos de embedding de texto em inglês e de um baseline BM25 em mais de 500 consultas curadas manualmente em três domínios de recuperação: contratos jurídicos (CUAD), suporte ao cliente (IBM TechQA) e saúde (MedRAG PubMed). Voyage-3.5 fica em primeiro lugar geral. Perplexity Embed V1 0.6b alcança o nível intermediário superior…

Leia mais