Serviços
Contate-nos

Modelos de Embedding: OpenAI vs Gemini vs Voyage

Ekrem Sarı
Ekrem Sarı
atualizado em 25 abr. 2026

Comparamos 15 modelos de embedding de texto em inglês e uma baseline BM25 em mais de 500 consultas manualmente curadas em três domínios de recuperação: contratos legais (CUAD), suporte ao cliente (IBM TechQA) e saúde (MedRAG PubMed).

Voyage-3.5 ocupa o primeiro lugar geral. Perplexity Embed V1 0.6b atinge o nível médio-alto com o menor preço em nosso benchmark.

Resultados do benchmark de modelos de embedding

Loading Chart

Métricas explicadas

nDCG@3: Ganho cumulativo descontado normalizado com corte em 3. Com um documento relevante por consulta, é 1 / log2(rank + 1) quando o documento gold fica no top 3, e 0 caso contrário. Rank 1 pontua 1.000, rank 2 pontua 0.631, rank 3 pontua 0.500. Usamos nDCG@3 como métrica primária porque pipelines de RAG em produção alimentam o LLM com os 3 a 5 principais chunks, e o viés de primazia faz o rank 1 ter um peso desproporcional.

nDCG@10: Mesma fórmula com corte em 10.

Recall@10: Fração de consultas em que o documento gold aparece no top 10.

MRR@10: Rank recíproco médio com corte em 10. Gold no rank 1 pontua 1.000, rank 2 pontua 0.500 e rank 10 pontua 0.100. Intenção similar ao nDCG@3, mas com penalidade de rank mais acentuada.

Top-1 hit: Fração de consultas em que o documento gold-relevante é o único resultado no topo. A métrica mais rigorosa e a mais próxima de um fluxo de trabalho de consulta sem LLM.

nDCG@3 por domínio

Jurídico (CUAD, 246 consultas, 509 contratos): O domínio jurídico é o único onde o especialista voyage-law-2 vence; seus dados de treinamento ajustados para CUAD rendem +0.040 nDCG@3 sobre voyage-4-large. openai/text-embedding-3-large fica em 11º com 0.6430, abaixo de seis modelos mais baratos. Piso do BM25: 0.5844.

Suporte ao cliente (TechQA, 151 consultas, 28.000 notas técnicas IBM): A diferença de voyage-4-lite para o modelo seguinte é de 0.018. gemini-embedding-001 cai para 7º (0.8856), 0.045 atrás de seu irmão mais novo em TechQA, embora vença nos outros dois domínios. Piso do BM25: 0.6097.

Saúde (MedRAG-PubMed, 154 consultas, 50.000 resumos): Saúde é o cluster mais compacto em nosso benchmark (14 modelos pontuam acima de 0.88) porque o vocabulário médico é denso em palavras-chave, o que empurra a maioria das consultas para o cluster de topo. Piso do BM25: 0.7862, dentro de 0.02 do modelo denso mais fraco. gemini-embedding-001 também supera gemini-embedding-2-preview por sua maior margem aqui (+0.013).

As inversões no nível de domínio justificam o enquadramento da média de 3 domínios: Nenhum domínio único é um proxy justo para "qual modelo é o melhor", e um comprador que escolher com base em um domínio terá um ranking incorreto nos outros.

Os intervalos de confiança bootstrap de 95% por modelo para cada célula de domínio, mais os quatro empates par a par que as classificações por estimativa pontual ocultam, estão detalhados na seção de metodologia.

Acurácia vs preço: Custo por 1M de tokens

Métricas explicadas

Preço por 1M de tokens de entrada é o preço de tabela para embedding de 1M de tokens de entrada, em 2026-04-23. Os preços da Voyage vêm da página de preços direta da Voyage. Modelos servidos via OpenRouter usam o snapshot do catálogo do OpenRouter do mesmo dia. Tokens de consulta e documento são precificados à mesma taxa em todos os fornecedores testados. BM25 é plotado a $0.001/M para renderização em eixo logarítmico. O verdadeiro custo de self-host é $0.

Média de nDCG@3 dos 3 domínios é a média não ponderada do nDCG@3 por domínio nos três corpora. Cada domínio contribui igualmente para a média, independentemente do número de consultas.

  • Para plataformas de RAG com foco em custo, pplx-embed-v1-0.6b é a escolha clara. A $0.004/M, é 30-50x mais barato que qualquer um dos principais modelos comerciais e entrega 92% da qualidade do voyage-3.5 (0.8604 / 0.9429). Nenhum outro modelo em nosso benchmark compete nessa faixa de preço.
  • Para RAG empresarial com foco em qualidade, voyage-3.5 via SDK direto da Voyage ocupa o ponto Pareto máximo. Você troca uma integração extra de API (contra uma stack somente OpenRouter) por um modelo marginalmente melhor que o principal da Voyage pela metade do preço. O instinto de "sempre escolher o mais novo e maior" está errado dentro do catálogo da Voyage.
  • Para implantações OSS / self-hostable / on-prem, qwen3-embedding-8b vence. É o embedder não trivial mais barato em nosso benchmark a $0.010/M, iguala ou supera todas as outras famílias de codificadores OSS que testamos e é distribuído com pesos self-hostable.
  • Os principais modelos premium (openai-3-large, gemini-2-preview, voyage-4-large, gemini-001) todos perdem para voyage-3.5 na média dos 3 domínios, embora voyage-3.5 seja 2-3x mais barato que qualquer um deles.

Principais conclusões do benchmark de embedding

voyage-3.5 vence a média de 3 domínios e supera o principal voyage-4-large pela metade do preço

voyage-3.5 obtém média de 0.9429 nDCG@3 nos domínios jurídico, suporte ao cliente e saúde. O principal voyage-4-large obtém média de 0.9416 a $0.12 por 1M de tokens, 2x o preço de $0.06 do voyage-3.5. O principal vence TechQA por 0.002 e vence MedRAG por 0.032. Perde CUAD por 0.037 (0.8730 vs 0.9102), o suficiente para que sua média de 3 domínios fique abaixo de voyage-3.5. Dentro da linha Voyage, o modelo de gama média mais antigo é a melhor escolha de uso geral. O principal só justifica seu preço premium em saúde.

Voyage assumiu o primeiro lugar em todos os três domínios e varreu os dois primeiros lugares em CUAD e TechQA. Em MedRAG, gemini-embedding-001 irrompeu em 2º lugar (0.9814, atrás de 0.9855 de voyage-4-large), à frente de todos os outros modelos Voyage. gemini-001 também alcança o terceiro lugar em CUAD. Nenhum outro modelo não-Voyage chega ao top 2 em qualquer domínio único.

Um modelo legado Gemini supera seu irmão "preview" mais novo em dois de três domínios

google/gemini-embedding-001 (lançado em junho de 2025) supera google/gemini-embedding-2-preview em ambos CUAD (0.8980 vs 0.8958) e MedRAG (0.9814 vs 0.9685). O modelo mais novo vence apenas TechQA (0.9301 vs 0.8856), uma diferença de 0.04 que vem com um aumento de preço de 33% ($0.20 vs $0.15 por 1M de tokens de entrada). O enquadramento de "atualização multimodal mais recente" do Gemini 2 não se sustenta na recuperação de texto em inglês em corpora jurídico ou de saúde.

Para cargas de trabalho de RAG nesses dois domínios hoje, gemini-embedding-001 é a escolha correta do Gemini. A inversão em MedRAG (001 em 2º, 2-preview em 3º) é grande o suficiente para que um comprador que opte pelo modelo "mais novo" por padrão perca qualidade mensurável.

openai/text-embedding-3-large fica em 11º de 15 modelos densos em CUAD com 0.6430 nDCG@3. Oito modelos estritamente mais baratos o superam em contratos legais: ambos os principais da série Voyage 4 a $0.12, voyage-3.5 pela metade do preço, voyage-4-lite a 1/6 do preço, ambas as variantes de embedding Qwen3, intfloat/e5-large-v2 a 1/13 do preço, e perplexity/pplx-embed-v1-0.6b (0.8031) a 1/32 do preço. O principal da OpenAI é 9º em TechQA (0.8581) e 11º em MedRAG (0.9296). Em saúde, fica num cluster de topo apertado (dispersão do 2º ao 11º: 0.05 nDCG@3). Em jurídico, a diferença é grande e cara.

A $0.13 por 1M de tokens de entrada, é 32x mais caro que pplx-embed-v1-0.6b. Equipes que escolhem OpenAI por padrão porque "é a escolha segura" estão pagando um prêmio que os dados de 3 domínios não justificam.

pplx-embed-v1-0.6b atinge o nível superior por um trigésimo do preço de modelos principais comparáveis

perplexity/pplx-embed-v1-0.6b a $0.004 por 1M de tokens obtém média de 0.8604 nDCG@3 nos três domínios, atrás apenas dos quatro modelos Voyage, das duas variantes Gemini e qwen/qwen3-embedding-8b. Supera todos os modelos OpenAI e OSS na lista. Também supera openai/text-embedding-3-large por 0.16 nDCG@3 em CUAD, perde por 0.012 em TechQA (0.8457 vs 0.8581) e vence por 0.003 em MedRAG. O próximo modelo mais barato do top-10 é qwen/qwen3-embedding-8b a $0.010 (2.5x mais), também servido via OpenRouter.

Para plataformas de RAG com foco em custo, onde embedding é um item de linha material, pplx-0.6b é a escolha clara. A diferença de 30-50x para o preço dos principais modelos não compra nada em qualidade de recuperação, essencialmente nesses três domínios.

BM25 está a 0.02 do modelo denso mais fraco em resumos médicos

Em MedRAG-PubMed, BM25 pontua 0.7862 nDCG@3 contra baai/bge-m3 (modo denso) com 0.8038, uma diferença de 0.02. A busca lexical fica a 0.15 de sete dos quinze modelos densos neste corpus (bge-m3, e5-base-v2, openai-3-small, e5-large-v2, openai-3-large, pplx-0.6b, qwen3-4b). A razão é estrutural: consultas médicas são densas em palavras-chave por design (nomes de medicamentos, nomes de doenças, termos de design de estudo, símbolos de genes), e esses tokens carregam a maior parte do sinal de recuperação. Um scorer estilo Lucene os casa diretamente sem precisar de contexto semântico.

Um reranker sobre BM25 é uma alternativa plausível e mais barata a um embedder denso premium para corpora densos em palavras-chave: a lacuna de recuperação que o BM25 deixa (0.2 nDCG@3 para o nível superior em MedRAG) é o tipo de lacuna que um reranker da Cohere ou da Voyage pode fechar. Em CUAD, a lacuna do BM25 para o melhor modelo denso é 0.33, em TechQA 0.36, em MedRAG 0.20. A densidade do vocabulário do domínio é o maior determinante do quanto embeddings densos ajudam.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Especialistas de domínio vs generalistas entre fornecedores

Voyage precifica voyage-law-2 a $0.12/M, idêntico a voyage-4-large. Os dois modelos compartilham fornecedor, tokenizador, SDK e esquema de invocação assimétrica. Apenas a ênfase dos dados de treinamento difere. Executar ambos contra generalistas em CUAD, TechQA e MedRAG isola o efeito do treinamento jurídico.

Em CUAD, voyage-law-2 fica em 1º com 0.9126: 0.0024 acima de voyage-3.5, 0.0146 acima de gemini-embedding-001, 0.040 acima de voyage-4-large, 0.097 acima de qwen3-embedding-8b e 0.270 acima de openai/text-embedding-3-large (0.6430). Em TechQA, voyage-law-2 fica em 4º com 0.9020, 0.064 atrás de voyage-4-large e 0.063 atrás de voyage-3.5. Em MedRAG, fica em 6º com 0.9409, 0.045 atrás de voyage-4-large e 0.041 atrás de gemini-embedding-001. O treinamento jurídico eleva nDCG@3 em CUAD e o reduz nos outros dois domínios.

Uma equipe jurídica que usa recuperação estilo CUAD com openai/text-embedding-3-large opera a 0.6430 nDCG@3 contra voyage-law-2 a 0.9126, uma diferença de 0.27. Uma equipe de saúde ou suporte que escolher voyage-law-2 porque ele ficou em primeiro em CUAD perde 0.045 para voyage-4-large em MedRAG e 0.064 em TechQA. Modelos de embedding especialistas de domínio não são atualizações diretas para recuperação genérica. Uma única recomendação de "melhor modelo" entre setores erra em pelo menos uma direção.

Quando escolher voyage-law-2: recuperação de contratos em corpora jurídicos comerciais que se assemelham estruturalmente a CUAD. Quando não escolher: qualquer outra coisa neste benchmark. voyage-3.5 custa $0.06/M, fica 0.0024 abaixo de voyage-law-2 em CUAD e o supera em TechQA e MedRAG.

Como o pipeline de recuperação por embedding foi avaliado

Cada modelo codifica um vetor de consulta e N vetores de documento via um bi-codificador. Calculamos similaridade de cosseno entre o vetor de consulta e cada vetor de documento, então ordenamos o top-k para aquela consulta. Com um documento gold por consulta e relevância binária, o avaliador verifica se o gold aparece no top-k e em qual rank. Esse rank alimenta nDCG@3 (nosso primário), nDCG@10 (para comparabilidade com BEIR/MTEB), Recall@10 e taxa de Top-1 hit.

Os codificadores de consulta e documento nem sempre são a mesma função. Alguns modelos são treinados assimetricamente: o lado da consulta aplica uma transformação, o lado do documento aplica outra. Invocar esses modelos simetricamente ("apenas passe o texto") degrada silenciosamente a qualidade de recuperação em 0.05-0.45 nDCG@10. Nossa lista se divide em quatro modos:

Por que nDCG@3 como primário. Pipelines de RAG em produção alimentam o LLM com os 3 a 5 principais chunks, não com o top 10. O viés de primazia em LLMs de contexto longo faz o rank 1 importar mais que o rank 3, e cada distrator que fica acima do gold no contexto do LLM é um candidato a confabulação. Rerankers nivelariam esse efeito, mas a maioria dos RAGs em produção roda sem um por razões de custo e latência, então o rank do embedder É o rank final.

Em MedRAG, Recall@10 atingiu o teto de 1.000 para três modelos Voyage e para qwen3-8b; nDCG@3 preservou uma dispersão de 0.10 nas mesmas consultas. nDCG@10 mantém a comparabilidade com BEIR, mas suaviza as diferenças no topo da lista que importam operacionalmente.

Veja mais dos nossos benchmarks e insights baseados em dados na Pesquisa Google.
GoogleAdicionar como fonte preferencial

Metodologia do benchmark de modelos de embedding

Corpora (seleção de domínio + porquê)

Escolhemos três domínios que estressam diferentes propriedades de recuperação e que cobrem os três RAGs empresariais mais comuns. Cada corpus tem hash SHA256 fixado, para que qualquer leitor possa reproduzir a célula exata que executamos.

PM209 (manuais de manufatura) foi descartado: apenas 209 documentos, muito pequeno para evitar o problema de atalho de entidade do BM25 em 150 consultas.

Geração de consultas: protocolo de consenso de 3 LLMs

Nossas consultas são geradas por LLM sob separação escritor-validador: o LLM que redige uma consulta nunca julga seu próprio alvo de recuperação, então o viés próprio é estruturalmente excluído. Apenas os dois validadores não-escritores, vendo os 20 candidatos embaralhados sem nenhuma dica sobre qual era o documento de fundamentação do escritor, decidem a aceitação. Além do consenso do LLM, revisamos pontualmente cerca de 25% do conjunto de consultas aceitas manualmente (revisão do autor sobre naturalidade da consulta, alinhamento com o documento-alvo e conformidade com R9, independente do voto do validador).

Cada consulta passou pelo seguinte pipeline antes de entrar no conjunto de produção:

  1. Escritor redige uma única consulta fundamentada em um documento amostrado aleatoriamente. O escritor rotaciona entre Claude Sonnet 4.6, Qwen3.6-plus e Gemini 3 Flash preview para que nenhum modelo único domine a impressão digital linguística.
  2. Avaliador (fixo: Claude Sonnet 4.6) classifica a consulta em uma rubrica de especificidade. Exigimos semantic_bridge ≥ 4 (a consulta deve descrever semanticamente o que o documento afirma, não apenas casar por nome) e unique_referent em 3-5 (as âncoras descritivas devem identificar aproximadamente de um a cinco documentos candidatos no corpus, não milhares ou exatamente um).
  3. Verificação de hard-negative: Pegamos os top-19 documentos distratores do BM25 mais o alvo e executamos um portão Jaccard de quase-duplicata (> 0.5 → rejeitar a consulta inteira como verdade de referência ambígua).
  4. Validadores (2 modelos, nunca incluindo o escritor) escolhem independentemente o documento-alvo do conjunto embaralhado de 20 candidatos. Ambos os validadores devem concordar no slot do alvo exato ou a consulta é descartada. "Nenhuma das opções acima" e "múltiplas respostas corretas" são respostas válidas dos validadores e também descartam a consulta.
  5. Kappa de Cohen calculado por par de validadores. Cada consulta teve exatamente 2 avaliadores (os não-escritores do pool de 3 modelos), então os 3 pares possíveis de exclusão de escritor nos dão 3 valores kappa separados por domínio. Nós os reportamos individualmente e como uma média ponderada por n.

Kappa de Cohen por par com concordância observada po e esperada pelo acaso pe, calculado nas consultas aceitas mais todas as rejeições consensus_fail onde ambos validadores chegaram a uma decisão. As células mostram n / po / pe / κ:

A média ponderada por n é um resumo descritivo, não uma estatística inferencial. Ela condensa os três kappas por par em um número ponderado por quantas consultas cada par julgou; não é em si um valor kappa para um dataset agrupado, e o IC sobre ela precisaria ser calculado via reamostragem bootstrap no nível da consulta (adiado para v2.1).

Usamos kappa de Cohen (não kappa de Fleiss ou alfa de Krippendorff) porque cada consulta teve exatamente 2 avaliadores: o enquadramento natural aqui são 3 cálculos de Cohen par a par, pois queremos saber se quaisquer dois modelos específicos concordam, não se um painel de 3 avaliadores é coeso. O alfa de Krippendorff daria um único número, mas misturaria os três pares e ocultaria a variância no nível do par.

CUAD especificamente: Claude × Qwen atinge κ=0.974 enquanto Claude × Gemini e Gemini × Qwen ficam em torno de κ=0.86, o que isola Gemini-3-flash-preview como o juiz mais ruidoso em contratos legais. Essa informação é um sinal metodológico que vale a pena destacar, não diluir na média.

Promovemos um domínio para produção após o kappa médio ponderado por n superar 0.85. Todos os três superaram. O 0.986 do MedRAG é efetivamente o teto: as duas discordâncias em 156 tentativas foram em alvos medicamente ambíguos, onde ambos os validadores eram internamente consistentes, mas um escolheu um resumo relacionado, mas não-gold.

Conjunto de regras de anonimização de entidades R9 (por domínio)

R9 é uma restrição rígida no momento da geração da consulta. Sem ela, BM25 sobe acima de 0.97 nDCG@10 porque entidades nomeadas atuam como atalhos perfeitos de palavras-chave; embeddings densos não têm margem semântica para medir. A regra é adaptada por domínio para que as âncoras que realmente carregam sinal de recuperação naquele domínio permaneçam utilizáveis:

  • CUAD estrito. Banir todas as entidades nomeadas: nomes de partes, nomes de estados dos EUA, pessoal, valores monetários em dólares exatos, nomes de produtos específicos. Forçar unicidade descritiva: setor + função + era temporal + faixa monetária + escopo geográfico. O teto do BM25 caiu de 0.97 para 0.591 após a aplicação do R9.
  • TechQA Opção X. Nomes de produtos IBM permitidos (são o sinal primário de recuperação para um administrador de sistemas) SE a consulta também contiver uma âncora descritiva secundária não-produto (classe de sintoma, família de código de erro, era da versão, contexto de implantação). Nomes de clientes, estados dos EUA, pessoal ainda banidos. Teto do BM25: 0.664.
  • MedRAG medical-relaxed + à prova de alucinação. Nomes de medicamentos, termos de doenças, anatomia, símbolos de genes mantidos textualmente da fonte, porque substituir rótulos de classe de medicamentos arrisca alucinação farmacológica ("p-cloroanfetamina" é um liberador de serotonina da classe das anfetaminas, mas traduções de rótulos de LLM de medicamentos mais raros falham silenciosamente). A consulta deve conter ≥2 âncoras não-medicamentosas para que a correspondência pura por nome de medicamento não carregue o resultado. Teto do BM25: 0.809 (propriedade estrutural do domínio, não uma falha metodológica).

Exemplos de consultas

Para cada exemplo, a consulta é o texto que alimentamos ao modelo de embedding. O documento gold é o único item no corpus (de 509 contratos CUAD, 28.000 notas técnicas TechQA ou 50.000 resumos PubMed) que realmente responde à consulta. A tarefa de recuperação é: embeddar a consulta, calcular similaridade de cosseno contra cada documento no corpus e classificá-los. Se o documento gold ficar no rank 1, a consulta pontua 1.000 em nDCG@3; rank 2 pontua 0.631; rank 3 pontua 0.500; abaixo do top-3 pontua 0.

CUAD (jurídico)

Consulta:

Documento gold (1 de 509 contratos CUAD): ANIXABIOSCIENCESINC_06_09_2020-EX-10.1-COLLABORATION AGREEMENT. É uma colaboração de 2020 entre uma empresa alemã e uma biotech dos EUA para descoberta de medicamentos para COVID-19; o contrato especifica um pagamento de marco devido quando o primeiro paciente entrar na Fase I de um ensaio clínico. A consulta não contém nomes de partes, valores monetários e geografias além de dois tokens de país; o sinal de recuperação é setor + temporal + estrutura de marco.

TechQA (suporte ao cliente)

Consulta:

Documento gold (1 de 28.000 notas técnicas IBM): swg1IY43185, que documenta exatamente esse bug do WebSEAL e nomeia o patch que o corrige. O nome de produto IBM (WebSEAL) é permitido sob nossa variante R9 do TechQA, mas o discriminador é o padrão comportamental do bug e a âncora de ordenação de requisição, não apenas o nome do produto.

MedRAG (saúde)

Consulta:

Documento gold (1 de 50.000 resumos PubMed): PMID:231299, um ensaio clínico comparando taxas de abandono por reação adversa entre cefradina e pivmecilinam em mulheres grávidas com infecções do trato urinário. Nomes de medicamentos são mantidos porque a comparação medicamento-versus-medicamento é o sinal de recuperação, mas a consulta adiciona população de pacientes + duração do tratamento + enquadramento de evento adverso para que uma correspondência pura por nome de medicamento via BM25 não acerte o alvo sozinha.

Protocolo estatístico

Intervalos de confiança bootstrap de 95% usam 10.000 reamostragens, método percentil, seed=2026 no vetor de métrica por consulta. Bootstrap pareado nos mesmos índices de consulta para significância par a par entre modelo A e modelo B (reivindicação requer ≥95% das reamostragens onde A > B).

Execução única por célula (modelo, domínio). Uma camada de variância cross-session de 3 execuções é adiada para v2.1 por razões de custo. Chamadas de API de embedding dentro da sessão são determinísticas dentro de algumas partes por milhão de diferença de cosseno, verificadas por verificação pontual; o IC bootstrap, portanto, captura o ruído no nível da consulta, que é a fonte de variância dominante em n=150-246.

Indexação e pontuação

Sem banco de dados vetorial. Cada modelo codifica cada documento do corpus uma vez; similaridade de cosseno é calculada diretamente em NumPy como um produto de matriz densa de embeddings normalizados L2. Isso é exato, não aproximado, então empates de rank são empates genuínos do modelo, não artefatos de ANN.

Regra de chunking por modelo: modelos de 512 ctx chunkam 512+64 de sobreposição; modelos de 8K-20K ctx chunkam para o contexto sem sobreposição; modelos de 32K+ ctx ingerem o documento completo quando ele cabe (os 9% de cauda longa do CUAD excedem todas as janelas de contexto não-Nemotron e recorrem ao chunking; a equidade entre modelos é preservada aplicando a mesma política por tamanho de contexto a cada modelo).

A invocação de recuperação assimétrica por modelo é o detalhe metodológico de maior impacto e merece uma seção dedicada. É a razão pela qual gemini-embedding-2-preview pontua 0.46 nDCG@10 sob a amostra de código documentada do OpenRouter versus 0.91 sob o formato Vertex IA do Google. Veja "Como o pipeline de recuperação por embedding foi avaliado" acima para a tabela por família.

Framework de avaliação: ranx como motor de métrica primário; saída compatível com trec_eval, compatível com submissões ao leaderboard MTEB. IC bootstrap calculado por scripts/bootstrap_ci.py sobre os arrays de métrica por consulta salvos na passagem de avaliação.

Modelos testados

Os preços são de 2026-04-23 do catálogo OpenRouter e da página de preços direta da Voyage.

nDCG@3 por modelo com IC bootstrap de 95%

Intervalos de confiança bootstrap de 95% calculados via 10.000 reamostragens do vetor de métrica por consulta (método percentil, seed=2026). Larguras de IC de 0.03-0.07 nesses tamanhos de amostra (n=154-246) significam que diferenças de estimativa pontual abaixo de ~0.03 estão dentro do ruído e devem ser tratadas como empates. Ordenado pela média de nDCG@3 dos 3 domínios:

Quatro empates estatísticos onde as classificações por estimativa pontual não são significativas a 95% de IC:

Limitações

Revisão humana por um autor: Um autor revisou pontualmente cerca de 25% das consultas finais aceitas quanto à naturalidade, alinhamento com o alvo e conformidade com R9.

Conclusão

voyage-3.5 obtém média de 0.9429 nDCG@3 nos domínios jurídico, suporte ao cliente e saúde, superando o principal da própria Voyage pela metade do preço e o text-embedding-3-large da OpenAI por 0.13 nDCG@3 a menos da metade do preço.

Escolha pplx-embed-v1-0.6b a $0.004/M se o custo de embedding precisar ser um erro de arredondamento. Escolha voyage-3.5 a $0.060/M para o ponto Pareto máximo. Escolha qwen/qwen3-embedding-8b a $0.010/M para permanecer OSS. Use voyage-law-2 apenas para recuperação jurídica adjacente a CUAD, onde ele ganha +0.04 nDCG@3 em CUAD e nada mais.

Leitura adicional

Explore outros benchmarks de RAG, como:

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Ekrem Sarı (2026) - "Modelos de Embedding: OpenAI vs Gemini vs Voyage". Publicado on-line em AIMultiple.com. Acessado em 25 Abril 2026, em: https://aimultiple.com/embedding-models [Recurso on-line]

Sarı, E. (2026, 25 Abril). Modelos de Embedding: OpenAI vs Gemini vs Voyage. AIMultiple. https://aimultiple.com/embedding-models

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Modelos de Embedding: OpenAI vs Gemini vs Voyage}},
  year   = {2026},
  month  = apr,
  howpublished    = {\url{https://aimultiple.com/embedding-models}},
  note   = {AIMultiple. Acessado em 25 Abril 2026}
}
Baixar todos os dados

Resultados e carimbos de data/hora de 0 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo 0 arquivos CSV e um README.

Última atualização: 7 Julho 2026
Baixar
Ekrem Sarı
Ekrem Sarı
Pesquisador de IA
Ekrem é pesquisador de IA na AIMultiple, com foco em automação inteligente, GPUs, agentes de IA e frameworks RAG.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450