Il modello più recente nei Benchmark dei modelli di embedding è jina-v5-text-small.
Benchmark degli Embedding
Benchmark trasparenti dei modelli di embedding basati sulle valutazioni di recupero condotte da AIMultiple su modelli di embedding commerciali e open source in tre domini RAG aziendali. Vedi la metodologia.
Classifica
Tutti i modelli di embedding testati, ordinati per la media nDCG@3 sui tre domini.
# | Modello | nDCG@3 | CUAD (legal) | TechQA (support) | MedRAG (health) |
|---|---|---|---|---|---|
| 1 | voyage-3.5 Voyage AI | 0.943 | 0.910 | 0.965 | 0.954 |
| 2 | voyage-4-large Voyage AI | 0.942 | 0.873 | 0.966 | 0.986 |
| 3 | gemini-2-preview Google | 0.932 | 0.896 | 0.930 | 0.969 |
| 4 | nvidia-nemotron-8b NVIDIA | 0.925 | 0.860 | 0.952 | 0.963 |
| 5 | gemini-001 Google | 0.922 | 0.898 | 0.886 | 0.981 |
| 6 | voyage-4-lite Voyage AI | 0.921 | 0.859 | 0.948 | 0.956 |
| 7 | voyage-law-2 Voyage AI | 0.919 | 0.913 | 0.902 | 0.941 |
| 8 | SFR-Embedding-2_R Salesforce | 0.905 | 0.842 | 0.911 | 0.962 |
| 9 | jina-v5-text-small Jina AI | 0.895 | 0.836 | 0.897 | 0.952 |
| 10 | harrier-oss-0.6b Microsoft | 0.891 | 0.872 | 0.841 | 0.961 |
Pagina 1 di 3 | |||||
Come sono costruiti i benchmark dei modelli di embedding
I benchmark dei modelli di embedding assegnano a ciascun modello un punteggio nDCG@3, ovvero la quota di query in cui il documento corretto rientra nei primi 3 risultati, e ne mediano la posizione sui tre domini di recupero in cui è stato valutato. Ogni benchmark qui sotto alimenta quel punteggio.
Aggiornamenti recenti
Ultime modifiche ai Benchmark dei modelli di embedding, alla copertura dei modelli e alla metodologia di benchmark di AIMultiple.
jina-v5-text-small
Nuovo modello aggiunto ai Benchmark dei modelli di embedding.
harrier-oss-0.6b
Nuovo modello aggiunto ai Benchmark dei modelli di embedding.
gemini-2-preview
Nuovo modello aggiunto ai Benchmark dei modelli di embedding.
voyage-4-large
Nuovo modello aggiunto ai Benchmark dei modelli di embedding.