I model di embedding multimodali eccellono nell'identificare oggetti ma faticano con le relazioni. I model attuali faticano a distinguere “telefono su una mappa” da “mappa su un telefono”. Abbiamo benchmarkato 7 model di punta su MS-COCO e Winoground per misurare questa specifica limitazione.
Per garantire un confronto equo, abbiamo valutato ogni model in condizioni identiche utilizzando hardware NVIDIA A40 e precisione bfloat16. Questa configurazione deterministica rivela quali model comprendono davvero la struttura della scena e quali sono semplicemente sofisticati abbinatori di parole chiave.
Risultati del benchmark dei model di embedding multimodali
Metriche spiegate
- T2I R@1 (Text-to-Image recall@1): Data una didascalia, il model è in grado di classificare l'immagine corretta come numero uno tra 5.000 candidate? Questa è la metrica di recupero più difficile perché non esiste un credito parziale per il secondo posto.
- I2T R@1 (Image-to-Text recall@1): Data un'immagine, il model è in grado di classificare una qualsiasi delle cinque didascalie ground truth come numero uno tra 25.000? I punteggi sono all'incirca 20 punti percentuali più alti di T2I perché ci sono cinque risposte valide invece di una.
- Immagine Winoground: Date due immagini e due didascalie che differiscono solo nella struttura (“telefono su una mappa” contro “mappa su un telefono”), il model è in grado di abbinare correttamente entrambe le coppie? La probabilità casuale è del 25 per cento.
Risultati principali
- Apple DFN5B-H raggiunge la più alta accuratezza di recupero (50.1 per cento T2I R@1) e il più alto punteggio di ragionamento composizionale (35.2 per cento su Winoground).
- Il ragionamento composizionale rimane scarso in tutti i model. Anche la prestazione di Apple del 35.2 per cento supera di poco la baseline casuale del 25 per cento.
- OpenAI CLIP mostra i suoi anni, restando indietro rispetto ai model moderni di 10-16 punti percentuali nonostante abbia un'architettura simile.
Nota: I punteggi I2T sono all'incirca 20 punti percentuali più alti di T2I a causa di un artefatto del protocollo. Ogni immagine ha cinque didascalie valide, mentre ogni didascalia corrisponde a una sola immagine valida. Consulta la sezione metodologia del benchmark di embedding multimodale per i dettagli.
Come funzionano i model di embedding multimodali
Prima di entrare nei dettagli del benchmark, è essenziale capire cosa fanno davvero questi model e dove si rompono.
Il meccanismo centrale
Un model di embedding multimodale converte sia immagini che testo in vettori numerici, cioè liste di numeri che occupano lo stesso spazio geometrico. I concetti simili si raggruppano, mentre i concetti dissimili sono più distanti.
Per cercare, si calcola quale vettore immagine è più vicino al vettore testo. Ecco perché la ricerca basata su embedding è veloce: si confrontano numeri, non si "comprende" il significato in senso umano.
Dove si rompe
Osserva cosa succede con didascalie composizionalmente diverse:
I vettori sono quasi identici. Entrambe le didascalie contengono gli stessi concetti: {telefono, mappa, su}. Il model codifica ciò che è presente ma perde il modo in cui le cose sono in relazione.
Questo è il problema del bag-of-words. Il model vede gli stessi "ingredienti" e produce embedding simili, anche se le scene sono completamente diverse. In una, il telefono è sopra. Nell'altra, lo è la mappa. La struttura relazionale svanisce durante la codifica.
Compiti di valutazione: recupero vs ragionamento
MS-COCO: trovare un ago in un pagliaio
La configurazione:
Una galleria di 5.000 immagini contiene gruppi di contenuti simili, tra cui centinaia di scene all'aperto, decine di veicoli e numerose aree di stoccaggio e strutture. Ogni immagine ha cinque didascalie diverse scritte da annotatori diversi, per un totale di 25.000 didascalie.
La query: “Una moto parcheggiata sotto una struttura di legno con altri oggetti.”
L'immagine:
La stessa immagine potrebbe anche essere descritta come:
- “Moto nera ferma sotto una sporgenza all'aperto.”
- “Moto parcheggiata sotto un'area coperta in un cortile recintato.”
Ogni didascalia viene testata separatamente e il model deve trovare l'immagine corretta indipendentemente da come è formulata.
Il compito:
Trovare la singola immagine specifica che corrisponde. Non una moto qualsiasi, non una struttura di legno qualsiasi, ma questa scena esatta tra 5.000 candidate.
La metrica: Recall@1
Binaria e senza appello. Immagine corretta classificata #1 = Hit. Classificata #2 = Miss. Nessun credito parziale.
Winoground: capire chi ha fatto cosa a chi
La configurazione:
400 coppie adversariali. Ciascuna contiene 2 immagini e 2 didascalie che differiscono solo nella struttura composizionale.
La query:
- Didascalia A: “c'è un telefono su una mappa”
- Didascalia B: “c'è una mappa su un telefono“
Entrambe le didascalie contengono esattamente gli stessi concetti: {telefono, mappa, su}. L'unica differenza è quale oggetto è sopra quale.
L'immagine:
Il compito:
Abbinare entrambe le didascalie alle immagini corrette simultaneamente. La Didascalia A deve corrispondere all'Immagine A (telefono appoggiato sulla mappa) e la Didascalia B deve corrispondere all'Immagine B (mappa visualizzata sul telefono). Nessun credito parziale: indovinarne solo una è considerato fallimento.
La metrica: Image Score
Binaria e senza appello. Entrambe le coppie abbinate correttamente = Hit. Una o zero corrette = Miss. La probabilità casuale è 25%.
Altri esempi da Winoground:
Perché i model falliscono nella composizione
I bassi punteggi Winoground (30-40% contro 25% della baseline casuale) indicano che i model attuali faticano con questo specifico tipo di ragionamento composizionale. Tuttavia, ci sono diversi avvertimenti:
- Dimensione del campione ridotta: Winoground contiene solo 400 esempi, producendo intervalli di confidenza di circa ±5 punti percentuali. Questo lo rende utile come indicatore ma non una prova definitiva delle capacità composizionali.
- Ambito del compito specifico ma diversificato: Winoground testa più tipi di ragionamento composizionale, tra cui relazioni spaziali (su/sopra/sotto), scambi agente-paziente (chi fa cosa a chi), associazione di attributi (assegnazioni colore/dimensione), quantificatori (più/meno, conteggio), coordinamento delle azioni (siede/sta in piedi), ordinamento temporale (prima/dopo), negazione (con/senza) e ambiguità di ambito. Questa diversità rende Winoground una sonda efficace della comprensione composizionale attraverso molteplici fenomeni linguistici.
Analisi tecnica & raccomandazioni di implementazione
La qualità dei dati batte la scala dei model
Apple, LAION e MetaCLIP usano tutte la stessa backbone ViT-H/14 (630M parametri).
Il vantaggio di Apple di +3.8pp sembra derivare principalmente dal suo approccio Data Filtering Network (DFN).
- Selezione automatizzata: Invece di usare solo didascalie sintetiche, Apple ha addestrato un teacher model per filtrare in modo aggressivo i dati di addestramento. Il model ha imparato a identificare e scartare coppie immagine-testo rumorose dall'enorme pool web.
- L'implicazione: Alla frontiera, i miglioramenti derivano dalla qualità della selezione (scegliere i dati giusti) piuttosto che solo da sintesi o scala grezza.
L'implicazione: alla frontiera, i miglioramenti derivano da dati migliori, non da architetture più grandi.
Comprendere il livello di prestazione del 50%
MS-COCO è stato progettato con immagini distinte e selezionate in cui ogni didascalia descrive una scena specifica. Sebbene esistano piccole ambiguità (ad es. due scene simili di parcheggi), i creatori del dataset hanno selezionato intenzionalmente immagini visivamente distinguibili.
L'accuratezza del 50% riflette il fallimento reale dei model nel classificare l'immagine corretta al primo posto, non una penalizzazione ingiusta per aver selezionato alternative ugualmente valide.
Perché OpenAI CLIP resta indietro di 10-16pp
Il CLIP-L di OpenAI (2021) ottiene 34.4% T2I R@1, mentre i model moderni che usano architetture ViT simili raggiungono 44-50%. Questo divario di 10-16 punti percentuali riflette tre anni di progressi:
Sebbene i principi architetturali di base siano rimasti simili (vision transformer con apprendimento contrastivo), i model moderni sono raddoppiati in dimensioni. Tuttavia, la maggior parte dei guadagni di prestazione è derivata da una migliore selezione dei dati e da tecniche di addestramento piuttosto che dalla sola innovazione architetturale.
ColPali: scambiare velocità con flessibilità architetturale
ColPali rappresenta un approccio architetturale diverso: invece di codificare ogni immagine in un singolo vettore, produce 1.030 patch embedding usando la late interaction. Questa scelta di design crea diversi compromessi:
Vantaggi:
- Recupero più simmetrico: ColPali mostra un divario di soli 3.9pp tra I2T (48.8%) e T2I (44.9%), rispetto a divari di 16-24pp nei model densi. Questo suggerisce che codifica la struttura dell'immagine in modo più uniforme.
- Flessibilità architetturale: La late interaction consente un abbinamento fine tra token di testo e patch dell'immagine, il che può beneficiare i domini specializzati.
Svantaggi:
- Sovraccarico di archiviazione: Ogni immagine richiede 1.030 vettori invece di 1, aumentando la dimensione dell'indice di circa 1000×.
- Prestazioni complessive inferiori: ColPali si classifica 4 nel nostro benchmark (44.9% T2I), dietro ai migliori model densi di 5.2pp (rispetto a Apple DFN5B-H al 50.1%).
Costo computazionale: Richiede batch size 4× più piccole (4 contro 32) a causa del sovraccarico di memoria dovuto a 1.030 embedding per immagine. Questo si traduce in un'indicizzazione più lenta e costi di serving più elevati su scala.
Quale model dovresti usare?
Metodologia del benchmark di embedding multimodale
Hardware & software
- GPU: NVIDIA A40 (48GB VRAM) via RunPod
- Precisione: bfloat16
- Framework: PyTorch 2.4.0, CUDA 12.1
- Librerie:
transformers==4.44.0,datasets==2.20.0
Model valutati
Abbiamo utilizzato i seguenti pesi di model specifici dallo Hugging Face Hub. Tutti i model sono stati caricati in precisione bfloat16 direttamente da questi repository senza modifiche.
Protocollo di inferenza
I model densi (CLIP/SigLIP) sono stati valutati con batch size 32, poiché un singolo vettore per immagine consente un elevato parallelismo. ColPali ha usato batch size 4, poiché i suoi 1.030 patch embedding per immagine richiedono molta più memoria.
Protocollo di valutazione
- Zero-Shot: Model valutati out-of-the-box utilizzando i pesi di Hugging Face. Nessun fine-tuning.
- Deterministico: Seme casuale fissato a 42. Stesso ordine del dataset per tutti i model.
- Split standard: test yerevann/coco-karpathy (5.000 immagini), validation facebook/winoground.
Il divario I2T vs. T2I
I punteggi I2T sono costantemente ~20pp più alti di T2I a causa della probabilità statistica, non di un errore del model.
- T2I (Text-to-Image): Il model deve trovare 1 immagine specifica tra 5.000. (Pool target = 1).
- I2T (Image-to-Text): Il model può abbinare una qualsiasi delle 5 didascalie valide associate a quell'immagine. (Pool target = 5).
Poiché il compito I2T offre cinque risposte "corrette" distinte per ogni query, il tasso di successo è naturalmente gonfiato rispetto alla mappatura rigorosa uno-a-uno richiesta in T2I.
Limitazioni
Dimensione del campione Winoground
400 campioni producono intervalli di confidenza di ~±5pp a un'accuratezza del 35%. I risultati sono indicativi, non definitivi. Benchmark più grandi (ARO, SugarCrepe) esistono ma richiedono infrastrutture diverse.
Solo Zero-Shot
Nessun fine-tuning di dominio. Le applicazioni mediche, legali o satellitari potrebbero vedere miglioramenti di 5-10pp con addestramento specifico per dominio.
Limitazioni del dataset:
MS-COCO e Winoground testano aspetti specifici della comprensione multimodale. Le prestazioni su questi benchmark non garantiscono risultati simili su compiti specifici di dominio o altri test di ragionamento composizionale.
Conclusione
Gli attuali model di embedding multimodali sono bravi nel riconoscimento degli oggetti, ma faticano con il ragionamento composizionale.
Per il recupero standard (“trova foto di moto”), qualsiasi model tra i primi 3 funziona bene. Per query relazionali (“telefono su una mappa” contro “mappa su un telefono”), aspettati un'accuratezza al massimo del 30-40%.
Sulla base dei nostri risultati e delle attuali tendenze di ricerca, diversi approcci possono migliorare le prestazioni:
- Qualità dei dati oltre la scala: Il vantaggio di Apple di +3.8pp utilizzando la stessa architettura ViT-H suggerisce che la selezione dei dati di addestramento contribuisca in modo significativo, sebbene ciò si basi su un unico confronto.
- Dati di addestramento composizionali: Includere hard negatives con variazioni relazionali durante l'addestramento potrebbe teoricamente migliorare la sensibilità composizionale, sebbene ciò rimanga in gran parte non testato su larga scala.
- Architetture ibride: Le pipeline a due fasi (recupero denso → riordino con late interaction) combinano velocità e precisione, sebbene il nostro benchmark mostri che questo non supera ancora i model densi in questi compiti.
Fino a quando i paradigmi di addestramento non cambiano, la comprensione composizionale rimane una frontiera aperta.
Ulteriori letture
Esplora altri benchmark di RAG, come:
- Model di embedding: OpenAI vs Gemini vs Cohere
- I migliori Vector Database per RAG: Qdrant vs Weaviate vs Pinecone
- Benchmark RAG agentico: routing multi-database e generazione di query
- 11 Embedding Models open source per RAG
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{sari2026,
author = {Sarı, Ekrem},
title = {{Model di embedding multimodali: Apple vs Meta vs OpenAI}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/multimodal-embeddings}},
note = {AIMultiple. Consultato il 14 Agosto 2026}
}Risultati e timestamp di 20 punti dati. Scarica i dati utilizzati in questo articolo come file ZIP contenente 4 file CSV.


Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.