Servizi
Contattaci

Grandi modelli multimodali (LMM) vs LLMs

Cem Dilmegani
Cem Dilmegani
aggiornato il 17 ago. 2026

Abbiamo valutato le prestazioni dei modelli multimodali di grandi dimensioni (LMM) in compiti di ragionamento finanziario utilizzando un dataset accuratamente selezionato. Analizzando un sottoinsieme di campioni finanziari di alta qualità, valutiamo le capacità dei modelli nell'elaborare e ragionare con dati multimodali nel dominio finanziario.

Loading Chart

La sezione metodologia fornisce approfondimenti dettagliati sul dataset e sul framework di valutazione utilizzato.

Esplora i modelli multimodali di grandi dimensioni e confrontali con i modelli linguistici di grandi dimensioni.

Perché i modelli hanno ottenuto prestazioni diverse?

La variazione nei tassi di successo riflette le differenze nel modo in cui ogni modello elabora i compiti multimodali finanziari. Poiché il benchmark utilizza campioni del dataset FinMME, che richiedono l'integrazione di testo e elementi visivi finanziari come grafici e documenti strutturati, le prestazioni dipendono fortemente dall'architettura del modello, dalla qualità dell'addestramento e dall'allineamento multimodale.

Architettura del modello e progettazione dei parametri

I modelli differiscono nel modo in cui combinano encoder di testo e immagini, nel numero di parametri attivi e nella complessità dell'instradamento degli esperti.

  • Llama 4 Maverick, ad esempio, utilizza un design basato su esperti più ampio, consentendo un ragionamento più solido.
  • I modelli più piccoli o orientati all'efficienza hanno meno parametri allineati al ragionamento multimodale, il che limita le prestazioni.

Queste distinzioni architetturali influenzano la capacità di ciascun modello di interpretare relazioni numeriche, strutture di grafici ed elementi visivi specifici del dominio.

Copertura dei dati di addestramento

Alcuni modelli sono addestrati su dataset multimodali estesi, mentre altri si basano principalmente su dati generici.

  • I modelli delle famiglie Claude 4 e Qwen 2.5 incorporano dati visivi e testuali su larga scala, migliorando la loro capacità di allineare indizi numerici e visivi.
  • I modelli addestrati su corpora multimodali più limitati hanno difficoltà con i grafici finanziari e i diagrammi strutturati.

I dati di addestramento influenzano direttamente l'affidabilità con cui un modello gestisce concetti finanziari cross-modali.

Fine-tuning per il ragionamento cross-modale

Il benchmark richiede il coordinamento tra l'interpretazione delle immagini e il ragionamento basato sul testo.

  • I modelli Claude 4 sono descritti come validi nei compiti che coinvolgono grafici e diagrammi.
  • I modelli senza un fine-tuning cross-modale dedicato possono rilevare correttamente le caratteristiche visive, ma risultano carenti nel collegarle al linguaggio o alla logica finanziaria.

La strategia di fine-tuning di un modello influisce sulla sua capacità di fondere i segnali testuali e visivi durante l'analisi.

Capacità di gestione del contesto

I campioni finanziari contengono spesso più elementi che devono essere letti insieme, come grafici in più parti o descrizioni lunghe.

  • I modelli con finestre di contesto più ampie riescono a mantenere le relazioni tra input lunghi.
  • I modelli più limitati possono non cogliere le dipendenze, riducendo l'accuratezza nei compiti che richiedono di seguire più componenti visive e testuali.

La dimensione della finestra di contesto influisce sulla capacità di un modello di mantenere l'allineamento tra dettagli quantitativi e visivi.

Dimensioni del modello e priorità di efficienza

Alcuni modelli sono deliberatamente progettati per una distribuzione leggera piuttosto che per un ragionamento ad alta complessità.

  • Phi-4 multimodal e modelli simili danno priorità all'efficienza, limitando la profondità dell'elaborazione multimodale.
  • I modelli più grandi mantengono una maggiore capacità per i compiti di ragionamento che richiedono una comprensione dettagliata dei grafici.

Questo compromesso si traduce in punteggi più bassi per i modelli più piccoli.

Differenze nella comprensione visiva

La valutazione include compiti che richiedono una lettura accurata dei grafici, l'identificazione di oggetti all'interno di documenti finanziari e l'estrazione di dettagli visivi.

  • I modelli con pipeline visive avanzate, come le varianti Qwen 2.5-VL, gestiscono questi compiti in modo più efficace.
  • Altri possono gestire bene le immagini generiche, ma hanno prestazioni incostanti con gli elementi visivi finanziari strutturati.

La forza del ragionamento visivo incide fortemente sui risultati nei campioni in stile FinMME.

Caratteristiche del dataset di valutazione

Il dataset si concentra sul ragionamento multimodale finanziario piuttosto che su compiti generici.

  • I modelli addestrati o sottoposti a fine-tuning per compiti finanziari, numerici o basati su grafici ottengono risultati migliori.
  • I modelli generalisti senza esposizione al dominio mostrano una precisione inferiore sui dataset finanziari.

La specializzazione del dataset rende le prestazioni più sensibili alla qualità del ragionamento cross-modale.

Cosa sono i modelli multimodali di grandi dimensioni open source?

LMM open source con il numero di stelle GitHub:

Il grafico mostra che la popolarità su GitHub di vari LMM open source è in aumento, con alcuni modelli che registrano un'adozione rapida subito dopo il rilascio.

La serie Janus di DeepSeek ha guadagnato migliaia di stelle GitHub nel giro di pochi giorni dal rilascio di Janus-Pro il 27 gennaio 2025, superando i concorrenti, che hanno impiegato mesi per raggiungere numeri simili. Questa rapida crescita è dovuta al successo di Janus-Pro ed è stata influenzata dallo slancio creato da DeepSeek-R1.

  1. Gemma 3 di Google: Gemma 3 è una famiglia di modelli aperti leggeri e all'avanguardia derivati dalla tecnologia Gemini 2.0. Questi modelli offrono capacità avanzate di ragionamento testuale e visivo, una finestra di contesto da 128k token, supporto per function calling e versioni quantizzate per prestazioni ottimizzate. Include ShieldGemma 2 per la sicurezza delle immagini e supporta diversi strumenti e opzioni di implementazione.1
  2. Janus-Pro di DeepSeek: Janus-Pro è una versione avanzata del modello Janus, progettata sia per comprendere sia per generare testo e immagini. Presenta una strategia di addestramento ottimizzata, dati di addestramento ampliati e una dimensione del modello maggiore, migliorandone le capacità multimodali.2
  3. Qwen2.5-VL di Alibaba: Qwen2.5-VL di Alibaba è un'estensione multimodale del modello linguistico Qwen2.5, progettata sia per la comprensione di testo sia di immagini. Vanta un pre-addestramento su larga scala (fino a 18T token), una finestra di contesto estesa (fino a 128K token), una migliore capacità di seguire le istruzioni e un robusto supporto multilingue, che lo rendono adatto a compiti come la didascalia di immagini e il visual question answering. 3
    • Sulla base della serie Qwen2.5-VL, Alibaba ha ottimizzato e reso open source Qwen2.5-VL-32B-Instruct, un modello VL da 32B che incorpora una comprensione e un ragionamento delle immagini più raffinati. Ciò si traduce in prestazioni migliori e analisi dettagliate in compiti come l'analisi delle immagini, il riconoscimento dei contenuti e la deduzione logica visiva.4
  4. CLIP (Contrastive Language–Image Pretraining) di OpenAI: CLIP è progettato per comprendere le immagini nel contesto del linguaggio naturale. Può eseguire compiti come la classificazione di immagini zero-shot, in cui è in grado di classificare accuratamente immagini anche in categorie per cui non è stato esplicitamente addestrato, comprendendo le descrizioni testuali.5
    • Sulla base della serie Qwen2.5-VL, Alibaba ha ottimizzato e reso open source Qwen2.5-VL-32B-Instruct, un modello VL da 32B che incorpora una comprensione e un ragionamento delle immagini più raffinati. Ciò si traduce in prestazioni migliori e analisi dettagliate in compiti come l'analisi delle immagini, il riconoscimento dei contenuti e la deduzione logica visiva.4
  5. Flamingo di DeepMind: Flamingo è progettato per sfruttare i punti di forza sia della comprensione linguistica sia di quella visiva, rendendolo capace di eseguire compiti che richiedono l'interpretazione e l'integrazione di informazioni provenienti da testo e immagini.6

Figura 1: Un esempio tratto da Chip Huyen7

Quali sono i principali LMM?

Funzionalità UI e API degli LLM generici

I fornitori sono selezionati tra gli LLM multimodali più popolari in base a comparabilità, disponibilità dei dati e tempestività.

LMM con il loro prezzo per token:

Per selezionare il modello più adatto, considera fattori come il budget, le capacità e il livello di prestazioni richiesti e il volume previsto di token di input/output necessari per il tuo caso d'uso specifico.

Ulteriori informazioni sui prezzi degli LLM.

Quali sono gli ultimi progressi nei modelli multimodali?

I recenti progressi nei modelli multimodali hanno introdotto nuove capacità ed efficienze nello sviluppo dell'IA.

Modelli di fondazione multimodali video-first

I modelli di fondazione multimodali video-first stanno andando oltre la generazione di didascalie o riassunti ad alto livello e stanno invece imparando a localizzare esplicitamente le evidenze all'interno dei video.

Piuttosto che dire che cosa accade, riescono a identificare quando accade (timestamp) e dove accade (bounding box attorno a oggetti o regioni).

Questo passaggio verso l'ancoraggio spazio-temporale rende la comprensione video più precisa e verificabile. Consente inoltre compiti come trovare momenti esatti, tracciare oggetti, modificare video usando il linguaggio naturale e supportare la robotica e i sistemi critici per la sicurezza.

Ad esempio, Vidi8è un progetto open source di ByteDance incentrato sui grandi modelli multimodali per la comprensione e il montaggio video.

Il repository ospita il codice e le risorse per una famiglia di modelli (ad es. Vidi-7B, Vidi1.5-9B, Vidi2 e Vidi2.5) che accettano visione, audio e testo come input per eseguire compiti come:

  • Recupero temporale (trovare i segmenti temporali in un video corrispondenti a una query testuale)
  • Ancoraggio spazio-temporale (individuare oggetti con bounding box)
  • Risposta a domande su video

Rilascio frontier multimodale di Mistral 3

Mistral IA ha sviluppato una nuova famiglia di modelli IA open source chiamata Mistral 3. La suite Mistral 3 comprende sia modelli multimodali/multilingue di livello frontier sia modelli più piccoli ed efficienti progettati per funzionare su una vasta gamma di dispositivi, dal cloud all'edge, e persino su singole GPU.

Rilasciati con una licenza open source permissiva (Apache 2.0), questi modelli mirano a democratizzare l'accesso all'IA avanzata, consentire personalizzazione e flessibilità di implementazione e rafforzare la posizione dell'Europa nello sviluppo dell'IA, dove vi sono preoccupazioni per il ritardo rispetto a Stati Uniti e Cina nelle tecnologie all'avanguardia.9

Modelli visione-linguaggio open source MoE

Kimi-VL (di Moonshot IA) è un modello visione-linguaggio multimodale open source costruito con un'architettura Mixture-of-Experts (MoE), che opera su compiti che combinano testo, immagini e video mantenendo efficiente il calcolo.

Ha una backbone da 16 miliardi di parametri totali, ma attiva in genere circa 2.8 miliardi di parametri durante l'inference, il che aiuta a bilanciare capacità e costo.

Kimi-VL è progettato per il ragionamento multimodale avanzato, la comprensione di contesti lunghi (fino a circa 128 K token) e le interazioni in stile agentico, e compete bene con modelli più grandi su benchmark come la comprensione video, il riconoscimento ottico dei caratteri (OCR), il ragionamento matematico e i compiti multi-immagine.

Varianti come Kimi-VL-A3B-Thinking sono ulteriormente sottoposte a fine-tuning per compiti di chain-of-thought e di ragionamento, mentre l'encoder visivo MoonViT supporta la comprensione di input ad alta risoluzione.

Figura 2: Architettura di Kimi-VL.10

La serie Claude 4 di Anthropic

La serie Anthropic Claude 4 integra una comprensione visiva avanzata con il suo motore di ragionamento testuale, incorporando la visione direttamente nei flussi di lavoro di risoluzione dei problemi.

I modelli Claude 4 dimostrano prestazioni elevate su benchmark di ragionamento multimodale come MMMU, in particolare nell'interpretazione di grafici, diagrammi e dati visivi complessi. Una caratteristica distintiva di Claude Opus 4.1 è la capacità di valutare le qualità estetiche delle immagini, andando oltre il riconoscimento verso valutazioni più sfumate.

Queste capacità, combinate con le funzioni agentiche di Claude, rendono la serie efficace per compiti come sintetizzare ricerche da report con testo e immagini misti o assistere nella progettazione di interfacce attraverso l'analisi di mockup visivi.

Gemini 3 di Google

Google ha rilasciato Gemini 3 a novembre 2025, con Gemini 3 Pro immediatamente disponibile e la modalità Gemini 3 Deep Think distribuita poco dopo agli abbonati Google IA Ultra. Gemini 3 è posizionato da Google come il suo modello multimodale più intelligente e capace, con supporto nativo per testo, immagini, video, audio e codice all'interno di un'unica architettura.

Gemini 3 Pro è dotato di una finestra di contesto da 1 milione di token e ottiene risultati solidi nei benchmark multimodali, tra cui 81% su MMMU-Pro e 87.6% su Video-MMMU. Ha raggiunto la vetta della classifica LMArena al rilascio con un punteggio di 1501 Elo e ha ottenuto 91.9% su GPQA Diamond per il ragionamento di livello universitario e 76.2% su SWE-bench Verified per i compiti di coding agentico.

Gemini 3 Deep Think è una modalità di ragionamento potenziata che migliora ulteriormente le prestazioni nei compiti più impegnativi, ottenendo 41.0% su Humanity's Last Exam (senza strumenti) e 45.1% su ARC-AGI-2. Insieme a Gemini 3, Google ha rilasciato anche Google Antigravity, una piattaforma di sviluppo agentico che abbina Gemini 3 al modello Gemini 2.5 Computer Use per il controllo del browser e al modello di editing delle immagini Nano Banana, consentendo flussi di lavoro di sviluppo software end-to-end in cui il modello può pianificare, programmare e validare compiti in modo autonomo.11

GPT-5 di OpenAI

GPT-5 introduce una multimodalità nativa migliorata per testo, voce, immagini e video. A differenza dei sistemi precedenti che si basavano in gran parte su plugin, GPT-5 integra queste modalità in un'architettura unificata, producendo un'interazione più fluida. Il modello si adatta in modo flessibile a vari tipi di input e può passare da uno all'altro.

Una caratteristica degna di nota è la modalità voce in tempo reale, che può regolare tono, ritmo e stile in base alle istruzioni dell'utente. Questo crea un'esperienza conversazionale più naturale e adattiva. Anche l'elaborazione visiva è migliorata, riducendo le allucinazioni nell'interpretazione o nella generazione di immagini, diagrammi e grafici. Un altro progresso risiede nelle capacità di memoria, che consentono al sistema di richiamare input precedenti e mantenere il contesto durante interazioni prolungate.

Questi miglioramenti rendono GPT-5 particolarmente prezioso per le interfacce multimodali accessibili, soprattutto per le persone con disabilità sensoriali.

I modelli multimodali di Google DeepMind incentrati sulla robotica

Google DeepMind ha sviluppato Gemini Robotics e Gemini Robotics-ER, modelli progettati per integrare visione, linguaggio e azione nei sistemi robotici. Questi modelli consentono ai robot di eseguire compiti in ambienti non strutturati, come piegare la carta o svitare tappi di bottiglia.

Una caratteristica fondamentale di questi modelli è il meccanismo di sicurezza. Prima di eseguire le azioni, il sistema esegue controlli integrati per ridurre al minimo i rischi e garantire una gestione appropriata dei compiti. Questo approccio affronta una delle sfide principali della robotica: collegare il ragionamento avanzato dell'IA a un'esecuzione sicura e affidabile nel mondo reale.

Llama 4 Scout e Llama 4 Maverick di Meta IA

Llama 4 Scout è un modello multimodale con 17 miliardi di parametri attivi e 16 esperti. Questo modello supera i modelli Llama della generazione precedente ed è progettato per funzionare su una singola H100 GPU. Dispone di una finestra di contesto da 10 milioni di token per elaborare grandi quantità di informazioni. I risultati dei benchmark indicano che Llama 4 Scout ottiene risultati migliori di Gemma 3, Gemini 2.0 Flash-Lite e Mistral 3.1 in una serie di benchmark ampiamente riportati.

Llama 4 Maverick è un modello multimodale con 17 miliardi di parametri attivi e 128 esperti. Questo modello è presentato come uno dei migliori della sua categoria, superando GPT-4o e Gemini 2.0 Flash in una serie di benchmark. Raggiunge prestazioni paragonabili a DeepSeek v3 nel ragionamento e nel coding, utilizzando meno parametri attivi. Una versione chat sperimentale di Llama 4 Maverick ha ottenuto un punteggio ELO di 1417 sulla piattaforma LMArena.

ChatGPT Images 2.0 di OpenAI

OpenAI ChatGPT Images 2.0 fa progredire la generazione di immagini con maggiore precisione, controllo e ragionamento visivo. Il modello migliora il rispetto delle istruzioni, il rendering del testo e il supporto multilingue. Può produrre immagini più sofisticate e realistiche in fotografia, illustrazione, manga, infografiche, poster e altri stili. Supporta inoltre proporzioni flessibili, rendendo i contenuti generati adatti a formati che vanno dagli schermi mobili ai banner e ai materiali di stampa.

Se combinato con le capacità di ragionamento di ChatGPT, ChatGPT Images 2.0 può interpretare i materiali di partenza e incorporare informazioni contestuali e del mondo reale. Ciò consente agli utenti di sviluppare grafiche più complesse e ricche di informazioni e di affinare i concetti creativi in modo conversazionale, mantenendo una maggiore coerenza nella composizione, nella tipografia e nella direzione visiva.

Qwen3-VL di Alibaba

La serie Qwen3-VL di Alibaba, rilasciata a partire da settembre 2025, si basa sul modello linguistico Qwen3 aggiungendo capacità più profonde di percezione visiva e ragionamento. La famiglia comprende varianti dense da 2B a 32B parametri e varianti Mixture-of-Experts fino a 235B parametri totali (22B attivi), tutte rilasciate sotto licenza Apache 2.0.

Le caratteristiche principali includono una finestra di contesto nativa da 256K (espandibile a 1 milione di token), OCR multilingue esteso a 32 lingue, ancoraggio di oggetti 2D e 3D per il ragionamento spaziale e l'IA incarnata, comprensione di video di ore con indicizzazione al secondo e capacità di agente visivo per il controllo della GUI.

Le varianti Thinking sono ottimizzate per il ragionamento STEM e multimodale, mentre le varianti Instruct si rivolgono a compiti generali di visione-linguaggio come l'analisi dei documenti, l'estrazione di grafici e il visual question answering.

Gemma 3 di Google

Gemma 3 di Google si basa sulla tecnologia dei modelli Gemini 2.0. È disponibile in quattro dimensioni (1B, 4B, 12B e 27B) per diverse esigenze hardware e offre una finestra di contesto da 128k token. Gemma 3 offre buone prestazioni su configurazioni con un singolo acceleratore e include ragionamento testuale e visivo, function calling e supporto per oltre 35 lingue, con pre-addestramento per più di 140. Le versioni quantizzate riducono le dimensioni del modello e le esigenze di calcolo. Il sistema ShieldGemma 2 fornisce la classificazione della sicurezza dei contenuti.

Phi-4-multimodal di Microsoft

Microsoft Phi-4-multimodal è un modello da 5.6B parametri che elabora voce, visione e testo in un'architettura unificata. Utilizza l'apprendimento cross-modale per interazioni consapevoli del contesto tra diversi tipi di input. Il modello gestisce più formati di input senza richiedere sistemi di elaborazione separati ed è progettato per l'implementazione su dispositivi e l'edge computing. Le applicazioni includono IA per smartphone, sistemi automobilistici e servizi multilingue.

Che cos'è un grande modello multimodale (LMM)?

Un grande modello multimodale è un tipo avanzato di modello di intelligenza artificiale in grado di elaborare e comprendere più tipi di modalità di dati. Questi dati multimodali possono includere testo, immagini, audio, video e potenzialmente altri. La caratteristica principale di un modello multimodale è la capacità di integrare e interpretare informazioni provenienti da queste diverse fonti di dati, spesso contemporaneamente.

Questi possono essere intesi come versioni più avanzate dei modelli linguistici di grandi dimensioni (LLMs) che possono lavorare con il testo e anche con diversi tipi di dati. Inoltre, gli output dei modelli linguistici multimodali sono progettati per essere testuali, visivi, uditivi e così via.

I modelli linguistici multimodali sono considerati il passo successivo verso il raggiungimento dell'intelligenza artificiale generale.

Che cos'è un agente IA multimodale?

Gli agenti IA multimodali sono sistemi progettati per interagire con il mondo utilizzando vari tipi di dati, tra cui immagini, video e testo, consentendo loro di operare sia in ambienti digitali sia fisici. I modelli multimodali sono la componente principale di questi agenti, poiché consentono loro di percepire e comprendere informazioni da fonti diverse.

Ad esempio, modelli come Magma utilizzano la comprensione visione-linguaggio e l'intelligenza spaziale, ottenute tramite tecniche come Set-of-Mark e Trace-of-Mark durante il pre-addestramento su dataset multimodali.

Ciò consente all'agente di eseguire compiti che vanno dalla comprensione dei contenuti video e dalla risposta alle domande alla navigazione nelle interfacce utente e al controllo dei robot, dimostrando le versatili capacità che i modelli multimodali apportano agli agenti IA sfruttando diverse modalità di dati. L'illustrazione seguente mostra Magma che pianifica traiettorie robotiche per portare a termine i compiti, mostrando la sua intelligenza spaziale in azione.12

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Qual è la differenza tra LMM e LLM?

1. Modalità dei dati

  • LMMs: Sono progettati per comprendere ed elaborare più tipi di dati in ingresso, o modalità. Ciò include testo, immagini, audio, video e talvolta altri tipi di dati come dati sensoriali. La capacità chiave degli LMM è la loro abilità di integrare e dare un senso a questi diversi formati di dati, spesso simultaneamente.
  • LLMs: Questi modelli sono specializzati nell'elaborazione e nella generazione di dati testuali. Sono addestrati principalmente su grandi corpora di testo e sono abili nel comprendere e generare il linguaggio umano in una varietà di contesti. Non elaborano intrinsecamente dati non testuali come immagini o audio.

2. Applicazioni e compiti

  • LMMs: Data la loro natura multimodale, questi modelli possono essere applicati a compiti che richiedono la comprensione e l'integrazione di informazioni tra diversi tipi di dati. Ad esempio, un LMM potrebbe analizzare un articolo di notizie (testo), le fotografie che lo accompagnano (immagini) e i videoclip correlati per ottenere una comprensione completa.
  • LLMs: Le loro applicazioni sono incentrate su compiti che coinvolgono testo, come scrivere articoli, tradurre lingue, rispondere a domande, riassumere documenti e creare contenuti testuali.

Quali sono le modalità di dati dei grandi modelli multimodali?

Testo

Include qualsiasi forma di contenuto scritto, come libri, articoli, pagine web e post sui social media. Il modello può comprendere, interpretare e generare contenuti testuali, inclusi compiti di elaborazione del linguaggio naturale come traduzione, sintesi e risposta a domande.

Immagini

Questi modelli possono analizzare e generare dati visivi. Ciò include la comprensione del contenuto e del contesto di fotografie, illustrazioni e altre rappresentazioni grafiche. Compiti come la classificazione delle immagini, il rilevamento di oggetti e la generazione di immagini a partire da descrizioni testuali rientrano in questa categoria.

Audio

Comprende registrazioni sonore, musica e linguaggio parlato. I modelli possono essere addestrati a riconoscere la voce, la musica, i suoni ambientali e altri input uditivi. Possono trascrivere il parlato, comprendere comandi vocali e persino generare parlato o musica sintetici.

Video

Combinando elementi visivi e uditivi, l'elaborazione video implica la comprensione di immagini in movimento e dei suoni che le accompagnano. Può includere l'analisi dei contenuti video, il riconoscimento di azioni o eventi nei video e la generazione di clip video.

Sebbene la maggior parte degli attuali grandi modelli linguistici multimodali possa elaborare testo e immagini, la ricerca futura mira a includere input di dati audio e video.

Non perderti i nostri benchmark e approfondimenti basati sui dati. Il pulsante apre Google; selezionare AIMultiple conferma che desideri vedere AIMultiple più spesso nei risultati di ricerca di Google.
GoogleAggiungi come fonte preferita

Come vengono addestrati i grandi modelli multimodali?

L'addestramento dei grandi modelli multimodali (LMM) differisce in modo significativo dall'addestramento dei grandi modelli linguistici (LLMs) in diversi aspetti chiave:

1. Raccolta e preparazione dei dati

  • LLMs: Si concentrano su dati testuali provenienti da libri, siti web e fonti scritte, con un'enfasi sulla diversità linguistica per le fonti di dati di addestramento degli LLM.
  • LMMs: Richiedono dati di testo, immagini, audio e video. La raccolta è più complessa a causa dei formati vari. L'annotazione dei dati e l'allineamento tra modalità sono essenziali.

2. Progettazione dell'architettura del modello

  • LLMs: Utilizzano architetture transformer ottimizzate per l'elaborazione sequenziale del testo.
  • LMMs: Impiegano architetture più complesse che integrano più tipi di reti neurali (CNN per le immagini, transformer per il testo) con meccanismi per collegare queste modalità.

3. Pre-addestramento

  • LLMs: Vengono pre-addestrati su corpora di testo utilizzando tecniche come il masked language modeling.
  • LMMs: Vengono pre-addestrati su più tipi di dati, imparando a correlare il testo con le immagini o a comprendere sequenze video.

4. Fine-tuning

  • LLMs: Vengono sottoposti a fine-tuning su dataset testuali specializzati per compiti specifici.
  • LMMs: Richiedono un fine-tuning sia su dataset specifici per modalità sia su dataset cross-modali per stabilire relazioni tra diversi tipi di dati.

5. Valutazione e iterazione

  • LLMs: Le metriche di valutazione si concentrano su compiti di comprensione e generazione del linguaggio, tra cui fluidità, coerenza e pertinenza.
  • LMMs: Vengono valutati su metriche più ampie che coprono il riconoscimento delle immagini, l'elaborazione audio e le capacità di integrazione cross-modale.

Come funzionano gli LMM?

I grandi modelli multimodali condividono somiglianze con i grandi modelli linguistici nel processo di addestramento, nella progettazione e nel funzionamento. Utilizzano la stessa architettura transformer e le stesse strategie di addestramento. I grandi modelli multimodali sono addestrati su:

  • Dati testuali
  • Milioni o miliardi di immagini con descrizioni testuali
  • Clip video
  • Estratti audio
  • Altri dati di input, come il codice

Questo addestramento comporta l'apprendimento simultaneo di più modalità di dati, consentendo al modello di:

  • Riconoscere una foto di un gatto
  • Identificare una parola in una clip audio
  • Comprendere concetti e dettagli sensoriali che vanno oltre il testo

In questo modo, gli utenti possono caricare:

  • Un'immagine per:
    • Ottenere una descrizione di ciò che sta accadendo
    • Usare l'immagine come parte di un prompt per generare testo o immagini
    • Porre domande di follow-up su elementi specifici dell'immagine
    • Tradurre il testo dell'immagine in una lingua diversa (ad es. un menu)

Figura 3: Caricamento di un'immagine di un gatto su ChatGPT per descriverla.

  • Grafici e diagrammi per:
    • Porre domande di follow-up complesse su ciò che mostrano
  • Mockup di design per:
    • Ottenere il codice HTML e CSS necessario per realizzarlo.

Figura 4: Generazione con prompt dell'immagine nello stile del film di Wes Anderson. ChatGPT invia il prompt a un modello di generazione di immagini (come DALL·E), che interpreta la richiesta e produce l'immagine stilizzata.

Dopo il processo di addestramento, i modelli potrebbero incorporare stereotipi malsani e idee tossiche. Per perfezionarli, possono essere utilizzate tecniche come:

  • Apprendimento per rinforzo con feedback umano (RLHF)
  • Modelli di IA di supervisione
  • Red teaming (test della robustezza del modello)

Inoltre, gli strumenti di governance dell'IA e gli strumenti di IA responsabile, che funzionano come soluzioni di conformità dell'IA, possono anche consentire l'ottimizzazione dell'inventario IA, contribuendo a prevenire i bias dell'IA e altri dilemmi etici. Ecco un esempio di come questi strumenti affrontano le preoccupazioni relative al copyright dell'IA generativa:

Figura 5: ChatGPT rifiuta la mia richiesta a causa delle linee guida delle policy sui contenuti per proteggere i diritti d'autore.

L'obiettivo è sviluppare un sistema multimodale funzionale in grado di gestire:

  • Sintesi testo-immagine
  • Didascalia delle immagini
  • Recupero di immagini basato su testo
  • Visual question answering.

In questo modo, l'IA multimodale può integrare varie modalità, fornendo capacità avanzate per compiti che coinvolgono sia il linguaggio sia la visione.

Quali sono i limiti dei grandi modelli linguistici?

  1. Requisiti dei dati e bias: Questi modelli richiedono dataset massicci e diversificati per l'addestramento. Tuttavia, la disponibilità e la qualità di tali dataset possono rappresentare una sfida. Inoltre, se i dati di addestramento contengono bias, è probabile che il modello li erediti e possibilmente li amplifichi, portando a risultati ingiusti o non etici.
  2. Risorse computazionali: L'addestramento e l'esecuzione di grandi modelli multimodali richiedono risorse computazionali significative, rendendoli costosi e meno accessibili per organizzazioni più piccole o ricercatori indipendenti.
  3. Interpretabilità e spiegabilità: Come per i modelli di IA complessi, capire come prendono decisioni può essere difficile. Questa mancanza di trasparenza può rappresentare un problema critico, soprattutto in applicazioni sensibili come la sanità o le forze dell'ordine.
  4. Integrazione delle modalità: Integrare efficacemente diversi tipi di dati (come testo, immagini e audio) in modo da comprendere davvero le sfumature di ciascuna modalità è estremamente impegnativo. Il modello potrebbe non cogliere sempre con precisione il contesto o le sottigliezze della comunicazione umana che derivano dalla combinazione di queste modalità.
  5. Generalizzazione e overfitting: Sebbene questi modelli siano addestrati su vasti dataset, potrebbero avere difficoltà a generalizzare a dati nuovi e mai visti o a scenari che differiscono significativamente dai dati di addestramento. Al contrario, potrebbero fare overfitting sui dati di addestramento, catturando rumore e anomalie come pattern.

Per saperne di più, esplora le sfide e i rischi associati ai modelli generativi e linguistici.

Metodologia di benchmark per gli LMM

Abbiamo valutato le prestazioni dei grandi modelli multimodali (LMM) utilizzando un sottoinsieme del dataset FinMME13, un benchmark completo progettato per valutare le capacità di ragionamento multimodale finanziario. FinMME comprende oltre 11.000 campioni finanziari di alta qualità in 18 domini finanziari e 6 classi di attività, fornendo un framework robusto per la valutazione degli LMM nel dominio finanziario.

Per questo benchmarking, abbiamo utilizzato una selezione curata di 100 campioni del dataset FinMME per analizzare la capacità dei modelli di elaborare e ragionare con dati finanziari multimodali.

Avvertenza

Questa valutazione ha utilizzato un sottoinsieme curato di 100 campioni provenienti da un dataset più ampio per il benchmarking degli LMM. Per una valutazione completa delle prestazioni del modello, devono essere considerati tutti i campioni presenti nel dataset di benchmark completo.

Conclusione

I grandi modelli multimodali (LMM) stanno integrando diversi tipi di dati, come testo, immagini, audio e video, superando così le capacità puramente testuali dei grandi modelli linguistici (LLMs). Con progressi come Llama 4 di Meta IA, GPT-4o di OpenAI e Qwen2.5-VL di Alibaba, gli LMM consentono applicazioni più ricche, dal ragionamento visivo alla generazione di immagini consapevole del contesto.

Tuttavia, la loro complessità, gli elevati requisiti computazionali e le sfide legate all'integrazione dei dati e alla mitigazione dei bias restano ostacoli. Man mano che gli LMM si evolvono, aprono la strada ad agenti IA più versatili, avvicinandoci all'intelligenza artificiale generale. Per le organizzazioni e i ricercatori, la scelta del modello giusto implica il bilanciamento tra prestazioni, costi ed esigenze specifiche del caso d'uso.

Cita questa ricerca

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Cem Dilmegani (2026) - "Grandi modelli multimodali (LMM) vs LLMs". Pubblicato online su AIMultiple.com. Consultato il 17 Agosto 2026, da: https://aimultiple.com/large-multimodal-models [Risorsa online]

Dilmegani, C. (2026, 17 Agosto). Grandi modelli multimodali (LMM) vs LLMs. AIMultiple. https://aimultiple.com/large-multimodal-models

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{Grandi modelli multimodali (LMM) vs LLMs}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/large-multimodal-models}},
  note   = {AIMultiple. Consultato il 17 Agosto 2026}
}
Scarica tutti i dati

Risultati e timestamp di 30 punti dati. Scarica i dati utilizzati in questo articolo come file ZIP contenente 3 file CSV.

Ultimo aggiornamento: 17 Agosto 2026
Scarica

Registro delle modifiche

20 aggiornamenti
  1. 2026

    Aggiunti i modelli fondamentali multimodali "Video-first", la versione "Mistral 3 multimodal frontier" e i modelli di visione-linguaggio MoE open source alla sezione sui recenti progressi nei modelli multimodali.

  2. 2025

    Aggiunta una sezione sul perché i modelli hanno avuto prestazioni diverse all'introduzione.

  3. Aggiunta la serie Claude 4 di Anthropic all'elenco dei modelli multimodali.

  4. Aggiunto GPT-5 di OpenAI alla sezione sui più recenti progressi nei modelli multimodali.

  5. Aggiornata l'introduzione con una descrizione della valutazione dei LMM nei compiti di ragionamento finanziario.

  6. Aggiunta una sezione sulla metodologia.

  7. Aggiunti modelli multimodali di grandi dimensioni open source alla sezione sui principali LMM.

  8. Aggiunti Llama 4 Scout e Llama 4 Maverick di Meta AI.

  9. Aggiunta la generazione di immagini 4o di OpenAI alla sezione sui progressi più recenti.

  10. Aggiunta una nuova sezione, "Cos'è un agente AI multimodale?", alla sezione "Qual è la differenza tra LMM e LLM?".

  11. Aggiunto Qwen2.5-VL-32B-Instruct di Alibaba all'elenco dei modelli.

  12. Aggiunto Gemma 3 di Google alla sezione 'Quali sono gli ultimi progressi nei modelli multimodali?'.

  13. Aggiunta una sezione che descrive il modello Phi-4-multimodal di Microsoft.

  14. Aggiunto Qwen2.5-VL di Alibaba all'elenco degli LMM open-source.

  15. Aggiunti i modelli o3-mini e DeepSeek-R1 all'introduzione.

  16. Aggiunta una tabella alla sezione "Cosa sono i principali LMM?".

  17. 2024

    Rimosse le LMM con le loro date di lancio dalla sezione Quali sono le LMM principali?

  18. Aggiunte le Figure 1, 2, 3 e 4 all'articolo.

  19. Aggiunta la sezione "Come funzionano gli LLM?".

  20. Aggiunti OpenAI GPT-4o, Gemini 1.5 e Qwen-VL-Plus/Max ai principali LMM.

Cem Dilmegani
Cem Dilmegani
Analista principale
Cem è analista principale presso AIMultiple dal 2017.

Il lavoro di Cem presso AIMultiple è stato citato da importanti testate internazionali tra cui Business Insider, Forbes, Morning Brew e Washington Post, da aziende globali come Deloitte e HPE, da ONG come il World Economic Forum e da organizzazioni sovranazionali come la Commissione europea. [1], [2], [3], [4], [5]

Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente tecnologico e imprenditore tecnologico. Ha consigliato le aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per più di un decennio. Ha inoltre pubblicato un report McKinsey sulla digitalizzazione.

Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha inoltre guidato la crescita commerciale dell'azienda deep tech Hypatos, che ha raggiunto ricavi ricorrenti annuali a 7 cifre e una valutazione a 9 cifre partendo da zero in 2 anni. Il lavoro di Cem in Hypatos è stato ripreso da importanti testate tecnologiche come TechCrunch e Business Insider.

Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato come ingegnere informatico presso l'Università di Bogazici e possiede un MBA della Columbia Business School.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450