Servizi
Contattaci

Grandi modelli multimodali (LMM) vs LLMs

Cem Dilmegani
Cem Dilmegani
aggiornato il 22 mag. 2026

Abbiamo valutato le prestazioni dei grandi modelli multimodali (LMM) in compiti di ragionamento finanziario utilizzando un dataset accuratamente selezionato. Analizzando un sottoinsieme di campioni finanziari di alta qualità, valutiamo le capacità dei modelli nell'elaborare e ragionare con dati multimodali nel dominio finanziario.

Loading Chart

La sezione sulla metodologia fornisce approfondimenti dettagliati sul dataset e sul framework di valutazione impiegato.

Esplora i grandi modelli multimodali e confrontali con i modelli linguistici di grandi dimensioni.

Perché i modelli hanno ottenuto risultati diversi?

La variazione nei tassi di successo riflette le differenze nel modo in cui ciascun modello elabora i compiti finanziari multimodali. Poiché il benchmark utilizza campioni del dataset FinMME, che richiedono l'integrazione di testo ed elementi visivi finanziari come grafici e documenti strutturati, le prestazioni dipendono fortemente dall'architettura del modello, dalla qualità dell'addestramento e dall'allineamento multimodale.

Architettura del modello e progettazione dei parametri

I modelli differiscono per il modo in cui combinano gli encoder di testo e immagini, per il numero di parametri attivi e per la complessità del routing degli esperti.

  • Llama 4 Maverick, ad esempio, utilizza un design più ampio basato su esperti, consentendo un ragionamento più solido.
  • I modelli più piccoli o orientati all'efficienza hanno meno parametri allineati al ragionamento multimodale, il che limita le prestazioni.

Queste distinzioni architetturali influenzano la capacità di ogni modello di interpretare relazioni numeriche, strutture dei grafici ed elementi visivi specifici del dominio.

Copertura dei dati di addestramento

Alcuni modelli sono addestrati su dataset multimodali estesi, mentre altri si basano principalmente su dati generici.

  • I modelli delle famiglie Claude 4 e Qwen 2.5 incorporano dati visivi e testuali su larga scala, migliorando la loro capacità di allineare segnali numerici e visivi.
  • I modelli addestrati su corpora multimodali più limitati hanno difficoltà con grafici finanziari e diagrammi strutturati.

I dati di addestramento influenzano direttamente l'affidabilità con cui un modello gestisce i concetti finanziari cross-modali.

Fine-tuning per il ragionamento cross-modale

Il benchmark richiede il coordinamento tra l'interpretazione delle immagini e il ragionamento basato sul testo.

  • I modelli Claude 4 sono descritti come validi nei compiti che coinvolgono grafici e diagrammi.
  • I modelli senza un fine-tuning cross-modale dedicato possono rilevare correttamente le caratteristiche visive, ma risultano carenti quando devono collegarle al linguaggio o alla logica finanziaria.

La strategia di fine-tuning di un modello influisce sulla sua capacità di fondere segnali testuali e visivi durante l'analisi.

Capacità di gestione del contesto

I campioni finanziari contengono spesso più elementi che devono essere letti insieme, come grafici in più parti o descrizioni lunghe.

  • I modelli con finestre di contesto più ampie possono mantenere le relazioni tra input lunghi.
  • I modelli più limitati possono perdere dipendenze, riducendo l'accuratezza nei compiti che richiedono di seguire più componenti visive e testuali.

La dimensione della finestra di contesto influenza la capacità del modello di mantenere l'allineamento tra dettagli quantitativi e visivi.

Dimensioni del modello e priorità di efficienza

Alcuni modelli sono progettati deliberatamente per una distribuzione leggera piuttosto che per un ragionamento ad alta complessità.

  • Phi-4 multimodal e modelli simili danno priorità all'efficienza, limitando la profondità dell'elaborazione multimodale.
  • I modelli più grandi mantengono una maggiore capacità per i compiti di ragionamento che richiedono una comprensione dettagliata dei grafici.

Questo compromesso si traduce in punteggi più bassi per i modelli più piccoli.

Differenze nella comprensione visiva

La valutazione include compiti che richiedono una lettura accurata dei grafici, l'identificazione di oggetti all'interno di documenti finanziari e l'estrazione di dettagli visivi.

  • I modelli con pipeline visive avanzate, come le varianti Qwen 2.5-VL, gestiscono questi compiti in modo più efficace.
  • Altri possono gestire bene le immagini generiche, ma risultano incoerenti con gli elementi visivi finanziari strutturati.

La forza del ragionamento visivo influisce fortemente sui risultati nei campioni in stile FinMME.

Caratteristiche del dataset di valutazione

Il dataset si concentra sul ragionamento finanziario multimodale piuttosto che su compiti generici.

  • I modelli addestrati o sottoposti a fine-tuning per compiti finanziari, numerici o basati su grafici ottengono risultati migliori.
  • I modelli generalisti senza esposizione al dominio mostrano una precisione inferiore sui dataset finanziari.

La specializzazione del dataset rende le prestazioni più sensibili alla qualità del ragionamento cross-modale.

Cosa sono i grandi modelli multimodali open source?

LMM open source con il loro numero di stelle GitHub:

Il grafico mostra che la popolarità su GitHub di vari LMM open source è in aumento, con alcuni modelli che registrano un'adozione rapida subito dopo il rilascio.

Janus-Series di DeepSeek ha guadagnato migliaia di stelle GitHub entro pochi giorni dal rilascio di Janus-Pro il 27 gennaio 2025, superando i suoi concorrenti, che hanno impiegato mesi per raggiungere numeri simili. Questa rapida ascesa è dovuta al successo di Janus-Pro ed è stata influenzata dallo slancio creato da DeepSeek-R1.

  1. Gemma 3 di Google: Gemma 3 è una famiglia di modelli open source leggeri e all'avanguardia derivati dalla tecnologia Gemini 2.0. Questi modelli offrono capacità avanzate di ragionamento visivo e testuale, una finestra di contesto da 128k token, supporto per function calling e versioni quantizzate per prestazioni ottimizzate. Include ShieldGemma 2 per la sicurezza delle immagini e supporta diversi strumenti e opzioni di distribuzione.1
  2. Janus-Pro di DeepSeek: Janus-Pro è una versione avanzata del modello Janus, progettata sia per comprendere sia per generare testo e immagini. Presenta una strategia di addestramento ottimizzata, dati di addestramento ampliati e una dimensione del modello maggiore, migliorandone le capacità multimodali.2
  3. Qwen2.5-VL di Alibaba: Qwen2.5-VL di Alibaba è un'estensione multimodale del modello linguistico Qwen2.5, progettato sia per la comprensione del testo sia delle immagini. Vanta un pre-addestramento su larga scala (fino a 18T token), una finestra di contesto estesa (fino a 128K token), una migliore capacità di seguire le istruzioni e un solido supporto multilingue, che lo rendono adatto a compiti come la generazione di didascalie per immagini e il visual question answering. 3
    • Sulla base della serie Qwen2.5-VL, Alibaba ha ottimizzato e reso open source Qwen2.5-VL-32B-Instruct, un modello VL da 32B che incorpora una comprensione e un ragionamento delle immagini più dettagliati. Ciò si traduce in prestazioni migliori e analisi dettagliate in compiti come l'analisi delle immagini, il riconoscimento dei contenuti e la deduzione logica visiva.4
  4. CLIP (Contrastive Language–Image Pretraining) di OpenAI: CLIP è progettato per comprendere le immagini nel contesto del linguaggio naturale. Può eseguire compiti come la classificazione zero-shot delle immagini, classificando accuratamente immagini anche in categorie per cui non è stato esplicitamente addestrato, comprendendo le descrizioni testuali.5
    • Sulla base della serie Qwen2.5-VL, Alibaba ha ottimizzato e reso open source Qwen2.5-VL-32B-Instruct, un modello VL da 32B che incorpora una comprensione e un ragionamento delle immagini più dettagliati. Ciò si traduce in prestazioni migliori e analisi dettagliate in compiti come l'analisi delle immagini, il riconoscimento dei contenuti e la deduzione logica visiva.4
  5. Flamingo di DeepMind: Flamingo è progettato per sfruttare i punti di forza della comprensione linguistica e visiva, rendendolo capace di eseguire compiti che richiedono l'interpretazione e l'integrazione di informazioni provenienti da testo e immagini.6

Figura 1: Un esempio tratto da Chip Huyen7

Quali sono i principali LMM?

Funzionalità UI e API degli LLM generici

I fornitori sono selezionati tra i più popolari LLM multimodali in base a comparabilità, disponibilità dei dati e tempestività.

LMM con il loro prezzo per token:

Per selezionare il modello più adatto, considera fattori come il budget, le capacità e il livello di prestazioni richiesti e il volume previsto di token di input/output necessari per il tuo caso d'uso specifico.

Scopri di più sui prezzi degli LLM.

Quali sono gli ultimi progressi nei modelli multimodali?

I recenti progressi nei modelli multimodali hanno introdotto nuove capacità ed efficienze nello sviluppo dell'IA.

Modelli di fondazione multimodali video-first

I modelli di fondazione multimodali video-first stanno andando oltre la generazione di didascalie o riassunti di alto livello e stanno invece imparando a localizzare esplicitamente le prove all'interno dei video.

Invece di dire cosa accade, possono identificare quando accade (timestamp) e dove accade (bounding box attorno a oggetti o regioni).

Questo spostamento verso l'ancoraggio spazio-temporale rende la comprensione video più precisa e verificabile. Consente inoltre compiti come trovare momenti esatti, tracciare oggetti, modificare video usando il linguaggio naturale e supportare la robotica e i sistemi critici per la sicurezza.

Ad esempio, Vidi8 è un progetto open source di ByteDance incentrato su grandi modelli multimodali per la comprensione e l'editing video.

Il repository ospita il codice e le risorse per una famiglia di modelli (ad es. Vidi-7B, Vidi1.5-9B, Vidi2 e Vidi2.5) che accettano visione, audio e testo come input per eseguire compiti come:

  • Recupero temporale (individuare i segmenti temporali in un video che corrispondono a una query testuale)
  • Ancoraggio spazio-temporale (individuare gli oggetti con bounding box)
  • Video question answering

Rilascio frontier multimodale Mistral 3

Mistral IA ha sviluppato una nuova famiglia di modelli di IA open source chiamata Mistral 3. La suite Mistral 3 comprende sia modelli multimodali/multilingue di livello frontier sia modelli più piccoli ed efficienti progettati per essere eseguiti su una vasta gamma di dispositivi, dal cloud all'edge, e persino su singole GPU.

Rilasciati sotto una licenza open source permissiva (Apache 2.0), questi modelli mirano a democratizzare l'accesso all'IA avanzata, consentire la personalizzazione e la flessibilità di distribuzione e rafforzare la posizione dell'Europa nello sviluppo dell'IA, dove si teme un ritardo rispetto a Stati Uniti e Cina nelle tecnologie all'avanguardia.9

Modelli visione-linguaggio MoE open source

Kimi-VL (di Moonshot IA) è un modello visione-linguaggio multimodale open source costruito con un'architettura Mixture-of-Experts (MoE), efficace in compiti che combinano testo, immagini e video mantenendo un calcolo efficiente.

Ha una backbone con un totale di 16 B parametri, ma in genere attiva circa 2.8 B parametri durante l'inference, il che aiuta a bilanciare capacità e costi.

Kimi-VL è progettato per il ragionamento multimodale avanzato, la comprensione di contesti lunghi (fino a circa 128 K token) e le interazioni in stile agente, e compete bene con modelli più grandi su benchmark come la comprensione video, il riconoscimento ottico dei caratteri (OCR), il ragionamento matematico e i compiti multi-immagine.

Varianti come Kimi-VL-A3B-Thinking sono ulteriormente ottimizzate per compiti di chain-of-thought e ragionamento, mentre l'encoder visivo MoonViT supporta la comprensione di input ad alta risoluzione.

Figura 2: design dell'architettura Kimi-VL.10

Serie Claude 4 di Anthropic

La serie Claude 4 di Anthropic integra una comprensione visiva avanzata con il suo motore di ragionamento basato sul testo, incorporando la visione direttamente nei flussi di lavoro di problem solving.

I modelli Claude 4 dimostrano prestazioni elevate su benchmark di ragionamento multimodale come MMMU, in particolare nell'interpretazione di grafici, diagrammi e dati visivi complessi. Una caratteristica distintiva di Claude Opus 4.1 è la capacità di valutare le qualità estetiche delle immagini, andando oltre il riconoscimento verso valutazioni più sfumate.

Queste capacità, combinate con le funzioni agentiche di Claude, rendono la serie efficace per compiti come sintetizzare ricerche da report con testo ed elementi visivi misti o assistere nella progettazione di interfacce tramite l'analisi di mockup visivi.

Google Gemini 3

Google ha rilasciato Gemini 3 a novembre 2025, con Gemini 3 Pro disponibile immediatamente e la modalità Gemini 3 Deep Think in distribuzione poco dopo per gli abbonati a Google IA Ultra. Gemini 3 è posizionato da Google come il suo modello multimodale più intelligente e capace, con supporto nativo per testo, immagini, video, audio e codice in un'unica architettura.

Gemini 3 Pro viene fornito con una finestra di contesto da 1 milione di token e ottiene ottimi risultati su benchmark multimodali, tra cui 81% su MMMU-Pro e 87.6% su Video-MMMU. Ha raggiunto la vetta della classifica LMArena al momento del rilascio con un punteggio di 1501 Elo, ottenendo 91.9% su GPQA Diamond per il ragionamento di livello universitario e 76.2% su SWE-bench Verified per compiti di codifica agentica.

Gemini 3 Deep Think è una modalità di ragionamento avanzata che migliora ulteriormente le prestazioni nei compiti più impegnativi, ottenendo 41.0% su Humanity's Last Exam (senza strumenti) e 45.1% su ARC-AGI-2. Accanto a Gemini 3, Google ha rilasciato anche Google Antigravity, una piattaforma di sviluppo agentico che abbina Gemini 3 al modello Gemini 2.5 Computer Use per il controllo del browser e al modello di modifica delle immagini Nano Banana, consentendo flussi di lavoro di sviluppo software end-to-end in cui il modello può pianificare, programmare e convalidare i compiti in autonomia.11

GPT-5 di OpenAI

GPT-5 introduce una multimodalità nativa avanzata tra testo, voce, immagini e video. A differenza dei sistemi precedenti che dipendevano fortemente dai plugin, GPT-5 integra queste modalità in un'architettura unificata, con interazioni più fluide. Il modello si adatta in modo flessibile a vari tipi di input e può passare dall'uno all'altro.

Una caratteristica degna di nota è la Real-time Voice Mode, che può regolare tono, ritmo e stile in base alle istruzioni dell'utente. Questo crea un'esperienza conversazionale più naturale e adattiva. Anche l'elaborazione visiva è migliorata, riducendo le allucinazioni nell'interpretare o generare immagini, diagrammi e grafici. Un altro progresso risiede nelle capacità di memoria, che consentono al sistema di richiamare input precedenti e mantenere il contesto durante interazioni prolungate.

Questi miglioramenti rendono GPT-5 particolarmente prezioso per le interfacce multimodali accessibili, soprattutto per le persone con disabilità sensoriali.

Modelli multimodali di Google DeepMind incentrati sulla robotica

Google DeepMind ha sviluppato Gemini Robotics e Gemini Robotics-ER, modelli pensati per integrare visione, linguaggio e azione nei sistemi robotici. Questi modelli consentono ai robot di svolgere compiti in ambienti non strutturati, come piegare la carta o svitare tappi di bottiglia.

Una caratteristica fondamentale di questi modelli è il loro meccanismo di sicurezza. Prima di eseguire le azioni, il sistema esegue controlli integrati per ridurre al minimo i rischi e garantire una gestione adeguata dei compiti. Questo approccio affronta una delle principali sfide della robotica: collegare il ragionamento avanzato dell'IA a un'esecuzione sicura e affidabile nel mondo reale.

Llama 4 Scout e Llama 4 Maverick di Meta IA

Llama 4 Scout è un modello multimodale con 17 miliardi di parametri attivi e 16 esperti. Questo modello supera i modelli Llama della generazione precedente ed è progettato per funzionare su una singola H100 GPU. Dispone di una finestra di contesto da 10 milioni di token per elaborare grandi quantità di informazioni. I risultati dei benchmark indicano che Llama 4 Scout ottiene risultati migliori di Gemma 3, Gemini 2.0 Flash-Lite e Mistral 3.1 in una serie di benchmark ampiamente diffusi.

Llama 4 Maverick è un modello multimodale con 17 miliardi di parametri attivi e 128 esperti. Questo modello è presentato come uno dei migliori della sua categoria, superando GPT-4o e Gemini 2.0 Flash in una serie di benchmark. Raggiunge prestazioni paragonabili a DeepSeek v3 nel ragionamento e nella programmazione, usando meno parametri attivi. Una versione chat sperimentale di Llama 4 Maverick ha ottenuto un punteggio ELO di 1417 sulla piattaforma LMArena.

Generazione di immagini 4o di OpenAI

Il più recente modello di generazione di immagini di OpenAI, integrato in GPT-4o, unisce la creazione di testo e immagini in un sistema unificato. Questa capacità multimodale consente a GPT-4 di generare immagini attingendo alle proprie conoscenze testuali e al contesto della chat, creando un'interazione tra linguaggio e immagini.

Attraverso la generazione multi-turno, gli utenti possono perfezionare le immagini in modo conversazionale, come mostrato nelle figure seguenti. Il modello si basa su precedenti input testuali e immagini caricate per mantenere la coerenza. Analizzando gli elementi visivi forniti dall'utente e apprendendo nel contesto, GPT-4o si adatta a dettagli specifici, migliorando la capacità di produrre immagini consapevoli del contesto.

Figura 3: Richiesta di creare un disegno usando riferimenti e istruzioni sulle caratteristiche testuali per l'immagine.

Figura 4: Richiesta di creare una foto dal disegno e di inserirla in una scena.12

Qwen3-VL di Alibaba

La serie Qwen3-VL di Alibaba, rilasciata a partire da settembre 2025, si basa sul modello linguistico Qwen3 aggiungendo capacità più profonde di percezione visiva e ragionamento. La famiglia comprende varianti dense da 2B a 32B parametri e varianti Mixture-of-Experts fino a 235B parametri totali (22B attivi), tutte rilasciate sotto licenza Apache 2.0.

Tra le caratteristiche principali figurano una finestra di contesto nativa da 256K (espandibile a 1 milione di token), un OCR multilingue esteso a 32 lingue, l'ancoraggio di oggetti 2D e 3D per il ragionamento spaziale e l'IA incarnata, la comprensione di video lunghi con indicizzazione al secondo e capacità di agente visivo per il controllo delle GUI.

Le varianti Thinking sono ottimizzate per lo STEM e il ragionamento multimodale, mentre le varianti Instruct sono destinate a compiti generali di visione-linguaggio come l'analisi dei documenti, l'estrazione di grafici e il visual question answering.

Gemma 3 di Google

Gemma 3 di Google si basa sulla tecnologia dei modelli Gemini 2.0. È disponibile in quattro dimensioni (1B, 4B, 12B e 27B) per diverse esigenze hardware e offre una finestra di contesto da 128k token. Gemma 3 funziona bene su configurazioni con un singolo acceleratore e include ragionamento testuale e visivo, function calling e supporto per oltre 35 lingue, con pre-addestramento per più di 140. Le versioni quantizzate riducono le dimensioni del modello e le esigenze di calcolo. Il sistema ShieldGemma 2 fornisce la classificazione della sicurezza dei contenuti.

Phi-4-multimodal di Microsoft

Phi-4-multimodal di Microsoft è un modello da 5.6B parametri che elabora voce, visione e testo in un'architettura unificata. Utilizza l'apprendimento cross-modale per interazioni consapevoli del contesto tra diversi tipi di input. Il modello gestisce più formati di input senza richiedere sistemi di elaborazione separati ed è progettato per la distribuzione su dispositivo e l'edge computing. Le applicazioni includono IA per smartphone, sistemi automobilistici e servizi multilingue.

Che cos'è un grande modello multimodale (LMM)?

Un grande modello multimodale è un tipo avanzato di modello di intelligenza artificiale in grado di elaborare e comprendere più tipi di modalità di dati. Questi dati multimodali possono includere testo, immagini, audio, video e potenzialmente altri. La caratteristica principale di un modello multimodale è la capacità di integrare e interpretare informazioni provenienti da queste diverse fonti di dati, spesso simultaneamente.

Questi possono essere considerati versioni più avanzate dei modelli linguistici di grandi dimensioni (LLM) in grado di lavorare con il testo e anche con tipi di dati diversi. Inoltre, gli output dei modelli linguistici multimodali sono progettati per essere testuali, visivi, uditivi e così via.

I modelli linguistici multimodali sono considerati il passo successivo verso il raggiungimento dell'intelligenza artificiale generale.

Che cos'è un agente di IA multimodale?

Gli agenti di IA multimodali sono sistemi progettati per interagire con il mondo usando vari tipi di dati, tra cui immagini, video e testo, consentendo loro di operare sia in ambienti digitali sia fisici. I modelli multimodali sono la componente centrale di questi agenti, poiché permettono loro di percepire e comprendere informazioni da fonti diverse.

Ad esempio, modelli come Magma utilizzano la comprensione visivo-linguistica e l'intelligenza spaziale, ottenute tramite tecniche come Set-of-Mark e Trace-of-Mark durante il pre-addestramento su dataset multimodali.

Questo consente all'agente di svolgere compiti che vanno dalla comprensione dei contenuti video e dalla risposta alle domande alla navigazione nelle interfacce utente e al controllo dei robot, dimostrando le versatili capacità che i modelli multimodali apportano agli agenti di IA sfruttando diverse modalità di dati. L'illustrazione seguente mostra Magma che pianifica le traiettorie dei robot per portare a termine i compiti, mettendo in mostra la sua intelligenza spaziale in azione.13

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Qual è la differenza tra LMM e LLM?

1. Modalità dei dati

  • LMM: Sono progettati per comprendere ed elaborare più tipi di input di dati, o modalità. Includono testo, immagini, audio, video e talvolta altri tipi di dati come quelli sensoriali. La capacità chiave degli LMM è di integrare e dare un senso a questi diversi formati di dati, spesso simultaneamente.
  • LLM: Questi modelli sono specializzati nell'elaborazione e nella generazione di dati testuali. Sono addestrati principalmente su grandi corpora di testo e sono abili nel comprendere e generare il linguaggio umano in vari contesti. Non elaborano intrinsecamente dati non testuali come immagini o audio.

2. Applicazioni e compiti

  • LMM: Grazie alla loro natura multimodale, questi modelli possono essere applicati a compiti che richiedono la comprensione e l'integrazione di informazioni tra diversi tipi di dati. Ad esempio, un LMM potrebbe analizzare un articolo di notizie (testo), le fotografie allegate (immagini) e i videoclip correlati per ottenere una comprensione completa.
  • LLM: Le loro applicazioni sono incentrate su compiti che coinvolgono il testo, come scrivere articoli, tradurre lingue, rispondere a domande, riassumere documenti e creare contenuti testuali.

Quali sono le modalità di dati dei grandi modelli multimodali?

Testo

Sono incluse tutte le forme di contenuto scritto, come libri, articoli, pagine web e post sui social media. Il modello può comprendere, interpretare e generare contenuti testuali, compresi compiti di elaborazione del linguaggio naturale come traduzione, riassunto e risposta alle domande.

Immagini

Questi modelli possono analizzare e generare dati visivi. Ciò include la comprensione del contenuto e del contesto di fotografie, illustrazioni e altre rappresentazioni grafiche. Compiti come la classificazione delle immagini, il rilevamento degli oggetti e la generazione di immagini da descrizioni testuali rientrano in questa categoria.

Audio

Comprende registrazioni audio, musica e linguaggio parlato. I modelli possono essere addestrati a riconoscere il parlato, la musica, i suoni ambientali e altri input uditivi. Possono trascrivere il parlato, comprendere comandi vocali e persino generare voce o musica sintetica.

Video

Combinando elementi visivi e uditivi, l'elaborazione video implica la comprensione delle immagini in movimento e dei suoni associati. Può includere l'analisi dei contenuti video, il riconoscimento di azioni o eventi nei video e la generazione di clip video.

Sebbene la maggior parte degli attuali grandi modelli linguistici multimodali possa elaborare testo e immagini, la ricerca futura mira a includere input di dati audio e video.

Non perderti i nostri benchmark e approfondimenti basati sui dati. Il pulsante apre Google; selezionare AIMultiple conferma che desideri vedere AIMultiple più spesso nei risultati di ricerca di Google.
GoogleAggiungi come fonte preferita

Come vengono addestrati i grandi modelli multimodali?

L'addestramento dei grandi modelli multimodali (LMM) differisce in modo significativo dall'addestramento dei modelli linguistici di grandi dimensioni (LLM) per diversi aspetti chiave:

1. Raccolta e preparazione dei dati

  • LLM: Si concentrano su dati testuali provenienti da libri, siti web e fonti scritte, con un'enfasi sulla diversità linguistica per le fonti di dati di addestramento degli LLM.
  • LMM: Richiedono dati di testo, immagini, audio e video. La raccolta è più complessa a causa dei formati vari. L'annotazione dei dati e l'allineamento tra le modalità sono essenziali.

2. Progettazione dell'architettura del modello

  • LLM: Utilizzano architetture transformer ottimizzate per l'elaborazione sequenziale del testo.
  • LMM: Impiegano architetture più complesse che integrano più tipi di reti neurali (CNN per le immagini, transformer per il testo) con meccanismi per collegare queste modalità.

3. Pre-addestramento

  • LLM: Si pre-addestrano su corpora di testo usando tecniche come il masked language modeling.
  • LMM: Si pre-addestrano su più tipi di dati, imparando a correlare il testo con le immagini o a comprendere sequenze video.

4. Fine-tuning

  • LLM: Fine-tuning su dataset testuali specializzati per compiti specifici.
  • LMM: Richiedono un fine-tuning sia su dataset specifici per modalità sia su dataset cross-modali per stabilire relazioni tra diversi tipi di dati.

5. Valutazione e iterazione

  • LLM: Le metriche di valutazione si concentrano su compiti di comprensione e generazione del linguaggio, tra cui fluidità, coerenza e pertinenza.
  • LMM: Valutati su metriche più ampie che coprono il riconoscimento delle immagini, l'elaborazione audio e le capacità di integrazione cross-modale.

Come funzionano gli LMM?

I grandi modelli multimodali condividono somiglianze con i modelli linguistici di grandi dimensioni nel processo di addestramento, nel design e nel funzionamento. Utilizzano la stessa architettura transformer e le stesse strategie di addestramento. I grandi modelli multimodali sono addestrati su:

  • Dati testuali
  • Milioni o miliardi di immagini con descrizioni testuali
  • Clip video
  • Frammenti audio
  • Altri dati di input, come il codice

Questo addestramento comporta l'apprendimento simultaneo di più modalità di dati, consentendo al modello di:

  • Riconoscere la foto di un gatto
  • Identificare una parola in una clip audio
  • Comprendere concetti e dettagli sensoriali oltre il testo

In questo modo, gli utenti possono caricare:

  • Un'immagine per:
    • Ottenere una descrizione di ciò che sta accadendo
    • Usare l'immagine come parte di un prompt per generare testo o immagini
    • Porre domande di follow-up su elementi specifici dell'immagine
    • Tradurre il testo dell'immagine in una lingua diversa (ad es. Menu)

Figura 5: Caricamento dell'immagine di un gatto su ChatGPT per descriverlo.

  • Grafici e diagrammi per:
    • Porre domande di follow-up complesse su ciò che mostrano
  • Mockup di design per:
    • Ottenere il codice HTML e CSS necessario per realizzarlo.

Figura 6: Richiesta dell'immagine in stile film di Wes Anderson. ChatGPT inserisce il prompt in un modello di generazione di immagini (come DALL·E), che interpreta la richiesta e produce l'immagine stilizzata.

Dopo il processo di addestramento, i modelli potrebbero incorporare stereotipi dannosi e idee tossiche. Per perfezionarli, si possono usare tecniche come:

  • Apprendimento per rinforzo con feedback umano (RLHF)
  • Modelli di IA di supervisione
  • Red teaming (testare la robustezza del modello).

Inoltre, gli strumenti di governance dell'IA e gli strumenti di IA responsabile, che funzionano come soluzioni di conformità dell'IA, possono anche consentire l'ottimizzazione dell'inventario di IA, contribuendo a prevenire i bias dell'IA e altri dilemmi etici. Ecco un esempio di come questi strumenti affrontano le preoccupazioni relative al copyright dell'IA generativa:

Figura 7: ChatGPT rifiuta la mia richiesta a causa delle linee guida sui contenuti per proteggere i diritti d'autore.

L'obiettivo è sviluppare un sistema multimodale funzionale in grado di gestire:

  • Sintesi testo-immagine
  • Generazione di didascalie per immagini
  • Recupero di immagini basato su testo
  • Visual question answering.

In questo modo, l'IA multimodale può integrare varie modalità, offrendo capacità avanzate per compiti che coinvolgono sia il linguaggio sia la visione.

Quali sono i limiti dei modelli linguistici di grandi dimensioni?

  1. Requisiti di dati e bias: Questi modelli richiedono dataset enormi e diversificati per l'addestramento. Tuttavia, la disponibilità e la qualità di tali dataset possono rappresentare una sfida. Inoltre, se i dati di addestramento contengono bias, è probabile che il modello li erediti e possibilmente li amplifichi, portando a risultati ingiusti o non etici.
  2. Risorse computazionali: L'addestramento e l'esecuzione di grandi modelli multimodali richiedono risorse computazionali significative, rendendoli costosi e meno accessibili per organizzazioni più piccole o ricercatori indipendenti.
  3. Interpretabilità e spiegabilità: Come per i modelli di IA complessi, capire come prendono le decisioni può essere difficile. Questa mancanza di trasparenza può essere un problema critico, soprattutto in applicazioni sensibili come la sanità o le forze dell'ordine.
  4. Integrazione delle modalità: Integrare efficacemente diversi tipi di dati (come testo, immagini e audio) in modo da comprendere davvero le sfumature di ciascuna modalità è estremamente difficile. Il modello potrebbe non cogliere sempre con precisione il contesto o le sottigliezze della comunicazione umana che derivano dalla combinazione di queste modalità.
  5. Generalizzazione e overfitting: Sebbene questi modelli siano addestrati su vasti dataset, potrebbero avere difficoltà a generalizzare su dati nuovi e mai visti o su scenari che differiscono in modo significativo dai dati di addestramento. Al contrario, potrebbero fare overfit sui dati di addestramento, catturando rumore e anomalie come pattern.

Per saperne di più, esplora le sfide e i rischi associati ai modelli generativi e linguistici.

Metodologia di benchmark per gli LMM

Abbiamo valutato le prestazioni dei grandi modelli multimodali (LMM) utilizzando un sottoinsieme del dataset FinMME14 , un benchmark completo progettato per valutare le capacità di ragionamento multimodale finanziario. FinMME comprende oltre 11.000 campioni finanziari di alta qualità in 18 domini finanziari e 6 classi di attività, fornendo un framework solido per la valutazione degli LMM nel dominio finanziario.

Per questo benchmark, abbiamo utilizzato una selezione curata di 100 campioni del dataset FinMME per analizzare la capacità dei modelli di elaborare e ragionare con dati finanziari multimodali.

Avvertenza

Questa valutazione ha utilizzato un sottoinsieme curato di 100 campioni provenienti da un dataset più ampio per valutare gli LMM. Per una valutazione completa delle prestazioni del modello, devono essere considerati tutti i campioni del dataset di benchmark completo.

Conclusione

I grandi modelli multimodali (LMM) stanno integrando tipi di dati diversi, come testo, immagini, audio e video, superando così le capacità basate sul testo dei modelli linguistici di grandi dimensioni (LLM). Con progressi come Llama 4 di Meta IA, GPT-4o di OpenAI e Qwen2.5-VL di Alibaba, gli LMM consentono applicazioni più ricche, dal ragionamento visivo alla generazione di immagini consapevole del contesto.

Tuttavia, la loro complessità, le elevate esigenze computazionali e le sfide legate all'integrazione dei dati e alla mitigazione dei bias rimangono ostacoli. Man mano che gli LMM si evolvono, aprono la strada ad agenti di IA più versatili, avvicinandoci all'intelligenza artificiale generale. Per organizzazioni e ricercatori, la scelta del modello giusto implica il raggiungimento di un equilibrio tra prestazioni, costi ed esigenze specifiche del caso d'uso.

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Cem Dilmegani (2026) - "Grandi modelli multimodali (LMM) vs LLMs". Pubblicato online su AIMultiple.com. Consultato il 22 Maggio 2026, da: https://aimultiple.com/large-multimodal-models [Risorsa online]

Dilmegani, C. (2026, 22 Maggio). Grandi modelli multimodali (LMM) vs LLMs. AIMultiple. https://aimultiple.com/large-multimodal-models

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{Grandi modelli multimodali (LMM) vs LLMs}},
  year   = {2026},
  month  = may,
  howpublished    = {\url{https://aimultiple.com/large-multimodal-models}},
  note   = {AIMultiple. Consultato il 22 Maggio 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista principale
Cem è l'analista principale di AIMultiple dal 2017. AIMultiple informa centinaia di migliaia di aziende (secondo SimilarWeb) compreso il 60% delle Fortune 500 ogni mese.

Il lavoro di Cem è stato citato da importanti pubblicazioni globali tra cui Business Insider, Forbes, Washington Post, aziende globali come Deloitte, HPE e ONG come il World Economic Forum e organizzazioni sovranazionali come la Commissione europea.

Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente di tecnologia e imprenditore tecnologico. Ha consigliato aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per oltre un decennio. Ha anche pubblicato un rapporto McKinsey sulla digitalizzazione.

Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha anche guidato la crescita commerciale dell'azienda deep tech Hypatos che ha raggiunto un fatturato annuo ricorrente a 7 cifre e una valutazione a 9 cifre partendo da 0 in 2 anni. Il lavoro di Cem in Hypatos è stato trattato da importanti pubblicazioni tecnologiche come TechCrunch e Business Insider.

Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato in ingegneria informatica all'Università Bogazici e ha conseguito un MBA presso la Columbia Business School.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450