Servizi
Contattaci
Confronto delle Funzionalità

Confronto tra 9 Large Language Models in ambito sanitario

Cem Dilmegani
Cem Dilmegani
aggiornato il 21 mag. 2026

Abbiamo sottoposto a benchmark 9 LLM utilizzando il dataset MedQA, un benchmark di esami clinici a livello universitario derivato dalle domande USMLE. Ogni modello ha risposto agli stessi scenari clinici a scelta multipla utilizzando un prompt standardizzato, consentendo un confronto diretto dell'accuratezza.

Abbiamo anche registrato la latenza per domanda dividendo il tempo di esecuzione totale per il numero di item MedQA completati.

Risultati del benchmark degli LLM in ambito sanitario

Loading Chart

Metodologia del benchmark: Questo benchmark valuta le prestazioni di fine-tuning supervisionato degli LLM in ambito sanitario rispetto a grandi modelli generici (GPT-4) su compiti di risposta a domande mediche (medical question-answering). Vedi fonti dati del benchmark.

MedQA: Domande d'esame medico a scelta multipla basate sullo United States Medical Licensing Examination.

Figura 1: Esempio di domanda clinica a scelta multipla in stile USMLE.

MedMCQA: Dataset su larga scala di risposta a domande a scelta multipla (MCQA) progettato per affrontare domande reali di esami di ammissione in medicina.

Figura 2: Una domanda a scelta multipla su larga scala per l'esame di ammissione in medicina che richiede al modello di selezionare la risposta corretta e interpretare le spiegazioni associate sui risultati clinici.

PubMedQA: Benchmark di risposta a domande biomediche con risposte sì/no/forse.

Figura 3: Una domanda biomedica sì/no/forse, in cui il modello deve giudicare la correttezza di un'affermazione clinica utilizzando il contesto dello studio fornito.

Esempi di LLM in ambito sanitario

Tipo BERT (Solo encoder)

Ottimizzati per codificare e rappresentare il testo biomedico, questi modelli eccellono nell'estrarre caratteristiche per compiti come la classificazione.

Tipo ChatGPT / LLaMA (Decoder, ottimizzati per istruzioni/chat)

Basati su architetture in stile LLaMA e ottimizzati per compiti interattivi e dialoghi clinici.

Tipo GPT / PaLM (Solo decoder, generativi)

Costruiti in modo simile a GPT-3 o PaLM, questi modelli sono sottoposti a fine-tuning per la generazione di testo generico e il riassunto.

LLM generici in ambito sanitario

*Llama 3.1 Instruct Turbo con 405B parametri. Vedi metodologia del benchmark.

Punti chiave:

  • o1: Modello con le migliori prestazioni
  • 03 mini: Migliore opzione economica
  • GPT 4.1: Migliore velocità e tempo di risposta

Oltre all'accuratezza e al costo di input, i modelli differiscono anche nei loro approcci sottostanti al question-answering medico. Ad esempio, o3 utilizza un approccio più graduale e analitico, mentre GPT-5 risponde in modo empatico, organizza e spiega le informazioni in modo chiaro per i non esperti:

Figura 4: Figura che mostra le differenze tra le risposte di GPT-5 e o3.

Fine-tuning degli LLM medici

Le prestazioni del ChatGPT predefinito (modello 4o) vengono confrontate con l'assistente esistente "Clinical Medicine Handbook". A entrambi i modelli viene fornito lo stesso prompt e le loro risposte vengono analizzate:

GPT 4o

Figura 5: La figura mostra che la risposta del modello predefinito GPT 4o è accurata ma anche molto riassuntiva.1

LLM medico sottoposto a fine-tuning

Figura 6: La figura mostra che la risposta dell'agente specializzato è spiegata meglio e più dettagliata.2

Leggi LLM fine-tuning e LLM training per saperne di più.

Applicazioni degli LLM generici

Questi modelli sono modelli generici sottoposti a fine-tuning che richiedono adattamento al dominio per eseguire compiti clinici in modo accurato. Puoi utilizzare questi modelli in ambito sanitario sfruttando:

  • Pretraining continuo su dati medici per aiutare il modello a riconoscere meglio il linguaggio medico esponendolo a note cliniche e letteratura biomedica (come PubMed).
  • RAG per estrarre dati da documenti clinici verificati al fine di produrre risposte accurate in fase di esecuzione.
  • Fine-tuning su istruzioni per consentire al modello di imparare a rispondere a domande cliniche o estrarre sintomi dal testo.

Figura 7: Un flusso di lavoro generale del fine-tuning degli LLM per casi d'uso specializzati.

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Casi d'uso degli LLM in ambito clinico

1. Trascrizione medica

Gli LLM possono aiutare a creare trascrizioni mediche:

  • Ascoltando il dialogo naturale tra un paziente e un clinico.
  • Estraendo dettagli medici critici.
  • Condensando i dati medici in registrazioni cliniche conformi che si allineano con le sezioni pertinenti di una cartella clinica elettronica (EHR).

Esempio reale: MedLM di Google può catturare e trasformare la conversazione paziente-clinico in trascrizione medica.9

2. Miglioramento delle cartelle cliniche elettroniche (EHR)

L'uso diffuso delle cartelle cliniche elettroniche (EHR) ha generato enormi quantità di dati dei pazienti che, se utilizzati in modo efficace, possono migliorare significativamente l'assistenza sanitaria.

Ad esempio, l'analisi dei dati EHR può aiutare i clinici a prendere decisioni migliori rivelando schemi nelle diagnosi, nei trattamenti e negli esiti. Può anche supportare una diagnosi precoce delle malattie e cure più personalizzate identificando i fattori di rischio e adattando i trattamenti ai singoli pazienti.

A livello di sistema, i dati EHR possono migliorare l'efficienza riducendo gli esami ridondanti, evidenziando le lacune assistenziali e informando politiche che migliorano la qualità e riducono i costi.

Esempio reale: MedLM di Google è utilizzato da BenchSci, Accenture e Deloitte per migliorare le cartelle cliniche elettroniche (EHR).

  • BenchSci ha integrato MedLM nella sua piattaforma ASCEND per migliorare la qualità della ricerca preclinica.
  • Accenture utilizza MedLM per organizzare dati non strutturati da fonti multiple, automatizzando operazioni manuali precedentemente dispendiose in termini di tempo e soggette a errori.
  • Deloitte collabora con MedLM per ridurre al minimo gli attriti nella ricerca del trattamento. Utilizzano un chatbot interattivo che aiuta i partecipanti ai piani sanitari a comprendere meglio le alternative dei fornitori.10

3. Supporto alle decisioni cliniche

Gli LLM aiutano i clinici a interpretare le informazioni specifiche del paziente incluse nelle attuali evidenze mediche, facendo emergere considerazioni rilevanti durante la diagnosi o la pianificazione del trattamento senza sostituire il giudizio clinico.

Esempio reale: MedGemma (Google DeepMind) è una raccolta di modelli medici a pesi aperti costruiti sull'architettura Gemma 3 di Google. Piuttosto che funzionare come strumento diagnostico diretto al consumatore, MedGemma funge da base per gli sviluppatori per creare applicazioni mediche destinate ai clinici.

Progettato sia per l'analisi di testi medici che di immagini, MedGemma può interpretare immagini mediche complesse, tra cui radiografie toraciche, risonanze magnetiche e TAC. Supporta anche compiti di ragionamento clinico, come il riassunto delle note dei pazienti o la risposta a domande in stile esame di abilitazione medica.

Secondo una revisione di un radiologo cardiotoracico certificato negli Stati Uniti, 81% dei referti di radiografie toraciche di MedGemma porterebbe a decisioni di gestione del paziente simili a quelle basate sui referti originali del radiologo (vedi il grafico sottostante).

Figura 8: Il grafico mostra quanto spesso i referti di radiografie toraciche generati dall'IA e i referti originali del radiologo portino a esiti clinici simili o diversi nei casi normali, anormali e in tutti i casi.11

4. Assistenza alla ricerca medica

Nella ricerca medica, il valore fondamentale degli LLM risiede nella loro capacità di accelerare la revisione e la sintesi della letteratura.

Piuttosto che riassumere articoli, gli LLM aiutano i ricercatori a tenere il passo con la letteratura biomedica in rapida espansione identificando studi pertinenti, estraendo risultati chiave e sintetizzando approfondimenti da fonti multiple.

Esempio reale: Il chatbot sanitario di John Snow aiuta i ricercatori a trovare articoli scientifici pertinenti, estrarre approfondimenti chiave e identificare tendenze di ricerca. È particolarmente utile per navigare nella vasta quantità di letteratura biomedica.12

5. Comunicazione automatizzata con i pazienti

I large language models in ambito sanitario possono redigere risposte informative e compassionevoli alle domande dei pazienti. Alcuni esempi includono:

  • Gestione dei farmaci e promemoria: Un chatbot fornisce ai pazienti promemoria regolari per assumere i farmaci per il diabete e richiede conferma.
  • Monitoraggio della salute e cure di follow-up: Un paziente post-operatorio invia il proprio stato di dolore e ferita a un chatbot, che determina se il processo di guarigione sta progredendo.
  • Comunicazione informativa ed educativa: Un paziente chiede a un chatbot come gestire la pressione alta e il chatbot risponde con consigli su nutrizione e stile di vita. 

Esempio reale: ChatGPT Health consente agli utenti di connettere in modo sicuro le proprie cartelle cliniche e i dati sul benessere (ad es., Apple Health o MyFitnessPal). Gli utenti possono quindi porre a ChatGPT domande sui propri dati, come "Come sta andando il mio colesterolo?" o "Riassumi i miei ultimi risultati di laboratorio."13

Esempio reale: Il Boston Children's Hospital utilizza Buoy Health, un chatbot online basato sull'IA per il controllo dei sintomi, che fornisce ai pazienti risposte immediate a domande relative alla salute e consulenze iniziali.

Il chatbot può fare triage dei pazienti analizzando i loro sintomi e consigliando se hanno bisogno di consultare un medico.14

6. Previsione degli esiti sanitari

Gli LLM possono essere utilizzati per consentire la stratificazione del rischio e la previsione in ambito sanitario. Supportando l'analisi di dati clinici strutturati e non strutturati, gli LLM possono aiutare a identificare i pazienti a rischio elevato (come la riammissione ospedaliera) e supportare una pianificazione proattiva delle cure, spesso in combinazione con modelli predittivi tradizionali.

Esempio reale: I farmacisti della WVU utilizzano un algoritmo predittivo per determinare il rischio di riammissione. Questo approccio esamina i dati delle cartelle cliniche elettroniche (EHR), che includono dati demografici dei pazienti, anamnesi clinica e determinanti socioeconomici della salute. 

Sulla base di questa ricerca, i farmacisti della WVU identificano i pazienti ad alto rischio di riammissione e assegnano coordinatori assistenziali per seguirli dopo la dimissione. Ciò può contribuire a ridurre i tassi di riammissione.15

7. Piani di trattamento personalizzati

Integrando anamnesi medica, sintomi e dati sanitari longitudinali, gli LLM possono aiutare a tradurre informazioni complesse sui pazienti in considerazioni assistenziali individualizzate, supportando discussioni terapeutiche più personalizzate e consapevoli del contesto tra clinici e pazienti.

Esempio reale: Il chatbot IA di Babylon Health fornisce raccomandazioni sanitarie personalizzate in base ai sintomi e all'anamnesi medica dell'utente. Coinvolge gli utenti in una conversazione ponendo domande pertinenti per analizzare meglio i loro problemi e fornendo raccomandazioni su misura.16

8. Codifica medica e fatturazione

I large language models possono automatizzare i processi di audit analizzando le cartelle cliniche dei pazienti e le EHR. 

Esempio reale: Epic Systems, un fornitore di EHR, integra gli LLM nel suo software per assistere con la codifica e la fatturazione. Gli LLM possono monitorare anomalie nei modelli di accesso alle informazioni sensibili dei pazienti o incongruenze nelle pratiche di codifica e fatturazione.17

Esempio reale: Claude for Healthcare (Anthropic) è una piattaforma orientata all'impresa progettata per organizzazioni sanitarie, fornitori e assicuratori. Collega i large language models a database medici professionali come ICD-10 e il CMS Coverage Database, consentendo agli ospedali di automatizzare i flussi di lavoro amministrativi. Questi flussi di lavoro includono autorizzazioni preventive assicurative, riassunto delle cartelle dei pazienti e triage dei messaggi del portale pazienti.18

Tuttavia, gli LLM non sono completamente pronti per la codifica medica, ma i loro contributi sono promettenti: I ricercatori hanno esaminato con quale frequenza quattro LLM (GPT-3.5, GPT-4, Gemini Pro e Llama2-70b Chat) emettessero i codici CPT, ICD-9-CM e ICD-10-CM corretti. 

I loro risultati mostrano un significativo margine di miglioramento. I ricercatori hanno scoperto che gli LLM generano spesso codici che trasmettono informazioni inesatte, con un'accuratezza massima del 50%.19

9. Formazione e istruzione

I large language models e l'IA generativa possono essere utilizzati come strumenti educativi interattivi, aiutando clinici e pazienti a comprendere meglio concetti medici complessi e a chiarire informazioni confuse.

Caso d'uso reale: Oxford Medical Simulation utilizza LLM integrati con la tecnologia VR per creare simulazioni immersive di pazienti virtuali. 

Queste simulazioni consentono agli studenti di vivere scenari ad alta pressione, come gestire un paziente in arresto cardiaco senza conseguenze nel mondo reale. 

Gli LLM alimentano le risposte dei pazienti virtuali, rendendole più realistiche e imprevedibili, preparando gli studenti alla variabilità degli ambienti clinici reali.20

10. Scoperta e sviluppo di farmaci

Gli LLM stanno accelerando la ricerca farmaceutica riducendo i cicli di sviluppo e il costo di immissione di nuovi composti sul mercato. Questi modelli possono:

  • Analizzare strutture molecolari complesse e segnalare composti con potenziale terapeutico.
  • Prevedere l'efficacia e il profilo di sicurezza dei farmaci candidati prima dei test di laboratorio.
  • Suggerire nuove configurazioni molecolari mirate a specifici bersagli terapeutici.
  • Ottimizzare i composti guida per migliorare la farmacocinetica e ridurre gli effetti collaterali.

I modelli di linguaggio chimico, un sottoinsieme di LLM creati specificamente per applicazioni farmaceutiche, hanno prodotto risultati misurabili nella progettazione di farmaci de novo. La ricerca indica che i modelli warm-started (quelli inizializzati da modelli di linguaggio biochimico pre-addestrati) generano composti di qualità superiore rispetto agli approcci di base.21

11. Radiologia e imaging medico

Gli LLM multimodali che elaborano sia testo che immagini possono esaminare immagini mediche insieme ai dati clinici per supportare il rilevamento di anomalie e contribuire a interpretazioni diagnostiche più precise.

  • Interpretazione delle immagini: Modelli come Med-Flamingo e LLaVA-Med analizzano le immagini mediche in un contesto clinico, supportando i radiologi nella diagnosi precoce di condizioni visibili su radiografie toraciche, risonanze magnetiche e TAC.
  • Generazione automatizzata di referti: Sistemi come ChatCAD generano referti radiologici direttamente dai dati di imaging, affrontando uno dei compiti che richiedono più tempo nei reparti di imaging ad alto volume.

12. Alfabetizzazione sanitaria e accessibilità linguistica

Un divario pratico nell'assistenza ai pazienti è la distanza tra il linguaggio clinico e il linguaggio che i pazienti usano per descrivere la propria salute. Gli LLM possono aiutare a colmare questo divario:

  • Traducendo la terminologia medica e il gergo in linguaggio semplice al livello di lettura del paziente.
  • Colmando le differenze linguistiche tra pazienti e fornitori in contesti assistenziali multilingue.
  • Spiegando opzioni di trattamento, risultati dei test e piani di cura in formati su cui i pazienti possono agire.

Una migliore comprensione da parte del paziente è associata a una maggiore aderenza al trattamento e a migliori esiti.

Sfide degli LLM in ambito sanitario

Preoccupazioni sulla privacy

L'utilizzo di applicazioni sanitarie basate su LLM che non sono state adeguatamente sviluppate, testate o approvate per uso medico può comportare rischi significativi per gli utenti, in particolare per quanto riguarda la privacy dei dati.

Questi strumenti spesso elaborano informazioni sanitarie sensibili fornite dagli utenti, ma non è sempre chiaro come questi dati vengano archiviati, condivisi o se le applicazioni siano pienamente conformi alle leggi e ai regolamenti esistenti sulla protezione dei dati.22

Accuratezza e affidabilità

Gli LLM sono anche inclini alle allucinazioni, informazioni plausibili ma errate o fuorvianti.

Ad esempio, a una domanda medica, GPT-3.5 ha erroneamente raccomandato la tetraciclina per una paziente incinta, nonostante avesse correttamente spiegato il suo potenziale danno al feto.23

Figura 8: Un esempio di GPT-3.5 che mostra la raccomandazione errata di un medicinale.

Generalizzazione vs. specializzazione

Un LLM addestrato su dati medici generici potrebbe non avere l'esperienza dettagliata necessaria per specialità mediche specifiche.

Distorsioni e considerazioni etiche

Oltre all'accuratezza, ci sono preoccupazioni etiche, come il potenziale degli LLM di perpetuare le distorsioni presenti nei loro dati di addestramento. Ciò potrebbe comportare raccomandazioni di cura diseguali per diversi gruppi demografici.

Per maggiori dettagli sulle sfide dei large language models, leggi i rischi dell'IA generativa e l'etica dell'IA generativa.

Non perderti i nostri benchmark e approfondimenti basati sui dati. Il pulsante apre Google; selezionare AIMultiple conferma che desideri vedere AIMultiple più spesso nei risultati di ricerca di Google.
GoogleAggiungi come fonte preferita

Il futuro degli LLM in ambito sanitario

L'analisi di Stanford indica che esiste un potenziale significativo non sfruttato per gli LLM in ambito sanitario.24

Mentre molti LLM sono stati utilizzati per compiti come il potenziamento della diagnostica o la comunicazione con i pazienti, meno si sono concentrati sui compiti amministrativi che contribuiscono al burnout dei clinici.

In futuro, gli LLM potrebbero evolversi per interagire con il comportamento, un maggiore contesto e le emozioni, consentendo loro di fornire un supporto più personalizzato ed empatico.

Metodologia dei large language models in ambito sanitario

Metodologia del benchmark: Questo benchmark valuta 9 LLM generici popolari su domande mediche a livello universitario utilizzando il dataset MedQA, che trae il suo contenuto dallo United States Medical Licensing Examination (USMLE). Ogni domanda include uno scenario clinico e opzioni di risposta a scelta multipla.

Output degli LLM: A ciascun modello è stato richiesto di restituire una risposta strutturata (ad es., "Risposta: C").25

Latenza: Il tempo medio che un modello impiega per generare una risposta a un singolo prompt MedQA. Ad esempio, se 100 domande richiedono 1.115 secondi totali per essere completate, la latenza media è di 11,15 secondi per domanda.

Fonti dati del benchmark degli LLM in ambito sanitario

  • Risultati di Me-LLaMA 70B26
  • Risultati di Meditron 70B27
  • Risultati di Med-PaLM 228
  • ChatGPT & GPT-429

Cita questa ricerca

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Cem Dilmegani (2026) - "Confronto tra 9 Large Language Models in ambito sanitario". Pubblicato online su AIMultiple.com. Consultato il 21 Maggio 2026, da: https://aimultiple.com/large-language-models-in-healthcare [Risorsa online]

Dilmegani, C. (2026, 21 Maggio). Confronto tra 9 Large Language Models in ambito sanitario. AIMultiple. https://aimultiple.com/large-language-models-in-healthcare

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{Confronto tra 9 Large Language Models in ambito sanitario}},
  year   = {2026},
  month  = may,
  howpublished    = {\url{https://aimultiple.com/large-language-models-in-healthcare}},
  note   = {AIMultiple. Consultato il 21 Maggio 2026}
}

Collegamenti di riferimento

1.
Generative Medical AI: A Journey with Fine-Tuned Language Models | by Eluney Hernandez | Medium
Medium
2.
Generative Medical AI: A Journey with Fine-Tuned Language Models | by Eluney Hernandez | Medium
Medium
3.
Google Launches A Healthcare-Focused LLM
Forbes
4.
How doctors are using Google's new AI models for health care
CNBC
5.
MedGemma: Our most capable open models for health AI development
6.
Medical ChatBot | Healthcare ChatBot | Medical GPT
7.
Introducing ChatGPT Health | OpenAI
8.
Buoy Health - IDHA
Boston Children's Hospital
9.
WVU pharmacists using AI to help lower patient readmission rates | WVU Today | West Virginia University
10.
Babylon's AI-enabled symptom checker added to recently acquired Higi's app | MobiHealthNews
MobiHealthNews
11.
Artificial Intelligence | Epic
12.
Healthcare | Claude by Anthropic
13.
Large Language Models Are Poor Medical Coders — Benchmarking of Medical Code Querying | NEJM AI
14.
Oxford Medical Simulation - Virtual Reality Healthcare Training
Oxford Medical Simulation
15.
Large Language Models in Healthcare and Medical Applications: A Review - PMC
16.
The Challenges for Regulating Medical Use of ChatGPT and Other Large Language Models - PubMed
17.
https://arxiv.org/pdf/2307.15343
18.
Large Language Models in Healthcare: Are We There Yet? | Stanford HAI
19.
https://www.vals.ai/benchmarks/medqa
20.
Medical foundation large language models for comprehensive text analysis and beyond | npj Digital Medicine
Nature Publishing Group UK
21.
[2311.16079] MEDITRON-70B: Scaling Medical Pretraining for Large Language Models
22.
[2305.09617] Towards Expert-Level Medical Question Answering with Large Language Models
23.
[2305.09617] Towards Expert-Level Medical Question Answering with Large Language Models
24.
Large Language Models in Healthcare: Are We There Yet? | Stanford HAI
25.
https://www.vals.ai/benchmarks/medqa
26.
Medical foundation large language models for comprehensive text analysis and beyond | npj Digital Medicine
Nature Publishing Group UK
27.
[2311.16079] MEDITRON-70B: Scaling Medical Pretraining for Large Language Models
28.
[2305.09617] Towards Expert-Level Medical Question Answering with Large Language Models
29.
[2305.09617] Towards Expert-Level Medical Question Answering with Large Language Models
Cem Dilmegani
Cem Dilmegani
Analista principale
Cem è analista principale presso AIMultiple dal 2017. AIMultiple fornisce informazioni a centinaia di migliaia di aziende (secondo SimilarWeb), tra cui il 55% delle aziende Fortune 500, ogni mese. Il lavoro di Cem è stato citato da importanti pubblicazioni globali come Business Insider, Forbes, Washington Post, società globali come Deloitte e HPE, ONG come il World Economic Forum e organizzazioni sovranazionali come la Commissione Europea. È possibile consultare l'elenco di altre aziende e risorse autorevoli che hanno citato AIMultiple. Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, responsabile acquisti tecnologici e imprenditore nel settore tecnologico. Ha fornito consulenza alle aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per oltre un decennio. Ha anche pubblicato un report di McKinsey sulla digitalizzazione. Ha guidato la strategia tecnologica e gli acquisti di un'azienda di telecomunicazioni, riportando direttamente al CEO. Ha inoltre guidato la crescita commerciale dell'azienda deep tech Hypatos, che ha raggiunto un fatturato annuo ricorrente a 7 cifre e una valutazione a 9 cifre partendo da zero in soli 2 anni. Il lavoro di Cem in Hypatos è stato oggetto di articoli su importanti pubblicazioni tecnologiche come TechCrunch e Business Insider. Cem partecipa regolarmente come relatore a conferenze internazionali di settore. Si è laureato in ingegneria informatica presso l'Università di Bogazici e ha conseguito un MBA presso la Columbia Business School.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450