Confronto tra 9 Large Language Models in ambito sanitario
Abbiamo sottoposto a benchmark 9 LLM utilizzando il dataset MedQA, un benchmark di esami clinici a livello universitario derivato dalle domande USMLE. Ogni modello ha risposto agli stessi scenari clinici a scelta multipla utilizzando un prompt standardizzato, consentendo un confronto diretto dell'accuratezza.
Abbiamo anche registrato la latenza per domanda dividendo il tempo di esecuzione totale per il numero di item MedQA completati.
Risultati del benchmark degli LLM in ambito sanitario
Metodologia del benchmark: Questo benchmark valuta le prestazioni di fine-tuning supervisionato degli LLM in ambito sanitario rispetto a grandi modelli generici (GPT-4) su compiti di risposta a domande mediche (medical question-answering). Vedi fonti dati del benchmark.
MedQA: Domande d'esame medico a scelta multipla basate sullo United States Medical Licensing Examination.
Figura 1: Esempio di domanda clinica a scelta multipla in stile USMLE.
MedMCQA: Dataset su larga scala di risposta a domande a scelta multipla (MCQA) progettato per affrontare domande reali di esami di ammissione in medicina.
Figura 2: Una domanda a scelta multipla su larga scala per l'esame di ammissione in medicina che richiede al modello di selezionare la risposta corretta e interpretare le spiegazioni associate sui risultati clinici.
PubMedQA: Benchmark di risposta a domande biomediche con risposte sì/no/forse.
Figura 3: Una domanda biomedica sì/no/forse, in cui il modello deve giudicare la correttezza di un'affermazione clinica utilizzando il contesto dello studio fornito.
Esempi di LLM in ambito sanitario
Tipo BERT (Solo encoder)
Ottimizzati per codificare e rappresentare il testo biomedico, questi modelli eccellono nell'estrarre caratteristiche per compiti come la classificazione.
Tipo ChatGPT / LLaMA (Decoder, ottimizzati per istruzioni/chat)
Basati su architetture in stile LLaMA e ottimizzati per compiti interattivi e dialoghi clinici.
Tipo GPT / PaLM (Solo decoder, generativi)
Costruiti in modo simile a GPT-3 o PaLM, questi modelli sono sottoposti a fine-tuning per la generazione di testo generico e il riassunto.
LLM generici in ambito sanitario
*Llama 3.1 Instruct Turbo con 405B parametri. Vedi metodologia del benchmark.
Punti chiave:
- o1: Modello con le migliori prestazioni
- 03 mini: Migliore opzione economica
- GPT 4.1: Migliore velocità e tempo di risposta
Oltre all'accuratezza e al costo di input, i modelli differiscono anche nei loro approcci sottostanti al question-answering medico. Ad esempio, o3 utilizza un approccio più graduale e analitico, mentre GPT-5 risponde in modo empatico, organizza e spiega le informazioni in modo chiaro per i non esperti:
Figura 4: Figura che mostra le differenze tra le risposte di GPT-5 e o3.
Fine-tuning degli LLM medici
Le prestazioni del ChatGPT predefinito (modello 4o) vengono confrontate con l'assistente esistente "Clinical Medicine Handbook". A entrambi i modelli viene fornito lo stesso prompt e le loro risposte vengono analizzate:
GPT 4o
Figura 5: La figura mostra che la risposta del modello predefinito GPT 4o è accurata ma anche molto riassuntiva.1
LLM medico sottoposto a fine-tuning
Figura 6: La figura mostra che la risposta dell'agente specializzato è spiegata meglio e più dettagliata.2
Leggi LLM fine-tuning e LLM training per saperne di più.
Applicazioni degli LLM generici
Questi modelli sono modelli generici sottoposti a fine-tuning che richiedono adattamento al dominio per eseguire compiti clinici in modo accurato. Puoi utilizzare questi modelli in ambito sanitario sfruttando:
- Pretraining continuo su dati medici per aiutare il modello a riconoscere meglio il linguaggio medico esponendolo a note cliniche e letteratura biomedica (come PubMed).
- RAG per estrarre dati da documenti clinici verificati al fine di produrre risposte accurate in fase di esecuzione.
- Fine-tuning su istruzioni per consentire al modello di imparare a rispondere a domande cliniche o estrarre sintomi dal testo.
Figura 7: Un flusso di lavoro generale del fine-tuning degli LLM per casi d'uso specializzati.
Casi d'uso degli LLM in ambito clinico
1. Trascrizione medica
Gli LLM possono aiutare a creare trascrizioni mediche:
- Ascoltando il dialogo naturale tra un paziente e un clinico.
- Estraendo dettagli medici critici.
- Condensando i dati medici in registrazioni cliniche conformi che si allineano con le sezioni pertinenti di una cartella clinica elettronica (EHR).
Esempio reale: MedLM di Google può catturare e trasformare la conversazione paziente-clinico in trascrizione medica.9
2. Miglioramento delle cartelle cliniche elettroniche (EHR)
L'uso diffuso delle cartelle cliniche elettroniche (EHR) ha generato enormi quantità di dati dei pazienti che, se utilizzati in modo efficace, possono migliorare significativamente l'assistenza sanitaria.
Ad esempio, l'analisi dei dati EHR può aiutare i clinici a prendere decisioni migliori rivelando schemi nelle diagnosi, nei trattamenti e negli esiti. Può anche supportare una diagnosi precoce delle malattie e cure più personalizzate identificando i fattori di rischio e adattando i trattamenti ai singoli pazienti.
A livello di sistema, i dati EHR possono migliorare l'efficienza riducendo gli esami ridondanti, evidenziando le lacune assistenziali e informando politiche che migliorano la qualità e riducono i costi.
Esempio reale: MedLM di Google è utilizzato da BenchSci, Accenture e Deloitte per migliorare le cartelle cliniche elettroniche (EHR).
- BenchSci ha integrato MedLM nella sua piattaforma ASCEND per migliorare la qualità della ricerca preclinica.
- Accenture utilizza MedLM per organizzare dati non strutturati da fonti multiple, automatizzando operazioni manuali precedentemente dispendiose in termini di tempo e soggette a errori.
- Deloitte collabora con MedLM per ridurre al minimo gli attriti nella ricerca del trattamento. Utilizzano un chatbot interattivo che aiuta i partecipanti ai piani sanitari a comprendere meglio le alternative dei fornitori.10
3. Supporto alle decisioni cliniche
Gli LLM aiutano i clinici a interpretare le informazioni specifiche del paziente incluse nelle attuali evidenze mediche, facendo emergere considerazioni rilevanti durante la diagnosi o la pianificazione del trattamento senza sostituire il giudizio clinico.
Esempio reale: MedGemma (Google DeepMind) è una raccolta di modelli medici a pesi aperti costruiti sull'architettura Gemma 3 di Google. Piuttosto che funzionare come strumento diagnostico diretto al consumatore, MedGemma funge da base per gli sviluppatori per creare applicazioni mediche destinate ai clinici.
Progettato sia per l'analisi di testi medici che di immagini, MedGemma può interpretare immagini mediche complesse, tra cui radiografie toraciche, risonanze magnetiche e TAC. Supporta anche compiti di ragionamento clinico, come il riassunto delle note dei pazienti o la risposta a domande in stile esame di abilitazione medica.
Secondo una revisione di un radiologo cardiotoracico certificato negli Stati Uniti, 81% dei referti di radiografie toraciche di MedGemma porterebbe a decisioni di gestione del paziente simili a quelle basate sui referti originali del radiologo (vedi il grafico sottostante).
Figura 8: Il grafico mostra quanto spesso i referti di radiografie toraciche generati dall'IA e i referti originali del radiologo portino a esiti clinici simili o diversi nei casi normali, anormali e in tutti i casi.11
4. Assistenza alla ricerca medica
Nella ricerca medica, il valore fondamentale degli LLM risiede nella loro capacità di accelerare la revisione e la sintesi della letteratura.
Piuttosto che riassumere articoli, gli LLM aiutano i ricercatori a tenere il passo con la letteratura biomedica in rapida espansione identificando studi pertinenti, estraendo risultati chiave e sintetizzando approfondimenti da fonti multiple.
Esempio reale: Il chatbot sanitario di John Snow aiuta i ricercatori a trovare articoli scientifici pertinenti, estrarre approfondimenti chiave e identificare tendenze di ricerca. È particolarmente utile per navigare nella vasta quantità di letteratura biomedica.12
5. Comunicazione automatizzata con i pazienti
I large language models in ambito sanitario possono redigere risposte informative e compassionevoli alle domande dei pazienti. Alcuni esempi includono:
- Gestione dei farmaci e promemoria: Un chatbot fornisce ai pazienti promemoria regolari per assumere i farmaci per il diabete e richiede conferma.
- Monitoraggio della salute e cure di follow-up: Un paziente post-operatorio invia il proprio stato di dolore e ferita a un chatbot, che determina se il processo di guarigione sta progredendo.
- Comunicazione informativa ed educativa: Un paziente chiede a un chatbot come gestire la pressione alta e il chatbot risponde con consigli su nutrizione e stile di vita.
Esempio reale: ChatGPT Health consente agli utenti di connettere in modo sicuro le proprie cartelle cliniche e i dati sul benessere (ad es., Apple Health o MyFitnessPal). Gli utenti possono quindi porre a ChatGPT domande sui propri dati, come "Come sta andando il mio colesterolo?" o "Riassumi i miei ultimi risultati di laboratorio."13
Esempio reale: Il Boston Children's Hospital utilizza Buoy Health, un chatbot online basato sull'IA per il controllo dei sintomi, che fornisce ai pazienti risposte immediate a domande relative alla salute e consulenze iniziali.
Il chatbot può fare triage dei pazienti analizzando i loro sintomi e consigliando se hanno bisogno di consultare un medico.14
6. Previsione degli esiti sanitari
Gli LLM possono essere utilizzati per consentire la stratificazione del rischio e la previsione in ambito sanitario. Supportando l'analisi di dati clinici strutturati e non strutturati, gli LLM possono aiutare a identificare i pazienti a rischio elevato (come la riammissione ospedaliera) e supportare una pianificazione proattiva delle cure, spesso in combinazione con modelli predittivi tradizionali.
Esempio reale: I farmacisti della WVU utilizzano un algoritmo predittivo per determinare il rischio di riammissione. Questo approccio esamina i dati delle cartelle cliniche elettroniche (EHR), che includono dati demografici dei pazienti, anamnesi clinica e determinanti socioeconomici della salute.
Sulla base di questa ricerca, i farmacisti della WVU identificano i pazienti ad alto rischio di riammissione e assegnano coordinatori assistenziali per seguirli dopo la dimissione. Ciò può contribuire a ridurre i tassi di riammissione.15
7. Piani di trattamento personalizzati
Integrando anamnesi medica, sintomi e dati sanitari longitudinali, gli LLM possono aiutare a tradurre informazioni complesse sui pazienti in considerazioni assistenziali individualizzate, supportando discussioni terapeutiche più personalizzate e consapevoli del contesto tra clinici e pazienti.
Esempio reale: Il chatbot IA di Babylon Health fornisce raccomandazioni sanitarie personalizzate in base ai sintomi e all'anamnesi medica dell'utente. Coinvolge gli utenti in una conversazione ponendo domande pertinenti per analizzare meglio i loro problemi e fornendo raccomandazioni su misura.16
8. Codifica medica e fatturazione
I large language models possono automatizzare i processi di audit analizzando le cartelle cliniche dei pazienti e le EHR.
Esempio reale: Epic Systems, un fornitore di EHR, integra gli LLM nel suo software per assistere con la codifica e la fatturazione. Gli LLM possono monitorare anomalie nei modelli di accesso alle informazioni sensibili dei pazienti o incongruenze nelle pratiche di codifica e fatturazione.17
Esempio reale: Claude for Healthcare (Anthropic) è una piattaforma orientata all'impresa progettata per organizzazioni sanitarie, fornitori e assicuratori. Collega i large language models a database medici professionali come ICD-10 e il CMS Coverage Database, consentendo agli ospedali di automatizzare i flussi di lavoro amministrativi. Questi flussi di lavoro includono autorizzazioni preventive assicurative, riassunto delle cartelle dei pazienti e triage dei messaggi del portale pazienti.18
Tuttavia, gli LLM non sono completamente pronti per la codifica medica, ma i loro contributi sono promettenti: I ricercatori hanno esaminato con quale frequenza quattro LLM (GPT-3.5, GPT-4, Gemini Pro e Llama2-70b Chat) emettessero i codici CPT, ICD-9-CM e ICD-10-CM corretti.
I loro risultati mostrano un significativo margine di miglioramento. I ricercatori hanno scoperto che gli LLM generano spesso codici che trasmettono informazioni inesatte, con un'accuratezza massima del 50%.19
9. Formazione e istruzione
I large language models e l'IA generativa possono essere utilizzati come strumenti educativi interattivi, aiutando clinici e pazienti a comprendere meglio concetti medici complessi e a chiarire informazioni confuse.
Caso d'uso reale: Oxford Medical Simulation utilizza LLM integrati con la tecnologia VR per creare simulazioni immersive di pazienti virtuali.
Queste simulazioni consentono agli studenti di vivere scenari ad alta pressione, come gestire un paziente in arresto cardiaco senza conseguenze nel mondo reale.
Gli LLM alimentano le risposte dei pazienti virtuali, rendendole più realistiche e imprevedibili, preparando gli studenti alla variabilità degli ambienti clinici reali.20
10. Scoperta e sviluppo di farmaci
Gli LLM stanno accelerando la ricerca farmaceutica riducendo i cicli di sviluppo e il costo di immissione di nuovi composti sul mercato. Questi modelli possono:
- Analizzare strutture molecolari complesse e segnalare composti con potenziale terapeutico.
- Prevedere l'efficacia e il profilo di sicurezza dei farmaci candidati prima dei test di laboratorio.
- Suggerire nuove configurazioni molecolari mirate a specifici bersagli terapeutici.
- Ottimizzare i composti guida per migliorare la farmacocinetica e ridurre gli effetti collaterali.
I modelli di linguaggio chimico, un sottoinsieme di LLM creati specificamente per applicazioni farmaceutiche, hanno prodotto risultati misurabili nella progettazione di farmaci de novo. La ricerca indica che i modelli warm-started (quelli inizializzati da modelli di linguaggio biochimico pre-addestrati) generano composti di qualità superiore rispetto agli approcci di base.21
11. Radiologia e imaging medico
Gli LLM multimodali che elaborano sia testo che immagini possono esaminare immagini mediche insieme ai dati clinici per supportare il rilevamento di anomalie e contribuire a interpretazioni diagnostiche più precise.
- Interpretazione delle immagini: Modelli come Med-Flamingo e LLaVA-Med analizzano le immagini mediche in un contesto clinico, supportando i radiologi nella diagnosi precoce di condizioni visibili su radiografie toraciche, risonanze magnetiche e TAC.
- Generazione automatizzata di referti: Sistemi come ChatCAD generano referti radiologici direttamente dai dati di imaging, affrontando uno dei compiti che richiedono più tempo nei reparti di imaging ad alto volume.
12. Alfabetizzazione sanitaria e accessibilità linguistica
Un divario pratico nell'assistenza ai pazienti è la distanza tra il linguaggio clinico e il linguaggio che i pazienti usano per descrivere la propria salute. Gli LLM possono aiutare a colmare questo divario:
- Traducendo la terminologia medica e il gergo in linguaggio semplice al livello di lettura del paziente.
- Colmando le differenze linguistiche tra pazienti e fornitori in contesti assistenziali multilingue.
- Spiegando opzioni di trattamento, risultati dei test e piani di cura in formati su cui i pazienti possono agire.
Una migliore comprensione da parte del paziente è associata a una maggiore aderenza al trattamento e a migliori esiti.
Sfide degli LLM in ambito sanitario
Preoccupazioni sulla privacy
L'utilizzo di applicazioni sanitarie basate su LLM che non sono state adeguatamente sviluppate, testate o approvate per uso medico può comportare rischi significativi per gli utenti, in particolare per quanto riguarda la privacy dei dati.
Questi strumenti spesso elaborano informazioni sanitarie sensibili fornite dagli utenti, ma non è sempre chiaro come questi dati vengano archiviati, condivisi o se le applicazioni siano pienamente conformi alle leggi e ai regolamenti esistenti sulla protezione dei dati.22
Accuratezza e affidabilità
Gli LLM sono anche inclini alle allucinazioni, informazioni plausibili ma errate o fuorvianti.
Ad esempio, a una domanda medica, GPT-3.5 ha erroneamente raccomandato la tetraciclina per una paziente incinta, nonostante avesse correttamente spiegato il suo potenziale danno al feto.23
Figura 8: Un esempio di GPT-3.5 che mostra la raccomandazione errata di un medicinale.
Generalizzazione vs. specializzazione
Un LLM addestrato su dati medici generici potrebbe non avere l'esperienza dettagliata necessaria per specialità mediche specifiche.
Distorsioni e considerazioni etiche
Oltre all'accuratezza, ci sono preoccupazioni etiche, come il potenziale degli LLM di perpetuare le distorsioni presenti nei loro dati di addestramento. Ciò potrebbe comportare raccomandazioni di cura diseguali per diversi gruppi demografici.
Per maggiori dettagli sulle sfide dei large language models, leggi i rischi dell'IA generativa e l'etica dell'IA generativa.
Il futuro degli LLM in ambito sanitario
L'analisi di Stanford indica che esiste un potenziale significativo non sfruttato per gli LLM in ambito sanitario.24
Mentre molti LLM sono stati utilizzati per compiti come il potenziamento della diagnostica o la comunicazione con i pazienti, meno si sono concentrati sui compiti amministrativi che contribuiscono al burnout dei clinici.
In futuro, gli LLM potrebbero evolversi per interagire con il comportamento, un maggiore contesto e le emozioni, consentendo loro di fornire un supporto più personalizzato ed empatico.
Metodologia dei large language models in ambito sanitario
Metodologia del benchmark: Questo benchmark valuta 9 LLM generici popolari su domande mediche a livello universitario utilizzando il dataset MedQA, che trae il suo contenuto dallo United States Medical Licensing Examination (USMLE). Ogni domanda include uno scenario clinico e opzioni di risposta a scelta multipla.
Output degli LLM: A ciascun modello è stato richiesto di restituire una risposta strutturata (ad es., "Risposta: C").25
Latenza: Il tempo medio che un modello impiega per generare una risposta a un singolo prompt MedQA. Ad esempio, se 100 domande richiedono 1.115 secondi totali per essere completate, la latenza media è di 11,15 secondi per domanda.
Fonti dati del benchmark degli LLM in ambito sanitario
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Confronto tra 9 Large Language Models in ambito sanitario}},
year = {2026},
month = may,
howpublished = {\url{https://aimultiple.com/large-language-models-in-healthcare}},
note = {AIMultiple. Consultato il 21 Maggio 2026}
}








Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.