Confronta 9 Large Language Models in ambito sanitario
Abbiamo valutato 9 LLM utilizzando il dataset MedQA, un benchmark di esami clinici di livello universitario derivato dalle domande USMLE. Ogni model ha risposto agli stessi scenari clinici a scelta multipla utilizzando un prompt standardizzato, consentendo un confronto diretto dell'accuratezza.
Abbiamo inoltre registrato la latenza per domanda dividendo il tempo di esecuzione totale per il numero di elementi MedQA completati.
Risultati del benchmark degli LLM in ambito sanitario
Metodologia del benchmark: questo benchmark valuta le prestazioni di fine-tuning supervisionato degli LLM in ambito sanitario rispetto ai large general-purpose models (GPT-4) su attività di risposta a domande medichecompiti. Vedi fonti dei dati del benchmark.
MedQA: domande d'esame medico a scelta multipla basate sullo United States Medical Licensing Examination.
Figura 1: esempio di domanda clinica a scelta multipla in stile USMLE.
MedMCQA: dataset su larga scala di risposte a domande a scelta multipla (MCQA) progettato per affrontare domande reali di esami di ammissione in medicina.
Figura 2: una domanda a scelta multipla su larga scala di un esame di ammissione in medicina che richiede al model di selezionare la risposta corretta e interpretare le spiegazioni associate sui reperti clinici.
PubMedQA: benchmark di risposta a domande biomediche con risposte sì/no/forse.
Figura 3: una domanda biomedica con risposta sì/no/forse, in cui il model deve valutare la correttezza di un'affermazione clinica utilizzando il contesto dello studio fornito.
Esempi di LLM in ambito sanitario
Simili a BERT (solo encoder)
Ottimizzati per codificare e rappresentare il testo biomedico, questi model eccellono nell'estrazione di caratteristiche per attività come la classificazione.
Modelli simili a ChatGPT / LLaMA (decoder, ottimizzati per istruzioni/chat)
Basati su architetture in stile LLaMA e ottimizzati per attività interattive e dialoghi clinici.
Simili a GPT / PaLM (solo decoder, generativi)
Costruiti in modo simile a GPT-3 o PaLM, questi model sono ottimizzati per la generazione e la sintesi di testi per uso generale.
Per uso generale, LLM in ambito sanitario
*Llama 3.1 Instruct Turbo con 405B parametri. Vedi metodologia del benchmark.
Punti chiave:
- o1: model con le migliori prestazioni
- 03 mini: migliore opzione economica
- GPT 4.1: migliore velocità e tempo di risposta
- Oltre all'accuratezza e al costo di input, i model differiscono anche nei loro approcci sottostanti alla risposta a domande mediche
Figura 4: figura che mostra le differenze tra le risposte di GPT-5 e o3.
Fine-tuning dei LLM medici
Le prestazioni del ChatGPT predefinito (model 4o) vengono confrontate con l'assistente esistente ‘Clinical Medicine Handbook’. A entrambi i model viene fornito lo stesso prompt e le loro risposte vengono analizzate:
GPT 4o
Figura 5: la figura mostra che la risposta del model predefinito GPT 4o è accurata ma anche fortemente riassunta.1
Fine-tuned LLM medici
Figura 6: la figura mostra la risposta dell'agente specializzato.1
Applicazioni degli LLM per uso generale
Puoi utilizzare questi model in ambito sanitario sfruttando:
- Pretraining continuo su dati medici per aiutare il model a riconoscere meglio il linguaggio medico esponendolo a note cliniche e letteratura biomedica (come PubMed).
- RAG per estrarre dati da documenti clinici verificati e produrre risposte accurate in fase di esecuzione.
- Fine-tuning su istruzioni per consentire al model di imparare a rispondere a domande cliniche o estrarre sintomi dal testo.
Figura 7: un flusso di lavoro generale di fine-tuning di LLM per casi d'uso specializzati.
Dove le organizzazioni sanitarie utilizzano gli LLM
Le organizzazioni sanitarie stanno testando gli LLM sia nei flussi di lavoro clinici sia in quelli amministrativi. Le applicazioni comuni includono documentazione clinica e trascrizione, sintesi delle cartelle cliniche elettroniche (EHR), ricerca bibliografica, redazione di messaggi per i pazienti, codifica medica, autorizzazione preventiva, formazione dei clinici e spiegazioni rivolte ai pazienti.
Il model appropriato dipende meno dall'etichetta del caso d'uso che dai requisiti del carico di lavoro. Le applicazioni rivolte ai pazienti e di supporto alle decisioni cliniche richiedono generalmente una maggiore accuratezza medica, valutazione della sicurezza, verificabilità e controlli di protezione dei dati, mentre i carichi di lavoro amministrativi possono dare più peso a costi, latenza, lunghezza del contesto e integrazione con i sistemi esistenti.
Metodologia per i large language models in ambito sanitario
Metodologia del benchmark: questo benchmark valuta 9 popolari LLM generici su domande mediche di livello universitario utilizzando il dataset MedQA, che trae i suoi contenuti dallo United States Medical Licensing Examination (USMLE). Ogni domanda include uno scenario clinico e opzioni di risposta a scelta multipla.
LLM output: a ogni model è stato richiesto di restituire una risposta strutturata (ad esempio, “Risposta: C”).8
Latenza: il tempo medio che un model impiega per generare una risposta a un singolo prompt MedQA. Ad esempio, se 100 domande richiedono 1.115 secondi in totale per essere completate, la latenza media è di 11.15 secondi per domanda.
LLM in ambito sanitario: fonti dei dati del benchmark
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Ermut, Sıla},
title = {{Confronta 9 Large Language Models in ambito sanitario}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/large-language-models-in-healthcare}},
note = {AIMultiple. Consultato il 4 Settembre 2026}
}Risultati e timestamp di 25 punti dati. Scarica i dati utilizzati in questo articolo come file ZIP contenente 4 file CSV.
Registro delle modifiche
15 aggiornamenti- 2026
Aggiunti tre casi d'uso: scoperta e sviluppo di farmaci, radiologia e imaging medico e alfabetizzazione sanitaria.
Ampliata la sezione "Supporto alle decisioni cliniche" con MedGemma e una nuova figura.
- 2025
Aggiunta la Figura 1 alla sezione MedQA.
Sostituita la metodologia di benchmark nella sezione "GPT 4.1 – Migliore velocità e tempo di risposta".
Aggiunta la metodologia di benchmark alla sezione metodologia.
Aggiunta la messa a punto di LLM medici alla sezione Casi d'uso di LLM per scopi generali.
Aggiunti i dati di latenza alla sezione degli output LLM.
Aggiunta una metodologia di benchmark alla sezione benchmark dei LLM sanitari.
Rimossa la sezione "LLM per scopi generali nell'assistenza sanitaria".
Rimossi Med-PaLM 2, MEDITRON-70B, Me-LLaMA, Radiology-Llama2, Health Acoustic Representations (HeAR), Polaris 3.0 di Hippocratic AI e Med-PaLM M dall'articolo.
Aggiunte fonti di dati di benchmark alla fine dell'articolo.
Aggiunto un confronto di LLM aperti sui compiti sanitari alla sezione LLM sanitari open source.
Aggiornati i punteggi di accuratezza per Llama-2-70B e GPT-3.5-turbo nella sezione Llama 2.
- 2024
Aggiunti Med-PaLM 2 e Radiology-Llama2 alla sezione LLM open source focalizzati sull'assistenza sanitaria.
Aggiunto il modello Hippocratic AI alla sezione "LLM sanitari".
Collegamenti di riferimento
Il lavoro di Cem presso AIMultiple è stato citato da importanti testate internazionali tra cui Business Insider, Forbes, Morning Brew e Washington Post, da aziende globali come Deloitte e HPE, da ONG come il World Economic Forum e da organizzazioni sovranazionali come la Commissione europea. [1], [2], [3], [4], [5]
Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente tecnologico e imprenditore tecnologico. Ha consigliato le aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per più di un decennio. Ha inoltre pubblicato un report McKinsey sulla digitalizzazione.
Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha inoltre guidato la crescita commerciale dell'azienda deep tech Hypatos, che ha raggiunto ricavi ricorrenti annuali a 7 cifre e una valutazione a 9 cifre partendo da zero in 2 anni. Il lavoro di Cem in Hypatos è stato ripreso da importanti testate tecnologiche come TechCrunch e Business Insider.
Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato come ingegnere informatico presso l'Università di Bogazici e possiede un MBA della Columbia Business School.
In precedenza ha lavorato come reclutatrice in società di project management e consulenza. Sıla ha conseguito un Master of Science in Psicologia Sociale e un Bachelor of Arts in Relazioni Internazionali.







Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.