Servizi
Contattaci
Confronto delle Funzionalità

Confronta 9 Large Language Models in ambito sanitario

Cem Dilmegani
Cem Dilmegani
aggiornato il 4 set. 2026

Abbiamo valutato 9 LLM utilizzando il dataset MedQA, un benchmark di esami clinici di livello universitario derivato dalle domande USMLE. Ogni model ha risposto agli stessi scenari clinici a scelta multipla utilizzando un prompt standardizzato, consentendo un confronto diretto dell'accuratezza.

Abbiamo inoltre registrato la latenza per domanda dividendo il tempo di esecuzione totale per il numero di elementi MedQA completati.

Risultati del benchmark degli LLM in ambito sanitario

Loading Chart

Metodologia del benchmark: questo benchmark valuta le prestazioni di fine-tuning supervisionato degli LLM in ambito sanitario rispetto ai large general-purpose models (GPT-4) su attività di risposta a domande medichecompiti. Vedi fonti dei dati del benchmark.

MedQA: domande d'esame medico a scelta multipla basate sullo United States Medical Licensing Examination.

Figura 1: esempio di domanda clinica a scelta multipla in stile USMLE.

MedMCQA: dataset su larga scala di risposte a domande a scelta multipla (MCQA) progettato per affrontare domande reali di esami di ammissione in medicina.

Figura 2: una domanda a scelta multipla su larga scala di un esame di ammissione in medicina che richiede al model di selezionare la risposta corretta e interpretare le spiegazioni associate sui reperti clinici.

PubMedQA: benchmark di risposta a domande biomediche con risposte sì/no/forse.

Figura 3: una domanda biomedica con risposta sì/no/forse, in cui il model deve valutare la correttezza di un'affermazione clinica utilizzando il contesto dello studio fornito.

Esempi di LLM in ambito sanitario

Simili a BERT (solo encoder)

Ottimizzati per codificare e rappresentare il testo biomedico, questi model eccellono nell'estrazione di caratteristiche per attività come la classificazione.

Modelli simili a ChatGPT / LLaMA (decoder, ottimizzati per istruzioni/chat)

Basati su architetture in stile LLaMA e ottimizzati per attività interattive e dialoghi clinici.

Simili a GPT / PaLM (solo decoder, generativi)

Costruiti in modo simile a GPT-3 o PaLM, questi model sono ottimizzati per la generazione e la sintesi di testi per uso generale.

Per uso generale, LLM in ambito sanitario

*Llama 3.1 Instruct Turbo con 405B parametri. Vedi metodologia del benchmark.

Punti chiave:

  • o1: model con le migliori prestazioni
  • 03 mini: migliore opzione economica
  • GPT 4.1: migliore velocità e tempo di risposta
  • Oltre all'accuratezza e al costo di input, i model differiscono anche nei loro approcci sottostanti alla risposta a domande mediche

Figura 4: figura che mostra le differenze tra le risposte di GPT-5 e o3.

Fine-tuning dei LLM medici

Le prestazioni del ChatGPT predefinito (model 4o) vengono confrontate con l'assistente esistente ‘Clinical Medicine Handbook’. A entrambi i model viene fornito lo stesso prompt e le loro risposte vengono analizzate:

GPT 4o

Figura 5: la figura mostra che la risposta del model predefinito GPT 4o è accurata ma anche fortemente riassunta.1

Fine-tuned LLM medici

Figura 6: la figura mostra la risposta dell'agente specializzato.1

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Applicazioni degli LLM per uso generale

Puoi utilizzare questi model in ambito sanitario sfruttando:

  • Pretraining continuo su dati medici per aiutare il model a riconoscere meglio il linguaggio medico esponendolo a note cliniche e letteratura biomedica (come PubMed).
  • RAG per estrarre dati da documenti clinici verificati e produrre risposte accurate in fase di esecuzione.
  • Fine-tuning su istruzioni per consentire al model di imparare a rispondere a domande cliniche o estrarre sintomi dal testo.

Figura 7: un flusso di lavoro generale di fine-tuning di LLM per casi d'uso specializzati.

Dove le organizzazioni sanitarie utilizzano gli LLM

Le organizzazioni sanitarie stanno testando gli LLM sia nei flussi di lavoro clinici sia in quelli amministrativi. Le applicazioni comuni includono documentazione clinica e trascrizione, sintesi delle cartelle cliniche elettroniche (EHR), ricerca bibliografica, redazione di messaggi per i pazienti, codifica medica, autorizzazione preventiva, formazione dei clinici e spiegazioni rivolte ai pazienti.

Il model appropriato dipende meno dall'etichetta del caso d'uso che dai requisiti del carico di lavoro. Le applicazioni rivolte ai pazienti e di supporto alle decisioni cliniche richiedono generalmente una maggiore accuratezza medica, valutazione della sicurezza, verificabilità e controlli di protezione dei dati, mentre i carichi di lavoro amministrativi possono dare più peso a costi, latenza, lunghezza del contesto e integrazione con i sistemi esistenti.

Non perderti i nostri benchmark e approfondimenti basati sui dati. Il pulsante apre Google; selezionare AIMultiple conferma che desideri vedere AIMultiple più spesso nei risultati di ricerca di Google.
GoogleAggiungi come fonte preferita

Metodologia per i large language models in ambito sanitario

Metodologia del benchmark: questo benchmark valuta 9 popolari LLM generici su domande mediche di livello universitario utilizzando il dataset MedQA, che trae i suoi contenuti dallo United States Medical Licensing Examination (USMLE). Ogni domanda include uno scenario clinico e opzioni di risposta a scelta multipla.

LLM output: a ogni model è stato richiesto di restituire una risposta strutturata (ad esempio, “Risposta: C”).8

Latenza: il tempo medio che un model impiega per generare una risposta a un singolo prompt MedQA. Ad esempio, se 100 domande richiedono 1.115 secondi in totale per essere completate, la latenza media è di 11.15 secondi per domanda.

LLM in ambito sanitario: fonti dei dati del benchmark

  • Risultati di Me-LLaMA 70B9
  • Risultati di Meditron 70B10
  • Risultati di Med-PaLM 211
  • ChatGPT e GPT-411

Cita questa ricerca

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Cem Dilmegani and Sıla Ermut (2026) - "Confronta 9 Large Language Models in ambito sanitario". Pubblicato online su AIMultiple.com. Consultato il 4 Settembre 2026, da: https://aimultiple.com/large-language-models-in-healthcare [Risorsa online]

Dilmegani, C., & Ermut, S. (2026, 4 Settembre). Confronta 9 Large Language Models in ambito sanitario. AIMultiple. https://aimultiple.com/large-language-models-in-healthcare

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Ermut, Sıla},
  title  = {{Confronta 9 Large Language Models in ambito sanitario}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/large-language-models-in-healthcare}},
  note   = {AIMultiple. Consultato il 4 Settembre 2026}
}
Scarica tutti i dati

Risultati e timestamp di 25 punti dati. Scarica i dati utilizzati in questo articolo come file ZIP contenente 4 file CSV.

Ultimo aggiornamento: 17 Agosto 2026
Scarica

Registro delle modifiche

15 aggiornamenti
  1. 2026

    Aggiunti tre casi d'uso: scoperta e sviluppo di farmaci, radiologia e imaging medico e alfabetizzazione sanitaria.

  2. Ampliata la sezione "Supporto alle decisioni cliniche" con MedGemma e una nuova figura.

  3. 2025

    Aggiunta la Figura 1 alla sezione MedQA.

  4. Sostituita la metodologia di benchmark nella sezione "GPT 4.1 – Migliore velocità e tempo di risposta".

  5. Aggiunta la metodologia di benchmark alla sezione metodologia.

  6. Aggiunta la messa a punto di LLM medici alla sezione Casi d'uso di LLM per scopi generali.

  7. Aggiunti i dati di latenza alla sezione degli output LLM.

  8. Aggiunta una metodologia di benchmark alla sezione benchmark dei LLM sanitari.

  9. Rimossa la sezione "LLM per scopi generali nell'assistenza sanitaria".

  10. Rimossi Med-PaLM 2, MEDITRON-70B, Me-LLaMA, Radiology-Llama2, Health Acoustic Representations (HeAR), Polaris 3.0 di Hippocratic AI e Med-PaLM M dall'articolo.

  11. Aggiunte fonti di dati di benchmark alla fine dell'articolo.

  12. Aggiunto un confronto di LLM aperti sui compiti sanitari alla sezione LLM sanitari open source.

  13. Aggiornati i punteggi di accuratezza per Llama-2-70B e GPT-3.5-turbo nella sezione Llama 2.

  14. 2024

    Aggiunti Med-PaLM 2 e Radiology-Llama2 alla sezione LLM open source focalizzati sull'assistenza sanitaria.

  15. Aggiunto il modello Hippocratic AI alla sezione "LLM sanitari".

Cem Dilmegani
Cem Dilmegani
Analista principale
Cem è analista principale presso AIMultiple dal 2017.

Il lavoro di Cem presso AIMultiple è stato citato da importanti testate internazionali tra cui Business Insider, Forbes, Morning Brew e Washington Post, da aziende globali come Deloitte e HPE, da ONG come il World Economic Forum e da organizzazioni sovranazionali come la Commissione europea. [1], [2], [3], [4], [5]

Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente tecnologico e imprenditore tecnologico. Ha consigliato le aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per più di un decennio. Ha inoltre pubblicato un report McKinsey sulla digitalizzazione.

Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha inoltre guidato la crescita commerciale dell'azienda deep tech Hypatos, che ha raggiunto ricavi ricorrenti annuali a 7 cifre e una valutazione a 9 cifre partendo da zero in 2 anni. Il lavoro di Cem in Hypatos è stato ripreso da importanti testate tecnologiche come TechCrunch e Business Insider.

Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato come ingegnere informatico presso l'Università di Bogazici e possiede un MBA della Columbia Business School.
Visualizza il profilo completo
Ricercato da
Sıla Ermut
Sıla Ermut
Analista di settore
Sıla Ermut è un'analista di settore presso AIMultiple e si occupa di modelli di IA, infrastrutture di IA, governance dell'IA e applicazioni aziendali dell'IA. La sua ricerca si concentra principalmente sull'uso dell'IA nel marketing, nella sanità, nelle catene di approvvigionamento e nella sostenibilità.
In precedenza ha lavorato come reclutatrice in società di project management e consulenza. Sıla ha conseguito un Master of Science in Psicologia Sociale e un Bachelor of Arts in Relazioni Internazionali.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450