Comparer 9 grands modèles de langage dans le secteur de la santé
Nous avons évalué 9 LLMs à l'aide du jeu de données MedQA, un benchmark d'examen clinique de niveau universitaire issu de questions de l'USMLE. Chaque modèle a répondu aux mêmes scénarios cliniques à choix multiples en utilisant un prompt standardisé, permettant une comparaison directe de la précision.
Nous avons également mesuré la latence par question en divisant le temps d'exécution total par le nombre d'items MedQA traités.
Résultats du benchmark des LLMs dans le secteur de la santé
Méthodologie du benchmark : Ce benchmark évalue les performances de fine-tuning supervisé des LLMs dans le secteur de la santé par rapport aux grands modèles généralistes (GPT-4) sur des tâches de réponse à des questions médicales. Voir sources de données du benchmark.
MedQA : Questions d'examen médical à choix multiples basées sur l'United States Medical Licensing Examination.
Figure 1 : Exemple de question clinique à choix multiples de type USMLE.
MedMCQA : Jeu de données de questions à choix multiples (MCQA) à grande échelle conçu pour répondre aux questions réelles des examens d'entrée en médecine.
Figure 2 : Une question à choix multiples d'un examen d'entrée en médecine à grande échelle demandant au modèle de sélectionner la réponse correcte et d'interpréter les explications associées sur les résultats cliniques.
PubMedQA : Benchmark de réponse à des questions biomédicales utilisant des réponses oui/non/peut-être.
Figure 3 : Une question biomédicale de type oui/non/peut-être, où le modèle doit juger de la justesse d'une affirmation clinique en utilisant le contexte de l'étude fournie.
Exemples de LLMs dans le secteur de la santé
De type BERT (Encodeur uniquement)
Optimisés pour l'encodage et la représentation de textes biomédicaux, ces modèles excellent dans l'extraction de caractéristiques pour des tâches telles que la classification.
Type ChatGPT / LLaMA (Décodeur, affiné par instructions/chat)
Basés sur des architectures de type LLaMA et optimisés pour les tâches interactives et les dialogues cliniques.
Type GPT / PaLM (Décodeur uniquement, génératif)
Construits de manière similaire à GPT-3 ou PaLM, ces modèles sont affinés pour la génération de texte et le résumé à usage général.
LLMs généralistes dans le secteur de la santé
*Llama 3.1 Instruct Turbo avec 405B paramètres. Voir méthodologie du benchmark.
Points clés à retenir :
- o1 : Modèle plus performant
- 03 mini : Meilleure option économique
- GPT 4.1 : Meilleure vitesse et temps de réponse
Au-delà de la précision et du coût d'entrée, les modèles diffèrent également dans leurs approches sous-jacentes pour répondre aux questions médicales. Par exemple, o3 utilise une approche plus analytique pas à pas, tandis que GPT-5 répond de manière empathique, organise et explique les informations clairement pour les non-experts :
Figure 4 : Figure montrant les différences entre les réponses de GPT-5 et o3.
Affinage des LLMs médicaux
Les performances du ChatGPT par défaut (modèle 4o) sont comparées à celles de l'assistant existant « Clinical Medicine Handbook ». Les deux modèles reçoivent le même prompt et leurs réponses sont analysées :
GPT 4o
Figure 5 : La figure montre que la réponse du modèle GPT 4o par défaut est précise mais aussi très résumée.1
LLM médical affiné
Figure 6 : La figure montre que la réponse de l'agent spécialisé est mieux expliquée et plus détaillée.2
Lire LLM fine-tuning et LLM training pour en savoir plus.
Applications des LLMs généralistes
Ces modèles sont des modèles généraux affinés qui nécessitent une adaptation au domaine pour effectuer des tâches cliniques avec précision. Vous pouvez utiliser ces modèles dans le secteur de la santé en tirant parti de :
- Pré-entraînement continu sur des données médicales pour aider le modèle à mieux identifier le langage médical en l'exposant à des notes cliniques et à la littérature biomédicale (comme PubMed).
- RAG pour extraire des données de documents cliniques vérifiés afin de produire des réponses précises au moment de l'exécution.
- Affinage par instructions pour permettre au modèle d'apprendre à répondre à des questions cliniques ou extraire des symptômes à partir de texte.
Figure 7 : Un flux de travail général de fine-tuning de LLM pour des cas d'usage spécialisés.
Cas d'usage des LLMs en milieu clinique
1. Transcription médicale
Les LLMs peuvent aider à créer des transcriptions médicales en :
- Écoutant le dialogue naturel entre un patient et un clinicien.
- Extrayant les détails médicaux critiques.
- Condensant les données médicales en dossiers médicaux conformes qui s'alignent sur les sections pertinentes d'un DSE.
Exemple concret : MedLM de Google peut capturer et transformer la conversation patient-clinicien en transcription médicale.9
2. Amélioration des dossiers de santé électroniques (DSE)
L'utilisation généralisée des dossiers de santé électroniques (DSE) a généré de vastes quantités de données sur les patients qui, lorsqu'elles sont utilisées efficacement, peuvent améliorer considérablement les soins de santé.
Par exemple, l'analyse des données des DSE peut aider les cliniciens à prendre de meilleures décisions en révélant des tendances dans les diagnostics, les traitements et les résultats. Elle peut également soutenir une détection plus précoce des maladies et des soins plus personnalisés en identifiant les facteurs de risque et en adaptant les traitements à chaque patient.
Au niveau du système, les données des DSE peuvent améliorer l'efficacité en réduisant les tests redondants, en mettant en évidence les lacunes dans les soins et en éclairant les politiques qui améliorent la qualité et réduisent les coûts.
Exemple concret : MedLM de Google est utilisé par BenchSci, Accenture et Deloitte pour améliorer les dossiers de santé électroniques (DSE).
- BenchSci a intégré MedLM dans sa plateforme ASCEND pour améliorer la qualité de la recherche préclinique.
- Accenture utilise MedLM pour organiser des données non structurées provenant de sources multiples, automatisant des opérations manuelles auparavant chronophages et sujettes aux erreurs.
- Deloitte travaille avec MedLM pour minimiser les frictions dans la recherche de traitement. Ils utilisent un chatbot interactif qui aide les participants aux régimes de santé à mieux comprendre les alternatives de prestataires.10
3. Aide à la décision clinique
Les LLMs aident les cliniciens à interpréter les informations spécifiques aux patients contenues dans les preuves médicales actuelles, en faisant émerger des considérations pertinentes lors du diagnostic ou de la planification du traitement sans remplacer le jugement clinique.
Exemple concret : MedGemma (Google DeepMind) est une collection de modèles médicaux à poids ouverts construits sur l'architecture Gemma 3 de Google. Plutôt que de fonctionner comme un outil de diagnostic direct pour le consommateur, MedGemma sert de base aux développeurs pour construire des applications médicales destinées aux cliniciens.
Conçu à la fois pour l'analyse de textes et d'images médicales, MedGemma peut interpréter des images médicales complexes, notamment des radiographies pulmonaires, des IRM et des scanners. Il prend également en charge les tâches de raisonnement clinique, telles que le résumé de notes de patients ou la réponse à des questions de type examen médical.
Selon une revue effectuée par un radiologue cardiothoracique certifié aux États-Unis, 81% des rapports de radiographie pulmonaire de MedGemma conduiraient à des décisions de prise en charge des patients similaires à celles basées sur les rapports originaux du radiologue (voir le graphique ci-dessous).
Figure 8 : Le graphique montre à quelle fréquence les rapports de radiographie pulmonaire générés par l'IA et les rapports originaux du radiologue conduisent à des résultats cliniques similaires ou différents dans les cas normaux, anormaux et tous les cas.11
4. Assistance à la recherche médicale
Dans la recherche médicale, la valeur fondamentale des LLMs réside dans leur capacité à accélérer la revue et la synthèse de la littérature.
Plutôt que de résumer des articles, les LLMs aident les chercheurs à suivre le rythme de la littérature biomédicale en expansion rapide en identifiant les études pertinentes, en extrayant les résultats clés et en synthétisant les informations provenant de sources multiples.
Exemple concret : Le chatbot de santé de John Snow aide les chercheurs à trouver des articles scientifiques pertinents, à extraire des informations clés et à identifier les tendances de recherche. Il est particulièrement utile pour naviguer dans la vaste littérature biomédicale.12
5. Communication automatisée avec les patients
Les grands modèles de langage dans le secteur de la santé peuvent rédiger des réponses informatives et compatissantes aux questions des patients. Voici quelques exemples :
- Gestion des médicaments et rappels : Un chatbot fournit aux patients des rappels réguliers pour prendre leurs médicaments contre le diabète et demande une confirmation.
- Suivi de la santé et soins de suivi : Un patient postopératoire envoie son état de douleur et de plaie à un chatbot, qui détermine si le processus de guérison progresse.
- Communication informationnelle et éducative : Un patient demande à un chatbot comment gérer l'hypertension artérielle, et le chatbot répond avec des conseils nutritionnels et de mode de vie.
Exemple concret : ChatGPT Health permet aux utilisateurs de connecter en toute sécurité leurs dossiers médicaux et leurs données de bien-être (par exemple, Apple Health ou MyFitnessPal). Les utilisateurs peuvent ensuite poser à ChatGPT des questions sur leurs propres données, telles que « Comment évolue mon cholestérol ? » ou « Résume mes derniers résultats de laboratoire. »13
Exemple concret : Le Boston Children's Hospital utilise Buoy Health, un chatbot de vérification des symptômes en ligne piloté par l'IA, qui fournit aux patients des réponses instantanées aux questions liées à la santé et des consultations initiales.
Le chatbot peut trier les patients en analysant leurs symptômes et en indiquant s'ils doivent consulter un médecin.14
6. Prédiction des résultats de santé
Les LLMs peuvent être positionnés pour permettre la stratification des risques et la prévision dans le secteur de la santé. En soutenant l'analyse des données cliniques structurées et non structurées, les LLMs peuvent aider à identifier les patients à risque élevé (comme une réadmission à l'hôpital) et à soutenir la planification proactive des soins, souvent en combinaison avec des modèles prédictifs traditionnels.
Exemple concret : Les pharmaciens de WVU utilisent un algorithme prédictif pour déterminer le risque de réadmission. Cette approche examinera les données des dossiers de santé électroniques (DSE), qui incluent les données démographiques des patients, les antécédents cliniques et les déterminants socio-économiques de la santé.
Sur la base de cette recherche, les pharmaciens de WVU identifient les patients à haut risque de réadmission et attribuent des coordinateurs de soins pour les suivre après leur sortie. Cela peut aider à réduire les taux de réadmission.15
7. Plans de traitement personnalisés
En intégrant les antécédents médicaux, les symptômes et les données de santé longitudinales, les LLMs peuvent aider à traduire des informations complexes sur les patients en considérations de soins individualisées, soutenant des discussions de traitement plus personnalisées et tenant compte du contexte entre cliniciens et patients.
Exemple concret : Le chatbot IA de Babylon Health fournit des recommandations de santé individualisées basées sur les symptômes et les antécédents médicaux de l'utilisateur. Il engage l'utilisateur dans une conversation en posant des questions pertinentes pour mieux analyser ses problèmes et en donnant des recommandations personnalisées.16
8. Codage médical et facturation
Les grands modèles de langage peuvent automatiser les processus d'audit en analysant les dossiers des patients et les DSE.
Exemple concret : Epic Systems, un fournisseur de DSE, intègre des LLMs dans son logiciel pour aider au codage et à la facturation. Les LLMs peuvent surveiller les anomalies dans les modèles d'accès aux informations sensibles des patients ou les incohérences dans les pratiques de codage et de facturation.17
Exemple concret : Claude pour la santé (Anthropic) est une plateforme orientée entreprise conçue pour les organisations de santé, les prestataires et les assureurs. Elle connecte de grands modèles de langage à des bases de données médicales professionnelles telles que l'ICD-10 et la CMS Coverage Database, permettant aux hôpitaux d'automatiser les flux de travail administratifs. Ces flux de travail incluent les autorisations préalables d'assurance, le résumé des dossiers des patients et le tri des messages du portail patient.18
Cependant, les LLMs ne sont pas encore tout à fait prêts pour le codage médical, mais leurs contributions sont prometteuses : Des chercheurs ont examiné à quelle fréquence quatre LLMs (GPT-3.5, GPT-4, Gemini Pro, et Llama2-70b Chat) émettaient les codes CPT, ICD-9-CM, et ICD-10-CM corrects.
Leurs conclusions montrent une marge d'amélioration significative. Les chercheurs ont constaté que les LLMs génèrent souvent des codes qui transmettent des informations inexactes, avec une précision maximale de 50%.19
9. Formation et éducation
Les grands modèles de langage et l'IA générative peuvent être utilisés comme outils éducatifs interactifs, aidant les cliniciens et les patients à mieux comprendre des concepts médicaux complexes et à clarifier des informations confuses.
Cas d'usage concret : Oxford Medical Simulation utilise des LLMs intégrés à la technologie VR pour créer des simulations immersives de patients virtuels.
Ces simulations permettent aux étudiants de vivre des scénarios à haute pression, comme la prise en charge d'un patient en arrêt cardiaque, sans conséquences réelles.
Les LLMs alimentent les réponses des patients virtuels, les rendant plus réalistes et imprévisibles, préparant les étudiants à la variabilité des environnements cliniques réels.20
10. Découverte et développement de médicaments
Les LLMs accélèrent la recherche pharmaceutique en raccourcissant les cycles de développement et en réduisant le coût de mise sur le marché de nouveaux composés. Ces modèles peuvent :
- Analyser des structures moléculaires complexes et signaler des composés à potentiel thérapeutique.
- Prédire l'efficacité et le profil de sécurité des médicaments candidats avant les tests en laboratoire.
- Suggérer de nouvelles configurations moléculaires visant des cibles thérapeutiques spécifiques.
- Optimiser les composés principaux pour améliorer la pharmacocinétique et réduire les effets secondaires.
Les modèles de langage chimique, un sous-ensemble de LLMs construits spécifiquement pour les applications pharmaceutiques, ont produit des résultats mesurables dans la conception de médicaments de novo. La recherche indique que les modèles à démarrage à chaud (ceux initialisés à partir de modèles de langage biochimiques pré-entraînés) génèrent des composés de meilleure qualité que les approches de base.21
11. Radiologie et imagerie médicale
Les LLMs multimodaux qui traitent à la fois le texte et les images peuvent examiner les images médicales parallèlement aux données cliniques pour soutenir la détection d'anomalies et contribuer à des interprétations diagnostiques plus précises.
- Interprétation d'images : Des modèles tels que Med-Flamingo et LLaVA-Med analysent les images médicales dans un contexte clinique, aidant les radiologues à détecter précocement des conditions visibles sur les radiographies pulmonaires, les IRM et les scanners.
- Génération automatique de rapports : Des systèmes comme ChatCAD génèrent des rapports de radiologie directement à partir des données d'imagerie, répondant à l'une des tâches les plus chronophages dans les services d'imagerie à volume élevé.
12. Littératie en santé et accessibilité linguistique
Un écart pratique dans les soins aux patients est la distance entre le langage clinique et le langage que les patients utilisent pour décrire leur propre santé. Les LLMs peuvent aider à combler cet écart en :
- Traduisant la terminologie médicale et le jargon en langage clair au niveau de lecture du patient.
- Combler les différences linguistiques entre les patients et les prestataires dans les contextes de soins multilingues.
- Expliquant les options de traitement, les résultats des tests et les plans de soins dans des formats que les patients peuvent utiliser.
Une meilleure compréhension du patient est associée à une meilleure observance du traitement et à de meilleurs résultats.
Défis des LLMs dans le secteur de la santé
Préoccupations en matière de confidentialité
L'utilisation d'applications de santé basées sur des LLMs qui n'ont pas été correctement développées, testées ou approuvées pour un usage médical peut présenter des risques significatifs pour les utilisateurs, notamment en ce qui concerne la confidentialité des données.
Ces outils traitent souvent des informations de santé sensibles fournies par l'utilisateur, mais il n'est pas toujours clair comment ces données sont stockées, partagées, ou si les applications sont pleinement conformes aux lois et réglementations existantes en matière de protection des données.22
Précision et fiabilité
Les LLMs sont également sujets aux hallucinations, des informations plausibles mais incorrectes ou trompeuses.
Par exemple, lorsqu'on lui a posé une question médicale, GPT-3.5 a incorrectement recommandé la tétracycline pour une patiente enceinte, bien qu'il ait correctement expliqué son potentiel nocif pour le fœtus.23
Figure 8 : Un exemple de GPT-3.5 montrant la recommandation incorrecte d'un médicament.
Généralisation vs. spécialisation
Un LLM entraîné sur des données médicales générales peut ne pas avoir l'expertise détaillée nécessaire pour des spécialités médicales spécifiques.
Biais et considérations éthiques
Au-delà de la précision, il existe des préoccupations éthiques, telles que le potentiel des LLMs à perpétuer les biais présents dans leurs données d'entraînement. Cela pourrait entraîner des recommandations de soins inégales pour différents groupes démographiques.
Pour plus de détails sur les défis des grands modèles de langage, lisez les risques de l'IA générative et l'éthique de l'IA générative.
L'avenir des LLMs dans le secteur de la santé
L'analyse de Stanford indique qu'il existe un potentiel inexploité significatif pour les LLMs dans le secteur de la santé.24
Alors que de nombreux LLMs ont été utilisés pour des tâches telles que l'augmentation des diagnostics ou la communication avec les patients, moins se sont concentrés sur les tâches administratives qui contribuent à l'épuisement des cliniciens.
À l'avenir, les LLMs pourraient évoluer pour interagir avec le comportement, plus de contexte, et les émotions, leur permettant de fournir un soutien plus personnalisé et empathique.
Méthodologie des grands modèles de langage dans le secteur de la santé
Méthodologie du benchmark : Ce benchmark évalue 9 LLMs généralistes populaires sur des questions médicales de niveau universitaire en utilisant le jeu de données MedQA, qui tire son contenu de l'United States Medical Licensing Examination (USMLE). Chaque question comprend un scénario clinique et des options de réponse à choix multiples.
LLM outputs : Chaque modèle a été incité à renvoyer une réponse structurée (par exemple, « Réponse : C »).25
Latence : Le temps moyen qu'un modèle met pour générer une réponse à un seul prompt MedQA. Par exemple, si 100 questions prennent 1 115 secondes au total, la latence moyenne est de 11,15 secondes par question.
Sources de données du benchmark des LLMs dans le secteur de la santé
Citer cette recherche
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Comparer 9 grands modèles de langage dans le secteur de la santé}},
year = {2026},
month = may,
howpublished = {\url{https://aimultiple.com/large-language-models-in-healthcare}},
note = {AIMultiple. Consulté le 21 Mai 2026}
}








Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.