Vergleich von 9 großen Sprachmodellen im Gesundheitswesen
Wir haben 9 LLMs mit dem MedQA-Datensatz bewertet, einem Benchmark auf Hochschulniveau für klinische Prüfungen, das aus USMLE-Fragen abgeleitet ist. Jedes Modell beantwortete dieselben klinischen Multiple-Choice-Szenarien mithilfe eines standardisierten Prompt, was einen direkten Vergleich der Genauigkeit ermöglicht.
Wir haben außerdem die Latenz pro Frage aufgezeichnet, indem wir die Gesamtlaufzeit durch die Anzahl der abgeschlossenen MedQA-Aufgaben geteilt haben.
Benchmark-Ergebnisse für LLMs im Gesundheitswesen
Benchmark-Methodik: Dieser Benchmark bewertet die Leistung des überwachten Fine-Tunings von LLMs im Gesundheitswesen im Vergleich zu großen Allzweckmodellen (GPT-4) bei medizinischen Frage-Antwort-Aufgaben. Siehe Benchmark-Datenquellen.
MedQA: Multiple-Choice-Fragen aus medizinischen Prüfungen, die auf der United States Medical Licensing Examination basieren.
Abbildung 1: Beispiel einer klinischen Multiple-Choice-Frage im USMLE-Stil.
MedMCQA: Großer, für Multiple-Choice-Fragenbeantwortung (MCQA) konzipierter Datensatz, der reale Fragen aus medizinischen Aufnahmeprüfungen abdeckt.
Abbildung 2: Eine groß angelegte Multiple-Choice-Frage aus einer medizinischen Aufnahmeprüfung, bei der das Modell die richtige Antwort auswählen und zugehörige Erklärungen zu klinischen Befunden interpretieren muss.
PubMedQA: Biomedizinischer Frage-Antwort-Benchmark mit Ja/Nein/Vielleicht-Antworten.
Abbildung 3: Eine biomedizinische Ja/Nein/Vielleicht-Frage, bei der das Modell die Richtigkeit einer klinischen Behauptung anhand des bereitgestellten Studienkontexts beurteilen muss.
Beispiele für LLM im Gesundheitswesen
BERT-artig (nur Encoder)
Diese Modelle sind für das Kodieren und Repräsentieren biomedizinischer Texte optimiert und zeichnen sich durch die Extraktion von Merkmalen für Aufgaben wie Klassifizierung aus.
ChatGPT / LLaMA-ähnlich (Decoder, anweisungs-/chat-abgestimmt)
Basiert auf LLaMA-artigen Architekturen und optimiert für interaktive Aufgaben und klinische Dialoge.
GPT / PaLM-artig (nur Decoder, generativ)
Diese Modelle sind ähnlich wie GPT-3 oder PaLM aufgebaut und für allgemeine Textgenerierung und Zusammenfassung fine-tuned.
Allgemeine LLMs im Gesundheitswesen
*Llama 3.1 Instruct Turbo mit 405B Parametern. Siehe Benchmark-Methodik.
Wichtige Erkenntnisse:
- o1: Modell mit der besten Leistung
- 03 mini: Beste Budget-Option
- GPT 4.1: Beste Geschwindigkeit und Reaktionszeit
Über Genauigkeit und Eingabekosten hinaus unterscheiden sich Modelle auch in ihren zugrunde liegenden Ansätzen zur medizinischen Fragenbeantwortung. Zum Beispiel verwendet o3 einen eher schrittweisen, analytischen Ansatz, während GPT-5 einfühlsam antwortet, Informationen organisiert und für Laien klar erklärt:
Abbildung 4: Abbildung, die Unterschiede zwischen den Antworten von GPT-5 und o3 zeigt.
Fine-tuning medizinischer LLMs
Die Leistung des Standard-ChatGPT (4o-Modell) wird mit dem bestehenden Assistenten „Clinical Medicine Handbook“ verglichen. Beide Modelle erhalten denselben Prompt, und ihre Antworten werden analysiert:
GPT 4o
Abbildung 5: Die Abbildung zeigt, dass die Antwort des Standardmodells GPT 4o korrekt, aber auch stark zusammengefasst ist.1
Fine-tuned medizinisches LLM
Abbildung 6: Die Abbildung zeigt, dass die Antwort des spezialisierten Agenten besser erklärt und detaillierter ist.1
Lesen Sie LLM-Fine-tuning und LLM-Training für weitere Informationen.
Anwendungen von allgemeinen LLMs
Diese Modelle sind allgemein fine-tuned Modelle, die eine Domänenanpassung benötigen, um klinische Aufgaben präzise auszuführen. Sie können diese Modelle im Gesundheitswesen einsetzen, indem Sie Folgendes nutzen:
- Kontinuierliches Pretraining auf medizinischen Daten, um dem Modell zu helfen, medizinische Sprache besser zu erkennen, indem es klinischen Notizen und biomedizinischer Literatur (wie PubMed) ausgesetzt wird.
- RAG , um Daten aus verifizierten klinischen Dokumenten zu beziehen und zur Laufzeit präzise Antworten zu erzeugen.
- Instruction Fine-tuning, um dem Modell zu ermöglichen, zu lernen, klinische Fragen zu beantworten oder Symptome aus Text zu extrahieren.
Abbildung 7: Ein allgemeiner Arbeitsablauf des LLM-Fine-tuning für spezialisierte Anwendungsfälle.
Anwendungsfälle von LLMs im klinischen Umfeld
1. Medizinische Transkription
LLMs können bei der Erstellung medizinischer Transkriptionen helfen, indem sie:
- dem natürlichen Dialog zwischen einem Patienten und einem Kliniker zuhören.
- kritische medizinische Details extrahieren.
- medizinische Daten in konforme medizinische Aufzeichnungen verdichten, die mit den relevanten Abschnitten einer EHR übereinstimmen.
Praxisbeispiel: Das MedLM von Google kann das Patient-Kliniker-Gespräch erfassen und in eine medizinische Transkription umwandeln.8
2. Verbesserung elektronischer Gesundheitsakten (EHR)
Die weit verbreitete Nutzung elektronischer Gesundheitsakten (EHRs) hat riesige Mengen an Patientendaten erzeugt, die bei effektiver Nutzung die Gesundheitsversorgung erheblich verbessern können.
Beispielsweise kann die Analyse von EHR-Daten Klinikern helfen, bessere Entscheidungen zu treffen, indem sie Muster in Diagnosen, Behandlungen und Ergebnissen aufzeigt. Sie kann auch eine frühere Krankheitserkennung und eine personalisiertere Versorgung unterstützen, indem Risikofaktoren identifiziert und Behandlungen auf einzelne Patienten zugeschnitten werden.
Auf Systemebene können EHR-Daten die Effizienz verbessern, indem sie überflüssige Tests reduzieren, Versorgungslücken aufzeigen und politische Maßnahmen informieren, die Qualität steigern und Kosten senken.
Praxisbeispiel: Das MedLM von Google wird von BenchSci, Accenture und Deloitte zur Verbesserung elektronischer Gesundheitsakten (EHRs) verwendet.
- BenchSci hat MedLM in seine ASCEND-Plattform integriert, um die Qualität der präklinischen Forschung zu verbessern.
- Accenture nutzt MedLM, um unstrukturierte Daten aus mehreren Quellen zu organisieren und zuvor zeitaufwändige, fehleranfällige manuelle Abläufe zu automatisieren.
- Deloitte arbeitet mit MedLM zusammen, um Reibungsverluste bei der Behandlungssuche zu minimieren. Sie nutzen einen interaktiven Chatbot, der Teilnehmern von Gesundheitstarifen hilft, die Anbieteralternativen besser zu verstehen.9
3. Klinische Entscheidungsunterstützung
LLMs helfen Klinikern, patientenspezifische Informationen in der aktuellen medizinischen Evidenz zu interpretieren, und bringen relevante Überlegungen bei der Diagnose- oder Behandlungsplanung ans Licht, ohne die klinische Beurteilung zu ersetzen.
Praxisbeispiel: MedGemma (Google DeepMind) ist eine Sammlung von medizinischen Open-Weight-Modellen, die auf der Gemma-3-Architektur von Google aufbauen. Anstatt als direktes Diagnosetool für Verbraucher zu fungieren, dient MedGemma als Grundlage für Entwickler, um klinisch ausgerichtete medizinische Anwendungen zu erstellen.
MedGemma ist sowohl für die Analyse medizinischer Texte als auch von Bildern konzipiert und kann komplexe medizinische Bilder interpretieren, darunter Röntgenaufnahmen des Brustkorbs, MRTs und CT-Scans. Es unterstützt auch klinische Argumentationsaufgaben, wie das Zusammenfassen von Patientennotizen oder die Beantwortung medizinischer Prüfungsfragen im Stil von Fachgremien.
Laut einer Überprüfung durch einen in den USA zertifizierten Herz-Thorax-Radiologen würden 81 % der Thorax-Röntgenberichte von MedGemma zu ähnlichen Patientenmanagement-Entscheidungen führen wie die ursprünglichen Radiologieberichte (siehe Grafik unten).
Abbildung 8: Die Grafik zeigt, wie oft KI-generierte Thorax-Röntgenberichte und ursprüngliche Radiologieberichte zu ähnlichen oder unterschiedlichen klinischen Ergebnissen bei normalen, auffälligen und allen Fällen führen.10
4. Unterstützung bei der medizinischen Forschung
In der medizinischen Forschung liegt der Kernwert von LLMs in ihrer Fähigkeit, die Literaturrecherche und -synthese zu beschleunigen.
Statt Arbeiten zusammenzufassen, helfen LLMs Forschern, mit der rasch wachsenden biomedizinischen Literatur Schritt zu halten, indem sie relevante Studien identifizieren, wichtige Erkenntnisse extrahieren und Einsichten aus mehreren Quellen synthetisieren.
Praxisbeispiel: Der Gesundheits-Chatbot von John Snow hilft Forschern, relevante wissenschaftliche Arbeiten zu finden, wichtige Erkenntnisse zu extrahieren und Forschungstrends zu erkennen. Er ist besonders wertvoll für die Navigation durch die riesige Menge biomedizinischer Literatur.11
5. Automatisierte Patientenkommunikation
LLM im Gesundheitswesen können informative und mitfühlende Antworten auf Patientenanfragen entwerfen. Einige Beispiele sind:
- Medikamentenmanagement und Erinnerungen: Ein Chatbot erinnert Patienten regelmäßig an die Einnahme ihrer Diabetes-Medikamente und bittet um Bestätigung.
- Gesundheitsüberwachung und Nachsorge: Ein postoperativer Patient sendet seinen Schmerz- und Wundstatus an einen Chatbot, der feststellt, ob der Heilungsprozess voranschreitet.
- Informations- und Aufklärungskommunikation: Ein Patient fragt einen Chatbot, wie er hohen Blutdruck behandeln kann, und der Chatbot antwortet mit Ernährungs- und Lebenstipps.
Praxisbeispiel: ChatGPT Health ermöglicht es Nutzern, ihre medizinischen Aufzeichnungen und Wellness-Daten sicher zu verbinden (z. B. Apple Health oder MyFitnessPal). Nutzer können ChatGPT dann Fragen zu ihren eigenen Daten stellen, wie „Wie entwickelt sich mein Cholesterin?“ oder „Fassen Sie meine neuesten Laborergebnisse zusammen.“12
Praxisbeispiel: Das Boston Children’s Hospital nutzt Buoy Health, einen KI-gesteuerten Online-Symptomchecker-Chatbot, der Patienten sofortige Antworten auf gesundheitsbezogene Fragen und Erstberatungen bietet.
Der Chatbot kann Patienten triagieren, indem er ihre Symptome analysiert und einschätzt, ob sie einen Arzt aufsuchen müssen.13
6. Prädiktive Gesundheitsergebnisse
LLMs können so positioniert werden, dass sie Risikostratifizierung und Prognosen im Gesundheitswesen ermöglichen. Durch die Unterstützung der Analyse strukturierter und unstrukturierter klinischer Daten können LLMs helfen, Patienten mit erhöhtem Risiko (wie z. B. Krankenhauswiederaufnahme) zu identifizieren und eine proaktive Versorgungsplanung zu unterstützen, häufig in Kombination mit herkömmlichen prädiktiven Modellen.
Praxisbeispiel: Apotheker der WVU verwenden einen prädiktiven Algorithmus, um das Wiederaufnahmerisiko zu bestimmen. Dieser Ansatz untersucht Daten aus elektronischen Gesundheitsakten (EHRs), die Patientendemografie, klinische Vorgeschichte und sozioökonomische Gesundheitsfaktoren umfassen.
Basierend auf dieser Forschung identifizieren die WVU-Apotheker Patienten mit hohem Wiederaufnahmerisiko und weisen ihnen Versorgungskoordinatoren zu, die sie nach der Entlassung nachbetreuen. Dies kann dazu beitragen, die Wiederaufnahmeraten zu senken.14
7. Personalisierte Behandlungspläne
Durch die Integration von Krankengeschichte, Symptomen und longitudinalen Gesundheitsdaten können LLMs helfen, komplexe Patienteninformationen in individualisierte Versorgungsüberlegungen zu übersetzen, und so personalisiertere und kontextbewusstere Behandlungsgespräche zwischen Klinikern und Patienten unterstützen.
Praxisbeispiel: Der KI-Chatbot von Babylon Health bietet individualisierte Gesundheitsempfehlungen basierend auf den Symptomen und der Krankengeschichte des Nutzers. Er bindet Nutzer in ein Gespräch ein, indem er relevante Fragen stellt, um ihre Probleme besser zu analysieren, und maßgeschneiderte Empfehlungen gibt.15
8. Medizinische Kodierung und Abrechnung
LLM können Prüfprozesse automatisieren, indem sie Patientenakten und EHRs analysieren.
Praxisbeispiel: Epic Systems, ein EHR-Anbieter, integriert LLMs in seine Software, um bei der Kodierung und Abrechnung zu unterstützen. Die LLMs können auf Anomalien in Zugriffsmustern auf sensible Patientendaten oder auf Unstimmigkeiten bei Kodierungs- und Abrechnungspraktiken achten.16
Praxisbeispiel: Claude for Healthcare (Anthropic) ist eine unternehmensorientierte Plattform für Gesundheitsorganisationen, Leistungserbringer und Versicherer. Sie verbindet große Sprachmodelle mit professionellen medizinischen Datenbanken wie ICD-10 und der CMS Coverage Database und ermöglicht es Krankenhäusern, administrative Arbeitsabläufe zu automatisieren. Zu diesen Arbeitsabläufen gehören Versicherungsvorabgenehmigungen, die Zusammenfassung von Patientendiagrammen und die Triage von Nachrichten im Patientenportal.17
Allerdings sind LLMs noch nicht vollständig bereit für die medizinische Kodierung, aber ihre Beiträge sind vielversprechend: Forscher untersuchten, wie häufig vier LLMs (GPT-3.5, GPT-4, Gemini Pro und Llama2-70b Chat) die korrekten CPT-, ICD-9-CM- und ICD-10-CM-Codes ausgaben.
Ihre Ergebnisse zeigen erhebliches Verbesserungspotenzial. Die Forscher fanden heraus, dass LLMs oft Code erzeugen, der ungenaue Informationen übermittelt, mit einer maximalen Genauigkeit von 50 %.18
9. Aus- und Weiterbildung
LLM und generative KI können als interaktive Lehrmittel eingesetzt werden, um Klinikern und Patienten zu helfen, komplexe medizinische Konzepte besser zu verstehen und verwirrende Informationen zu klären.
Praxisbeispiel: Oxford Medical Simulation nutzt LLMs, die mit VR-Technologie integriert sind, um immersive virtuelle Patientensimulationen zu erstellen.
Diese Simulationen ermöglichen es Studierenden, Drucksituationen zu erleben, wie z. B. die Versorgung eines Patienten mit Herzstillstand, ohne reale Konsequenzen.
Die LLMs steuern die Reaktionen der virtuellen Patienten, machen sie realistischer und unvorhersehbarer und bereiten die Studierenden auf die Variabilität realer klinischer Umgebungen vor.19
10. Arzneimittelforschung und -entwicklung
LLMs beschleunigen die pharmazeutische Forschung, indem sie Entwicklungszyklen verkürzen und die Kosten für die Markteinführung neuer Verbindungen senken. Diese Modelle können:
- komplexe Molekülstrukturen analysieren und Verbindungen mit therapeutischem Potenzial kennzeichnen.
- die Wirksamkeit und das Sicherheitsprofil von Arzneimittelkandidaten vor Labortests vorhersagen.
- neue molekulare Konfigurationen vorschlagen, die auf bestimmte therapeutische Ziele ausgerichtet sind.
- Leitverbindungen optimieren, um die Pharmakokinetik zu verbessern und Nebenwirkungen zu reduzieren.
Chemische Sprachmodelle, eine Untergruppe von LLMs, die speziell für pharmazeutische Anwendungen entwickelt wurden, haben messbare Ergebnisse im de novo Wirkstoffdesign erzielt. Forschungsergebnisse deuten darauf hin, dass warmgestartete Modelle (die aus vortrainierten biochemischen Sprachmodellen initialisiert werden) qualitativ hochwertigere Verbindungen erzeugen als Basisansätze.20
11. Radiologie und medizinische Bildgebung
Multimodale LLMs, die sowohl Text als auch Bilder verarbeiten, können medizinische Bilder zusammen mit klinischen Daten überprüfen, um die Erkennung von Anomalien zu unterstützen und zu präziseren diagnostischen Interpretationen beizutragen.
- Bildinterpretation: Modelle wie Med-Flamingo und LLaVA-Med analysieren medizinische Bilder im klinischen Kontext und unterstützen Radiologen bei der Früherkennung von Erkrankungen, die auf Thorax-Röntgenaufnahmen, MRTs und CT-Scans sichtbar sind.
- Automatisierte Befunderstellung: Systeme wie ChatCAD generieren radiologische Berichte direkt aus Bilddaten und adressieren damit eine der zeitaufwändigeren Aufgaben in bildgebenden Abteilungen mit hohem Volumen.
12. Gesundheitskompetenz und sprachliche Zugänglichkeit
Eine praktische Lücke in der Patientenversorgung ist die Distanz zwischen der klinischen Sprache und der Sprache, die Patienten verwenden, um ihre eigene Gesundheit zu beschreiben. LLMs können helfen, diese Lücke zu schließen, indem sie:
- medizinische Terminologie und Fachjargon in einfache Sprache auf dem Leseniveau des Patienten übersetzen.
- Sprachunterschiede zwischen Patienten und Anbietern in mehrsprachigen Versorgungsumgebungen überbrücken.
- Behandlungsoptionen, Testergebnisse und Versorgungspläne in Formaten erklären, nach denen Patienten handeln können.
Ein besseres Verständnis der Patienten ist mit besserer Therapietreue und besseren Ergebnissen verbunden.
Herausforderungen von LLMs im Gesundheitswesen
Datenschutzbedenken
Die Nutzung von LLM-basierten Gesundheitsanwendungen, die nicht ordnungsgemäß entwickelt, getestet oder für den medizinischen Gebrauch zugelassen wurden, kann erhebliche Risiken für Nutzer darstellen, insbesondere im Hinblick auf den Datenschutz.
Diese Tools verarbeiten häufig sensible, vom Nutzer bereitgestellte Gesundheitsinformationen, doch es ist nicht immer klar, wie diese Daten gespeichert und weitergegeben werden oder ob die Anwendungen die bestehenden Datenschutzgesetze und -vorschriften vollständig einhalten.21
Genauigkeit und Zuverlässigkeit
LLMs neigen auch zu Halluzinationen, plausibel klingenden, aber falschen oder irreführenden Informationen.
Beispielsweise empfahl GPT-3.5 bei einer medizinischen Anfrage fälschlicherweise Tetracyclin für eine schwangere Patientin, obwohl es die potenzielle Schädigung des Fötus korrekt erklärte.21
Abbildung 8: Ein Beispiel von GPT-3.5, das die falsche Empfehlung eines Medikaments zeigt.
Generalisierung vs. Spezialisierung
Ein auf allgemeinen medizinischen Daten trainiertes LLM verfügt möglicherweise nicht über das detaillierte Fachwissen, das für bestimmte medizinische Fachgebiete erforderlich ist.
Verzerrungen und ethische Überlegungen
Jenseits der Genauigkeit gibt es ethische Bedenken, etwa die Möglichkeit, dass LLMs Verzerrungen in ihren Trainingsdaten fortschreiben. Dies könnte zu ungleichen Versorgungsempfehlungen für verschiedene demografische Gruppen führen.
Weitere Einzelheiten zu den Herausforderungen großer Sprachmodelle finden Sie unter den Risiken generativer KI und Ethik generativer KI.
Die Zukunft von LLMs im Gesundheitswesen
Die Analyse von Stanford zeigt, dass es erhebliches ungenutztes Potenzial für LLMs im Gesundheitswesen gibt.17
Während viele LLMs für Aufgaben wie die Ergänzung der Diagnostik oder die Patientenkommunikation eingesetzt wurden, haben sich weniger auf administrative Aufgaben konzentriert, die zum Burnout von Klinikern beitragen.
In Zukunft könnten sich LLMs weiterentwickeln, um mit Verhalten, mehr Kontext und Emotionen zu interagieren, sodass sie personalisiertere und empathischere Unterstützung bieten können.
Methodik großer Sprachmodelle im Gesundheitswesen
Benchmark-Methodik: Dieser Benchmark bewertet 9 beliebte allgemeine LLMs anhand medizinischer Fragen auf Hochschulniveau unter Verwendung des MedQA-Datensatzes, dessen Inhalte aus der United States Medical Licensing Examination (USMLE) stammen. Jede Frage umfasst ein klinisches Szenario und Multiple-Choice-Antwortoptionen.
LLM-Ausgaben: Jedes Modell wurde aufgefordert, eine strukturierte Antwort zurückzugeben (z. B. „Antwort: C“).18
Latenz: Die durchschnittliche Zeit, die ein Modell benötigt, um eine Antwort auf einen einzelnen MedQA-Prompt zu generieren. Wenn beispielsweise 100 Fragen insgesamt 1.115 Sekunden dauern, beträgt die durchschnittliche Latenz 11.15 Sekunden pro Frage.
LLMs im Gesundheitswesen – Benchmark-Datenquellen
Diese Forschung zitieren
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Vergleich von 9 großen Sprachmodellen im Gesundheitswesen}},
year = {2026},
month = may,
howpublished = {\url{https://aimultiple.com/large-language-models-in-healthcare}},
note = {AIMultiple. Abgerufen am 21. Mai 2026}
}Referenzlinks
Cems Arbeit wurde von führenden globalen Publikationen zitiert, darunter Business Insider, Forbes, Washington Post, globalen Unternehmen wie Deloitte, HPE und NGOs wie dem World Economic Forum sowie supranationalen Organisationen wie der European Commission.
Während seiner Karriere war Cem als Tech-Berater, Tech-Einkäufer und Tech-Unternehmer tätig. Er beriet Unternehmen über ein Jahrzehnt lang bei McKinsey & Company und Altman Solon in Technologieentscheidungen. Er veröffentlichte auch einen McKinsey-Bericht zur Digitalisierung.
Er leitete die Technologiestrategie und Beschaffung eines Telekommunikationsunternehmens und berichtete dabei direkt an den CEO. Zudem führte er das kommerzielle Wachstum des Deep-Tech-Unternehmens Hypatos an, das innerhalb von 2 Jahren von null auf einen siebenstelligen jährlich wiederkehrenden Umsatz und eine neunstellige Bewertung anwuchs. Cems Arbeit bei Hypatos wurde von führenden Technologiepublikationen wie TechCrunch und Business Insider aufgegriffen.
Cem spricht regelmäßig auf internationalen Technologiekonferenzen. Er schloss sein Studium an der Bogazici University als Computer-Ingenieur ab und hat einen MBA von der Columbia Business School.









Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.