MedQA dataset'ini kullanarak 9 LLM'i benchmark ettik; bu, USMLE sorularından türetilen lisansüstü düzeyde bir klinik sınav benchmark'ıdır. Her model, standart bir prompt kullanarak aynı çoktan seçmeli klinik senaryoları yanıtladı; bu da doğrulukların doğrudan karşılaştırılmasını sağladı.
Ayrıca, toplam çalışma süresini tamamlanan MedQA öğesi sayısına bölerek soru başına gecikme süresini kaydettik.
Sağlık Hizmetlerinde LLM'ler benchmark sonuçları
Benchmark metodolojisi: Bu benchmark, sağlık hizmetlerindeki LLM'lerin denetimli fine-tuning performansını büyük genel amaçlı modellere karşı (GPT-4) medikal soru-cevaplama görevlerinde değerlendirir. Bkz. benchmark veri kaynakları.
MedQA: Amerika Birleşik Devletleri Tıp Lisanslama Sınavı'na dayanan çoktan seçmeli tıbbi sınav soruları.
Şekil 1: USMLE tarzı çoktan seçmeli klinik soru örneği.
MedMCQA: Gerçek dünyadaki tıbbi giriş sınavı sorularını ele almak için tasarlanmış büyük ölçekli, Çoktan Seçmeli Soru Cevaplama (MCQA) dataset'tir.
Şekil 2: Modelin doğru cevabı seçmesini ve klinik bulgularla ilgili açıklamaları yorumlamasını gerektiren büyük ölçekli bir tıbbi giriş sınavı çoktan seçmeli sorusu.
PubMedQA: Evet/hayır/belki yanıtları kullanan biyomedikal soru-cevaplama benchmark'ıdır.
Şekil 3: Modelin, verilen çalışma bağlamını kullanarak klinik bir iddianın doğruluğunu değerlendirmesi gereken biyomedikal bir evet/hayır/belki sorusu.
Sağlık Hizmetlerinde LLM Örnekleri
BERT benzeri (Yalnızca Encoder)
Biyomedikal metni kodlamak ve temsil etmek için optimize edilen bu modeller, sınıflandırma gibi görevler için özellik çıkarmada mükemmeldir.
ChatGPT / LLaMA benzeri (Decoder, talimat/sohbet ince ayarlı)
LLaMA tarzı mimarilere dayalıdır ve etkileşimli görevler ile klinik diyaloglar için optimize edilmiştir.
GPT / PaLM benzeri (Yalnızca Decoder, üretken)
GPT-3 veya PaLM'e benzer şekilde oluşturulan bu modeller, genel amaçlı metin üretimi ve özetleme için fine-tune edilmiştir.
Sağlık Hizmetlerinde Genel Amaçlı LLM'ler
*Llama 3.1 Instruct Turbo, 405B parametreli. Bkz. benchmark metodolojisi.
Önemli çıkarımlar:
- o1: En iyi performans gösteren model
- 03 mini: En iyi bütçe seçeneği
- GPT 4.1: En iyi hız ve yanıt süresi
- Doğruluk ve girdi maliyetinin ötesinde, modeller aynı zamanda tıbbi soru cevaplamaya yönelik temel yaklaşımlarında da farklılık gösterir.
Şekil 4: GPT-5 ile o3 yanıtları arasındaki farkları gösteren şekil.
Tıbbi LLM'lerde Fine-Tuning
Varsayılan ChatGPT (4o modeli) performansı, mevcut 'Clinical Medicine Handbook' asistanı ile karşılaştırılmıştır. Her iki modele aynı prompt verilmiş ve yanıtları analiz edilmiştir:
GPT 4o
Şekil 5: Şekil, GPT 4o varsayılan modelinin yanıtının doğru ancak aynı zamanda oldukça özetlendiğini göstermektedir.1
Fine-tuned tıbbi LLM
Şekil 6: Şekil, uzman ajanın yanıtını göstermektedir.1
Genel Amaçlı LLM'lerin Uygulamaları
Bu modelleri sağlık hizmetlerinde şunlardan yararlanarak kullanabilirsiniz:
- Tıbbi veriler üzerinde sürekli ön eğitim, modeli klinik notlara ve biyomedikal literatüre (PubMed gibi) maruz bırakarak tıbbi dili daha iyi tanımasına yardımcı olur.
- RAG çalışma anında doğru yanıtlar üretmek için doğrulanmış klinik belgelerden veri çekmeyi sağlar.
- Instruction fine-tuning, modelin klinik soruları yanıtlamayı veya metinden semptomları çıkarmayı öğrenmesini sağlar.
Şekil 7: Uzmanlaşmış kullanım durumları için LLM fine-tuning'in genel iş akışı.
Sağlık Kuruluşlarının LLM'leri Kullandığı Yerler
Sağlık kuruluşları, LLM'leri hem klinik hem de idari iş akışlarında test etmektedir. Yaygın uygulamalar arasında klinik dokümantasyon ve transkripsiyon, EHR özetleme, literatür taraması, hasta mesajı taslağı oluşturma, tıbbi kodlama, ön onay, klinisyen eğitimi ve hastaya yönelik açıklamalar yer alır.
Uygun model, kullanım durumu etiketinden çok iş yükü gereksinimlerine bağlıdır. Hastaya yönelik ve klinik karar destek uygulamaları genellikle daha güçlü tıbbi doğruluk, güvenlik değerlendirmesi, denetlenebilirlik ve veri koruma kontrolleri gerektirirken; idari iş yükleri maliyet, gecikme süresi, bağlam uzunluğu ve mevcut sistemlerle entegrasyona daha fazla ağırlık verebilir.
Sağlık Hizmetlerinde Büyük Dil Modelleri Metodolojisi
Benchmark metodolojisi: Bu benchmark, lisansüstü düzeydeki tıbbi sorularda 9 popüler genel LLM'i, MedQA dataset'ini kullanarak değerlendirir; bu dataset içeriğini United States Medical Licensing Examination (USMLE)'den alır. Her soru bir klinik senaryo ve çoktan seçmeli yanıt seçenekleri içerir.
LLM çıktıları: Her modele yapılandırılmış bir yanıt döndürmesi için prompt verildi (ör. “Cevap: C”).8
Gecikme süresi: Bir modelin tek bir MedQA prompt'una yanıt üretmek için harcadığı ortalama süre. Örneğin, 100 soru toplam 1.115 saniye sürüyorsa, ortalama gecikme süresi soru başına 11.15 saniyedir.
Sağlık Hizmetlerindeki LLM'ler için Benchmark Veri Kaynakları
Bu araştırmayı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Ermut, Sıla},
title = {{Sağlık Hizmetlerinde 9 Büyük Dil Modelini Karşılaştırın}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/large-language-models-in-healthcare}},
note = {AIMultiple. Erişim tarihi: 4 Eylül 2026}
}25 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 4 CSV dosyası içeren ZIP dosyası olarak indirin.
Değişiklik günlüğü
14 güncelleme- 2026
MedGemma ve yeni bir şekil ile "Klinik karar desteği" bölümü genişletildi.
- 2025
MedQA bölümüne Şekil 1 eklendi.
GPT 4.1 – En iyi hız ve yanıt süresi bölümündeki karşılaştırma metodolojisi değiştirildi.
Metodoloji bölümüne karşılaştırma metodolojisi eklendi.
Use cases of general purpose LLMs bölümüne ince ayar tıbbi LLM'ler eklendi.
LLM çıktıları bölümüne gecikme verileri eklendi.
Sağlık Hizmetleri LLM'leri kıyaslama bölümüne bir kıyaslama metodolojisi eklendi.
“Sağlık hizmetlerinde genel amaçlı Büyükl Dil Modelleri” bölümü kaldırıldı.
Makaleden Med-PaLM 2, MEDITRON-70B, Me-LLaMA, Radiology-Llama2, Health Acoustic Representations (HeAR), Hippocratic AI'dan Polaris 3.0 ve Med-PaLM M kaldırıldı.
Makalenin sonuna karşılaştırma veri kaynakları eklendi.
Açık kaynak sağlık LLM'leri bölümüne sağlık görevlerinde açık LLM'lerin bir karşılaştırması eklendi.
Llama 2 bölümündeki Llama-2-70B ve GPT-3.5-turbo için doğruluk puanları güncellendi.
- 2024
Açık kaynak sağlık odaklı LLM'ler bölümüne Med-PaLM 2 ve Radiology-Llama2 eklendi.
Hipokrat AI modelini "Sağlık Hizmetleri LLM'leri" bölümüne ekledi.
Referans Linkleri
Daha önce proje yönetimi ve danışmanlık firmalarında işe alım uzmanı olarak çalıştı. Sıla, Sosyal Psikoloji alanında yüksek lisans derecesine ve Uluslararası İlişkiler alanında lisans derecesine sahiptir.







Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.