Avaliamos 9 LLMs usando o dataset MedQA, um benchmark de exame clínico de nível de pós-graduação derivado das perguntas do USMLE. Cada modelo respondeu aos mesmos cenários clínicos de múltipla escolha usando um prompt padronizado, permitindo a comparação direta da precisão.
Também registramos a latência por pergunta dividindo o tempo total de execução pelo número de itens do MedQA concluídos.
Resultados do benchmark de LLMs na saúde
Metodologia do benchmark: Este benchmark avalia o desempenho de fine-tuning supervisionado de LLMs de saúde vs. grandes modelos de uso geral (GPT-4) em resposta a perguntas médicas tarefas. Consulte fontes de dados do benchmark.
MedQA: perguntas de múltipla escolha de exames médicos baseadas no Exame de Licenciamento Médico dos Estados Unidos.
Figura 1: Exemplo de pergunta clínica de múltipla escolha no estilo USMLE.
MedMCQA: dataset de Resposta a Perguntas de Múltipla Escolha (MCQA) em larga escala, projetado para abordar questões reais de exames de admissão em medicina.
Figura 2: Uma pergunta de múltipla escolha de exame de admissão em medicina em larga escala que exige que o modelo selecione a resposta correta e interprete as explicações associadas sobre achados clínicos.
PubMedQA: benchmark biomédico de resposta a perguntas com respostas sim/não/talvez.
Figura 3: Uma pergunta biomédica de sim/não/talvez, em que o modelo deve avaliar a correção de uma afirmação clínica usando o contexto do estudo fornecido.
Exemplos de LLMs na saúde
Semelhante ao BERT (somente encoder)
Otimizados para codificar e representar texto biomédico, esses modelos se destacam na extração de características para tarefas como classificação.
Tipo ChatGPT / LLaMA (Decoder, ajustado para instruções/chat)
Baseados em arquiteturas no estilo LLaMA e otimizados para tarefas interativas e diálogos clínicos.
Tipo GPT / PaLM (somente decoder, generativos)
Construídos de forma semelhante ao GPT-3 ou PaLM, esses modelos são fine-tuned para geração de texto de uso geral e sumarização.
LLMs de uso geral na saúde
*Llama 3.1 Instruct Turbo com 405B parâmetros. Consulte metodologia do benchmark.
Principais conclusões:
- o1: modelo com melhor desempenho
- 03 mini: melhor opção de custo-benefício
- GPT 4.1: melhor velocidade e tempo de resposta
- Além da precisão e do custo de entrada, os modelos também diferem em suas abordagens subjacentes à resposta a perguntas médicas
Figura 4: Figura mostrando as diferenças entre as respostas do GPT-5 e do o3.
Fine-tuning de LLMs médicos
O desempenho do ChatGPT padrão (modelo 4o) é comparado com o assistente existente do 'Clinical Medicine Handbook'. Ambos os modelos recebem o mesmo prompt e suas respostas são analisadas:
GPT 4o
Figura 5: A figura mostra que a resposta do modelo padrão GPT 4o é precisa, mas também altamente resumida.1
Fine-tuned medical LLM
Figura 6: A figura mostra a resposta do agente especializado.1
Aplicações de LLMs de uso geral
Você pode usar esses modelos na área da saúde aproveitando:
- Pré-treinamento contínuo em dados médicos para ajudar o modelo a identificar melhor a linguagem médica, expondo-o a notas clínicas e literatura biomédica (como PubMed).
- RAG para extrair dados de documentos clínicos verificados para produzir respostas precisas em tempo de execução.
- Fine-tuning de instruções para permitir que o modelo aprenda a responder perguntas clínicas ou extrair sintomas de textos.
Figura 7: Um fluxo de trabalho geral de fine-tuning de LLM para casos de uso especializados.
Onde as organizações de saúde usam LLMs
As organizações de saúde estão testando LLMs em fluxos de trabalho clínicos e administrativos. As aplicações comuns incluem documentação clínica e transcrição, resumo de EHR, busca de literatura, redação de mensagens para pacientes, codificação médica, autorização prévia, educação de clínicos e explicações voltadas ao paciente.
O modelo apropriado depende menos do rótulo do caso de uso do que dos requisitos da carga de trabalho. As aplicações voltadas ao paciente e de apoio à decisão clínica geralmente exigem maior precisão médica, avaliação de segurança, auditabilidade e controles de proteção de dados, enquanto as cargas de trabalho administrativas podem dar mais peso a custo, latência, comprimento de contexto e integração com sistemas existentes.
Metodologia de grandes modelos de linguagem na saúde
Metodologia do benchmark: Este benchmark avalia 9 LLMs gerais populares em perguntas médicas de nível de pós-graduação usando o dataset MedQA, que extrai seu conteúdo Exame de Licenciamento Médico dos Estados Unidos (USMLE). Cada pergunta inclui um cenário clínico e opções de resposta de múltipla escolha.
Saídas do LLM: Cada modelo foi solicitado a retornar uma resposta estruturada (por exemplo, “Resposta: C”).8
Latência: O tempo médio que um modelo leva para gerar uma resposta a um único prompt do MedQA. Por exemplo, se 100 perguntas levam 1.115 segundos no total para serem concluídas, a latência média é de 11.15 segundos por pergunta.
LLMs nas fontes de dados do benchmark de saúde
- Resultados do Me-LLaMA 70B9
- Resultados do Meditron 70B10
- Resultados do Med-PaLM 211
- ChatGPT e GPT-411
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Ermut, Sıla},
title = {{Compare 9 grandes modelos de linguagem na saúde}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/large-language-models-in-healthcare}},
note = {AIMultiple. Acessado em 4 Setembro 2026}
}Resultados e carimbos de data/hora de 25 pontos de dados. Baixe os dados resumidos exibidos nos gráficos e tabelas deste artigo como um arquivo ZIP contendo 4 arquivos CSV.
Quer os dados granulares por trás disso? Assine o Premium
Registro de alterações
15 atualizações- 2026
Adicionados três casos de uso: descoberta e desenvolvimento de medicamentos, radiologia e imagem médica, e literacia em saúde.
Expandida a seção "Suporte à decisão clínica" com MedGemma e uma nova figura.
- 2025
Adicionada a Figura 1 à seção MedQA.
Substituída a metodologia de benchmark na seção "GPT 4.1 – Melhor velocidade e tempo de resposta".
Adicionada metodologia de benchmark à seção de metodologia.
Adicionada a otimização de LLMs médicos à seção Casos de uso de LLMs de propósito geral.
Adicionados dados de latência à seção de saídas do LLM.
Adicionada uma metodologia de benchmark à seção de benchmark de LLMs de saúde.
Removida a seção "LLMs de uso geral na área da saúde".
Removidos Med-PaLM 2, MEDITRON-70B, Me-LLaMA, Radiology-Llama2, Health Acoustic Representations (HeAR), Polaris 3.0 da Hippocratic AI e Med-PaLM M do artigo.
Adicionadas fontes de dados de benchmark ao final do artigo.
Adicionada uma comparação de LLMs abertos em tarefas de saúde à seção LLMs de saúde de código aberto.
Atualizados os escores de precisão para Llama-2-70B e GPT-3.5-turbo na seção Llama 2.
- 2024
Adicionado Med-PaLM 2 e Radiology-Llama2 à seção de LLMs de código aberto focados na área da saúde.
Adicionado o modelo Hippocratic AI à seção "LLMs de Saúde".
Links de referência
O trabalho de Cem na AIMultiple foi citado por publicações globais líderes, incluindo Business Insider, Forbes, Morning Brew e Washington Post, por empresas globais como Deloitte e HPE, ONGs como o World Economic Forum e organizações supranacionais como a European Commission. [1], [2], [3], [4], [5]
Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas sobre suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.
Ele liderou a estratégia de tecnologia e as compras de uma operadora de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de deep tech Hypatos, que atingiu uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia líderes como TechCrunch e Business Insider.
Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou como engenheiro da computação pela Bogazici University e possui um MBA pela Columbia Business School.
Ela trabalhou anteriormente como recrutadora em empresas de gerenciamento de projetos e consultoria. Sıla possui mestrado em Psicologia Social e bacharelado em Relações Internacionais.







Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.