Compare 9 Modelos de Linguagem de Grande Escala na Área da Saúde
Avaliamos 9 LLMs usando o conjunto de dados MedQA, um benchmark de exame clínico de nível de pós-graduação derivado de questões do USMLE. Cada modelo respondeu aos mesmos cenários clínicos de múltipla escolha usando um prompt padronizado, permitindo a comparação direta da precisão.
Também registramos a latência por pergunta, dividindo o tempo total de execução pelo número de itens do MedQA concluídos.
Resultados do benchmark de LLMs na área da saúde
Metodologia do benchmark: Este benchmark avalia o desempenho de fine-tuning supervisionado de LLMs da área da saúde em comparação com grandes modelos de uso geral (GPT-4) em perguntas médicastarefas. Veja fontes de dados do benchmark.
MedQA: Questões de exame médico de múltipla escolha baseadas no Exame de Licenciamento Médico dos Estados Unidos (USMLE).
Figura 1: Exemplo de questão clínica de múltipla escolha no estilo USMLE.
MedMCQA: Conjunto de dados de resposta a perguntas de múltipla escolha (MCQA) em larga escala, projetado para abordar questões reais de exames de admissão médica.
Figura 2: Uma pergunta de múltipla escolha de exame de admissão médica em larga escala que exige que o modelo selecione a resposta correta e interprete as explicações associadas sobre achados clínicos.
PubMedQA: Benchmark de resposta a perguntas biomédicas usando respostas sim/não/talvez.
Figura 3: Uma pergunta biomédica de sim/não/talvez, em que o modelo deve avaliar a correção de uma afirmação clínica usando o contexto do estudo fornecido.
Exemplos de LLMs na área da saúde
Semelhantes ao BERT (somente codificador)
Otimizados para codificar e representar texto biomédico, esses modelos são excelentes para extrair características de tarefas como classificação.
Semelhantes ao ChatGPT / LLaMA (decodificador, ajustados para instrução/chat)
Baseados em arquiteturas do estilo LLaMA e otimizados para tarefas interativas e diálogos clínicos.
Semelhantes ao GPT / PaLM (somente decodificador, generativos)
Construídos de forma semelhante ao GPT-3 ou PaLM, esses modelos são ajustados para geração e sumarização de texto de uso geral.
LLMs de uso geral na área da saúde
*Llama 3.1 Instruct Turbo com parâmetros 405B. Veja metodologia do benchmark.
Principais conclusões:
- o1: Melhor modelo em desempenho
- 03 mini: Melhor opção de orçamento
- GPT 4.1: Melhor velocidade e tempo de resposta
Além da precisão e do custo de entrada, os modelos também diferem em suas abordagens subjacentes para responder a perguntas médicas. Por exemplo, o o3 usa uma abordagem mais passo a passo e analítica, enquanto o GPT-5 responde com empatia, organiza e explica as informações de forma clara para não especialistas:
Figura 4: Figura mostrando as diferenças entre as respostas do GPT-5 e do o3.
Fine-tuning de LLMs médicos
O desempenho do ChatGPT padrão (modelo 4o) é comparado com o assistente existente do 'Manual de Medicina Clínica'. Ambos os modelos recebem o mesmo prompt e suas respostas são analisadas:
GPT 4o
Figura 5: A figura mostra que a resposta do modelo padrão GPT 4o é precisa, mas também muito resumida.1
LLM médico ajustado
Figura 6: A figura mostra que a resposta do agente especializado é mais bem explicada e detalhada.1
Leia LLM fine-tuning e LLM treinamento para mais.
Aplicações de LLMs de uso geral
Esses modelos são ajustados de forma geral e exigem adaptação de domínio para realizar tarefas clínicas com precisão. Você pode usar esses modelos na área da saúde aproveitando:
- Pré-treinamento contínuo em dados médicos para ajudar o modelo a identificar melhor a linguagem médica, expondo-o a anotações clínicas e literatura biomédica (como o PubMed).
- RAG para obter dados de documentos clínicos verificados e produzir respostas precisas em tempo de execução.
- Fine-tuning de instruções para permitir que o modelo aprenda a responder a perguntas clínicas ou extrair sintomas de texto.
Figura 7: Um fluxo de trabalho geral de fine-tuning de LLM para casos de uso especializados.
Casos de uso de LLMs em ambientes clínicos
1. Transcrição médica
LLMs podem ajudar a criar transcrições médicas ao:
- Ouvir o diálogo orgânico entre paciente e médico.
- Extrair detalhes médicos críticos.
- Condensar dados médicos em registros médicos compatíveis, alinhados com as seções relevantes de um EHR.
Exemplo real: O MedLM do Google pode capturar e transformar a conversa paciente-médico em transcrição médica.8
2. Melhoria de registros eletrônicos de saúde (EHR)
O uso generalizado de registros eletrônicos de saúde (EHRs) gerou vastas quantidades de dados de pacientes que, quando usados de forma eficaz, podem melhorar significativamente a saúde.
Por exemplo, analisar dados de EHR pode ajudar os médicos a tomar melhores decisões ao revelar padrões em diagnósticos, tratamentos e resultados. Também pode apoiar a detecção precoce de doenças e um cuidado mais personalizado, identificando fatores de risco e adaptando tratamentos a pacientes individuais.
No nível do sistema, os dados de EHR podem melhorar a eficiência ao reduzir exames redundantes, destacar lacunas no cuidado e informar políticas que melhorem a qualidade e reduzam custos.
Exemplo real: O MedLM do Google é usado pela BenchSci, Accenture e Deloitte para melhorar registros eletrônicos de saúde (EHRs).
- BenchSci integrou o MedLM em sua plataforma ASCEND para melhorar a qualidade da pesquisa pré-clínica.
- Accenture usa o MedLM para organizar dados não estruturados de múltiplas fontes, automatizando operações manuais anteriormente demoradas e propensas a erros.
- Deloitte trabalha com o MedLM para minimizar o atrito na busca por tratamento. Eles usam um chatbot interativo que ajuda os participantes do plano de saúde a entender melhor as alternativas de provedores.9
3. Apoio à decisão clínica
LLMs ajudam os médicos a interpretar informações específicas do paciente incluídas nas evidências médicas atuais, destacando considerações relevantes durante o diagnóstico ou planejamento do tratamento, sem substituir o julgamento clínico.
Exemplo real: O MedGemma (do Google DeepMind) é uma coleção de modelos médicos de pesos abertos construídos sobre a arquitetura Gemma 3 do Google. Em vez de funcionar como uma ferramenta de diagnóstico direta ao consumidor, o MedGemma serve como base para desenvolvedores criarem aplicações médicas voltadas para médicos.
Projetado para análise de texto e imagens médicas, o MedGemma pode interpretar imagens médicas complexas, incluindo radiografias de tórax, ressonâncias magnéticas e tomografias computadorizadas. Também apoia tarefas de raciocínio clínico, como resumir anotações de pacientes ou responder a perguntas no estilo de conselhos médicos.
De acordo com uma revisão de um radiologista torácico certificado nos EUA, 81% dos laudos de radiografia de tórax do MedGemma levariam a decisões de manejo do paciente semelhantes às baseadas nos laudos originais do radiologista (veja o gráfico abaixo).
Figura 8: O gráfico mostra com que frequência laudos de radiografia de tórax gerados por IA e laudos originais de radiologistas levam a desfechos clínicos semelhantes ou diferentes em casos normais, anormais e todos os casos.10
4. Assistência à pesquisa médica
Na pesquisa médica, o principal valor dos LLMs está na capacidade de acelerar a revisão e a síntese da literatura.
Em vez de resumir artigos, os LLMs ajudam os pesquisadores a acompanhar a literatura biomédica em rápida expansão, identificando estudos relevantes, extraindo descobertas-chave e sintetizando insights de múltiplas fontes.
Exemplo real: O chatbot de saúde da John Snow ajuda os pesquisadores a encontrar artigos científicos relevantes, extrair insights-chave e identificar tendências de pesquisa. É particularmente valioso para navegar pela vasta quantidade de literatura biomédica.11
5. Comunicação automatizada com pacientes
Modelos de linguagem de grande escala na área da saúde podem redigir respostas informativas e compassivas às dúvidas dos pacientes. Alguns exemplos incluem:
- Gerenciamento de medicamentos e lembretes: Um chatbot fornece aos pacientes lembretes regulares para tomar sua medicação para diabetes e solicita confirmação.
- Monitoramento de saúde e cuidados de acompanhamento: Um paciente pós-operatório envia seu status de dor e ferida para um chatbot, que determina se o processo de cicatrização está progredindo.
- Comunicação informativa e educacional: Um paciente pergunta a um chatbot como controlar a pressão alta, e o chatbot responde com dicas de nutrição e estilo de vida.
Exemplo real: O ChatGPT Health permite que os usuários conectem com segurança seus registros médicos e dados de bem-estar (por exemplo, Apple Health ou MyFitnessPal). Os usuários podem então fazer perguntas ao ChatGPT sobre seus próprios dados, como “Como está a tendência do meu colesterol?” ou “Resuma meus últimos resultados de laboratório.”12
Exemplo real: O Boston Children’s Hospital usa o Buoy Health, um chatbot verificador de sintomas on-line orientado por IA, que fornece aos pacientes respostas instantâneas a perguntas relacionadas à saúde e consultas iniciais.
O chatbot pode triagem de pacientes analisando seus sintomas e aconselhando se precisam consultar um médico.13
6. Resultados de saúde preditivos
LLMs podem ser posicionados para permitir estratificação de risco e previsão na área da saúde. Ao apoiar a análise de dados clínicos estruturados e não estruturados, os LLMs podem ajudar a identificar pacientes com risco elevado (como readmissão hospitalar) e apoiar o planejamento proativo do cuidado, muitas vezes em combinação com modelos preditivos tradicionais.
Exemplo real: Farmacêuticos da WVU usam um algoritmo preditivo para determinar o risco de readmissão. Essa abordagem examinará dados de registros eletrônicos de saúde (EHRs), que incluem dados demográficos do paciente, histórico clínico e determinantes socioeconômicos da saúde.
Com base nessa pesquisa, os farmacêuticos da WVU identificam pacientes com alto risco de readmissão e designam coordenadores de cuidados para acompanhá-los após a alta. Isso pode ajudar a reduzir as taxas de readmissão.14
7. Planos de tratamento personalizados
Ao integrar histórico médico, sintomas e dados longitudinais de saúde, os LLMs podem ajudar a traduzir informações complexas do paciente em considerações de cuidado individualizadas, apoiando discussões de tratamento mais personalizadas e conscientes do contexto entre médicos e pacientes.
Exemplo real: O chatbot de IA da Babylon Health fornece recomendações de saúde individualizadas com base nos sintomas e no histórico médico do usuário. Ele envolve os usuários em uma conversa fazendo perguntas relevantes para analisar melhor seus problemas e dando recomendações personalizadas.15
8. Codificação médica e faturamento
Modelos de linguagem de grande escala podem automatizar processos de auditoria analisando registros de pacientes e EHRs.
Exemplo real: A Epic Systems, provedora de EHR, integra LLMs em seu software para auxiliar na codificação e no faturamento. Os LLMs podem monitorar anomalias nos padrões de acesso a informações sensíveis do paciente ou inconsistências nas práticas de codificação e faturamento.16
Exemplo real: O Claude for Healthcare (Anthropic) é uma plataforma voltada para empresas, projetada para organizações de saúde, provedores e seguradoras. Ele conecta modelos de linguagem de grande escala a bancos de dados médicos profissionais, como ICD-10 e o CMS Coverage Database, permitindo que hospitais automatizem fluxos de trabalho administrativos. Esses fluxos de trabalho incluem autorizações prévias de seguros, resumo de prontuários de pacientes e triagem de mensagens do portal do paciente.17
No entanto, os LLMs não estão totalmente prontos para codificação médica, mas suas contribuições são promissoras: Pesquisadores examinaram com que frequência quatro LLMs (GPT-3.5, GPT-4, Gemini Pro e Llama2-70b Chat) emitiram os códigos corretos CPT, ICD-9-CM e ICD-10-CM.
Os resultados mostram uma oportunidade significativa de melhoria. Os pesquisadores descobriram que os LLMs geralmente geram códigos que transmitem informações imprecisas, com uma precisão máxima de 50%.18
9. Treinamento e educação
Modelos de linguagem de grande escala e IA generativa podem ser usados como ferramentas educacionais interativas, ajudando médicos e pacientes a entender melhor conceitos médicos complexos e esclarecer informações confusas.
Caso de uso real: A Oxford Medical Simulation usa LLMs integrados à tecnologia de RV para criar simulações imersivas de pacientes virtuais.
Essas simulações permitem que os alunos vivenciem cenários de alta pressão, como atender um paciente em parada cardíaca sem consequências reais.
Os LLMs alimentam as respostas dos pacientes virtuais, tornando-os mais realistas e imprevisíveis, preparando os alunos para a variabilidade dos ambientes clínicos reais.19
10. Descoberta e desenvolvimento de medicamentos
LLMs estão acelerando a pesquisa farmacêutica ao reduzir os ciclos de desenvolvimento e o custo de trazer novos compostos ao mercado. Esses modelos podem:
- Analisar estruturas moleculares complexas e sinalizar compostos com potencial terapêutico.
- Prever a eficácia e o perfil de segurança de medicamentos candidatos antes dos testes laboratoriais.
- Sugerir novas configurações moleculares voltadas para alvos terapêuticos específicos.
- Otimizar compostos líderes para melhorar a farmacocinética e reduzir os efeitos colaterais.
Modelos de linguagem química, um subconjunto de LLMs criados especificamente para aplicações farmacêuticas, produziram resultados mensuráveis em design de medicamentos de novo. Pesquisas indicam que modelos inicializados a quente (aqueles inicializados a partir de modelos de linguagem bioquímicos pré-treinados) geram compostos de maior qualidade do que abordagens de linha de base.20
11. Radiologia e imagens médicas
LLMs multimodais que processam texto e imagens podem revisar imagens médicas juntamente com dados clínicos para apoiar a detecção de anormalidades e contribuir para interpretações diagnósticas mais precisas.
- Interpretação de imagens: Modelos como Med-Flamingo e LLaVA-Med analisam imagens médicas em um contexto clínico, apoiando radiologistas na detecção precoce de condições visíveis em radiografias de tórax, ressonâncias magnéticas e tomografias computadorizadas.
- Geração automatizada de laudos: Sistemas como ChatCAD geram laudos de radiologia diretamente a partir de dados de imagem, abordando uma das tarefas mais demoradas em departamentos de imagem de alto volume.
12. Alfabetização em saúde e acessibilidade linguística
Uma lacuna prática no cuidado ao paciente é a distância entre a linguagem clínica e a linguagem que os pacientes usam para descrever a própria saúde. Os LLMs podem ajudar a fechar essa lacuna ao:
- Traduzir terminologia médica e jargões para uma linguagem simples no nível de leitura do paciente.
- Superar diferenças de idioma entre pacientes e profissionais em ambientes de atendimento multilíngue.
- Explicar opções de tratamento, resultados de exames e planos de cuidados em formatos com os quais os pacientes possam agir.
A melhora da compreensão do paciente está associada a uma melhor adesão ao tratamento e a melhores resultados.
Desafios dos LLMs na área da saúde
Preocupações com privacidade
O uso de aplicações de saúde baseadas em LLMs que não foram adequadamente desenvolvidas, testadas ou aprovadas para uso médico pode representar riscos significativos aos usuários, especialmente em relação à privacidade dos dados.
Essas ferramentas geralmente processam informações de saúde sensíveis fornecidas pelos usuários, mas nem sempre fica claro como esses dados são armazenados, compartilhados ou se as aplicações cumprem totalmente as leis e regulamentos de proteção de dados existentes.21
Precisão e confiabilidade
Os LLMs também são propensos a alucinações, informações plausíveis, mas incorretas ou enganosas.
Por exemplo, ao receber uma consulta médica, o GPT-3.5 recomendou incorretamente tetraciclina para uma paciente grávida, apesar de explicar corretamente seu potencial dano ao feto.21
Figura 8: Um exemplo do GPT-3.5 mostrando a recomendação incorreta de um medicamento.
Generalização vs. especialização
Um LLM treinado em dados médicos gerais pode não ter a experiência detalhada necessária para especialidades médicas específicas.
Vieses e considerações éticas
Além da precisão, há preocupações éticas, como o potencial de os LLMs perpetuarem vieses presentes em seus dados de treinamento. Isso pode resultar em recomendações de cuidados desiguais para diferentes grupos demográficos.
Para mais detalhes sobre os desafios dos modelos de linguagem de grande escala, leia os riscos da IA generativa e a ética da IA generativa.
O futuro dos LLMs na área da saúde
A análise de Stanford indica que há um potencial inexplorado significativo para LLMs na área da saúde.17
Embora muitos LLMs tenham sido usados para tarefas como aumento de diagnósticos ou comunicação com pacientes, menos se concentraram em tarefas administrativas que contribuem para o esgotamento dos médicos.
No futuro, os LLMs podem evoluir para interagir com comportamento, mais contexto e emoções, permitindo-lhes fornecer um apoio mais personalizado e empático.
Metodologia de modelos de linguagem de grande escala na área da saúde
Metodologia do benchmark: Este benchmark avalia 9 LLMs populares de uso geral em questões médicas de nível de pós-graduação usando o conjunto de dados MedQA, que extrai seu conteúdo Exame de Licenciamento Médico dos Estados Unidos (USMLE). Cada pergunta inclui um cenário clínico e opções de resposta de múltipla escolha.
Saídas dos LLMs: Cada modelo foi instruído a retornar uma resposta estruturada (por exemplo, "Resposta: C").18
Latência: O tempo médio que um modelo leva para gerar uma resposta a um único prompt do MedQA. Por exemplo, se 100 perguntas levam 1.115 segundos no total para serem concluídas, a latência média é de 11.15 segundos por pergunta.
Fontes de dados de benchmark de LLMs na área da saúde
- Resultados do Me-LLaMA 70B19
- Resultados do Meditron 70B20
- Resultados do Med-PaLM 221
- ChatGPT & GPT-421
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Compare 9 Modelos de Linguagem de Grande Escala na Área da Saúde}},
year = {2026},
month = may,
howpublished = {\url{https://aimultiple.com/large-language-models-in-healthcare}},
note = {AIMultiple. Acessado em 21 Maio 2026}
}Resultados e carimbos de data/hora de 25 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo 4 arquivos CSV.
Links de referência
O trabalho de Cem foi citado por publicações globais de destaque, incluindo Business Insider, Forbes, Washington Post, empresas globais como Deloitte, HPE e ONGs como o Fórum Econômico Mundial e organizações supranacionais como a Comissão Europeia.
Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas em suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.
Ele liderou a estratégia de tecnologia e aquisições de uma empresa de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de tecnologia profunda Hypatos, que alcançou uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia de destaque como TechCrunch e Business Insider.
Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou na Universidade Bogazici como engenheiro de computação e possui um MBA pela Columbia Business School.









Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.