Servicios
Contáctanos

Comparar 9 grandes modelos de lenguaje en atención médica

Cem Dilmegani
Cem Dilmegani
actualizado el 21 de may. de 2026

Hemos comparado 9 LLMs usando el dataset MedQA, un benchmark de examen clínico de nivel de posgrado derivado de preguntas del USMLE. Cada modelo respondió los mismos escenarios clínicos de opción múltiple usando una indicación estandarizada, lo que permite una comparación directa de la precisión.

También registramos la latencia por pregunta dividiendo el tiempo total de ejecución entre el número de elementos MedQA completados.

Resultados del benchmark de LLMs en atención médica

Loading Chart

Metodología del benchmark: Este benchmark evalúa el rendimiento del fine‑tuning supervisado de LLMs frente a modelos grandes de propósito general (GPT-4) en respuesta a preguntas médicastareas. Consulte fuentes de datos del benchmark.

MedQA: Preguntas de examen médico de opción múltiple basadas en el Examen de Licencia Médica de los Estados Unidos.

Figura 1: Ejemplo de pregunta clínica de opción múltiple estilo USMLE.

MedMCQA: Dataset de Respuesta a Preguntas de Opción Múltiple (MCQA) a gran escala, diseñado para abordar preguntas reales de exámenes de ingreso médico.

Figura 2: Una pregunta de opción múltiple de un examen de ingreso médico a gran escala que requiere que el modelo seleccione la respuesta correcta e interprete las explicaciones asociadas sobre los hallazgos clínicos.

PubMedQA: Benchmark de respuesta a preguntas biomédicas con respuestas sí/no/tal vez.

Figura 3: Una pregunta biomédica de sí/no/tal vez, donde el modelo debe juzgar la corrección de una afirmación clínica utilizando el contexto del estudio proporcionado.

Ejemplos de LLM en atención médica

Similares a BERT (Solo codificador)

Optimizados para codificar y representar texto biomédico, estos modelos destacan en la extracción de características para tareas como la clasificación.

Similares a ChatGPT / LLaMA (Decodificador, ajustado por instrucciones/chat)

Basados en arquitecturas estilo LLaMA y optimizados para tareas interactivas y diálogos clínicos.

Similares a GPT / PaLM (Solo decodificador, generativo)

Construidos de manera similar a GPT-3 o PaLM, estos modelos están ajustados para la generación y resumen de texto de propósito general.

LLMs de propósito general en atención médica

*Llama 3.1 Instruct Turbo con 405B parámetros. Consulte metodología del benchmark.

Conclusiones clave:

  • o1: Modelo con mejor rendimiento
  • 03 mini: Mejor opción económica
  • GPT 4.1: Mejor velocidad y tiempo de respuesta

Más allá de la precisión y el costo de entrada, los modelos también difieren en sus enfoques subyacentes para la respuesta a preguntas médicas. Por ejemplo, o3 utiliza un enfoque más paso a paso y analítico, mientras que GPT-5 responde de manera empática, organiza y explica la información claramente para no expertos:

Figura 4: Figura que muestra las diferencias entre las respuestas de GPT-5 y o3.

Ajuste fino de LLMs médicos

Se compara el rendimiento del ChatGPT predeterminado (modelo 4o) con el asistente existente ‘Clinical Medicine Handbook’. A ambos modelos se les da la misma indicación y se analizan sus respuestas:

GPT 4o

Figura 5: La figura muestra que la respuesta del modelo GPT 4o predeterminado es precisa pero también muy resumida.1

LLM médico ajustado

Figura 6: La figura muestra que la respuesta del agente especializado está mejor explicada y detallada.2

Lea LLM fine‑tuning y LLM training para más información.

Aplicaciones de LLMs de propósito general

Estos modelos son modelos generales ajustados que requieren adaptación al dominio para realizar tareas clínicas con precisión. Puede utilizar estos modelos en atención médica aprovechando:

  • Preentrenamiento continuo en datos médicos para ayudar al modelo a identificar mejor el lenguaje médico exponiéndolo a notas clínicas y literatura biomédica (como PubMed).
  • RAG para extraer datos de documentos clínicos verificados y producir respuestas precisas en tiempo de ejecución.
  • Ajuste fino por instrucciones para permitir que el modelo aprenda a responder preguntas clínicas o extraer síntomas del texto.

Figura 7: Un flujo de trabajo general de ajuste fino de LLM para casos de uso especializados.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Casos de uso de LLMs en entornos clínicos

1. Transcripción médica

LLMs pueden ayudar a crear transcripciones médicas al:

  • Escuchar el diálogo orgánico entre un paciente y un clínico.
  • Extraer detalles médicos críticos.
  • Condensar datos médicos en registros médicos conformes que se alineen con las secciones relevantes de un EHR.

Ejemplo real: El MedLM de Google puede capturar y transformar la conversación paciente-clínico en transcripción médica.9

2. Mejora de los registros de salud electrónicos (EHR)

El uso generalizado de los registros de salud electrónicos (EHR) ha generado grandes cantidades de datos de pacientes que, cuando se utilizan de manera efectiva, pueden mejorar significativamente la atención médica.

Por ejemplo, analizar datos de EHR puede ayudar a los clínicos a tomar mejores decisiones al revelar patrones en diagnósticos, tratamientos y resultados. También puede apoyar la detección temprana de enfermedades y una atención más personalizada al identificar factores de riesgo y adaptar los tratamientos a pacientes individuales.

A nivel del sistema, los datos de EHR pueden mejorar la eficiencia al reducir pruebas redundantes, destacar brechas en la atención e informar políticas que mejoran la calidad y reducen costos.

Ejemplo real: El MedLM de Google es utilizado por BenchSci, Accenture y Deloitte para mejorar los registros de salud electrónicos (EHR).

  • BenchSci ha integrado MedLM en su plataforma ASCEND para mejorar la calidad de la investigación preclínica.
  • Accenture utiliza MedLM para organizar datos no estructurados de múltiples fuentes, automatizando operaciones manuales que antes consumían mucho tiempo y eran propensas a errores.
  • Deloitte trabaja con MedLM para minimizar la fricción al encontrar tratamiento. Utilizan un chatbot interactivo que ayuda a los participantes del plan de salud a comprender mejor las alternativas de proveedores.10

3. Apoyo a la decisión clínica

LLMs ayudan a los clínicos a interpretar información específica del paciente incluida en la evidencia médica actual, resaltando consideraciones relevantes durante el diagnóstico o la planificación del tratamiento sin reemplazar el juicio clínico.

Ejemplo real: MedGemma (Google DeepMind) es una colección de modelos médicos de pesos abiertos construidos sobre la arquitectura Gemma 3 de Google. En lugar de funcionar como una herramienta de diagnóstico directa al consumidor, MedGemma sirve como base para que los desarrolladores creen aplicaciones médicas orientadas al clínico.

Diseñado para el análisis de texto e imágenes médicas, MedGemma puede interpretar imágenes médicas complejas, incluidas radiografías de tórax, resonancias magnéticas y tomografías computarizadas. También admite tareas de razonamiento clínico, como resumir notas de pacientes o responder preguntas estilo juntas médicas.

Según una revisión realizada por un radiólogo cardiotorácico certificado por la junta de EE. UU., el 81% de los informes de radiografías de tórax de MedGemma conducirían a decisiones de manejo del paciente similares a las basadas en los informes originales del radiólogo (vea el gráfico a continuación).

Figura 8: El gráfico muestra con qué frecuencia los informes de radiografías de tórax generados por IA y los informes originales del radiólogo conducen a resultados clínicos similares o diferentes en casos normales, anormales y en todos los casos.11

4. Asistencia en investigación médica

En la investigación médica, el valor principal de los LLMs radica en su capacidad para acelerar la revisión y síntesis de la literatura.

En lugar de resumir artículos, los LLMs ayudan a los investigadores a mantenerse al día con la literatura biomédica en rápida expansión al identificar estudios relevantes, extraer hallazgos clave y sintetizar ideas de múltiples fuentes.

Ejemplo real: El chatbot de atención médica de John Snow ayuda a los investigadores a encontrar artículos científicos relevantes, extraer ideas clave e identificar tendencias de investigación. Es particularmente valioso para navegar por la vasta cantidad de literatura biomédica.12

5. Comunicación automatizada con el paciente

Los grandes modelos de lenguaje en atención médica pueden redactar respuestas informativas y compasivas a las consultas de los pacientes. Algunos ejemplos incluyen:

  • Gestión de medicamentos y recordatorios: Un chatbot proporciona a los pacientes recordatorios regulares para tomar su medicación para la diabetes y solicita confirmación.
  • Monitorización de la salud y atención de seguimiento: Un paciente postoperatorio envía su estado de dolor y herida a un chatbot, que determina si el proceso de curación está progresando.
  • Comunicación informativa y educativa: Un paciente le pregunta a un chatbot cómo manejar la presión arterial alta, y el chatbot responde con consejos de nutrición y estilo de vida.

Ejemplo real: ChatGPT Health permite a los usuarios conectar de forma segura sus registros médicos y datos de bienestar (por ejemplo, Apple Health o MyFitnessPal). Luego, los usuarios pueden hacer preguntas a ChatGPT sobre sus propios datos, como “¿Cómo está mi tendencia de colesterol?” o “Resume mis últimos resultados de laboratorio.”13

Ejemplo real: El Boston Children’s Hospital utiliza Buoy Health, un chatbot de verificación de síntomas en línea impulsado por IA, que proporciona a los pacientes respuestas instantáneas a preguntas relacionadas con la salud y consultas iniciales.

El chatbot puede clasificar a los pacientes analizando sus síntomas y aconsejando si necesitan ver a un médico.14

6. Resultados de salud predictivos

Los LLMs pueden posicionarse para permitir la estratificación del riesgo y la previsión en la atención médica. Al apoyar el análisis de datos clínicos estructurados y no estructurados, los LLMs pueden ayudar a identificar pacientes con riesgo elevado (como readmisión hospitalaria) y apoyar la planificación proactiva de la atención, a menudo en combinación con modelos predictivos tradicionales.

Ejemplo real: Los farmacéuticos de WVU utilizan un algoritmo predictivo para determinar el riesgo de readmisión. Este enfoque examinará datos de registros de salud electrónicos (EHR), que incluyen datos demográficos de pacientes, historial clínico y determinantes socioeconómicos de la salud.

Basándose en esta investigación, los farmacéuticos de WVU identifican a los pacientes con alto riesgo de readmisión y asignan coordinadores de atención para hacerles un seguimiento después del alta. Esto puede ayudar a reducir las tasas de readmisión.15

7. Planes de tratamiento personalizados

Al integrar el historial médico, los síntomas y los datos de salud longitudinales, los LLMs pueden ayudar a traducir la información compleja del paciente en consideraciones de atención individualizadas, apoyando discusiones de tratamiento más personalizadas y conscientes del contexto entre clínicos y pacientes.

Ejemplo real: El chatbot de IA de Babylon Health proporciona recomendaciones de salud individualizadas basadas en los síntomas y el historial médico del usuario. Involucra a los usuarios en una conversación haciendo preguntas relevantes para analizar mejor sus problemas y brindando recomendaciones personalizadas.16

8. Codificación y facturación médica

Los grandes modelos de lenguaje pueden automatizar los procesos de auditoría analizando los registros de pacientes y los EHR.

Ejemplo real: Epic Systems, un proveedor de EHR, integra LLMs en su software para ayudar con la codificación y facturación. Los LLMs pueden monitorear anomalías en los patrones de acceso a información sensible del paciente o inconsistencias en las prácticas de codificación y facturación.17

Ejemplo real: Claude for Healthcare (Anthropic) es una plataforma centrada en la empresa diseñada para organizaciones de atención médica, proveedores y aseguradoras. Conecta grandes modelos de lenguaje con bases de datos médicas profesionales como ICD-10 y la base de datos de cobertura de CMS, permitiendo a los hospitales automatizar flujos de trabajo administrativos. Estos flujos de trabajo incluyen autorizaciones previas de seguros, resumen de historias clínicas de pacientes y clasificación de mensajes del portal del paciente.18

Sin embargo, los LLMs no están completamente listos para la codificación médica, pero sus contribuciones son prometedoras: Los investigadores examinaron con qué frecuencia cuatro LLMs (GPT-3.5, GPT-4, Gemini Pro y Llama2-70b Chat) emitieron los códigos correctos CPT, ICD-9-CM y ICD-10-CM.

Sus hallazgos muestran una oportunidad significativa de mejora. Los investigadores encontraron que los LLMs a menudo generan código que transmite información inexacta, con una precisión máxima del 50%.19

9. Capacitación y educación

Los grandes modelos de lenguaje y la IA generativa pueden utilizarse como herramientas educativas interactivas, ayudando a clínicos y pacientes a comprender mejor conceptos médicos complejos y aclarar información confusa.

Caso de uso real: Oxford Medical Simulation utiliza LLMs integrados con tecnología de realidad virtual para crear simulaciones inmersivas de pacientes virtuales.

Estas simulaciones permiten a los estudiantes experimentar escenarios de alta presión, como manejar a un paciente con paro cardíaco sin consecuencias en el mundo real.

Los LLMs impulsan las respuestas de los pacientes virtuales, haciéndolas más realistas e impredecibles, preparando a los estudiantes para la variabilidad de los entornos clínicos reales.20

10. Descubrimiento y desarrollo de fármacos

Los LLMs están acelerando la investigación farmacéutica al acortar los ciclos de desarrollo y reducir el costo de llevar nuevos compuestos al mercado. Estos modelos pueden:

  • Analizar estructuras moleculares complejas y señalar compuestos con potencial terapéutico.
  • Predecir el perfil de eficacia y seguridad de los fármacos candidatos antes de las pruebas de laboratorio.
  • Sugerir nuevas configuraciones moleculares dirigidas a objetivos terapéuticos específicos.
  • Optimizar los compuestos principales para mejorar la farmacocinética y reducir los efectos secundarios.

Los modelos de lenguaje químico, un subconjunto de LLMs construidos específicamente para aplicaciones farmacéuticas, han producido resultados medibles en el diseño de fármacos de novo. La investigación indica que los modelos iniciados en caliente (aquellos inicializados a partir de modelos de lenguaje bioquímico preentrenados) generan compuestos de mayor calidad que los enfoques de referencia.21

11. Radiología e imágenes médicas

LLMs multimodales que procesan tanto texto como imágenes pueden revisar imágenes médicas junto con datos clínicos para apoyar la detección de anomalías y contribuir a interpretaciones diagnósticas más precisas.

  • Interpretación de imágenes: Modelos como Med-Flamingo y LLaVA-Med analizan imágenes médicas en un contexto clínico, apoyando a los radiólogos en la detección temprana de afecciones visibles en radiografías de tórax, resonancias magnéticas y tomografías computarizadas.
  • Generación automatizada de informes: Sistemas como ChatCAD generan informes de radiología directamente a partir de datos de imágenes, abordando una de las tareas que más tiempo consumen en los departamentos de imágenes de alto volumen.

12. Alfabetización en salud y accesibilidad lingüística

Una brecha práctica en la atención al paciente es la distancia entre el lenguaje clínico y el lenguaje que los pacientes usan para describir su propia salud. Los LLMs pueden ayudar a cerrar esta brecha al:

  • Traducir terminología médica y jerga a un lenguaje sencillo al nivel de lectura del paciente.
  • Superar las diferencias de idioma entre pacientes y proveedores en entornos de atención multilingüe.
  • Explicar opciones de tratamiento, resultados de pruebas y planes de atención en formatos que los pacientes puedan utilizar.

Una mejor comprensión del paciente se asocia con una mejor adherencia al tratamiento y mejores resultados.

Desafíos de los LLMs en la atención médica

Preocupaciones de privacidad

El uso de aplicaciones de salud basadas en LLM que no han sido desarrolladas, probadas o aprobadas adecuadamente para uso médico puede plantear riesgos significativos para los usuarios, particularmente en lo que respecta a la privacidad de los datos.

Estas herramientas a menudo procesan información de salud sensible proporcionada por el usuario, sin embargo, no siempre está claro cómo se almacenan, comparten estos datos o si las aplicaciones cumplen plenamente con las leyes y regulaciones de protección de datos existentes.22

Precisión y confiabilidad

Los LLMs también son propensos a alucinaciones, información que suena plausible pero incorrecta o engañosa.

Por ejemplo, cuando se le hizo una consulta médica, GPT-3.5 recomendó incorrectamente tetraciclina para una paciente embarazada, a pesar de explicar correctamente su daño potencial al feto.23

Figura 8: Un ejemplo de GPT-3.5 que muestra la recomendación incorrecta de un medicamento.

Generalización vs. especialización

Un LLM entrenado en datos médicos generales podría no tener la experiencia detallada necesaria para especialidades médicas específicas.

Sesgos y consideraciones éticas

Más allá de la precisión, existen preocupaciones éticas, como el potencial de que los LLMs perpetúen sesgos en sus datos de entrenamiento. Esto podría resultar en recomendaciones de atención desiguales para diferentes grupos demográficos.

Para más detalles sobre los desafíos de los grandes modelos de lenguaje, lea los riesgos de la IA generativa y ética de la IA generativa.

Descubre más de nuestros análisis comparativos e insights basados en datos en la Búsqueda de Google.
GoogleAñadir como fuente preferida

El futuro de los LLMs en la atención médica

El análisis de Stanford indica que existe un potencial significativo sin explotar para los LLMs en la atención médica.24

Si bien muchos LLMs se han utilizado para tareas como aumentar el diagnóstico o la comunicación con el paciente, menos se han enfocado en tareas administrativas que contribuyen al agotamiento de los clínicos.

En el futuro, los LLMs pueden evolucionar para interactuar con el comportamiento, más contexto y las emociones, lo que les permitiría brindar un apoyo más personalizado y empático.

Metodología de grandes modelos de lenguaje en atención médica

Metodología del benchmark: Este benchmark evalúa 9 LLMs generales populares en preguntas médicas de nivel de posgrado utilizando el dataset MedQA, que extrae su contenido del Examen de Licencia Médica de los Estados Unidos (USMLE). Cada pregunta incluye un escenario clínico y opciones de respuesta de opción múltiple.

Salidas de los LLM: Se solicitó a cada modelo que devolviera una respuesta estructurada (por ejemplo, “Respuesta: C”).25

Latencia: El tiempo promedio que tarda un modelo en generar una respuesta a una única indicación de MedQA. Por ejemplo, si 100 preguntas toman un total de 1,115 segundos en completarse, la latencia promedio es de 11.15 segundos por pregunta.

Fuentes de datos del benchmark de LLMs en atención médica

  • Resultados de Me-LLaMA 70B26
  • Resultados de Meditron 70B27
  • Resultados de Med-PaLM 228
  • ChatGPT & GPT-429

Cita esta investigación

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Cem Dilmegani (2026) - "Comparar 9 grandes modelos de lenguaje en atención médica". Publicado en línea en AIMultiple.com. Recuperado el 21 de Mayo de 2026, de: https://aimultiple.com/large-language-models-in-healthcare [Recurso en línea]

Dilmegani, C. (2026, 21 de Mayo). Comparar 9 grandes modelos de lenguaje en atención médica. AIMultiple. https://aimultiple.com/large-language-models-in-healthcare

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{Comparar 9 grandes modelos de lenguaje en atención médica}},
  year   = {2026},
  month  = may,
  howpublished    = {\url{https://aimultiple.com/large-language-models-in-healthcare}},
  note   = {AIMultiple. Recuperado el 21 de Mayo de 2026}
}

Enlaces de referencia

1.
Generative Medical AI: A Journey with Fine-Tuned Language Models | by Eluney Hernandez | Medium
Medium
2.
Generative Medical AI: A Journey with Fine-Tuned Language Models | by Eluney Hernandez | Medium
Medium
3.
Google Launches A Healthcare-Focused LLM
Forbes
4.
How doctors are using Google's new AI models for health care
CNBC
5.
MedGemma: Our most capable open models for health AI development
6.
Medical ChatBot | Healthcare ChatBot | Medical GPT
7.
Introducing ChatGPT Health | OpenAI
8.
Buoy Health - IDHA
Boston Children's Hospital
9.
WVU pharmacists using AI to help lower patient readmission rates | WVU Today | West Virginia University
10.
Babylon's AI-enabled symptom checker added to recently acquired Higi's app | MobiHealthNews
MobiHealthNews
11.
Artificial Intelligence | Epic
12.
Healthcare | Claude by Anthropic
13.
Large Language Models Are Poor Medical Coders — Benchmarking of Medical Code Querying | NEJM AI
14.
Oxford Medical Simulation - Virtual Reality Healthcare Training
Oxford Medical Simulation
15.
Large Language Models in Healthcare and Medical Applications: A Review - PMC
16.
The Challenges for Regulating Medical Use of ChatGPT and Other Large Language Models - PubMed
17.
https://arxiv.org/pdf/2307.15343
18.
Large Language Models in Healthcare: Are We There Yet? | Stanford HAI
19.
https://www.vals.ai/benchmarks/medqa
20.
Medical foundation large language models for comprehensive text analysis and beyond | npj Digital Medicine
Nature Publishing Group UK
21.
[2311.16079] MEDITRON-70B: Scaling Medical Pretraining for Large Language Models
22.
[2305.09617] Towards Expert-Level Medical Question Answering with Large Language Models
23.
[2305.09617] Towards Expert-Level Medical Question Answering with Large Language Models
24.
Large Language Models in Healthcare: Are We There Yet? | Stanford HAI
25.
https://www.vals.ai/benchmarks/medqa
26.
Medical foundation large language models for comprehensive text analysis and beyond | npj Digital Medicine
Nature Publishing Group UK
27.
[2311.16079] MEDITRON-70B: Scaling Medical Pretraining for Large Language Models
28.
[2305.09617] Towards Expert-Level Medical Question Answering with Large Language Models
29.
[2305.09617] Towards Expert-Level Medical Question Answering with Large Language Models
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem ha sido el analista principal en AIMultiple desde 2017. AIMultiple informa a cientos de miles de empresas (según similarWeb), incluido el 60% de Fortune 500 cada mes. El trabajo de Cem ha sido citado por publicaciones globales líderes como Business Insider, Forbes, Washington Post, firmas globales como Deloitte, HPE y ONG como el Foro Económico Mundial y organizaciones supranacionales como la Comisión Europea. A lo largo de su carrera, Cem se ha desempeñado como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización. Lideró la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando directamente al CEO. También lideró el crecimiento comercial de la empresa de tecnología profunda Hypatos, que alcanzó ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider. Cem habla regularmente en conferencias internacionales de tecnología. Se graduó de la Universidad de Bogazici como ingeniero informático y tiene un MBA de Columbia Business School.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450