Comparativa de 9 grandes modelos de lenguaje en atención médica
Evaluamos comparativamente 9 LLMs utilizando el dataset MedQA, un benchmark de examen clínico de nivel de posgrado derivado de preguntas del USMLE. Cada modelo respondió los mismos escenarios clínicos de opción múltiple mediante un prompt estandarizado, lo que permite una comparación directa de la precisión.
También registramos la latencia por pregunta dividiendo el tiempo de ejecución total entre el número de elementos MedQA completados.
Resultados del benchmark de LLMs en atención médica
Metodología del benchmark: Este benchmark evalúa el rendimiento del fine-tuning supervisado de LLMs frente a modelos grandes de propósito general (GPT-4) en tareas de respuesta a preguntas médicastareas. Consulte las fuentes de datos del benchmark.
MedQA: Preguntas de examen médico de opción múltiple basadas en el United States Medical Licensing Examination.
Figura 1: Ejemplo de pregunta clínica de opción múltiple estilo USMLE.
MedMCQA: dataset a gran escala de respuesta a preguntas de opción múltiple (MCQA) diseñado para abordar preguntas reales de exámenes de ingreso a medicina.
Figura 2: Una pregunta de opción múltiple a gran escala de examen de ingreso médico que requiere que el modelo seleccione la respuesta correcta e interprete las explicaciones asociadas sobre los hallazgos clínicos.
PubMedQA: benchmark biomédico de respuesta a preguntas con respuestas sí/no/quizá.
Figura 3: Una pregunta biomédica de sí/no/quizá, donde el modelo debe juzgar la corrección de una afirmación clínica usando el contexto de estudio proporcionado.
Ejemplos de LLM en atención médica
Tipo BERT (solo codificador)
Optimizados para codificar y representar texto biomédico, estos modelos destacan en la extracción de características para tareas como la clasificación.
Similares a ChatGPT / LLaMA (decodificador, ajustados por instrucciones/chat)
Basados en arquitecturas estilo LLaMA y optimizados para tareas interactivas y diálogos clínicos.
Similares a GPT / PaLM (solo decodificador, generativos)
Construidos de forma similar a GPT-3 o PaLM, estos modelos están fine-tuned para la generación de texto de propósito general y el resumen.
LLMs de propósito general en atención médica
*Llama 3.1 Instruct Turbo con 405B parámetros. Consulte la metodología del benchmark.
Conclusiones clave:
- o1: modelo con mejor rendimiento
- 03 mini: la mejor opción económica
- GPT 4.1: la mejor velocidad y tiempo de respuesta
- Más allá de la precisión y el coste de entrada, los modelos también difieren en sus enfoques subyacentes para responder preguntas médicas
Figura 4: Figura que muestra las diferencias entre las respuestas de GPT-5 y o3.
Fine-tuning de LLMs médicos
El rendimiento del ChatGPT predeterminado (modelo 4o) se compara con el asistente existente ‘Clinical Medicine Handbook’. Ambos modelos reciben el mismo prompt y se analizan sus respuestas:
GPT 4o
Figura 5: La figura muestra que la respuesta del modelo predeterminado GPT 4o es precisa, pero también está muy resumida.1
Fine-tuned LLM médico
Figura 6: La figura muestra la respuesta del agente especializado.1
Aplicaciones de LLMs de propósito general
Puede usar estos modelos en atención médica aprovechando:
- Preentrenamiento continuo con datos médicos para ayudar al modelo a identificar mejor el lenguaje médico al exponerlo a notas clínicas y literatura biomédica (como PubMed).
- RAG para extraer datos de documentos clínicos verificados y producir respuestas precisas en tiempo de ejecución.
- Instruction fine-tuning para permitir que el modelo aprenda a responder preguntas clínicas o extraer síntomas del texto.
Figura 7: Un flujo de trabajo general de LLM fine-tuning para casos de uso especializados.
Dónde usan LLMs las organizaciones de atención médica
Las organizaciones sanitarias están probando LLMs tanto en flujos de trabajo clínicos como administrativos. Las aplicaciones habituales incluyen la documentación y transcripción clínica, los resúmenes de EHR, la búsqueda de literatura, la redacción de mensajes para pacientes, la codificación médica, la autorización previa, la formación de profesionales clínicos y las explicaciones dirigidas al paciente.
El modelo adecuado depende menos de la etiqueta del caso de uso que de los requisitos de la carga de trabajo. Las aplicaciones orientadas al paciente y de apoyo a la toma de decisiones clínicas suelen requerir una mayor precisión médica, evaluación de seguridad, auditabilidad y controles de protección de datos, mientras que las cargas de trabajo administrativas pueden dar más importancia al coste, la latencia, la longitud del contexto y la integración con los sistemas existentes.
Metodología de los grandes modelos de lenguaje en atención médica
Metodología del benchmark: Este benchmark evalúa 9 LLMs de propósito general populares en preguntas médicas de nivel de posgrado mediante el dataset MedQA, que extrae su contenido del United States Medical Licensing Examination (USMLE). Cada pregunta incluye un escenario clínico y opciones de respuesta de opción múltiple.
Salidas de LLM: Se pidió a cada modelo que devolviera una respuesta estructurada (por ejemplo, “Answer: C”).8
Latencia: El tiempo medio que tarda un modelo en generar una respuesta a un único prompt de MedQA. Por ejemplo, si 100 preguntas tardan 1.115 segundos en total en completarse, la latencia media es de 11.15 segundos por pregunta.
Fuentes de datos del benchmark de LLMs en atención médica
- Resultados de Me-LLaMA 70B9
- Resultados de Meditron 70B10
- Resultados de Med-PaLM 211
- ChatGPT y GPT-411
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Ermut, Sıla},
title = {{Comparativa de 9 grandes modelos de lenguaje en atención médica}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/large-language-models-in-healthcare}},
note = {AIMultiple. Recuperado el 4 de Septiembre de 2026}
}Resultados y marcas de tiempo de 25 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene 4 archivos CSV.
Registro de cambios
15 actualizaciones- 2026
Añadidos tres casos de uso: descubrimiento y desarrollo de fármacos, radiología e imagen médica, y alfabetización sanitaria.
Se amplió la sección "Soporte de decisiones clínicas" con MedGemma y una nueva figura.
- 2025
Se añadió la Figura 1 a la sección MedQA.
Se reemplazó la metodología de evaluación comparativa en la sección "GPT 4.1 – Mejor velocidad y tiempo de respuesta".
Se añadió la metodología de evaluación comparativa a la sección de metodología.
Se añadió el ajuste fino de LLM médicos a la sección Casos de uso de LLM de propósito general.
Añadidos datos de latencia a la sección de salidas del LLM.
Se añadió una metodología de evaluación comparativa a la sección de evaluación comparativa de LLM de atención médica.
Se eliminó la sección "LLM de propósito general en el cuidado de la salud".
Se eliminaron Med-PaLM 2, MEDITRON-70B, Me-LLaMA, Radiology-Llama2, Health Acoustic Representations (HeAR), Polaris 3.0 de Hippocratic AI y Med-PaLM M del artículo.
Se añadieron fuentes de datos de referencia al final del artículo.
Se añadió una comparación de LLM abiertos en tareas de atención médica a la sección LLM de atención médica de código abierto.
Actualizados los puntajes de precisión para Llama-2-70B y GPT-3.5-turbo en la sección Llama 2.
- 2024
Se añadió Med-PaLM 2 y Radiology-Llama2 a la sección de LLM de código abierto centrados en la atención médica.
Se añadió el modelo Hippocratic AI a la sección "LLM de atención médica".
Enlaces de referencia
El trabajo de Cem en AIMultiple ha sido citado por publicaciones líderes mundiales como Business Insider, Forbes, Morning Brew y Washington Post, empresas globales como Deloitte y HPE, ONG como World Economic Forum y organizaciones supranacionales como European Commission. [1], [2], [3], [4], [5]
A lo largo de su carrera, Cem trabajó como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.
Dirigió la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando al CEO. También lideró el crecimiento comercial de la empresa de deep tech Hypatos, que alcanzó unos ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.
Cem participa habitualmente en conferencias internacionales de tecnología. Se graduó en Bogazici University como ingeniero informático y tiene un MBA de Columbia Business School.
Anteriormente trabajó como reclutadora en empresas de gestión de proyectos y consultoría. Sıla tiene un máster en Psicología Social y una licenciatura en Relaciones Internacionales.







Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.