Vea el futuro de los large language models adentrándose en enfoques prometedores, como el autoentrenamiento, la verificación de hechos y la experiencia dispersa que podrían abordar las limitaciones de los LLM.
Comparación de la tasa de éxito de los LLM
Claude Sonnet 4.6 lideró el benchmark con una puntuación general de 0.748, con las variantes base y de pensamiento empatadas hasta tres decimales. Claude Opus 4.8 (0.702), Opus 4.6 base (0.706) y Opus 4.6 de pensamiento (0.729) le siguieron, lo que otorgó a Anthropic las cinco primeras posiciones. El primer model no perteneciente a Anthropic fue Gemini 3.5 Flash, de pensamiento con 0.625. Las variantes de GPT se agruparon entre 0.57 y 0.60, con mejores puntuaciones de backend compensadas por la inestabilidad del frontend. Vea más en nuestro artículo de benchmark.
LLM Metodología del benchmark
Comparamos los principales large language models en 10 tareas de desarrollo de software utilizando un harness CLI agéntico. Cada model se ejecutó 3 veces por tarea (30 muestras por model, 270 celdas de validación por iteración) para estabilizar las puntuaciones y medir la varianza por celda. Todos los models se accedieron a través de OpenRouter en condiciones idénticas, el mismo harness, las mismas instrucciones de tarea y el mismo entorno de hardware.
Models probados
El benchmark cubre los models disponibles a través de la API a fecha de junio de 2026. Todas las variantes enumeradas a continuación se probaron de forma independiente:
- Claude Sonnet 4.6 (base y de pensamiento)
- Claude Opus 4.8
- Claude Opus 4.6 (base y de pensamiento)
- Claude Opus 4.7
- Gemini 3.5 Flash (base y de pensamiento)
- GPT 5.5 (de pensamiento)
- GPT 5.4 Mini
- GPT 5.3 Codex
- MiniMax M3
- Grok 4.3
- Qwen 3.6 Plus (base y de pensamiento)
- GLM 5.1 (base y de pensamiento)
- Deepseek V4 Pro (base y de pensamiento)
Entorno de prueba
Cada agente y tarea comienza en un entorno limpio. Las instrucciones de la tarea se proporcionan como un archivo TASK.md. Un watchdog de heartbeat de 20 minutos supervisa cada ejecución. Registramos los códigos de salida, el tiempo de ejecución, la creación de archivos de backend y frontend, y el uso de tokens en tiempo real en las categorías de entrada, salida y caché.
Las tareas van desde sistemas de reservas hasta paneles interactivos. Todas requieren gestión de proyectos de múltiples archivos y un entregable full-stack funcional.
Puntuación
Validación del backend: Los proyectos generados se despliegan en entornos aislados y se prueban contra un contrato YAML canónico que cubre escenarios de happy path, manejo de errores (400/403/409) y consistencia de datos. Se utilizan dos modos:
- Modo adaptativo valida la funcionalidad incluso cuando los nombres de las rutas difieren de la especificación
- Modo estricto requiere una adherencia exacta al contrato (rutas, códigos de estado, campos de respuesta)
Puntuación de backend por celda: backend_overall = has_backend × (0.7 × adaptive_pass_rate + 0.3 × strict_pass_rate)
Validación de UI: La automatización del navegador simula flujos reales de usuario, incluidos preflights, renderizado, envío de inicio de sesión y comportamiento posterior al inicio de sesión. Ocho pasos divididos en dos grupos:
- Pasos de infraestructura (preflight del backend, renderizado del frontend, formulario de login visible, envío de login, login 2xx, sin fallo en tiempo de ejecución)
- Pasos de comportamiento (señal de autenticación posterior al login, señal de comportamiento posterior al login)
Puntuación de UI por celda: ui_score = (behavior_passed / (behavior_passed + behavior_failed)) × (infra_passed / infra_total)
Los pasos de comportamiento bloqueados se excluyen del denominador de comportamiento para que una celda no se penalice dos veces cuando la aplicación no carga.
Puntuación final: Final Score = (0.7 × backend_overall) + (0.3 × ui_score)
El backend se pondera más alto porque los fallos de lógica a nivel de la API suelen invalidar cualquier éxito del frontend.
Medición de costes
El coste por celda se calcula a partir del uso de tokens extraído de la respuesta de la LLM API. Los tokens de entrada en caché se restan del total de tokens de entrada para obtener la entrada efectiva (solo los tokens recién procesados). Los tokens de salida nunca se almacenan en caché y permanecen sin cambios. Las tarifas por token proceden de LLM Precios en el momento de la prueba.
Limitaciones
- Alcance de la tarea: Las 10 tareas son construcciones de aplicaciones web full-stack. El benchmark no cubre tareas de razonamiento puro, resolución de problemas científicos, resumen ni cargas de trabajo específicas de dominio (legal, médico, financiero). Las puntuaciones reflejan específicamente la capacidad de codificación agéntica.
- Solo acceso por API: Todos los models se probaron a través de la API. Las implementaciones locales u on-premise de los mismos models pueden producir resultados diferentes según la cuantificación, el hardware y la configuración de inference.
- Instantánea en el tiempo: Las versiones de los models cambian. Los resultados reflejan la versión de la API activa en el momento de la prueba. Una actualización del model puede mover las puntuaciones en cualquier dirección sin previo aviso del proveedor.
- Estilo de llamadas de herramientas: Los models difieren en cómo estructuran las escrituras y ediciones de archivos (por ejemplo, el
apply_patchde OpenAI agrupa un diff de archivo completo en una sola llamada; los models de Anthropic escriben y reeditan en múltiples llamadas). El número de llamadas de herramientas no es un proxy directo de la calidad. - Un único harness: Todas las pruebas utilizaron Opencode como el harness del agente. Un harness diferente puede producir clasificaciones relativas diferentes, en particular para los models cuyo comportamiento predeterminado está ajustado a patrones específicos de uso de herramientas.
Tendencias futuras de los large language models
1- Verificación de hechos en tiempo real con datos en vivo
Los LLMs acceden a fuentes externas durante las conversaciones en lugar de depender solo de los datos de entrenamiento. El model consulta bases de datos externas, recupera información actual y proporciona citas.
Limitación: Sigue cometiendo errores. Las citas no garantizan la exactitud; los models a veces citan fuentes incorrectamente o malinterpretan el contenido citado.
Microsoft Copilot: Integra GPT-5.4 Thinking con datos en vivo de internet, introduciendo los modos “Quick Response” y “Think Deeper” para un razonamiento personalizado en diferentes tipos de tareas.1 El agente Researcher combina GPT para la investigación inicial con Claude de Anthropic revisando los resultados para comprobar la exactitud y la calidad de las citas antes de ofrecer una mejora del 13.8 % en el benchmark de investigación profunda DRACO con respecto a los sistemas independientes.2
- ChatGPT: Busca en la web cuando se le pregunta por eventos recientes. Cita fuentes en las respuestas.
- Perplexity: Creado específicamente para búsquedas con citas. Cada respuesta incluye enlaces a las fuentes.
2- Datos de entrenamiento sintéticos
Los models generan sus propios datasets de entrenamiento en lugar de requerir datos etiquetados por humanos.
Google y su model auto-mejorado (investigación de 2023):
- El model crea preguntas
- Cura respuestas
- Se fine-tunea a sí mismo con los datos generados
Rendimiento mejorado: del 74.2 % al 82.1 % en los problemas de matemáticas GSM8K, y del 78.2 % al 83.0 % en la comprensión lectora DROP.
OpenAI, Anthropic y Google están utilizando datos sintéticos para complementar los datasets etiquetados por humanos. Esto reduce los costes de etiquetado de datos, pero introduce nuevos riesgos de sesgo; los models pueden amplificar sus propios errores.
Fuente: “Large Language Models Can Self-Improve”
Una encuesta de marzo de 2026 encontró que el 76 % de los investigadores de IA cree que las ganancias derivadas de escalar la computación y los datos se han estancado, y los principales laboratorios informan de rendimientos decrecientes a pesar de las enormes inversiones. El hallazgo sugiere que el próximo salto en la capacidad de los LLM tiene más probabilidades de proceder de la innovación arquitectónica, como una mayor eficiencia del entrenamiento, arquitecturas dispersas o mejoras del razonamiento, que de simplemente escalar aún más los enfoques existentes.3
3- Models expertos dispersos (Mixture of Experts)
En lugar de activar toda la red neuronal para cada entrada, solo se activa un subconjunto relevante de parámetros, según la tarea. El model enruta la entrada hacia “expertos” especializados dentro de la red. Solo los expertos activados procesan la consulta.
Ejemplos reales:
- Llama 4 Scout: 109B parámetros totales, 17B activos por token. La arquitectura Mixture of Experts (MoE) ofrece una ventana de contexto de 10M tokens en una única H100 GPU.
- Mistral Devstral 2: Diseñado específicamente para tareas de ingeniería de software. 123B parámetros, ventana de contexto de 256K tokens. Alcanza un 72.2 % en SWE-bench Verified, lo que lo consolida como el model de código de pesos abiertos líder. Una variante más pequeña, Devstral Small 2 (24B parámetros), se ejecuta localmente en hardware de consumo bajo la licencia Apache 2.0.4
- En nuestro A-CODE-LLM Bench, tanto las variantes base como de pensamiento de DeepSeek V4 Pro obtuvieron una puntuación global inferior a 0.45, con tiempos de finalización superiores a 1.700 segundos por tarea. La capacidad de codificación agéntica del model está por detrás de su sólido rendimiento en consultas individuales en benchmark, lo que probablemente refleja una menor madurez en el uso de herramientas en comparación con los models de frontera de Anthropic y Google en esta etapa.
4- Integración con flujos de trabajo empresariales
Los LLMs se integran directamente en los procesos empresariales en lugar de utilizarse como herramientas independientes.
Ejemplos reales:
- Salesforce Agentforce (anteriormente Einstein Copilot): Integra LLMs en las operaciones de CRM. Responde a las consultas de los clientes, genera contenido y ejecuta acciones en Salesforce, con base en los datos y metadatos de CRM de la organización a través de Einstein Trust Layer.5
- Microsoft 365 Copilot: Integrado en Word, Excel, PowerPoint y Outlook. Redacta documentos, analiza hojas de cálculo, genera presentaciones y resume hilos de correo electrónico, basándose en los datos de la empresa a través de Microsoft Graph para fundamentar las respuestas en el contexto organizativo.6 El agente Researcher utiliza una arquitectura multi-model donde GPT se encarga de la investigación inicial y Claude revisa los resultados antes de la entrega, lo que supone el primer despliegue comercial confirmado de proveedores de IA competidores dentro de un único producto empresarial.
- Anthropic Claude for Enterprise: La separación de memoria basada en proyectos mantiene los contextos de trabajo diferenciados entre equipos. Claude Opus 4.6 introdujo equipos de agentes, lo que permite que múltiples agentes de Claude dividan tareas más grandes en flujos de trabajo paralelos, cada uno responsable de un segmento y coordinado con los demás simultáneamente. La misma versión integró Claude directamente en PowerPoint como un panel lateral nativo (vista previa de investigación), lo que permite crear y editar presentaciones dentro de la aplicación sin transferencias de archivos.7
5- Híbridos LLMs con capacidades multimodales
Los large multimodal models integran múltiples formas de datos, como texto, imágenes y audio, lo que les permite comprender y generar contenido en diferentes tipos de medios.
- En nuestro A-CODE-LLM Bench, GPT 5.5 de pensamiento obtuvo 0.597 con un tiempo medio de finalización de 276 segundos, el model más rápido por encima de 0.50 en tiempo. El coste por celda de la API fue de $0,41–$0,45 para las mini variantes, aproximadamente un tercio del coste de Claude Sonnet 4.6 en rangos de puntuación similares.
- Gemini 2.5 Pro: Maneja de forma nativa texto, audio, imágenes, vídeo y repositorios de código completos dentro de una ventana de contexto de 1M tokens. Disponible en Google IA Studio, Vertex IA y NotebookLM. El precio empieza en $1,25 por millón de tokens de entrada y $10 por millón de tokens de salida a través de la API.8
- Llama 4 Scout y Maverick: Los models de pesos abiertos de Meta utilizan tokens multimodales de texto y visión con fusion temprana, entrenados juntos desde el principio en lugar de añadirse como módulos separados. Los models se preentrenaron en 200 idiomas y proporcionaron soporte específico de fine-tuning para 12 idiomas, incluidos árabe, español, alemán e hindi.9
La capacidad multimodal es estándar en los models de frontera. El reto pendiente es la consistencia: los models funcionan bien en combinaciones comunes de imagen y texto, pero se degradan en contextos visuales poco frecuentes, entradas de baja resolución y razonamiento intermodal que requiere conectar evidencia visual y textual.
6- Models de razonamiento
Models que piensan los problemas paso a paso en lugar de generar respuestas inmediatas.
Este cambio de la predicción al razonamiento es fundamental para permitir:
- Comportamiento agéntico, donde los models planifican, ejecutan y adaptan tareas de forma autónoma.
- IA interpretable, donde los resultados son paso a paso y lógicamente sólidos, no solo plausibles.
- Claude Sonnet 4.6: Líder de producción actual de Anthropic en benchmarks de codificación agéntica, con una puntuación de 0.748 en el A-CODE-LLM Bench de AIMultiple, por encima de todas las variantes de Opus. Utiliza pensamiento adaptativo, donde el model determina dinámicamente la profundidad de razonamiento según la complejidad de la tarea sin requerir un cambio manual de modo. El precio es de $3/$15 por millón de tokens. En SWE-bench Verified, Sonnet 4.6 alcanza un 79.6 %, a un punto del 80.8 % de Opus 4.7, a una quinta parte del coste.
- Claude Opus 4.7: Buque insignia de Anthropic en razonamiento complejo de múltiples pasos y visión (98.5 % en el benchmark de agudeza visual de XBOW, frente al 54.5 % de la generación anterior). Con un precio de $5/$25 por millón de tokens. En el benchmark de AIMultiple, Opus 4.7 obtuvo 0.61, por debajo de Sonnet 4.6 (0.748) y Opus 4.8 (0.702), principalmente debido a una mayor latencia (1.562 segundos de media por tarea) que degradó las puntuaciones de UI. La diferencia frente a Sonnet se amplía en tareas de razonamiento abstracto como ARC-AGI-2.
- Claude Opus 4.8: Lanzado después de Opus 4.7, recuperándose de la regresión de 4.7 en codificación agéntica. Obtuvo 0.702 en el A-CODE-LLM Bench, quinto en general. Completó la tarea de referencia en 34 segundos, el model más rápido del benchmark en esa tarea, utilizando solo 6 llamadas a herramientas. Precio: $2,92 por celda en condiciones de benchmark ($15/$75 por millón de tokens).
7- Models específicos de dominio con fine-tuning
Models entrenados con datos especializados para sectores específicos en lugar de un entrenamiento de propósito general.
Google, Microsoft y Meta han lanzado importantes models propietarios específicos de dominio y fine-tuned dirigidos a casos de uso empresariales, además de sus ofertas de propósito general.
Estos LLMs especializados pueden dar lugar a menos alucinaciones y una mayor precisión al aprovechar el pre-entrenamiento específico del dominio, la alineación del model y el fine-tuning supervisado.
Programación
GitHub Copilot: Fine-tuned en repositorios de código. En julio de 2025, 20 millones de desarrolladores usan GitHub Copilot, un aumento interanual del 400 %, y el 90 % de las empresas Fortune 100 lo utiliza. Autocompleta código, genera funciones y sugiere correcciones de errores.10
Finanzas
BloombergGPT: 50-mil millones de parámetros LLM entrenado con un dataset de 363 mil millones de tokens de documentos financieros de Bloomberg, superando a models de tamaño comparable en benchmarks de NLP financiero, incluidos el análisis de sentimiento, el reconocimiento de entidades nombradas y la respuesta a preguntas.11
Salud
Google Med-PaLM 2: Fine-tuned en datasets médicos, alcanzó una precisión superior al 85 % en preguntas tipo Examen de Licencia Médica de EE. UU. (USMLE), el primer LLM en alcanzar un rendimiento de nivel experto en este benchmark. Impulsa MedLM, la familia de models fundacionales de Google Cloud para la atención sanitaria.12
Derecho
ChatLAW: Un model de lenguaje de código abierto entrenado específicamente con datasets del dominio jurídico chino.13
8- IA ética y mitigación de sesgos
Las empresas se centran cada vez más en la IA ética y la mitigación de sesgos en el desarrollo y despliegue de los large language models.
- Anthropic y OpenAI llevaron a cabo una evaluación mutua de alineación a mediados de 2025, probando los models públicos de cada uno en busca de adulación, tendencias a denunciar irregularidades y comportamientos de autopreservación. El ejercicio halló adulación en todos los models probados, incluidos casos en los que los models validaron decisiones perjudiciales de usuarios simulados que presentaban creencias delirantes. Posteriormente, Anthropic desarrolló el framework de pruebas Bloom específicamente para benchmarkear este comportamiento en nuevos models.
- Anthropic también lanzó Claude Mythos Preview (Project Glasswing), un model solo por invitación puesto a disposición de un pequeño grupo de organizaciones específicamente para encontrar y corregir vulnerabilidades de ciberseguridad en los principales sistemas operativos y navegadores web. Anthropic ha declarado que no planea hacer que este model esté disponible de forma general. El enfoque de acceso controlado representa un nuevo framework para desplegar models especializados altamente capaces cuando el perfil de riesgo exige un despliegue restringido.14
- Google DeepMind: Publicó “The Ethics of Advanced IA Assistants”, ofreciendo el primer tratamiento sistemático de las cuestiones éticas y sociales que plantean los agentes de IA, cubriendo la alineación de valores, los riesgos de manipulación, el antropomorfismo, la privacidad y la equidad. La evaluación Responsible IA de la empresa incluyó más de 350 ejercicios adversariales de equipo rojo e introdujo un nuevo Critical Capability Level específicamente para la manipulación dañina, tratándolo como un riesgo de nivel frontera junto con los ciberataques y las amenazas CBRN.
Limitaciones de los large language models (LLMs)
1- Alucinaciones
Los models generan información que suena plausible pero es incorrecta.
El leaderboard de alucinaciones de Vectara es el benchmark de resumen fundamentado más referenciado de la industria. En el dataset original de Vectara, los models de Google Gemini ocupan sistemáticamente las primeras posiciones, y las variantes Gemini Flash logran tasas de alucinación inferiores al 1 %. La familia GPT de OpenAI se agrupa entre 0.8 % y 2.0 %.
Vectara lanzó un benchmark significativamente más difícil a finales de 2025 con 7.700 artículos (frente a 1.000), documentos más largos de hasta 32K tokens y contenido que abarca derecho, medicina, finanzas y tecnología. Los hallazgos en el nuevo dataset revelan un patrón contraintuitivo: los models de razonamiento y de pensamiento que destacan en tareas complejas alucinan con frecuencia más en resúmenes fundamentados que los models más pequeños y rápidos. La mayoría de los models de clase de pensamiento muestran tasas de alucinación superiores al 10 % en el dataset más difícil, mientras que los models más ligeros, como las variantes Gemini Flash, mantienen tasas más bajas.15
Nota: Ningún benchmark por sí solo ofrece una “tasa de alucinación” definitiva para ningún model. Una evaluación responsable cruza al menos dos benchmarks que miden cosas diferentes: una tarea fundamentada (Vectara), una tarea de conocimiento abierto, y especifica la versión exacta del model y las condiciones de llamada.
Todos los models alucinan. La frecuencia se ha reducido sustancialmente de aproximadamente 21 % en 2021 a menos del 5 % para los mejores en benchmarks estándar, pero no se ha eliminado. Las aplicaciones críticas siguen requiriendo verificación humana.
2- Sesgo
Los models absorben y amplifican los sesgos sociales de los datos de entrenamiento.
Figura: Puntuaciones globales de sesgo por models y tamaño
Fuente: Arxiv16
Tipos de sesgo observados:
- Sesgo de género en las sugerencias de ocupación
- Sesgo racial en las simulaciones de selección de currículums
- Sesgo de edad en las recomendaciones de atención sanitaria
- Sesgo socioeconómico en el contenido educativo
3- Toxicidad
Los models pueden generar contenido dañino, ofensivo o tóxico a pesar de las medidas de seguridad.
Figura: mapa de toxicidad de los LLMs
Fuente: Investigadores de UCLA y UC Berkeley17
*GPT-4-turbo-2024-04-09*, Llama-3-70b* y Gemini-1.5-pro* se utilizan como moderador; los resultados podrían estar sesgados en estos 3 models.
Las medidas de seguridad estrictas reducen la toxicidad, pero aumentan los falsos positivos (rechazar solicitudes inofensivas). Las medidas laxas dejan pasar la toxicidad.
4- Limitaciones de la ventana de contexto
Cada model tiene una capacidad de memoria fija, el número de tokens que puede procesar en una sola sesión. Si se supera ese límite, el model trunca el contenido anterior o rechaza la solicitud. La diferencia práctica entre models es lo bastante amplia como para importar en cargas de trabajo reales.
Ventanas de contexto más recientes:
- Llama 4 Scout (Meta): 10M tokens (~7.5M palabras), la mayor ventana de contexto verificada en producción entre los models líderes.18 En la práctica, esto significa cargar bases de código completas, archivos jurídicos o historiales de conversación de varios días sin fragmentación.
- Gemini 2.5 Pro: 1.048.576 tokens (~780.000 palabras), con entrada multimodal nativa de texto, audio, imágenes y vídeo dentro de la misma ventana. La recuperación se mantiene en 100 % hasta 530.000 tokens y en 99.7 % en el límite completo de 1 millón de tokens.
- Claude Sonnet 4.6: 1M tokens (~750.000 palabras) con precios estándar, disponible sin cabeceras beta ni configuración especial.19
- GPT-5.5: ventana de contexto de 1M tokens a nivel de API.20
Una ventana de contexto grande no implica automáticamente un mejor rendimiento en toda ella. La recuperación se degrada hacia la mitad de contextos muy largos en la mayoría de los models, y los costes aumentan con la longitud de la entrada: procesar 1M tokens cuesta significativamente más que procesar 10K tokens en el mismo model. Para la mayoría de las cargas de trabajo en producción, la pregunta práctica no es qué model tiene la ventana más grande, sino qué model recupera de forma fiable con las longitudes de contexto que realmente requiere tu caso de uso.
5- Corte de conocimiento estático
Los models dependen de conocimiento preentrenado con una fecha de corte específica. No tienen acceso a información posterior al entrenamiento a menos que estén conectados a fuentes externas.
Problemas:
- Información desactualizada sobre eventos actuales
- Incapacidad para manejar novedades recientes
- Menor relevancia en dominios dinámicos (tecnología, finanzas, medicina)
Solución: Integración de búsqueda web. ChatGPT, Claude y Perplexity ofrecen búsqueda en tiempo real. Pero la búsqueda no elimina las alucinaciones; los models a veces malinterpretan los resultados de búsqueda.
Principales plataformas de LLM
GPT-5.5
El buque insignia actual de OpenAI se lanzó el 23 de abril de 2026. Construido en torno a un esfuerzo de razonamiento configurable, los desarrolladores establecen la profundidad de pensamiento por solicitud (de none a xhigh), de modo que las consultas simples no consumen la computación reservada para problemas difíciles. El model destaca en codificación agéntica, uso del ordenador y tareas de largo horizonte en las que necesita mantener contexto en sistemas grandes y comprobar su propio trabajo a mitad de ejecución.20
Quién lo usa: Desarrolladores, empresas y creadores de contenido. La mayor base de usuarios entre los LLMs.
Limitaciones: $5/$30 por millón de tokens, el precio base más alto de esta lista. Sigue alucinando. Requiere integración de búsqueda web para cualquier cosa posterior a su corte de entrenamiento.
Claude Opus 4.8 / Sonnet 4.6
Claude Sonnet 4.6 lidera el A-CODE-LLM Bench de AIMultiple con una puntuación global de 0.748 a $1,26–$1,33 por celda, por encima de todas las variantes de Opus probadas. Claude Opus 4.8 le sigue con 0.702, recuperándose de la regresión de Opus 4.7 (0.61) a $2,92 por celda. Opus 4.7 sigue siendo el mejor en tareas complejas de razonamiento de varios pasos y visión (98.5 % en el benchmark de agudeza visual de XBOW), pero su tiempo medio de finalización de 1.562 segundos en flujos de trabajo agénticos eleva el coste total a $3,08 por celda, el model más caro del benchmark.
Tanto Sonnet 4.6 como las variantes de Opus utilizan pensamiento adaptativo: el model determina la profundidad de razonamiento según la complejidad de la tarea sin requerir un cambio manual de modo. Sonnet 4.6 realizó el menor número de llamadas a herramientas por tarea entre los models de Anthropic (51 base, 48 de pensamiento), alcanzando la mejor puntuación del benchmark con menos iteraciones que las variantes de Opus (56–70 llamadas a herramientas). Los equipos de agentes, disponibles en la línea de producción de Anthropic, permiten que múltiples instancias de Claude dividan una tarea en flujos de trabajo paralelos coordinados en tiempo real.
Quién lo usa: Desarrolladores y empresas que ejecutan codificación agéntica, flujos de trabajo de investigación o pipelines multiagente. Los equipos que priorizan la eficiencia de costes usan Sonnet 4.6; los equipos con cargas de trabajo intensivas en visión o razonamiento complejo usan Opus 4.7.
Limitaciones: El pensamiento extendido es más lento y más caro por token. La brecha de rendimiento frente a Sonnet se amplía en tareas de razonamiento abstracto (ARC-AGI-2). Opus 4.8 tiene un precio de $15/$75 por millón de tokens.
Gemini 3.5 Flash
Gemini 3.5 Flash de pensamiento obtuvo 0.625, el resultado más alto no perteneciente a Anthropic a $1,30 por celda y 390 segundos de finalización media. La variante base obtuvo una puntuación inferior a la de pensamiento con un coste mayor ($0,56 por celda de referencia), debido a la sobrescritura (131 líneas para una tarea cuya solución de referencia es de ~50 líneas).
Llama 4 Scout
El model MoE de pesos abiertos de Meta. 109B parámetros totales, 17B activos por token, se ejecuta en una sola NVIDIA H100 GPU con cuantificación int4. La implicación práctica es que se puede acceder a una ventana de contexto de 10M tokens sin un contrato de centro de datos.18 La multimodalidad de fusion temprana significa que el texto y la visión se procesan conjuntamente desde la primera capa en lugar de combinarse en la etapa de salida. Disponible bajo la Llama 4 Community License de Meta.
Quién lo usa: Investigadores, organizaciones que necesitan despliegue on-premise, desarrolladores que evitan la dependencia del proveedor y equipos donde el coste a escala hace inviable el precio de la API.
Limitaciones: El rendimiento depende en gran medida de la configuración de hosting y de las decisiones de cuantificación. Requiere inversión en infraestructura y capacidad de ML ops. Menor acabado de producción que los models comerciales.
DeepSeek V4
El model de cuarta generación de DeepSeek está disponible como vista previa. Utiliza una arquitectura MoE de 1 billón de parámetros, aproximadamente un 50 % más grande que V3, con capacidades multimodales de texto, imagen y vídeo. Thinking in Tool-Use permite que el model razone internamente antes de llamar a herramientas externas y verificar los resultados de las herramientas con su propia lógica, lo que es el diferenciador principal para flujos de trabajo agénticos. El precio de entrada de la API empieza en $0,27 por millón de tokens (cache-miss), aproximadamente 18x más barato que GPT-5.5.21
Preguntas frecuentes
Un large language model es un model de IA diseñado para generar y comprender texto similar al humano mediante el análisis de grandes cantidades de datos.
Estos models fundacionales se basan en técnicas de deep learning y suelen implicar redes neuronales con muchas capas y un gran número de parámetros, lo que les permite capturar patrones complejos en los datos con los que se entrenan.
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sezer, Sena},
title = {{El futuro de los large language models}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/future-of-large-language-models}},
note = {AIMultiple. Recuperado el 25 de Junio de 2026}
}Registro de cambios
12 actualizaciones- 2026
Eliminado el gráfico de referencia de alucinaciones para LLMs populares.
Se añadió una sección de metodología de referencia que detalla los modelos evaluados y la puntuación.
Reemplazados GPT-5.2, Gemini 3.1 Pro y DeepSeek V3.2 por GPT-5.5, Gemini 2.5 Pro, DeepSeek V4 y Claude Opus 4.7.
Actualizados los datos de 'Ejemplos de la vida real' en la sección 'Domain-Specific Fine-Tuned Models'.
Actualizada la sección "Tendencias futuras de los grandes modelos de lenguaje" con nuevos ejemplos de verificación de hechos en tiempo real.
- 2025
Se añadieron modelos de razonamiento a la sección de enfoques prometedores.
- 2024
Se reemplazó la sección "¿Cuál es la etapa actual de los grandes modelos de lenguaje?" con contenido nuevo.
Se actualizó la sección '¿Cuál es el futuro de los grandes modelos de lenguaje?' con nuevas categorías y ejemplos de la vida real.
Actualizada la introducción con nuevas estadísticas de visitantes para ChatGPT.
Se añadió Claude 3 (Anthropic) a la lista de LLMs.
Eliminada la Figura 1 de la introducción.
Añadidos modelos multimodales a la sección "Datos de entrenamiento sintéticos".
Enlaces de referencia
El trabajo de Cem en AIMultiple ha sido citado por publicaciones líderes mundiales como Business Insider, Forbes, Morning Brew y Washington Post, empresas globales como Deloitte y HPE, ONG como World Economic Forum y organizaciones supranacionales como European Commission. [1], [2], [3], [4], [5]
A lo largo de su carrera, Cem trabajó como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.
Dirigió la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando al CEO. También lideró el crecimiento comercial de la empresa de deep tech Hypatos, que alcanzó unos ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.
Cem participa habitualmente en conferencias internacionales de tecnología. Se graduó en Bogazici University como ingeniero informático y tiene un MBA de Columbia Business School.




Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.