Precios de LLM: Comparativa de 15+ proveedores principales
Los precios de LLM abarcan cuatro órdenes de magnitud: los models más baratos se lanzaron por menos de $0,03 por millón de tokens, mientras que los niveles de razonamiento frontera se lanzaron hasta $262.50. El gráfico siguiente rastrea los precios de lanzamiento: cada punto es el precio promedio de los models de una clase de tamaño lanzados en un trimestre natural, combinando 3 partes de entrada por 1 de salida, en 8 clases de tamaño. Los precios son la tarifa estándar de lista del proveedor sin descuentos por caché ni por lotes, o la tarifa alojada en el momento del lanzamiento para los models de pesos abiertos sin precio de primera parte; el eje y es logarítmico.
- Los models de chat insignia son cada vez más baratos. GPT-4 se lanzó a $37,50 en marzo de 2023; Claude Opus 5 a $10,00 en julio de 2026.
- Los niveles Pro de razonamiento marcan un nuevo techo. o1-pro alcanzó un máximo de $262,50 en marzo de 2025; los lanzamientos Pro de 2026 de OpenAI se mantienen en $67.50.
- El nivel barato está subiendo. El lanzamiento mediano cerrado-pequeño costó $0,53 en 2024 y $3,00 en los primeros ocho meses de 2026. Seis models se lanzaron en esa clase este año y solo Upstage, con su Solar Pro 4, a $0,53, quedó por debajo de $1.00.
- Los buques insignia de pesos abiertos triplicaron su precio y siguen siendo más baratos que los models cerrados. Su precio medio de lanzamiento subió de $0,48 en 2024 a $1,63 en 2026, frente a una mediana de $3,75 para los lanzamientos cerrados de gama media. Moonshot, con su Kimi K3, a $6,00, es el lanzamiento de pesos abiertos más caro del gráfico.
- Los lanzamientos cerrados de gama media cuestan un 38 % menos que en 2024. La mediana cayó de $6,00 en 2024 a $4,38 en 2025 y $3,75 en 2026. Grok 4.5 y Grok 4.6 se lanzaron a $3,00; Meta, con su Muse Spark 1.1, a $2.00.
Los precios son precios de lanzamiento combinados por millón de tokens, ponderados con tres partes de entrada por una de salida, y excluyen las promociones de lanzamiento por tiempo limitado.
Evaluación de precios de LLM API
Hay dos formas de pagar por un LLM: planes de suscripción con tarifa plana de LLM de los principales proveedores, o un model de API de pago por uso facturado por consumo de tokens.
Haz clic en los nombres de los model para ver sus resultados de benchmark, la latencia real y los precios, y evaluar la eficiencia y la relación coste-eficacia de cada model.
Ranking: Los models se clasifican según su posición promedio en todos los benchmarks.
Puedes consultar las tasas de alucinación y el rendimiento de razonamiento de los principales LLMs en nuestros benchmarks.
Comparación de planes de suscripción de LLM
Los usuarios no técnicos pueden preferir usar la interfaz de usuario en lugar de la API. En 2026, la mayoría de las suscripciones de los proveedores incluyen mucho más que una interfaz de chat. Los agentes de programación como Claude Code, Codex, Kimi Code y Mistral Vibe se incluyen en los planes de nivel Pro. Para desarrolladores y usuarios intensivos, la suscripción adecuada de $10–$200 a menudo sustituye lo que de otro modo sería una suscripción separada a un IDE de programación, un presupuesto de API por token y una herramienta de vídeo o investigación combinadas.
OpenAI
El plan gratuito incluye chats de texto diarios ilimitados con GPT-5.6 Luna, modo de voz estándar, cargas limitadas y generación de imágenes básica. Los anuncios contextuales llegan a unos 40 mercados a fecha de agosto de 2026, incluidos EE. UU. y la mayor parte de Europa, y aparecen solo en los planes Free y Go.
- ChatGPT Go ($8/mes) es un plan de bajo coste que puede incluir anuncios. Los chats de texto son ilimitados, como en Free; la mejora ofrece límites más altos de carga de archivos, creación de imágenes, voz y memoria, todo con GPT-5.6 Luna.
- ChatGPT Plus ($20/mes) incluye límites de uso ampliados, acceso a GPT-5.6 Sol, Terra y Luna, modo de voz avanzado, el agente Codex, generación de imágenes y funciones de acceso anticipado.
El plan Pro tiene dos niveles desde abril de 2026:
- ChatGPT Pro ($100/mes) ofrece la misma gama de models que el nivel de $200 (incluido GPT-5.6 Sol) con límites de uso de aproximadamente 5x los de Plus.
- ChatGPT Pro ($200/mes) ofrece los límites de uso individuales más altos (unas 20x Plus), la mayor asignación de Deep Research, voz avanzada con vídeo y uso compartido de pantalla, Codex con el máximo impulso de uso y Sora.
Ambos niveles Pro incluyen acceso prioritario durante las horas pico. El precio de Codex en Plus, Pro y Business pasó de ser por mensaje a un uso alineado con tokens de API en abril de 2026.
ChatGPT Work, el agente de OpenAI para proyectos de larga duración y varios pasos (lanzado el 9 de julio de 2026), está incluido en los planes de pago, y la aplicación de escritorio que incluye Chat, Work y Codex está disponible en todos los planes, incluido Free.
- Plan Business ($20/usuario/mes anual o $25/usuario/mes mensual) es el plan de OpenAI para equipos pequeños y medianos (antes ChatGPT Team, renombrado en agosto de 2025). Añade límites de mensajes más altos, consola de administración, SSO, datos de equipo excluidos del entrenamiento y grupos de créditos compartidos para funciones avanzadas. Aplicaciones incluidas: Codex con créditos de espacio de trabajo compartidos. Los puestos solo de Codex se cerraron para nuevos espacios de trabajo el 24 de junio de 2026; OpenAI ha anunciado puestos Premium a $100/usuario/mes anuales ($125 mensuales) con uso Estándar de 5x. El plan requiere al menos 2 puestos.
- El plan Enterprise (precio personalizado) ofrece acceso a models de alta velocidad, ventanas de contexto ampliadas, controles de datos de nivel empresarial, verificación de dominio, analítica y registros de auditoría. Aplicaciones incluidas: Codex con grupo de créditos compartido y puestos opcionales solo de Codex.
Anthropic (Claude)
El plan gratuito incluye acceso web y móvil, análisis básico, acceso a Claude Sonnet 5 y Haiku, y carga de documentos. El uso diario está limitado y los models Opus y Fable no están disponibles.
- Plan Pro ($20/mes, o $17/mes con facturación anual) ofrece acceso a Opus 5, Sonnet 5 y Haiku, aproximadamente 5x más uso que Free, organización de proyectos y acceso prioritario en horas pico. Fable 5 no forma parte de los límites de uso de Pro; se factura a tarifas de API mediante créditos de uso de pago por consumo. Aplicaciones incluidas: Claude Code (el agente de programación de Anthropic en la terminal y el IDE), Cowork, Claude Design y Claude para Microsoft 365, todos compartiendo el mismo grupo de uso que el chat.
- Plan Max 5x ($100/mes) ofrece aproximadamente 5x más uso que Pro, acceso prioritario a las funciones y models más recientes, y acceso completo a Claude Code en el nivel de uso superior Max.
- Plan Max 20x ($200/mes) ofrece aproximadamente 20x más uso que Pro, máxima prioridad de acceso y acceso completo a Claude Code. Diseñado para usuarios intensivos diarios que ejecutan cargas de trabajo de Claude Code. Ambos niveles Max incluyen Fable 5, el model más caro de Anthropic; su uso puede consumir hasta la mitad del límite de uso semanal del plan.
El plan Team ofrece dos tipos de puestos y admite de 2 a 150 miembros:
- Puesto Estándar: $20/usuario/mes anual ($25/usuario/mes mensual). Incluye funciones básicas, límites de uso estándar y acceso a Claude Code.
- Puesto Premium: $100/usuario/mes anual ($125/usuario/mes mensual). Todo lo de Estándar, además de límites de uso más altos para usuarios intensivos que ejecutan cargas de trabajo más pesadas de Claude Code.
Aplicaciones incluidas: Claude Code y Cowork están incluidos con cada puesto de Team (Estándar y Premium); la diferencia está en la asignación de uso, no en el acceso. Ambos tipos de puestos incluyen facturación central, herramientas de colaboración y controles de administración.
- Plan Enterprise ($20/puesto/mes más uso a tarifas de API en el nivel de autoservicio; precio personalizado con ventas) ofrece ventanas de contexto ampliadas, SSO, captura de dominio, acceso basado en roles, SCIM, registros de auditoría e integraciones de datos. Aplicaciones incluidas: en los planes Enterprise nuevos y de autoservicio, Claude Code y Cowork están incluidos con cada puesto; los contratos Enterprise más antiguos pueden distinguir entre puestos solo de Chat y puestos de Chat + Claude Code con facturación por uso.
Google (Gemini)
El plan gratis ofrece acceso a Gemini 3.6 Flash y acceso variable a Gemini 3.1 Pro, generación de imágenes básica, Deep Research, Gemini Live, Canvas y Gems. Aplicaciones incluidas: Gemini Notebook (antes NotebookLM) y Flow con acceso limitado a Nano Banana Pro.
Google utiliza precios regionales, por lo que el precio puede variar según la región.
- Google IA Plus ($4,99/mes, EE. UU.) es el nivel de pago inicial con límites de uso 2x de Free. Aplicaciones incluidas: más acceso a Gemini 3.1 Pro en el chat, generación de imágenes con Nano Banana Pro, generación de vídeo con Gemini Omni Flash, 200 créditos Flow, Gemini Notebook con más resúmenes de audio, Gemini en Gmail, Docs y Vids, y acceso anticipado a Gemini en Chrome. Incluye 400 GB de almacenamiento.
- Google IA Pro ($19,99/mes, EE. UU.) ofrece límites de uso 4x de Free y 5 TB de almacenamiento. Aplicaciones incluidas: Jules (agente de programación asíncrono), Google Antigravity (plataforma de desarrollo agéntico), límites ampliados de IA Studio, $40/mes en créditos de Google Cloud, Gemini Notebook con 5x resúmenes de audio, Deep Research, 1.000 créditos Flow, YouTube Premium Lite y Google Home Premium (plan Estándar).
- Google IA Ultra (EE. UU.) cuesta $99,99/mes para límites de uso de IA Pro de 5x o $199,99/mes para 20x. Aplicaciones incluidas: razonamiento Deep Think, Gemini Agent (solo EE. UU.), Gemini Spark, Project Genie (model de mundo interactivo), Jules con los límites más altos, Antigravity de nivel superior, 10.000 o 25.000 créditos Flow, Google Home Premium (plan Avanzado) y una suscripción individual a YouTube Premium. El almacenamiento comienza en 20 TB.
Microsoft Copilot
El plan gratis (Copilot Chat) está disponible sin coste adicional para todos los usuarios de Microsoft Entra con una suscripción elegible a Microsoft 365. Incluye chat básico de Copilot en todas las aplicaciones de Microsoft sin las funciones más profundas dentro de los documentos.
- Microsoft 365 Premium ($19,99/mes o $199,99/año) es ahora el plan Copilot para consumidores. Incluye las aplicaciones de Office, hasta 6 TB de almacenamiento (1 TB cada una para hasta seis personas) y los límites de Copilot para consumidores más altos; las funciones de IA se aplican solo al titular de la suscripción. El antiguo Copilot Pro ($20/mes) está cerrado para nuevas compras, y los suscriptores actuales pueden mantenerlo o cambiarse a Premium.
- Microsoft 365 Copilot Business ($21/usuario/mes anual; $18/usuario/mes tarifa del primer año para compras hasta el 30 de septiembre de 2026; $25,20/usuario/mes mensual) añade Copilot en todas las aplicaciones de Microsoft 365, integración con Teams y controles de administración. Aplicaciones incluidas: Copilot Studio Lite para crear agentes ligeros, Copilot en SharePoint y Copilot Pages para borradores colaborativos. Limitado a organizaciones con hasta 300 usuarios.
- Microsoft 365 Copilot Enterprise ($30/usuario/mes anual, o $31,50/usuario/mes facturado mensualmente; requiere una licencia elegible de Microsoft 365) ofrece seguridad avanzada, cumplimiento y analítica sobre las funciones de Business. Aplicaciones incluidas: creación de agentes con Copilot Studio (los datos de trabajo y los agentes predefinidos pueden medirse; Copilot Studio independiente se vende por separado), Copilot en Microsoft Purview e Intune para flujos de trabajo de TI y seguridad, y gobernanza de los agentes implementados.
xAI (Grok)
El plan gratis ofrece acceso limitado a Grok.
- SuperGrok Lite ($10/mes) es el nivel de pago inicial. Incluye conversaciones 2x más largas, límites de frecuencia más altos y creación de imágenes y vídeo con IA. Aplicaciones incluidas: Grok Build (el agente de creación de aplicaciones de xAI, también gratis en la web desde agosto de 2026) y Grok Imagine para la generación de imágenes y vídeo.
- SuperGrok ($30/mes, o $300/año) incluye razonamiento mejorado con Grok 4.6, conversaciones 5x más largas, cargas de archivos más largas, modo de voz para chat hablado y 20x más generaciones de imágenes y vídeo de Grok Imagine, incluidos vídeos HD de 720p y 30 segundos.
- SuperGrok Plus ($100/mes) añade acceso a Grok Bot, generación de vídeo en 1080p, límites de uso más altos, respuestas más rápidas y acceso prioritario.
- SuperGrok Heavy ($300/mes) ofrece todo lo de Plus, un equipo de agentes para trabajo en paralelo, límites de frecuencia máximos, vistas previas anticipadas de las próximas funciones de xAI y una suscripción a X Premium+. En julio de 2026, xAI también lanzó complementos para Excel, Outlook y Google Workspace, además de Automations programadas; la mayoría son gratis, y el complemento de Outlook y las Automations activadas por correo electrónico están reservadas para usuarios de pago.
Grok también está incluido en las suscripciones de X: X Premium ($8/mes) es la vía de pago más barata para acceder a Grok dentro de la aplicación X e incluye estado verificado y menos anuncios. X Premium+ ($40/mes) elimina los anuncios en toda X y tiene los límites de uso de Grok más altos, junto con la monetización completa para creadores.
Moonshot IA (Kimi)
Los planes para consumidores de Kimi reciben nombres de indicaciones de tempo musical, de más lento a más rápido. El precio internacional está en USD; los usuarios chinos pagan en CNY a tarifas más bajas. A fecha de agosto de 2026, las nuevas compras están en lista de espera. La página de precios anuncia próximos planes que separan los beneficios de Kimi y Kimi Code, y el aviso de Moonshot del 20 de julio cita restricciones de capacidad de cómputo para su lanzamiento retrasado, cuatro días después del lanzamiento de K3. Los suscriptores actuales mantienen sus planes y pueden renovarlos.
- Adagio (Free) ofrece conversaciones básicas ilimitadas con 6 usos de agente, consultas limitadas de Deep Research y tareas básicas del agente OK Computer.
- Moderato ($19/mes) añade Kimi K3 en el chat y en tareas de agente, además de sesiones ampliadas de Deep Research. Aplicaciones incluidas: Kimi Code (agente de programación de IA que prioriza la terminal; entre 300 y 1.200 solicitudes por ventana de 5 horas, facturadas desde el grupo de créditos compartido), además de herramientas de creación de presentaciones y sitios web.
- Allegretto ($39/mes) ofrece mayor uso en todo lo de Moderato. Aplicaciones incluidas: Agent Swarm (orquestación de subagentes en paralelo, hasta 4 subtareas paralelas en este nivel), despliegue en la nube de Kimi Claw para grupos de agentes heterogéneos con memoria persistente y 2x los créditos de agente de Moderato.
- Allegro ($99/mes) ofrece 5x créditos de agente, Agent Swarm con hasta 8 subtareas paralelas y chat con K3 con hasta 1M de tokens de contexto.
- Vivace ($199/mes) ofrece 10x créditos de agente, 4 tareas simultáneas, Agent Swarm con hasta 8 subtareas paralelas y chat con K3 con hasta 1M de tokens de contexto, orientado a cargas de trabajo intensivas de investigación y agénticas.
La membresía incluye claves de API de Kimi Code para usar en herramientas de programación de terceros; la API independiente de Kimi Open Platform se factura por token.
MiniMax
MiniMax vende un único Token Plan sobre sus models M3 y M2.7. Sustituyó a los anteriores planes de créditos de agente y al plan de programación a mediados de 2026.
MiniMax Token Plan (una cuota para agentes, programación y trabajo multimodal):
- Plus ($20/mes): ventanas de cuota semanales y móviles de 5 horas, suficientes para 3 o 4 agentes de programación en paralelo; para proyectos personales y creación de prototipos.
- Max ($50/mes): las mismas ventanas para 4 o 5 agentes en paralelo; para programación diaria con agentes y trabajo multimodal.
- Ultra ($120/mes): de 6 a 7 agentes en paralelo; para flujos de trabajo con agentes intensivos y sesiones prolongadas.
- Paquetes de créditos: $5 por 5.000 créditos, $25 por 25.000, $100 por 100.000 (1.000 créditos = $1, válidos 365 días), utilizables además de cualquier plan.
El Token Plan cubre toda la gama de models (M3, M2.7, imagen y voz) en una única cuota, lo que lo convierte en una de las vías más baratas para acceder a un model de programación de vanguardia cuando se combina con una CLI como Cline o Kilo Code.
Mistral IA
El plan gratuito de Mistral Vibe (antes Le Chat) incluye navegación web, análisis básico de archivos, generación de imágenes, sesiones de programación limitadas, 100+ conectores y $10/mes en créditos de API.
- Plan Pro ($14,99/usuario/mes) incluye más mensajes y búsquedas web, más pensamiento extendido e informes de Deep Research, 15 GB de almacenamiento de documentos, hasta 1.000 proyectos, generación de imágenes y $30/mes en créditos de API. Aplicaciones incluidas: el modo Code de Mistral Vibe en la CLI, el IDE o la web, con pago por uso más allá de la cuota incluida. Los estudiantes verificados obtienen Pro por $5,99/mes.
- Plan Team ($24,99/usuario/mes) incluye todo lo de Pro con hasta 30 GB de almacenamiento por usuario, facturación central, control de acceso basado en roles, verificación de nombre de dominio y exportación de datos. Aplicaciones incluidas: Mistral Vibe en el nivel de uso de equipo con controles de administración compartidos.
- Plan Enterprise (precio personalizado) ofrece opciones de implementación segura, incluidas nube privada y autoalojada, SSO SAML, registros de auditoría, soporte premium y analítica detallada. Aplicaciones incluidas: Mistral Vibe con opciones de implementación locales para cargas de trabajo reguladas.
DeepSeek
DeepSeek no ofrece planes de suscripción tradicionales. El acceso por chat web y móvil a los últimos models (actualmente DeepSeek V4-Flash y V4-Pro) es gratis para todos los usuarios, con limitación por uso razonable.
El acceso a la API es de pago por token con tarifas pico y valle desde el 16 de agosto de 2026. En horas valle, V4-Flash cuesta $0,22 por millón de tokens de entrada (fallo de caché) y $0,66 por millón de tokens de salida; las tarifas pico son el doble ($0,44 y $1,32). V4-Pro cuesta $0,66 y $1,98 en horas valle. Los aciertos de caché cuestan alrededor del 3 % de la tarifa de fallo, y las horas pico son de 01:00 a 04:00 y de 06:00 a 10:00 UTC en días laborables.
DeepSeek también ha entrado en el ámbito de las herramientas para agentes. DeepSeek Harness, un kit de herramientas de código abierto basado en complementos para crear y ejecutar agentes de IA, está en vista previa para desarrolladores con código fuente público. No tiene precio propio y es agnóstico respecto al model; el uso se factura según la API del model que llame el agente.
Meta (Muse Spark)
Meta IA sigue siendo gratis en WhatsApp, Instagram, Facebook, Messenger, la aplicación Meta IA y las gafas Ray-Ban Meta, impulsado por Muse Spark (lanzado el 8 de abril de 2026, ahora en la versión 1.2). Meta ha comenzado pruebas limitadas de suscripciones de pago Meta One. Los planes Plus y Premium aumentan la asignación mensual de uso de IA y el acceso al modo Thinking, con precios reportados de $7,99 y $19,99 al mes.1
La Meta Model API está en vista previa pública, es de autoservicio y compatible con el SDK de OpenAI. Los precios de pago por uso de Muse Spark 1.2 comienzan en $1,25 por millón de tokens de entrada y $4,25 por millón de tokens de salida con una ventana de contexto de 1M de tokens. Muse Code, un agente de programación para terminal, se lanzó en beta el 5 de agosto de 2026.
Entender los precios de LLM
Tokens: la unidad fundamental de precio
Figura 1: Ejemplo de tokenización con el tokenizador de GPT-4o y GPT-4o mini para la frase “Identify New Technologies, Accelerate Your Enterprise”.2
Aunque los proveedores ofrecen diversas estructuras de precios, el precio por token es el más común. Los métodos de tokenización difieren entre los models; algunos ejemplos son:
- Byte-Pair Encoding (BPE): divide las palabras en unidades de subpalabras frecuentes, equilibrando el tamaño del vocabulario y la eficiencia.3
- Ejemplo: “unbelievable” → [“un”, “believ”, “able”]
- WordPiece: similar a BPE, pero optimiza la probabilidad del model de lenguaje y se usa en BERT.4
- Ejemplo: “tokenization” → [“token”, “##ization”]. “token” es una palabra independiente; “##ization” es un sufijo.
- SentencePiece: tokeniza texto sin depender de espacios, eficaz para models multilingües como T5.5
- Ejemplo: “natural language” → [” natural”, ” lan”, “guage”] o [” natu”, “ral”, ” language”].
Ten en cuenta que las subpalabras exactas dependen de los datos de entrenamiento y del proceso BPE/WordPiece. Para comprender mejor estos métodos de tokenización, mira el siguiente vídeo:
Tras entender la tokenización, se puede estimar un precio medio según la longitud de tokens del proyecto. La Tabla 2 describe los rangos de tokens por tipo de contenido, incluidos prompts de interfaz, fragmentos de correo electrónico, blogs de marketing, informes detallados y artículos de investigación, y señala que el número de tokens varía según los models. Una vez elegido un model, se puede usar su tokenizador para estimar el número medio de tokens del contenido.
Tabla 2: Tipos de contenido típicos, sus rangos de tamaño y consideraciones empresariales (los rangos son estimaciones y pueden variar).
Implicaciones de la ventana de contexto
La ventana de contexto establece un límite estricto en el número de tokens de entrada y salida por llamada, incluidos los tokens que usan los models de razonamiento para el razonamiento en cadena de pensamiento. Si el total supera este límite, la respuesta se trunca o la solicitud falla por completo.
Figura 2: Ilustración de las limitaciones de la ventana de contexto que provocan el truncamiento de la salida en una conversación de varios turnos.6
En las aplicaciones que mantienen conversaciones largas, cada turno adicional incorpora más historial a la entrada. Sin intervención, los tokens de entrada crecen linealmente con la duración de la conversación, y la factura también. Los usuarios de la API suelen abordar esto de una de estas tres formas:
- Prompt caching. OpenAI, Anthropic, Google y DeepSeek almacenan en caché los prefijos de prompt repetidos en el servidor y facturan los aciertos de caché a una fracción de la tarifa de entrada estándar, normalmente entre el 3 y el 10 por ciento del precio de fallo de caché. Para las aplicaciones que reutilizan un prompt de sistema largo o un prefijo de conversación, el almacenamiento en caché puede reducir el coste de entrada en un orden de magnitud.
- Ventana móvil o generación aumentada por recuperación (RAG). Descarta los turnos más antiguos una vez alcanzado un umbral, o recupera solo los mensajes pasados relevantes de un almacén vectorial en cada llamada.
- Resumen. Condensa periódicamente los turnos más antiguos en un resumen en lugar de reenviarlos literalmente.
Para cargas de trabajo agénticas, como sesiones de programación o investigación profunda, los agentes de programación modernos gestionan esto automáticamente en la sesión. Claude Code, por ejemplo, incluye compactación de contexto: cuando la conversación se acerca al límite, resume los mensajes más antiguos en una versión condensada y mantiene intactos los turnos recientes. Los turnos posteriores envían solo el resumen más el contexto reciente al model.
El impacto en el precio es directo. En las API de pago por token, la compactación limita cuánto crece la entrada de cada llamada y el almacenamiento en caché reduce el precio del prefijo repetido, de modo que el coste por turno sigue siendo predecible en sesiones largas. En las suscripciones de tarifa plana como Claude Pro, ChatGPT Plus o Kimi Moderato, la compactación amplía los límites de uso diarios y semanales porque cada llamada contiene menos contexto. Una sesión de programación que de otro modo agotaría un límite de frecuencia de 5 horas puede durar más cuando los turnos antiguos se comprimen.
El inconveniente es que cualquier forma de resumen tiene pérdidas. El resumen puede omitir detalles que luego resultan importantes, lo que obliga al usuario a volver a proporcionarlos.
Máximo de tokens de salida
El máximo de tokens de salida limita la longitud de la respuesta de un model. Aunque muchas documentaciones mencionan que se puede ajustar mediante el parámetro max_tokens, es fundamental revisar la documentación de la API específica que se esté usando para identificar el parámetro correcto. Debe ajustarse según las necesidades concretas:
Si se ajusta demasiado bajo, puede dar lugar a salidas incompletas y hacer que el model corte las respuestas antes de ofrecer la respuesta completa.
Si se ajusta demasiado alto, según la temperatura (un parámetro que controla la creatividad de la respuesta), puede generar salidas innecesariamente largas, tiempos de respuesta mayores y un mayor coste.
Por tanto, es un parámetro que requiere una consideración cuidadosa para optimizar el uso de los recursos y equilibrar la calidad de la salida, el coste y el rendimiento.
Tabla 3: Ejemplos de prompts de entrada y recuentos de tokens estimados por tipo de contenido.
*Esto asume que cada model produce respuestas con el mismo número de tokens de salida, aunque el recuento de tokens de entrada y salida puede variar según la tokenización de cada model; aquí el número se ha mantenido constante para cada model.
Al combinar los rangos de tokens de la Tabla 2 con las tarifas por token de un model se obtiene el coste esperado por tipo de contenido; los prompts de ejemplo de la Tabla 3 muestran los tamaños de entrada y salida que hay detrás de esas estimaciones.
Usar varios models de lenguaje
Una pasarela de IA como OpenRouter permite enviar el mismo prompt a varios models simultáneamente. Después se pueden comparar las respuestas, el consumo de tokens, el tiempo de respuesta y el precio para determinar qué model es más adecuado para la tarea.
Figura 3: Interfaz que muestra un prompt enviado a varios Large Language Models a través de OpenRouter.7
Beneficios y retos
- Mayor adaptabilidad y eficiencia: la orquestación mejora la capacidad de respuesta, permite evaluar en tiempo real la eficiencia de los models e identificar un model rentable y posibles ahorros.
- Sensibilidad y optimización de prompts: prompts idénticos pueden generar resultados muy diferentes en distintos models, lo que exige ingeniería de prompts adaptada a cada model para lograr los resultados deseados, lo que añade complejidad al desarrollo y al mantenimiento.
Mecánica de precios y costes ocultos
Tokens de razonamiento frente a tokens de salida
Un número creciente de proveedores ha introducido models de razonamiento que dedican cómputo adicional para realizar internamente razonamiento en cadena de pensamiento. OpenAI, Anthropic y Google facturan esos tokens de razonamiento como tokens de salida a la tarifa de salida estándar del model, por lo que el aumento del coste proviene del volumen, no de un precio por token más alto.
Models como GPT-5.5 Pro, Claude Opus 5 con pensamiento extendido o Gemini 3.1 Pro Deep Think generan trazas internas de razonamiento
incluso cuando no las solicitas explícitamente. Estos tokens internos cuentan para tu factura y pueden aumentar sustancialmente el coste, especialmente en tareas analíticas largas como revisión legal, análisis de datos o razonamiento en varios pasos.
Por eso es esencial:
- Elegir un model de razonamiento solo cuando la precisión supere claramente al coste.
- Desactivar la cadena de pensamiento o establecer un recuento máximo de tokens de salida más corto cuando sea posible.
- Probar la misma tarea en models que no sean de razonamiento para ver si el rendimiento es comparable a una fracción del precio.
Dado que un model de razonamiento puede emitir de 10 a 30 veces más tokens de salida que el mismo prompt sin razonamiento, es fundamental comprender esta distinción para planificar los costes.
Diferencias de precios según la arquitectura
Las arquitecturas de LLM influyen directamente en la eficiencia de los models y, por tanto, en el precio de la API. Por ejemplo:
- Los models Mixture-of-Experts (MoE) activan solo un subconjunto de parámetros por solicitud, lo que reduce el coste de cómputo y permite a los proveedores ofrecer tarifas por token más bajas.
- La decodificación especulativa combina un model borrador más pequeño con uno más grande, lo que mejora el rendimiento y reduce el coste en tareas deterministas.
- Las variantes cuantizadas (por ejemplo, de 4 u 8 bits) pueden realizar inference con menor precisión, lo que permite precios más bajos en versiones desplegadas localmente o alojadas en la nube.
Comprender estas opciones de arquitectura ayuda a los usuarios a predecir no solo las diferencias de precio, sino también la latencia, la calidad y la forma en que un model escala bajo cargas de trabajo de producción.
Costes operativos más allá de las tarifas de API
Aunque el precio por token es el principal factor de coste, muchos despliegues en producción incurren en costes adicionales más allá del uso de la API:
- Embeddings y bases de datos vectoriales: almacenar y recuperar vectores (por ejemplo, Pinecone, Weaviate, ChromaDB) añade coste por consulta y por GB de almacenamiento.
- Models de reranking y posprocesamiento: muchas aplicaciones usan models más pequeños para resumir, filtrar o clasificar antes de enviar una solicitud final a un model más grande.
- Capas de caché: proveedores como OpenAI ahora ofrecen almacenamiento en caché a nivel de prompt, pero la infraestructura de caché local puede requerir cómputo adicional.
- Registro, supervisión y auditoría: las empresas suelen incurrir en costes por la supervisión a nivel de token, el seguimiento de la latencia y las auditorías de seguridad.
Estos costes ocultos suelen representar entre el 20 y el 40 % de los gastos operativos totales de LLM y deben tenerse en cuenta al evaluar las estructuras de precios.
Consideraciones de precio específicas para empresas
Muchos proveedores de LLM cobran tarifas adicionales por funciones de seguridad y cumplimiento de nivel empresarial, como:
- Implementaciones de inquilino único
- Clústeres de GPU dedicados
- SLA mejorados (por ejemplo, garantías de tiempo de actividad y latencia)
- Residencia de datos y controles regionales
- Modos de cumplimiento de SOC2, HIPAA o GDPR
Estas ofertas pueden aumentar considerablemente los costes, pero son esenciales para sectores regulados como la atención sanitaria, las finanzas, los servicios jurídicos y las instituciones públicas.
Tendencias futuras en los precios de LLM
Tres cosas definieron los precios de LLM en 2025: los models básicos se abarataron, casi todos los grandes proveedores lanzaron una suscripción de chat y los models de razonamiento siguieron siendo caros. La brecha es estructural y probablemente se amplíe: un millón de tokens de salida cuesta $0,66 en DeepSeek V4-Flash (hora valle) y $180 en GPT-5.5 Pro. Las preguntas interesantes a partir de 2026 se refieren a qué cambia por encima de esa base.
La facturación por token da paso a la tarificación por tarea
Los agentes generan ahora la mayor parte del uso intensivo de LLM. Una sola tarea de programación con Claude Code, una sesión de investigación con Cowork o una sesión de navegación autónoma con Operator puede realizar cientos de llamadas secuenciales a models. La facturación por token se vuelve impredecible tanto para el comprador como para el vendedor.
En respuesta, los proveedores están pasando de los medidores de tokens a cuotas por tarea y por sesión. Moonshot estima entre 300 y 1.200 solicitudes de Kimi Code por ventana de 5 horas desde un grupo de créditos compartido. Claude Code limita el uso por sesión de 5 horas en lugar de por mensaje. MiniMax configura las cuotas de su Token Plan como ventanas móviles de 5 horas y semanales dimensionadas según el número de agentes de programación en paralelo. Kimi establece límites específicos por nivel en los subagentes paralelos de Agent Swarm.
Los arneses de agentes entre proveedores, como OpenClaw y MaxHermes, llevan esto más lejos. Se sitúan entre los usuarios y varias API de models, y sus precios siguen cada vez más el rendimiento por tarea en lugar de por millón de tokens. Es de esperar que más proveedores publiquen SKU por tarea o por sesión durante el próximo año.
Los models de razonamiento pequeños se trasladan al dispositivo
Apple Intelligence ejecuta la inference en el dispositivo para consultas rutinarias y recurre a Private Cloud Compute solo para solicitudes complejas. Los PC Copilot+ de Microsoft incluyen un model local. Los dispositivos Pixel ejecutan Gemini Nano. Models pequeños recientes como Phi-4 de Microsoft y Gemma 3 de Google son capaces de razonar en tamaños que caben en la unidad de procesamiento neuronal de un teléfono o portátil.
La implicación para los precios es un mercado de consumo de dos niveles. El trabajo rutinario se ejecuta gratis con el token marginal en el dispositivo. Las suscripciones a la nube compiten en lo que lo local no puede hacer: razonamiento de vanguardia, contexto amplio, generación multimodal y orquestación de agentes. El suelo gratis local empuja las suscripciones solo de chat hacia cero, dejando las aplicaciones incluidas como el verdadero motivo para pagar.
El contexto largo y la memoria deciden quién gana el trabajo agéntico
Las tareas agénticas de horizonte largo fallan cuando los models pierden el hilo de instrucciones anteriores o alucinan hechos que deberían recordar. El trabajo agéntico sostenido depende de tres cosas: una ventana de contexto amplia, memoria persistente y una baja tasa de alucinaciones.
En un año, tres capacidades de vanguardia se han desplomado hacia la línea base. Claude Opus 5, Gemini 3.1 Pro, GPT-5.6 y Kimi K3 ofrecen ventanas de contexto de 1M de tokens. En OpenAI, Anthropic, Google y DeepSeek, los aciertos de caché cuestan entre el 3 y el 10 por ciento de los fallos de caché. ChatGPT y Claude ahora incluyen memoria persistente en sus niveles gratis.
Los models agénticos especializados están surgiendo en la parte alta de este mercado. En junio de 2026, Anthropic lanzó Claude Fable 5, un model de clase Mythos disponible con carácter general8, con un precio de $10 por millón de tokens de entrada y $50 por millón de tokens de salida, el doble de la tarifa de Opus 5. Fable 5 está orientado a programación agéntica, uso de ordenador e investigación de horizonte largo; Claude Mythos 5, el mismo model con salvaguardas retiradas en algunas áreas, sigue limitado a socios aprobados al mismo precio.
La cuestión competitiva pasa de “¿cómo de grande es la ventana de contexto?” a “¿con qué economía y fiabilidad puede el model sostener una tarea agéntica larga?”. Los proveedores que lo resuelvan bien podrán cobrar primas. Los que no, perderán cargas de trabajo agénticas con independencia del precio de token anunciado.
Preguntas frecuentes
Acceder a Large Language Models (LLMs) a través de una interfaz de programación de aplicaciones (API) te da acceso remoto a los models de IA. Este acceso está sujeto a una tarifa, a menudo llamada “tarifa de API”, que cobra el proveedor del servicio. Esta tarifa es una consideración fundamental al integrar LLMs en tus aplicaciones.
Representa el coste asociado a cada consulta, solicitud o tarea realizada a través de la API del proveedor. Dado que las estructuras de precios pueden variar mucho (según factores como el uso de tokens, el volumen de llamadas a la API, la utilización de funciones o los models de suscripción), es esencial entender cómo calculan los proveedores estos costes.
El precio de LLM API puede ser complejo debido a factores como el consumo de tokens, la longitud del contexto y la elección del model. Los procedimientos de tokenización varían entre models; algunos usan Byte-Pair Encoding (BPE), WordPiece o SentencePiece, y cada uno influye en cómo se divide el texto en tokens y en la eficiencia de costes. Comprender estas diferencias ayuda a optimizar el uso y el precio de la API.
Los costes de LLM están determinados principalmente por el uso de tokens (tanto de entrada como de salida), el volumen de llamadas a la API y el model de precios (por ejemplo, por token o por suscripción).
Compara los precios de los tokens de entrada y salida, los límites de la ventana de contexto y cualquier tarifa adicional. Herramientas como OpenRouter te permiten enviar el mismo prompt a varios models y comparar directamente sus resultados, el uso de tokens, la velocidad y el precio. Ten en cuenta la longitud típica de tu contenido y tus patrones de uso para estimar los costes totales.
Los tokens de entrada son los tokens del prompt que envías al LLM, mientras que los tokens de salida son los tokens de la respuesta generada. En los models de razonamiento, los tokens generados durante el propio proceso de razonamiento también se cuentan como tokens de salida, lo que afecta al coste final. Tanto la entrada como la salida contribuyen al coste total.
Las solicitudes de texto más grandes requieren más procesamiento, lo que aumenta el tiempo de respuesta y los costes. Optimiza el tamaño de las entradas y usa una calculadora de precios de LLM API para estimar el recuento de tokens y gestionar tu presupuesto de forma eficaz.
La comunidad de LLM ha desarrollado diversas herramientas y benchmarks para ayudar a los usuarios a entender y optimizar los precios de LLM. Estos recursos suelen incluir calculadoras y tablas comparativas que ofrecen información sobre la potencia y la eficiencia de distintos models.
Plataformas como Hugging Face y GitHub alojan herramientas y código desarrollados por la comunidad para analizar el rendimiento y los costes de los models. Muchos servicios ofrecen soporte comunitario a través de foros o funciones de chat.
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Precios de LLM: Comparativa de 15+ proveedores principales}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/llm-pricing}},
note = {AIMultiple. Recuperado el 27 de Agosto de 2026}
}Resultados y marcas de tiempo de 19 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene 3 archivos CSV.
Registro de cambios
8 actualizaciones- 2026
Actualizada la descripción del gráfico en la introducción.
Se añadió un gráfico a la sección de tipos de precios de LLM.
Se eliminó la sección 'Comprender los precios de LLM'.
Se amplió la sección "Implicaciones de la ventana de contexto" con estrategias para gestionar el uso de tokens en conversaciones largas.
Se añadió ChatGPT Go a la sección de OpenAI.
- 2025
Se amplió la sección "Comparación de planes de suscripción de LLM" con precios detallados para Microsoft Copilot, Google Gemini, Mistral AI, OpenAI y Claude.ai.
Se añadió la sección "Mecánica de precios y costos ocultos" al artículo.
Eliminada la definición de Rango (Límite Superior) de la sección anterior a las FAQ.
Enlaces de referencia
El trabajo de Cem en AIMultiple ha sido citado por publicaciones líderes mundiales como Business Insider, Forbes, Morning Brew y Washington Post, empresas globales como Deloitte y HPE, ONG como World Economic Forum y organizaciones supranacionales como European Commission. [1], [2], [3], [4], [5]
A lo largo de su carrera, Cem trabajó como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.
Dirigió la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando al CEO. También lideró el crecimiento comercial de la empresa de deep tech Hypatos, que alcanzó unos ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.
Cem participa habitualmente en conferencias internacionales de tecnología. Se graduó en Bogazici University como ingeniero informático y tiene un MBA de Columbia Business School.



Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.