Premium
Servicios
Premium

LLM Pricing: Top 15+ Providers Compared

Cem Dilmegani
Cem Dilmegani
actualizado el 27 de ago. de 2026

LLM pricing spans four orders of magnitude: the cheapest models launched under $0,03 per million tokens, while frontier reasoning tiers launched at up to $262.50. The chart below tracks launch prices: each point is the average price of the models one size class launched in a calendar quarter, blended 3 parts input to 1 part output, across 8 size classes. Prices are the vendor’s standard list rate without cache or batch discounts, or the launch-time hosted rate for open-weights models with no first-party price; the y-axis is logarithmic.

Cargando gráfico
  • Los modelos de chat insignia se abaratan. GPT-4 se lanzó a $37,50 en marzo de 2023; Claude Opus 5 a $10,00 en julio de 2026.
  • Los niveles Reasoning Pro marcan un nuevo techo. o1-pro alcanzó un máximo de $262,50 en marzo de 2025; los lanzamientos Pro de OpenAI en 2026 se mantienen en $67.50.
  • El nivel económico está subiendo. El precio mediano de lanzamiento cerrado-pequeño fue de $0,53 en 2024 y de $3,00 en los primeros ocho meses de 2026. Seis modelos se lanzaron en esa clase este año y solo Upstage con su Solar Pro 4, a $0,53, quedó por debajo de $1.00.
  • Los buques insignia de pesos abiertos triplicaron su precio y aun así siguen por debajo de los modelos cerrados. Su precio mediano de lanzamiento subió de $0,48 en 2024 a $1,63 en 2026, frente a una mediana de $3,75 en lanzamientos cerrados de gama media. Kimi K3 de Moonshot a $6,00 es el lanzamiento de pesos abiertos más caro del gráfico.
  • Los lanzamientos cerrados de gama media cuestan un 38 % menos que en 2024. La mediana cayó de $6,00 en 2024 a $4,38 en 2025 y $3,75 en 2026. Grok 4.5 y Grok 4.6 se lanzaron a $3,00; Meta con su Muse Spark 1.1 a $2.00.

Los precios son precios de lanzamiento combinados por millón de tokens, ponderados en tres partes de entrada por una de salida, y excluyen las promociones de lanzamiento de duración limitada. El trimestre actual es parcial: su punto se mueve a medida que se lanzan nuevos modelos hasta que cierra el trimestre.

LLM API price evaluation

Hay dos formas de pagar por un LLM: planes de suscripción con precios de tarifa plana de LLM de los principales proveedores, o un modelo de API de pago por uso facturado por uso de tokens.

Haga clic en los nombres de los modelos para ver sus resultados de referencia, latencia real y precios, y evaluar la eficiencia y rentabilidad de cada modelo.

Clasificación: Los modelos se clasifican por su posición media en todos los benchmarks.

Puede consultar las tasas de alucinación y el rendimiento de razonamiento de los principales LLM en nuestros benchmarks.

Comparativa de planes de suscripción de LLM

Los usuarios no técnicos pueden preferir usar la interfaz en lugar de la API. En 2026, la mayoría de las suscripciones de los proveedores incluyen mucho más que una interfaz de chat. Agentes de programación como Claude Code, Codex, Kimi Code y Mistral Vibe vienen en planes de nivel Pro. Para desarrolladores y usuarios intensivos, la suscripción adecuada de $10–$200 suele sustituir lo que de otro modo sería una suscripción separada a un IDE de programación, un presupuesto de API por tokens y una herramienta de vídeo o investigación combinadas.

OpenAI

El plan Free incluye chats de texto diarios ilimitados con GPT-5.6 Luna, modo de voz estándar, cargas limitadas y generación básica de imágenes. Los anuncios contextuales llegan a unos 40 mercados en agosto de 2026, incluidos Estados Unidos y la mayor parte de Europa, y solo aparecen en los planes Free y Go.

  • ChatGPT Go ($8/mes) es un plan de bajo coste que puede incluir anuncios. Los chats de texto son ilimitados, como en Free; la mejora ofrece límites más altos en carga de archivos, creación de imágenes, voz y memoria, todo con GPT-5.6 Luna.
  • ChatGPT Plus ($20/mes) incluye límites de uso ampliados, acceso a GPT-5.6 Sol, Terra y Luna, modo de voz avanzado, el agente Codex, generación de imágenes y funciones de acceso anticipado.

El plan Pro tiene dos niveles a partir de abril de 2026:

  • ChatGPT Pro ($100/mes) ofrece la misma gama de modelos que el nivel de $200 (incluido GPT-5.6 Sol) con aproximadamente 5x los límites de uso de Plus.
  • ChatGPT Pro ($200/mes) ofrece los límites de uso individuales más altos (aproximadamente 20x Plus), la mayor asignación de Deep Research, voz avanzada con vídeo y pantalla compartida, Codex con el máximo aumento de uso, y Sora.

Ambos niveles Pro incluyen acceso prioritario durante las horas punta. Los precios de Codex en Plus, Pro y Business pasaron de estar alineados por mensaje a un uso alineado con tokens de la API en abril de 2026.

ChatGPT Work, el agente de OpenAI para proyectos de varios pasos de larga duración (lanzado el 9 de julio de 2026), está incluido en los planes de pago, y la aplicación de escritorio que incluye Chat, Work y Codex está disponible en todos los planes, incluido Free.

  • Plan Business ($20/usuario/mes anual o $25/usuario/mes mensual) es el plan de OpenAI para equipos pequeños y medianos (antes ChatGPT Team, renombrado en agosto de 2025). Añade límites de mensajes más altos, consola de administración, SSO, datos de equipo excluidos del entrenamiento y fondos de crédito compartidos para funciones avanzadas. Aplicaciones incluidas: Codex con créditos de espacio de trabajo compartidos. Los puestos solo de Codex se cerraron para nuevos espacios de trabajo el 24 de junio de 2026; OpenAI ha anunciado puestos Premium a $100/usuario/mes anuales ($125 mensuales) con un uso 5x el estándar. El plan requiere al menos 2 puestos.
  • El plan Enterprise (precio personalizado) ofrece acceso a modelos de alta velocidad, ventanas de contexto ampliadas, controles de datos de nivel empresarial, verificación de dominio, analítica y registros de auditoría. Aplicaciones incluidas: Codex con fondo de crédito compartido y puestos opcionales solo de Codex.

Anthropic (Claude)

El plan Free incluye acceso web y móvil, análisis básico, acceso a Claude Sonnet 5 y Haiku, y carga de documentos. El uso diario está limitado, y los modelos Opus y Fable no están disponibles.

  • Plan Pro ($20/mes, o $17/mes facturado anualmente) ofrece acceso a Opus 5, Sonnet 5 y Haiku, aproximadamente 5x más uso que Free, organización de proyectos y acceso prioritario durante las horas punta. Fable 5 no forma parte de los límites de uso de Pro; se factura a tarifas de API mediante créditos de uso de pago por consumo. Aplicaciones incluidas: Claude Code (el agente de programación de Anthropic en la terminal y el IDE), Cowork, Claude Design y Claude para Microsoft 365, todos compartiendo el mismo fondo de uso que el chat.
  • Plan Max 5x ($100/mes) ofrece aproximadamente 5x más uso que Pro, acceso prioritario a las funciones y modelos más nuevos, y acceso completo a Claude Code en el nivel de uso Max superior.
  • Plan Max 20x ($200/mes) ofrece aproximadamente 20x más uso que Pro, acceso prioritario máximo y acceso completo a Claude Code. Diseñado para usuarios intensivos diarios que ejecutan cargas de trabajo de Claude Code. Ambos niveles Max incluyen Fable 5, el modelo más caro de Anthropic; su uso puede consumir hasta la mitad del límite de uso semanal del plan.

El plan Team ofrece dos tipos de puestos y admite de 2 a 150 miembros:

  • Puesto estándar: $20/usuario/mes anual ($25/usuario/mes mensual). Incluye funciones básicas, límites de uso estándar y acceso a Claude Code.
  • Puesto premium: $100/usuario/mes anual ($125/usuario/mes mensual). Todo lo de Standard, más límites de uso más altos para usuarios intensivos que ejecutan cargas de trabajo más pesadas de Claude Code.

Aplicaciones incluidas: Claude Code y Cowork están incluidos con cada puesto de Team (estándar y premium); la diferencia está en la asignación de uso, no en el acceso. Ambos tipos de puestos incluyen facturación central, herramientas de colaboración y controles de administración.

  • Plan Enterprise ($20/puesto/mes más uso a tarifas de API en el nivel de autoservicio; precios personalizados con ventas) ofrece ventanas de contexto ampliadas, SSO, captura de dominio, acceso basado en roles, SCIM, registros de auditoría e integraciones de datos. Aplicaciones incluidas: en los planes Enterprise nuevos y de autoservicio, Claude Code y Cowork están incluidos con cada puesto; los contratos Enterprise más antiguos pueden distinguir entre puestos solo de Chat y puestos de Chat + Claude Code con facturación basada en el uso.

Google (Gemini)

El plan gratis ofrece acceso a Gemini 3.6 Flash y acceso variable a Gemini 3.1 Pro, generación básica de imágenes, Deep Research, Gemini Live, Canvas y Gems. Aplicaciones incluidas: Gemini Notebook (antes NotebookLM) y Flow con acceso limitado a Nano Banana Pro.

Google utiliza precios regionales, por lo que los precios pueden variar según la región.

  • Google IA Plus ($4,99/mes, EE. UU.) es el nivel de pago de entrada con 2x los límites de uso de Free. Aplicaciones incluidas: más acceso a Gemini 3.1 Pro en el chat, generación de imágenes con Nano Banana Pro, generación de vídeo con Gemini Omni Flash, 200 créditos de Flow, Gemini Notebook con más resúmenes de audio, Gemini en Gmail, Docs y Vids, y acceso anticipado a Gemini en Chrome. Incluye 400 GB de almacenamiento.
  • Google IA Pro ($19,99/mes, EE. UU.) ofrece 4x los límites de uso de Free y 5 TB de almacenamiento. Aplicaciones incluidas: Jules (agente de programación asíncrono), Google Antigravity (plataforma de desarrollo agéntico), límites ampliados de IA Studio, $40/mes en créditos de Google Cloud, Gemini Notebook con 5x resúmenes de audio, Deep Research, 1.000 créditos de Flow, YouTube Premium Lite y Google Home Premium (plan estándar).
  • Google IA Ultra (EE. UU.) cuesta $99,99/mes por 5x los límites de uso de IA Pro o $199,99/mes por 20x. Aplicaciones incluidas: razonamiento Deep Think, Gemini Agent (solo EE. UU.), Gemini Spark, Project Genie (modelo de mundo interactivo), Jules con los límites más altos, Antigravity de nivel superior, 10.000 o 25.000 créditos de Flow, Google Home Premium (plan avanzado) y una suscripción individual a YouTube Premium. El almacenamiento comienza en 20 TB.

Microsoft Copilot

El plan gratis (Copilot Chat) está disponible sin coste adicional para todos los usuarios de Microsoft Entra con una suscripción elegible a Microsoft 365. Incluye chat básico de Copilot en las aplicaciones de Microsoft sin las funciones más profundas dentro de los documentos.

  • Microsoft 365 Premium ($19,99/mes o $199,99/año) es ahora el plan Copilot para consumidores. Incluye las aplicaciones de Office, hasta 6 TB de almacenamiento (1 TB cada una para hasta seis personas) y los límites de Copilot para consumidores más altos; las funciones de IA se aplican solo al propietario de la suscripción. El antiguo Copilot Pro ($20/mes) está cerrado a nuevas compras, y los suscriptores existentes pueden conservarlo o cambiarse a Premium.
  • Microsoft 365 Copilot Business ($21/usuario/mes anual; $18/usuario/mes tarifa del primer año para compras hasta el 30 de septiembre de 2026; $25,20/usuario/mes mensual) añade Copilot en las aplicaciones de Microsoft 365, integración con Teams y controles de administración. Aplicaciones incluidas: Copilot Studio Lite para crear agentes ligeros, Copilot en SharePoint y Copilot Pages para borradores colaborativos. Limitado a organizaciones con hasta 300 usuarios.
  • Microsoft 365 Copilot Enterprise ($30/usuario/mes anual, o $31,50/usuario/mes facturado mensualmente; requiere una licencia elegible de Microsoft 365) ofrece seguridad avanzada, cumplimiento y analítica sobre las funciones de Business. Aplicaciones incluidas: creación de agentes con Copilot Studio (los agentes con datos de trabajo y predefinidos pueden medirse; Copilot Studio independiente se vende por separado), Copilot en Microsoft Purview e Intune para flujos de trabajo de TI y seguridad, y gobernanza de los agentes implementados.

xAI (Grok)

El plan gratis ofrece acceso limitado a Grok.

  • SuperGrok Lite ($10/mes) es el nivel de pago de entrada. Incluye conversaciones 2x más largas, mayores límites de velocidad y creación de imágenes y vídeo con IA. Aplicaciones incluidas: Grok Build (el agente de creación de aplicaciones de xAI, también gratis en la web desde agosto de 2026) y Grok Imagine para generación de imágenes y vídeo.
  • SuperGrok ($30/mes, o $300/año) incluye razonamiento mejorado con Grok 4.6, conversaciones 5x más largas, cargas de archivos más largas, modo de voz para chat hablado y 20x más generaciones de imagen y vídeo de Grok Imagine, incluido vídeo HD de 720p y 30 segundos.
  • SuperGrok Plus ($100/mes) añade acceso a Grok Bot, generación de vídeo 1080p, límites de uso más altos, respuestas más rápidas y acceso prioritario.
  • SuperGrok Heavy ($300/mes) ofrece todo lo de Plus, un equipo de agentes para trabajo en paralelo, límites de velocidad máximos, vistas previas anticipadas de las próximas funciones de xAI y una suscripción a X Premium+. En julio de 2026, xAI también lanzó complementos para Excel, Outlook y Google Workspace, además de Automations programadas; la mayoría son gratis, con el complemento de Outlook y las Automations activadas por correo reservadas para usuarios de pago.

Grok también está incluido en las suscripciones de X: X Premium ($8/mes) es la vía de pago más barata para Grok dentro de la aplicación X e incluye estado verificado y menos anuncios. X Premium+ ($40/mes) elimina los anuncios en X y tiene los límites de uso más altos de Grok, además de la monetización completa para creadores.

Moonshot IA (Kimi)

Los planes de consumo de Kimi llevan nombres de indicaciones de tempo musical, del más lento al más rápido. Los precios internacionales están en USD; los usuarios chinos pagan en CNY a tarifas más bajas. A partir de agosto de 2026, las nuevas compras están en lista de espera. La página de precios anuncia próximos planes que separan los beneficios de Kimi y Kimi Code, y el aviso del 20 de julio de Moonshot cita limitaciones de capacidad informática para su lanzamiento retrasado, cuatro días después del lanzamiento de K3. Los suscriptores existentes conservan sus planes y pueden renovarlos.

  • Adagio (Free) ofrece conversaciones básicas ilimitadas con 6 usos de agentes, consultas limitadas de Deep Research y tareas básicas del agente OK Computer.
  • Moderato ($19/mes) añade Kimi K3 en el chat y tareas de agentes, además de sesiones ampliadas de Deep Research. Aplicaciones incluidas: Kimi Code (agente de programación con IA centrado en la terminal; entre 300 y 1.200 solicitudes estimadas por ventana de 5 horas, facturadas del fondo de crédito compartido), además de herramientas de creación de Slides y Websites.
  • Allegretto ($39/mes) ofrece mayor uso en todo lo de Moderato. Aplicaciones incluidas: Agent Swarm (orquestación de subagentes en paralelo, hasta 4 subtareas paralelas en este nivel), despliegue en la nube de Kimi Claw para grupos de agentes heterogéneos con memoria persistente y 2x los créditos de agente de Moderato.
  • Allegro ($99/mes) ofrece 5x créditos de agente, Agent Swarm con hasta 8 subtareas paralelas y chat K3 con hasta 1M tokens de contexto.
  • Vivace ($199/mes) ofrece 10x créditos de agente, 4 tareas simultáneas, Agent Swarm con hasta 8 subtareas paralelas y chat K3 con hasta 1M tokens de contexto, orientado a cargas intensivas de investigación y trabajo agéntico.

La membresía incluye claves de API de Kimi Code para usar en herramientas de programación de terceros; la API independiente de Kimi Open Platform se factura por token.

MiniMax

MiniMax vende un plan Token Plan unificado sobre sus modelos M3 y M2.7. Sustituyó a los anteriores planes de crédito de agente y al Coding Plan a mediados de 2026.

MiniMax Token Plan (una cuota para agentes, programación y trabajo multimodal):

  • Plus ($20/mes): ventanas de cuota semanales y móviles de 5 horas, suficientes para 3 o 4 agentes de programación ejecutándose en paralelo; para proyectos personales y prototipos.
  • Max ($50/mes): las mismas ventanas para 4 o 5 agentes en paralelo; para programación diaria con agentes y trabajo multimodal.
  • Ultra ($120/mes): 6 o 7 agentes en paralelo; para flujos de trabajo intensivos con agentes y sesiones prolongadas.
  • Paquetes de créditos: $5 por 5.000 créditos, $25 por 25.000, $100 por 100.000 (1.000 créditos = $1, válidos 365 días), utilizables además de cualquier plan.

El Token Plan cubre toda la gama de modelos (M3, M2.7, imagen y voz) en una sola cuota, lo que lo convierte en uno de los caminos más baratos hacia un modelo de programación de frontera cuando se combina con una CLI como Cline o Kilo Code.

Mistral AI

El plan Free de Mistral Vibe (antes Le Chat) incluye navegación web, análisis básico de archivos, generación de imágenes, sesiones de programación limitadas, más de 100 conectores y $10/mes en créditos de API.

  • Plan Pro ($14,99/usuario/mes) incluye más mensajes y búsquedas web, más informes de pensamiento extendido y Deep Research, 15 GB de almacenamiento de documentos, hasta 1.000 proyectos, generación de imágenes y $30/mes en créditos de API. Aplicaciones incluidas: el modo Code de Mistral Vibe en la CLI, el IDE o la web, con pago por consumo más allá de la cuota incluida. Los estudiantes verificados obtienen Pro por $5,99/mes.
  • Plan Team ($24,99/usuario/mes) incluye todo lo de Pro con hasta 30 GB de almacenamiento por usuario, facturación central, control de acceso basado en roles, verificación de nombre de dominio y exportación de datos. Aplicaciones incluidas: Mistral Vibe en el nivel de uso de equipo con controles de administración compartidos.
  • Plan Enterprise (precio personalizado) ofrece opciones de despliegue seguras, incluidas nube privada y autohospedada, SSO SAML, registros de auditoría, soporte premium y analítica detallada. Aplicaciones incluidas: Mistral Vibe con opciones de despliegue local para cargas de trabajo reguladas.

DeepSeek

DeepSeek no ofrece planes de suscripción tradicionales. El acceso por chat web y móvil a los últimos modelos (actualmente DeepSeek V4-Flash y V4-Pro) es gratis para todos los usuarios, con limitación por uso justo.

El acceso a la API es de pago por token con tarifas pico y valle desde el 16 de agosto de 2026. En horas valle, V4-Flash cuesta $0,22 por millón de tokens de entrada (fallo de caché) y $0,66 por millón de tokens de salida; las tarifas pico son el doble ($0,44 y $1,32). V4-Pro cuesta $0,66 y $1,98 en horas valle. Los aciertos de caché cuestan aproximadamente el 3 % de la tarifa de fallo, y las horas pico son de 01:00 a 04:00 y de 06:00 a 10:00 UTC los días laborables.

DeepSeek también ha entrado en las herramientas para agentes. DeepSeek Harness, un kit de herramientas de código abierto basado en complementos para construir y ejecutar agentes de IA, está en vista previa para desarrolladores con código fuente público. No tiene precio propio y es independiente del modelo; el uso se factura según la API del modelo que llame el agente.

Meta (Muse Spark)

Meta IA sigue siendo gratis dentro de WhatsApp, Instagram, Facebook, Messenger, la aplicación Meta IA y las gafas Ray-Ban Meta, impulsado por Muse Spark (lanzado el 8 de abril de 2026, ahora en la versión 1.2). Meta ha comenzado pruebas limitadas de suscripciones de pago Meta One. Los planes Plus y Premium aumentan la asignación mensual de uso de IA y el acceso al modo Thinking, con precios reportados de $7,99 y $19,99 al mes.1

La API de Meta Model está en vista previa pública, es de autoservicio y compatible con el SDK de OpenAI. Los precios de pago por consumo de Muse Spark 1.2 comienzan en $1,25 por millón de tokens de entrada y $4,25 por millón de tokens de salida con una ventana de contexto de 1M tokens. Muse Code, un agente de programación de terminal, se lanzó en beta el 5 de agosto de 2026.

Cómo entender los precios de LLM

Tokens: la unidad fundamental de precios

Figura 1: Ejemplo de tokenización con el tokenizador GPT-4o y GPT-4o mini para la frase “Identifique nuevas tecnologías, acelere su empresa.”2

Aunque los proveedores ofrecen diversas estructuras de precios, los precios por token son los más comunes. Los métodos de tokenización difieren entre modelos; algunos ejemplos incluyen:

  • Codificación por pares de bytes (BPE): divide las palabras en unidades de subpalabras frecuentes, equilibrando el tamaño del vocabulario y la eficiencia.3
    • Ejemplo: “unbelievable” → [“un”, “believ”, “able”]
  • WordPiece: Similar a BPE pero optimiza la probabilidad del modelo de lenguaje, usado en BERT.4
    • Ejemplo: “tokenization” → [“token”, “##ization”]. “token” es una palabra independiente; “##ization” es un sufijo.
  • SentencePiece: Tokeniza texto sin depender de espacios, eficaz para modelos multilingües como T5.5
    • Ejemplo: “natural language” → [” natural”, ” lan”, “guage”] o [” natu”, “ral”, ” language”].

Tenga en cuenta que las subpalabras exactas dependen de los datos de entrenamiento y del proceso BPE/WordPiece. Para comprender mejor estos métodos de tokenización, vea el siguiente vídeo:

Vídeo que explica los métodos de tokenización.

Una vez entendida la tokenización, se puede estimar un precio medio en función de la longitud de tokens del proyecto. La tabla 2 describe los rangos de tokens por tipo de contenido, incluidos prompts de interfaz, fragmentos de correo electrónico, blogs de marketing, informes detallados y artículos de investigación, y señala que el recuento de tokens varía según el modelo. Una vez elegido un modelo, se puede usar su tokenizador para estimar el recuento medio de tokens del contenido.

Tabla 2: Tipos de contenido típicos, sus rangos de tamaño y consideraciones empresariales (los rangos son estimaciones y pueden variar).

Implicaciones de la ventana de contexto

La ventana de contexto establece un límite estricto al número de tokens de entrada y salida por llamada, incluidos los tokens que usan los modelos de razonamiento para el razonamiento en cadena. Si el total supera este límite, la respuesta se trunca o la solicitud falla por completo.

Figura 2: Ilustración de las limitaciones de la ventana de contexto que provocan el truncamiento de la salida en una conversación de varios turnos.6

En las aplicaciones que mantienen conversaciones largas, cada turno adicional empuja más historial a la entrada. Sin intervención, los tokens de entrada crecen linealmente con la longitud de la conversación, y también la factura. Los usuarios de la API suelen abordar esto de una de estas tres maneras:

  • Almacenamiento en caché de prompts. OpenAI, Anthropic, Google y DeepSeek almacenan en caché los prefijos de prompt repetidos en el servidor y facturan los aciertos de caché a una fracción de la tarifa de entrada estándar, normalmente del 3 al 10 por ciento del precio de fallo de caché. Para las aplicaciones que reutilizan un prompt de sistema largo o un prefijo de conversación, el almacenamiento en caché puede reducir el coste de entrada en un orden de magnitud.
  • Ventana deslizante o generación aumentada por recuperación (RAG). Descarte los turnos más antiguos una vez que se alcance un umbral o recupere solo los mensajes pasados relevantes de un almacén de vectores en cada llamada.
  • Resumen. Condense periódicamente los turnos más antiguos en un resumen en lugar de reenviarlos textualmente.

Para cargas de trabajo agénticas, como sesiones de programación o investigación profunda, los agentes de programación modernos gestionan esto automáticamente en la sesión. Claude Code, por ejemplo, incluye compactación de contexto: cuando la conversación se acerca al límite, resume los mensajes más antiguos en una versión condensada mientras mantiene intactos los turnos recientes. Los turnos posteriores envían al modelo solo el resumen más el contexto reciente.

El impacto en los precios es directo. En las API de pago por token, la compactación limita el crecimiento de la entrada de cada llamada y el almacenamiento en caché reduce el precio del prefijo repetido, por lo que el coste por turno se mantiene predecible en sesiones largas. En suscripciones de tarifa plana como Claude Pro, ChatGPT Plus o Kimi Moderato, la compactación estira los límites de uso diario y semanal porque cada llamada lleva menos contexto. Una sesión de programación que de otro modo agotaría un límite de velocidad de 5 horas puede durar más cuando los turnos antiguos se comprimen.

La desventaja es que cualquier forma de resumen es con pérdida. El resumen puede omitir detalles que luego resultan importantes, obligando al usuario a proporcionarlos de nuevo.

Tokens máximos de salida

Los tokens máximos de salida limitan la longitud de la respuesta de un modelo. Aunque muchas documentaciones mencionan que se puede ajustar con el parámetro max_tokens, es fundamental revisar la documentación de la API específica que se esté utilizando para identificar el parámetro correcto. Debe ajustarse según las necesidades específicas:

Si se ajusta demasiado bajo, puede dar lugar a salidas incompletas, haciendo que el modelo corte las respuestas antes de entregar la respuesta completa.

Si se ajusta demasiado alto, dependiendo de la temperatura (un parámetro que controla la creatividad de la respuesta), puede provocar salidas innecesariamente verbosas, tiempos de respuesta más largos y un mayor coste.

Por lo tanto, es un parámetro que requiere una consideración cuidadosa para optimizar el uso de recursos y equilibrar la calidad de la salida, el coste y el rendimiento.

Tabla 3: Ejemplos de prompts de entrada y recuentos de tokens estimados por tipo de contenido.

*Esto supone que cada modelo produce respuestas con el mismo número de tokens de salida, aunque el recuento de tokens tanto de entrada como de salida puede variar según la tokenización de cada modelo; aquí el número se ha mantenido constante para cada modelo.

Combinando los rangos de tokens de la tabla 2 con las tarifas por token de un modelo se obtiene el coste esperado por tipo de contenido; los prompts de ejemplo de la tabla 3 muestran los tamaños de entrada y salida detrás de esas estimaciones.

Uso de múltiples modelos de lenguaje

Una puerta de enlace de IA como OpenRouter permite enviar el mismo prompt a múltiples modelos simultáneamente. Las respuestas, el consumo de tokens, el tiempo de respuesta y los precios pueden compararse para determinar qué modelo es el más adecuado para la tarea.

Figura 3: Interfaz que muestra un prompt enviado a múltiples modelos de lenguaje grandes a través de OpenRouter.7

Beneficios y desafíos

  • Mayor adaptabilidad y eficiencia: La orquestación mejora la capacidad de respuesta, permitiendo evaluar en tiempo real la eficiencia de los modelos e identificar un modelo rentable y posibles ahorros.
  • Sensibilidad y optimización de prompts: Los mismos prompts pueden provocar salidas muy diferentes según el modelo, lo que exige una ingeniería de prompts adaptada a cada modelo para lograr los resultados deseados, lo que añade complejidad de desarrollo y mantenimiento.
Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Mecánica de precios y costes ocultos

Tokens de razonamiento frente a tokens de salida

Un número creciente de proveedores ha introducido modelos de razonamiento que emplean cómputo adicional para realizar internamente un razonamiento en cadena. OpenAI, Anthropic y Google facturan esos tokens de razonamiento como tokens de salida a la tarifa de salida estándar del modelo, por lo que el aumento del coste proviene del volumen, no de un precio por token más alto.

Modelos como GPT-5.5 Pro, Claude Opus 5 con pensamiento extendido o Gemini 3.1 Pro Deep Think generan trazas internas de razonamiento
incluso cuando no las solicita explícitamente. Estos tokens internos cuentan para su factura y pueden aumentar sustancialmente el coste, especialmente en tareas analíticas largas como revisión jurídica, análisis de datos o razonamiento de varios pasos.

Esto hace que sea esencial:

  • Elija un modelo de razonamiento solo cuando la precisión supere sustancialmente al coste.
  • Desactive la cadena de pensamiento o establezca un número máximo de tokens de salida más corto cuando sea posible.
  • Pruebe la misma tarea en modelos que no son de razonamiento para ver si el rendimiento es comparable a una fracción del precio.

Dado que un modelo de razonamiento puede emitir de 10 a 30 veces más tokens de salida de los que el mismo prompt produciría sin razonamiento, es fundamental comprender esta distinción para planificar los costes.

Diferencias de precios según la arquitectura

Las arquitecturas de los LLM influyen directamente en la eficiencia del modelo y, por lo tanto, en los precios de la API. Por ejemplo:

  • Mixture-of-Experts (MoE): los modelos activan solo un subconjunto de parámetros por solicitud, lo que reduce el coste de cómputo y permite a los proveedores ofrecer tarifas por token más bajas.
  • Decodificación especulativa empareja un modelo borrador más pequeño con uno más grande, mejorando el rendimiento y reduciendo el coste de tareas deterministas.
  • Variantes cuantizadas (por ejemplo, de 4 u 8 bits) pueden ejecutar inferencia con menor precisión, lo que permite precios más bajos para versiones desplegadas localmente o alojadas en la nube.

Comprender estas opciones de arquitectura ayuda a los usuarios a predecir no solo las diferencias de precios, sino también la latencia, la calidad y cómo escala un modelo bajo cargas de trabajo de producción.

Costes operativos más allá de las tarifas de API

Aunque la tarificación por token es el principal factor de coste, muchos despliegues de producción incurren en costes adicionales más allá del uso de la API:

  • Embeddings y bases de datos vectoriales: almacenar y recuperar vectores (por ejemplo, Pinecone, Weaviate, ChromaDB) añade coste por consulta y por GB de almacenamiento.
  • Modelos de reranking y posprocesamiento: muchas aplicaciones usan modelos más pequeños para resumir, filtrar o clasificar antes de enviar una solicitud final a un modelo más grande.
  • Capas de caché: proveedores como OpenAI ofrecen ahora almacenamiento en caché a nivel de prompt, pero la infraestructura de caché local puede requerir cómputo adicional.
  • Registro, supervisión y auditoría: las empresas a menudo incurren en costes por la supervisión a nivel de tokens, el seguimiento de latencia y las auditorías de seguridad.

Estos costes ocultos suelen representar entre el 20 y el 40 % de los gastos operativos totales de LLM y deben tenerse en cuenta al evaluar las estructuras de precios.

Consideraciones de precios específicas para empresas

Muchos proveedores de LLM cobran tarifas adicionales por funciones de seguridad y cumplimiento de nivel empresarial, como:

  • Despliegues de inquilino único
  • Clústeres de GPU dedicados
  • SLA mejorados (por ejemplo, garantías de disponibilidad y latencia)
  • Residencia de datos y controles regionales
  • Modos de cumplimiento SOC2, HIPAA o RGPD

Estas ofertas pueden aumentar los costes de forma significativa, pero son esenciales para sectores regulados como la salud, las finanzas, los servicios jurídicos y las instituciones públicas.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Tendencias futuras en los precios de LLM

Tres cosas definieron los precios de LLM en 2025: los modelos básicos se abarataron, casi todos los principales proveedores lanzaron una suscripción de chat y los modelos de razonamiento siguieron siendo caros. La brecha es estructural y probablemente se amplíe: un millón de tokens de salida cuesta $0,66 en DeepSeek V4-Flash (horas valle) y $180 en GPT-5.5 Pro. Las preguntas interesantes a partir de 2026 son qué cambia sobre esa base.

La facturación por token da paso a la facturación por tarea

Los agentes ahora impulsan la mayor parte del uso intensivo de LLM. Una sola tarea de programación con Claude Code, una investigación con Cowork o una sesión de navegación autónoma con Operator puede realizar cientos de llamadas secuenciales al modelo. La facturación por tokens se vuelve impredecible tanto para el comprador como para el vendedor.

En respuesta, los proveedores están pasando de los medidores por tokens a las cuotas por tarea y por sesión. Moonshot estima entre 300 y 1.200 solicitudes de Kimi Code por ventana de 5 horas desde un fondo de crédito compartido. Claude Code limita el uso por sesión de 5 horas en lugar de por mensaje. MiniMax establece las cuotas del Token Plan como ventanas móviles de 5 horas y semanales dimensionadas por el número de agentes de programación en paralelo. Kimi establece límites específicos por nivel en los subagentes paralelos de Agent Swarm.

Los arneses de agentes multiproveedor como OpenClaw y MaxHermes llevan esto más lejos. Se sitúan entre los usuarios y múltiples API de modelos, y sus precios siguen cada vez más el rendimiento por tarea en lugar de por millón de tokens. Es de esperar que más proveedores publiquen SKU por tarea o por sesión durante el próximo año.

Los modelos de razonamiento pequeños pasan al dispositivo

Apple Intelligence ejecuta la inferencia en el dispositivo para consultas rutinarias, y recurre a Private Cloud Compute solo para solicitudes complejas. Los PC Copilot+ de Microsoft incluyen un modelo local. Los dispositivos Pixel ejecutan Gemini Nano. Modelos pequeños recientes como Phi-4 de Microsoft y Gemma 3 de Google son capaces de razonar en tamaños que caben en la unidad de procesamiento neuronal de un teléfono o portátil.

La implicación en los precios es un mercado de consumo de dos niveles. El trabajo rutinario se ejecuta gratis en el token marginal en el dispositivo. Las suscripciones a la nube compiten en lo que lo local no puede hacer: razonamiento de frontera, contexto grande, generación multimodal y orquestación de agentes. El suelo free-local empuja las suscripciones solo de chat hacia cero, dejando las aplicaciones incluidas como la verdadera razón para pagar.

El contexto largo y la memoria deciden quién gana el trabajo agéntico

Las tareas agénticas de horizonte largo fallan cuando los modelos pierden el hilo de instrucciones anteriores o alucinan hechos que deberían recordar. El trabajo agéntico sostenido depende de tres cosas: una ventana de contexto grande, memoria persistente y una baja tasa de alucinación.

En un año, tres capacidades de frontera se han derrumbado hacia la línea base. Claude Opus 5, Gemini 3.1 Pro, GPT-5.6 y Kimi K3 ofrecen ventanas de contexto de 1M tokens. En OpenAI, Anthropic, Google y DeepSeek, los aciertos de caché cuestan del 3 al 10 por ciento de los fallos de caché. ChatGPT y Claude ahora incluyen memoria persistente en sus niveles gratis.

Los modelos agénticos especializados están surgiendo en la parte alta de este mercado. En junio de 2026, Anthropic lanzó Claude Fable 5, un modelo de clase Mythos disponible de forma general8, con un precio de $10 de entrada y $50 de salida por millón de tokens, el doble de la tarifa de Opus 5. Fable 5 está dirigido a la programación agéntica, el uso de ordenadores y la investigación de horizonte largo; Claude Mythos 5, el mismo modelo con salvaguardas levantadas en algunas áreas, sigue limitado a socios aprobados al mismo precio.

La cuestión competitiva pasa de "¿cómo de grande es la ventana de contexto?" a "¿con qué economía y fiabilidad puede el modelo mantener una tarea agéntica larga?". Los proveedores que resuelvan esto bien obtendrán primas. Los que no, perderán cargas de trabajo agénticas independientemente del precio de token anunciado.

Preguntas frecuentes

Acceder a modelos de lenguaje grandes (LLMs) a través de una interfaz de programación de aplicaciones (API) le otorga acceso remoto a los modelos de IA. Este acceso está sujeto a una tarifa, a menudo llamada “tarifa de API”, que cobra el proveedor del servicio. Esta tarifa es una consideración fundamental al integrar LLM en sus aplicaciones.

Representa el coste asociado a cada consulta, solicitud o tarea realizada a través de la API del proveedor. Dado que las estructuras de precios pueden variar ampliamente (en función de factores como el uso de tokens, el volumen de llamadas a la API, la utilización de funciones o los modelos de suscripción), es esencial entender cómo calculan los proveedores estos costes.

La tarificación de LLM API puede ser compleja debido a factores como el consumo de tokens, la longitud del contexto y la elección del modelo. Los procedimientos de tokenización varían según el modelo; algunos usan codificación por pares de bytes (BPE), WordPiece o SentencePiece, y cada uno influye en cómo se divide el texto en tokens y en la eficiencia de costes. Comprender estas diferencias ayuda a optimizar el uso y los precios de la API.

Los costes de LLM están determinados principalmente por el uso de tokens (tanto de entrada como de salida), el volumen de llamadas a la API y el modelo de precios (por ejemplo, por token o suscripción).

Compare los precios de los tokens de entrada y salida, los límites de la ventana de contexto y cualquier tarifa adicional. Herramientas como OpenRouter le permiten enviar el mismo prompt a varios modelos y comparar directamente sus resultados, uso de tokens, velocidad y precios. Tenga en cuenta la longitud típica de su contenido y sus patrones de uso para estimar los costes totales.

Los tokens de entrada son los tokens del prompt que envía al LLM, mientras que los tokens de salida son los tokens de la respuesta generada. En los modelos de razonamiento, los tokens generados durante el propio proceso de razonamiento también se cuentan como tokens de salida, lo que afecta al coste final. Tanto la entrada como la salida contribuyen al coste total.

Las solicitudes de texto más grandes requieren más procesamiento, lo que aumenta el tiempo de respuesta y los costes. Optimice los tamaños de entrada y use una calculadora de precios de LLM API para estimar el recuento de tokens y gestionar su presupuesto de forma eficaz.

La comunidad de LLM ha desarrollado diversas herramientas y benchmarks para ayudar a los usuarios a comprender y optimizar los precios de LLM. Estos recursos suelen incluir calculadoras y tablas comparativas que ofrecen información sobre la potencia y eficiencia de los distintos modelos.

Plataformas como Hugging Face y GitHub alojan herramientas y código desarrollados por la comunidad para analizar el rendimiento y los costes de los modelos. Muchos servicios ofrecen soporte comunitario a través de foros o funciones de chat.

Cita esta investigación

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Cem Dilmegani (2026) - "LLM Pricing: Top 15+ Providers Compared". Publicado en línea en AIMultiple.com. Recuperado el 27 de agosto de 2026, de: https://aimultiple.com/llm-pricing [Recurso en línea]

Dilmegani, C. (2026, 27 de agosto). LLM Pricing: Top 15+ Providers Compared. AIMultiple. https://aimultiple.com/llm-pricing

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{LLM Pricing: Top 15+ Providers Compared}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/llm-pricing}},
  note   = {AIMultiple. Recuperado el 27 de agosto de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 177 puntos de datos. Descargue los datos resumidos que se muestran en los gráficos y las tablas de este artículo como un archivo ZIP que contiene 4 archivos CSV y un README.

Última actualización: 27 de septiembre de 2026
Descargar

¿Quieres los datos granulares que hay detrás? Únete a Premium

Registro de cambios

8 actualizaciones
  1. Actualizada la descripción del gráfico en la introducción.

  2. Se añadió un gráfico a la sección de tipos de precios de LLM.

  3. Se eliminó la sección 'Comprender los precios de LLM'.

  4. Se amplió la sección "Implicaciones de la ventana de contexto" con estrategias para gestionar el uso de tokens en conversaciones largas.

  5. Se añadió ChatGPT Go a la sección de OpenAI.

Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem ha sido el analista principal en AIMultiple desde 2017.

El trabajo de Cem en AIMultiple ha sido citado por publicaciones líderes mundiales como Business Insider, Forbes, Morning Brew y Washington Post, empresas globales como Deloitte y HPE, ONG como World Economic Forum y organizaciones supranacionales como European Commission. [1], [2], [3], [4], [5]

A lo largo de su carrera, Cem trabajó como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.

Dirigió la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando al CEO. También lideró el crecimiento comercial de la empresa de deep tech Hypatos, que alcanzó unos ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.

Cem participa habitualmente en conferencias internacionales de tecnología. Se graduó en Bogazici University como ingeniero informático y tiene un MBA de Columbia Business School.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450