Servicios
Contáctanos

Mejores proveedores de LLM API de tarifa plana

Berk Kalelioğlu
Berk Kalelioğlu
actualizado el 7 de ago. de 2026

Los proveedores de LLM de tarifa plana venden uso ilimitado del modelo por un precio mensual fijo en lugar de facturar por token. Este modelo se extendió porque las sesiones de codificación agentiva pueden usar decenas de millones de tokens, por lo que una factura por token es difícil de predecir. Muy pocos proveedores ofrecen una tarifa plana auténtica; la mayoría de los planes que se comercializan como planos incluyen una cuota de uso subyacente. A continuación comparamos los proveedores que realmente venden uso ilimitado, con los modelos ofrecidos, el límite de concurrencia y el precio de cada uno.

Proveedor
Enfoque
Modelos
Concurrencia
Precio
Giotto.ai
Implementación soberana alojada en la UE
Giotto 1 (modelo propio)
1 solicitud a la vez
49.90 CHF/mes
Featherless.ai
Variedad de modelos de peso abierto a un costo fijo
30.000+ modelos de peso abierto
4 a 8 unidades por plan
Desde $25/mes
Awan LLM
Acceso económico de tarifa plana
Llama 3 y 3.1 (8B y 70B)
100 a 200 solicitudes/min
De $5 a $80/mes

Los proveedores en esta tabla cumplen dos criterios:

  • Un precio mensual fijo publicado.
  • Uso ilimitado: sin presupuesto de tokens o prompts que te detenga. Se permiten límites de velocidad que regulan las solicitudes; no se permiten presupuestos que finalicen el uso.

Proveedores de LLM de tarifa plana analizados

Featherless.ai

Featherless sirve más de 30.000 modelos de peso abierto (DeepSeek, Kimi, GLM, Qwen, Llama y fine-tunes) a través de una API compatible con OpenAI con tokens y solicitudes ilimitados.1 En lugar de un medidor de tokens, cobra por unidades de concurrencia: un modelo pequeño cuesta 1 unidad por solicitud en vuelo, un modelo de clase 70B cuesta 4, y las solicitudes que exceden tu presupuesto devuelven un error HTTP 429 en lugar de un cargo.

El plan Premium incluye 4 unidades, por lo que $25 compra un carril para modelo grande o cuatro carriles para modelos pequeños. Los planes Agent añaden 8 unidades y un sandbox para cargas de trabajo autónomas. La empresa recaudó una Serie A de $20M coliderada por AMD Ventures y Airbus Ventures el 2026-04-30, el respaldo financiero más sólido en este mercado.

Mejor caso de uso: Codificación agentiva intensiva de un solo flujo y experimentación con modelos con un techo de costes fijo.

Modelos: 30.000+ modelos de peso abierto; límite de tamaño de 229B en los planes de $100, sin límite en los planes de $200.

Concurrencia: 4 unidades (Premium), 8 unidades (Agent y por unidad Business).

Precio: Premium $25/mes. Agent $100 o $200/mes. Business $100 o $200 por unidad/mes.

Características principales:

  • Tokens y solicitudes ilimitados en todos los planes.
  • Cualquier modelo de peso abierto catalogado, intercambiable por solicitud.
  • OpenAI-compatible API.
  • Política documentada de no registro de prompts y completaciones.
  • La concurrencia escala linealmente en los planes Business.

Limitaciones:

  • Una solicitud de clase 70B consume todo el presupuesto de unidades Premium.
  • Las solicitudes que exceden el presupuesto se rechazan con HTTP 429, por lo que el tooling paralelo necesita su propia cola de solicitudes.
  • El rendimiento por carril no se publica; el proveedor no especifica tokens por segundo.

Giotto.ai

Giotto es un laboratorio suizo en Lausana que ofrece su propio modelo de razonamiento, Giotto 1, al que posiciona como el modelo más potente que se ejecuta en una sola GPU.2 La empresa vende el mismo sistema como nube alojada en la UE, despliegue privado en las instalaciones o hardware preinstalado, con certificación ISO 27001.

La API de tarifa plana fue anunciada por el CEO Aldo Podestà el 2026-07-09: 49.90 CHF al mes, una solicitud concurrente, uso ilimitado.3 A partir del 2026-07-23, la oferta no está disponible en giotto.ai, que no tiene página de precios y dirige a los compradores a un formulario de contacto, por lo que todos los términos a continuación son provisionales.

Mejor caso de uso: Requisitos de residencia y soberanía de datos de la UE con un presupuesto fijo.

Modelos: Solo Giotto 1.

Concurrencia: 1 solicitud a la vez (concurrencia única).

Precio: 49.90 CHF/mes; gratis espacio de trabajo Giotto Open con límites de API no declarados.

Características principales:

  • Uso ilimitado a través de un único carril de solicitud.
  • Alojamiento en la UE en centros de datos suizos y de socios de la UE.
  • El mismo modelo disponible para despliegue privado en GPUs propias.
  • El espacio de trabajo compartido gratuito incluye acceso a API.

Limitaciones:

  • Aún no se puede comprar; no hay página de precios pública a partir del 2026-07-23.
  • El anuncio afirma ahorros de hasta 200x en comparación con Fable 5 y 350x en comparación con la API de GPT Pro; estos comparan solo el precio. La propia tabla de referencia de Giotto posiciona a Giotto 1 frente a modelos de una sola GPU como Gemma 4 31B y GPT-OSS-120B, no frente a los modelos de frontera en la afirmación de precio.
  • Empresa en etapa inicial: el producto se lanzó el 2026-05-18, y el CEO declaró en junio de 2026 que se esperaba cerrar un préstamo convertible de CHF 5-10M para julio, con una ronda inicial más grande planificada para finales de año.4

Awan LLM

Awan LLM vende “tokens ilimitados” desde $5 al mes, con límites diarios de solicitudes que escalan según la clase de tamaño del modelo y límites de velocidad por minuto.5 Los límites diarios (de 30K a 80K solicitudes en el plan Pro de $20) están muy por encima de lo que genera un único usuario interactivo, lo que hace que el plan sea de tarifa plana en la práctica.

El catálogo de modelos se encuentra en una página de modelos separada en lugar de en la página de precios: Llama 3.1 8B e 70B Instruct, Llama 3 8B y 70B, y los fine-tunes de 8B propios de Awan.6 El más reciente de estos se lanzó en julio de 2024, por lo que el catálogo está una o dos generaciones por detrás de los lanzamientos actuales de peso abierto.

Mejor caso de uso: Entrada de tarifa plana de menor costo para cargas de trabajo ligeras y medias de peso abierto.

Modelos: Llama 3.1 (8B, 70B), Llama 3 (8B, 70B), y fine-tunes de 8B.

Concurrencia: Limitado en velocidad a 100 solicitudes/min (Pro) hasta 200 solicitudes/min (Max).

Precio: Lite gratis, Core $5/mes, Plus $10/mes, Pro $20/mes, Max $80/mes.

Características principales:

  • Tokens ilimitados en todos los niveles de pago.
  • Nivel gratuito disponible para pruebas a pequeña escala.
  • El nivel Max elimina los límites diarios de solicitudes.
  • Entrada de pago más barata en este mercado a $5/mes.

Limitaciones:

  • El catálogo se detiene en Llama 3.1; no se ofrece ningún modelo de peso abierto de 2025 o 2026.
  • Los límites de solicitudes por clase de tamaño de modelo reemplazan el medidor de tokens.

Planes de tarifa plana con cuotas de uso

La mayoría de los planes en el debate sobre la tarifa plana son suscripciones con una cuota renovable: el precio es fijo, y un presupuesto de prompts o tokens te detiene en lugar de facturarte. Lo que sucede al llegar al límite de la cuota varía según el proveedor y es tan importante como el tamaño de la cuota. Cubrimos estos planes nivel por nivel en nuestra guía de precios de LLM.

Z.ai GLM Coding Plan

  • Medidor: ~80 a 1.600 prompts por ventana de 5 horas más ~400 a 8.000 por semana según el nivel; cada prompt desencadena un estimado de 15 a 20 llamadas al modelo; deducción de 3x de la cuota en horas pico.
  • Al límite: bloqueo total hasta que se renueve la ventana, sin opción de pago por uso alternativo.
  • Resumen: De $18 a $160/mes, ofrece GLM-5.2 a través de un endpoint compatible con Anthropic en 20+ herramientas de codificación.7

Kimi Code

  • Medidor: un fondo de créditos compartido con todas las funciones de membresía de Kimi, renovado semanalmente sin acumulación, más una ventana de velocidad de 5 horas continua; los volúmenes de cuota no se publican.
  • Al límite: recarga medida a través de Uso Extra en lugar de un bloqueo total.
  • Resumen: De $19 a $199/mes para K2.7 Code con 2 a 8 tareas de agente concurrentes; el modo HighSpeed consume 3x de la cuota.8

MiniMax Coding Plan

  • Medidor: ~1.7B a 12.5B tokens por mes dentro de ventanas de 5 horas y semanales; la cuota no utilizada no se acumula.
  • Resumen: $20 a $120/mes; MiniMax recomienda el pago por uso para uso en producción.9

Cerebras Code

  • Medidor: 24M a 120M tokens por día.
  • Resumen: $50 o $200/mes para GLM 4.7 en hardware de Cerebras; todos los niveles seguían mostrándose agotados el 2026-07-23.10

NanoGPT Pro

  • Medidor: 60M tokens de entrada por semana; los modelos grandes deducen a 2x.
  • Resumen: $12/mes en un conjunto de modelos de código abierto incluido, web y API.11

Synthetic

  • Medidor: 500 solicitudes cada 5 horas, 1 solicitud concurrente por modelo.
  • Resumen: $30/mes para siete modelos de peso abierto siempre activos, IU más API.12

Chutes

  • Medidor: uso incluido limitado a 5x el precio del plan, luego la facturación continúa por token.
  • Resumen: Paquetes prepago de $10 o $20/mes en computación descentralizada; un programa de descuento más que una tarifa plana.13

Claude y suscripciones de ChatGPT

  • Medidor: sesiones de 5 horas más límites semanales (Claude); niveles de uso con límites (ChatGPT).
  • Resumen: De $20 a $200+/mes; la única ruta de tarifa plana a modelos cerrados de frontera, vendidos como puestos, no como APIs.14 15

Cómo funciona la tarifa plana

1. Los carriles de concurrencia reemplazan el medidor de tokens

Un proveedor de tarifa plana limita cuántas solicitudes puede ejecutar a la vez en lugar de cuántos tokens consume. Un carril de solicitud no puede extraer más de la salida de una sola secuencia de GPU, por lo que el costo de servicio en el peor de los casos para el proveedor es fijo. La aritmética también te limita: un carril que transmite 50 tokens por segundo las 24 horas del día produce como máximo alrededor de 130M tokens de salida en un mes de 30 días, y el uso real está muy por debajo de eso porque el carril está inactivo entre llamadas. Por lo tanto, los tokens por segundo se convierten en un criterio de compra, y ninguno de los tres proveedores lo publica.

2. Economía de peso abierto

Todos los verdaderos proveedores de tarifa plana ofrecen modelos de peso abierto en GPUs estándar (Featherless, Awan) o su propio modelo en su propia infraestructura (Giotto). Nadie vende acceso ilimitado y plano a un modelo cerrado de frontera, porque un revendedor no puede limitar el costo de servicio de un modelo que licencia por token. Anthropic y OpenAI venden precios planos solo para sus propios modelos, agrupados en suscripciones de chat con cuota limitada.

3. Punto de equilibrio frente al pago por token

Un plan plano gana cuando el gasto medido para el mismo modelo superaría el precio del plan, y el punto de equilibrio depende en gran medida de con qué proveedor medido se compare. Llama 3.3 70B cuesta $0.10 por millón de tokens de entrada y $0.32 por millón de salida en DeepInfra, frente a una tarifa plana de $1.04 por millón en Together IA.16 Suponiendo una combinación de entrada-salida de 70:30, Featherless Premium a $25 alcanza el punto de equilibrio en aproximadamente 150M tokens por mes frente a DeepInfra, pero solo en aproximadamente 24M tokens frente a Together IA. El uso agentivo intenso de un solo flujo supera fácilmente el límite inferior y puede superar el superior.

El caso inverso es igual de importante. Una carga de trabajo de 5M tokens al mes repartidos en veinte sesiones paralelas cortas cuesta menos de $1 medido en DeepInfra, mientras que servir esa concurrencia en carriles de tarifa plana costaría $100 o más. La tarifa plana se adapta al trabajo de alto volumen y baja concurrencia; el pago por token gana en tráfico de bajo volumen o altamente paralelo. Las cifras son ilustraciones en las fechas de acceso citadas; ejecuta los recuentos de tokens del mes pasado con la misma aritmética.

4. Sostenibilidad del precio ilimitado

Los planes ilimitados atraen a los usuarios más intensivos, y el mercado ya muestra la tensión. Cerebras Code estaba agotado en todos los niveles el 2026-07-23, diez días después de que lo verificamos por primera vez. NanoGPT aumentó su suscripción de $8 a $12 en un año. El descuento del 30 % de Z.ai tiene un límite de tiempo.

Los precedentes van más allá de este nicho. El CEO de OpenAI dijo en enero de 2025 que el plan ChatGPT Pro de $200/mes estaba perdiendo dinero porque los suscriptores lo usaban más de lo proyectado.17 GitHub reemplazó las unidades de solicitud premium de Copilot por Créditos de IA basados en el uso el 2026-06-01, manteniendo los precios de suscripción sin cambios.18 Cursor cambió su asignación de 500 solicitudes por un fondo de uso de $20 en junio de 2025 y emitió reembolsos tras la reacción negativa.19 Cuando los mayores vendedores de uso de IA a precio plano se retiran hacia medidores, trata el plan ilimitado de un proveedor pequeño como un precio introductorio, y las matemáticas del punto de equilibrio como válidas por meses en lugar de años.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

¿Por qué necesitarías un plan de LLM de tarifa plana en 2026?

1. Codificación agentiva intensiva

Una sola sesión de agente de codificación realiza cientos de llamadas secuenciales al modelo y puede consumir decenas de millones de tokens. Un carril sirve este patrón de forma continua sin variación en la factura. Featherless encaja; Giotto lo hará una vez que esté disponible para comprar.

2. Residencia de datos en la UE

Giotto aloja en centros de datos suizos y de la UE, sirve su propio modelo y ofrece el mismo sistema para despliegue privado, lo que se adapta a equipos regulados que no pueden enviar datos a APIs alojadas en EE. UU.

3. Experimentación con modelos

Featherless expone 30.000+ modelos de peso abierto detrás de una sola API y una sola tarifa, por lo que comparar modelos no cuesta nada más allá de la suscripción.

4. Proyectos paralelos con costo limitado

Un proyecto aficionado con uso irregular corre el riesgo de facturas sorpresa en un medidor. Awan LLM de $5 a $20 al mes limita las pérdidas al precio de suscripción.

5. Procesamiento por lotes y en segundo plano

Trabajos de resumen, clasificación o limpieza de datos nocturnos toleran las colas, por lo que pueden saturar las horas inactivas de un carril sin costo marginal. Cualquiera de los tres proveedores encaja si la calidad del modelo es suficiente.

¿Cómo elegir el plan de LLM de tarifa plana adecuado?

La forma de la carga de trabajo decide más que el precio. El trabajo secuencial (un agente, un chat, trabajos por lotes) funciona bien en un solo carril. Las flotas de agentes paralelas se serializan detrás de un carril y necesitan más concurrencia: Featherless cobra por unidades adicionales explícitamente y rechaza las solicitudes que exceden el presupuesto con HTTP 429, mientras que un plan de concurrencia única como la API anunciada de Giotto no se puede ampliar en absoluto.

La calidad del modelo establece el mínimo. Un plan plano solo ahorra dinero si el modelo ofrecido puede hacer tu trabajo, así que verifica las puntuaciones de referencia independientes para el modelo específico antes de comparar precios. Los múltiplos de precio citados contra los modelos de frontera comparan diferentes clases de calidad. Nuestro benchmark de LLM agentivo puntúa los modelos de peso abierto que estos planes ofrecen, incluidos Kimi, GLM y MiniMax.

El volumen mensual y la alternativa medida deciden juntos entre plano y medido. Frente a un proveedor de bajo costo, el punto de cruce para un plan de $25 se sitúa cerca de 150M tokens por mes; frente a un proveedor premium, baja a aproximadamente 24M. Por debajo de tu punto de cruce, el pago por uso es más barato; muy por encima, un plan plano rinde múltiplos de su precio.

Limitaciones que vale la pena verificar antes de suscribirse:

  • Las cifras de tokens por segundo y latencia, que ningún proveedor publica actualmente.
  • Lo que cuesta una solicitud de modelo grande en unidades de concurrencia.
  • Comportamiento en el límite: solicitudes rechazadas (Featherless), colas o recarga medida.
  • Si el catálogo de modelos ofrecidos está documentado (Awan no lo enumera).
  • Términos de uso comercial y de producción.

La durabilidad del proveedor es un criterio real en este mercado. Featherless cuenta con una Serie A de $20M; Giotto aún estaba cerrando un préstamo convertible de CHF 5-10M en junio de 2026. Prefiere a los proveedores cuyo limitador les otorgue una economía unitaria sostenible, y evita estandarizar a un equipo en un plan que pueda cambiar de precio o agotarse en un año.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Preguntas frecuentes

A partir de julio de 2026: Featherless.ai (desde $25/mes, limitado por concurrencia), Awan LLM (de $5 a $80/mes, limitado por tasa de solicitudes), y la API de Giotto.ai anunciada a 49.90 CHF/mes, aún no disponible para compra pública. Todos los demás planes de precio plano que verificamos miden el uso a través de cuotas renovables.

Limitando las solicitudes concurrentes. Un carril no puede consumir más que la salida de una sola secuencia de GPU, por lo que el costo en el peor de los casos del proveedor es fijo, y los modelos ofrecidos son de peso abierto o propiedad del proveedor, por lo que no se aplica ningún costo de licencia por token.

Generalmente no. El rendimiento máximo lo determinan los carriles comprados, ningún proveedor en la tabla principal publica un SLA para estos planes, y las alternativas basadas en cuotas señalan explícitamente a los usuarios de producción al pago por uso.

Cita esta investigación

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Berk Kalelioğlu (2026) - "Mejores proveedores de LLM API de tarifa plana". Publicado en línea en AIMultiple.com. Recuperado el 7 de Agosto de 2026, de: https://aimultiple.com/flat-rate-llm-api [Recurso en línea]

Kalelioğlu, B. (2026, 7 de Agosto). Mejores proveedores de LLM API de tarifa plana. AIMultiple. https://aimultiple.com/flat-rate-llm-api

@misc{kalelioglu2026,
  author = {Kalelioğlu, Berk},
  title  = {{Mejores proveedores de LLM API de tarifa plana}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/flat-rate-llm-api}},
  note   = {AIMultiple. Recuperado el 7 de Agosto de 2026}
}
Berk Kalelioğlu
Berk Kalelioğlu
Investigador de IA
Berk es investigador de IA en AIMultiple, centrado en sistemas de IA agéntica y language models.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450