Serviços
Contate-nos

Melhores provedores com tarifa fixa de LLM API

Berk Kalelioğlu
Berk Kalelioğlu
atualizado em 7 ago. 2026

Provedores de LLM com tarifa fixa vendem uso ilimitado do modelo por um preço mensal fixo em vez de cobrar por token. Esse modelo se espalhou porque sessões de codificação agentiva podem usar dezenas de milhões de tokens, então uma conta por token é difícil de prever. Muito poucos provedores oferecem uma tarifa fixa verdadeira; a maioria dos planos comercializados como fixos carrega uma cota de uso oculta. Abaixo, comparamos os provedores que realmente vendem uso ilimitado, com os modelos servidos, o limite de concorrência e o preço para cada um.

Provedor
Foco
Modelos
Concorrência
Preço
Giotto.ai
implantação soberana hospedada na UE
Giotto 1 (modelo próprio)
1 solicitação por vez
49.90 CHF/mês
Featherless.ai
Variedade de modelos de peso aberto a um custo fixo
30.000+ modelos de peso aberto
4 a 8 unidades por plano
A partir de $25/mês
Awan LLM
Acesso econômico com tarifa fixa
Llama 3 e 3.1 (8B e 70B)
100 a 200 solicitações/min
$5 a $80/mês

Os provedores nesta tabela atendem a dois critérios:

  • Um preço mensal fixo publicado.
  • Uso ilimitado: sem orçamento de token ou prompt que o interrompa. Limites de taxa que regulam o fluxo de solicitações são permitidos; orçamentos que encerram o uso não são.

Provedores de LLM com tarifa fixa analisados

Featherless.ai

Featherless serve mais de 30.000 modelos de peso aberto (DeepSeek, Kimi, GLM, Qwen, Llama e ajustes finos) por meio de uma API compatível com OpenAI com tokens e solicitações ilimitados.1 Em vez de um medidor de tokens, ele precifica unidades de concorrência: um modelo pequeno custa 1 unidade por solicitação em voo, um modelo da classe 70B custa 4, e solicitações acima do seu orçamento retornam um erro HTTP 429 em vez de uma cobrança.

O plano Premium inclui 4 unidades, então $25 compram uma faixa de modelo grande ou quatro faixas de modelos pequenos. Os planos Agent adicionam 8 unidades e um sandbox para cargas de trabalho autônomas. A empresa levantou uma Série A de $20M coliderada pela AMD Ventures e Airbus Ventures em 2026-04-30, o respaldo financeiro mais forte neste mercado.

Melhor caso de uso: Codificação agentiva pesada de fluxo único e experimentação de modelos com um teto de custo rígido.

Modelos: 30.000+ modelos de peso aberto; limite de tamanho de 229B nos planos de $100, sem limite nos planos de $200.

Concorrência: 4 unidades (Premium), 8 unidades (Agent e por unidade de Negócios).

Preço: Premium $25/mês. Agent $100 ou $200/mês. Business $100 ou $200 por unidade/mês.

Principais características:

  • Tokens e solicitações ilimitados em todos os planos.
  • Qualquer modelo de peso aberto catalogado, comutável por solicitação.
  • API compatível com OpenAI.
  • Política documentada de não registro de prompts e conclusões.
  • A concorrência escala linearmente nos planos Business.

Limitações:

  • Uma solicitação da classe 70B consome todo o orçamento de unidades do Premium.
  • Solicitações acima do orçamento são rejeitadas com HTTP 429, portanto, ferramentas paralelas precisam de sua própria fila de solicitações.
  • A taxa de transferência por faixa não é publicada; o fornecedor não informa tokens por segundo.

Giotto.ai

Giotto é um laboratório suíço em Lausanne que oferece seu próprio modelo de raciocínio, Giotto 1, que posiciona como o modelo mais forte que roda em uma única GPU.2 A empresa vende o mesmo sistema como nuvem hospedada na UE, implantação privada local ou hardware pré-instalado, com certificação ISO 27001.

A API com tarifa fixa foi anunciada pelo CEO Aldo Podestà em 09-07-2026: 49.90 CHF por mês, uma solicitação concorrente, uso ilimitado.3 Em 23-07-2026, a oferta não está no giotto.ai, que não possui página de preços e direciona os compradores para um formulário de contato, portanto, todos os termos abaixo são provisórios.

Melhor caso de uso: Requisitos de residência e soberania de dados na UE com um orçamento fixo.

Modelos: Somente Giotto 1.

Concorrência: 1 solicitação por vez (monoconcorrência).

Preço: Preço: 49.90 CHF/mês; gratuito no espaço de trabalho Giotto Open com limites de API não declarados.

Principais características:

  • Uso ilimitado por meio de uma única faixa de solicitações.
  • Hospedagem na UE em data centers na Suíça e parceiros da UE.
  • Mesmo modelo disponível para implantação privada em GPUs próprias.
  • O espaço de trabalho compartilhado gratuito inclui acesso à API.

Limitações:

  • Ainda não pode ser comprado; nenhuma página de preços pública em 23-07-2026.
  • O anúncio afirma economia de até 200x em relação ao Fable 5 e 350x em relação à API do GPT Pro; esses comparam apenas o preço. A própria tabela de benchmark do Giotto posiciona o Giotto 1 em relação a modelos de GPU única, como Gemma 4 31B e GPT-OSS-120B, não os modelos de fronteira na alegação de preço.
  • Empresa em estágio inicial: o produto foi lançado em 18-05-2026, e o CEO afirmou em junho de 2026 que um empréstimo conversível de CHF 5-10M deveria ser fechado até julho, com uma rodada de financiamento inicial maior planejada para o final do ano.4

Awan LLM

Awan LLM vende “tokens ilimitados” a partir de $5 por mês, com limites diários de solicitações que escalam por classe de tamanho do modelo e limites de taxa por minuto.5 Os limites diários (30K a 80K solicitações no plano Pro de $20) estão muito acima do que um único usuário interativo gera, o que torna o plano uma tarifa fixa na prática.

O catálogo de modelos está em uma página separada, e não na página de preços: Llama 3.1 8B e 70B Instruct, Llama 3 8B e 70B, e os ajustes finos 8B do próprio Awan.6 O mais recente deles foi lançado em julho de 2024, portanto, o catálogo está de uma a duas gerações atrás dos lançamentos atuais de modelos de peso aberto.

Melhor caso de uso: Entrada de tarifa fixa com o menor custo para cargas de trabalho leves e médias de peso aberto.

Modelos: Llama 3.1 (8B, 70B), Llama 3 (8B, 70B) e ajustes finos de 8B.

Concorrência: Limitado por taxa a 100 solicitações/min (Pro) a 200 solicitações/min (Max).

Preço: Lite gratuito, Core $5/mês, Plus $10/mês, Pro $20/mês, Max $80/mês.

Principais características:

  • Tokens ilimitados em todos os planos pagos.
  • Plano gratuito disponível para testes em pequena escala.
  • O plano Max remove os limites diários de solicitações.
  • Entrada paga mais barata neste mercado a $5/mês.

Limitações:

  • O catálogo para no Llama 3.1; nenhum modelo de peso aberto de 2025 ou 2026 é servido.
  • Os limites de solicitações por classe de tamanho do modelo substituem o medidor de tokens.

Planos com preço fixo e cotas de uso

A maioria dos planos na conversa sobre tarifa fixa são assinaturas com uma cota renovável: o preço é fixo e um orçamento de prompt ou token o interrompe em vez de cobrar. O que acontece no limite da cota difere por fornecedor e importa tanto quanto o tamanho da cota. Abordamos esses planos nível por nível em nosso guia de preços de LLM.

Plano de Codificação Z.ai GLM

  • Medidor: ~80 a 1.600 prompts por janela de 5 horas mais ~400 a 8.000 por semana por nível; cada prompt aciona cerca de 15 a 20 chamadas de modelo; dedução de cota 3x em horários de pico.
  • No limite: bloqueio rígido até que a janela seja renovada, sem fallback para pagamento por uso.
  • Visão geral: $18 a $160/mês, oferece GLM-5.2 por meio de um endpoint compatível com Anthropic em mais de 20 ferramentas de codificação.7

Kimi Code

  • Medidor: um pool de créditos compartilhado com todos os recursos de associação do Kimi, renovado semanalmente sem acúmulo, além de uma janela de taxa contínua de 5 horas; volumes de cota não publicados.
  • No limite: recarga medida via Uso Extra em vez de um bloqueio rígido.
  • Visão geral: $19 a $199/mês para K2.7 Code com 2 a 8 tarefas agentes concorrentes; o modo HighSpeed consome 3x a cota.8

MiniMax Coding Plan

  • Medidor: ~1,7B a 12,5B tokens por mês dentro de janelas de 5 horas e semanais; a cota não utilizada não é acumulada.
  • Visão geral: $20 a $120/mês; MiniMax recomenda pagamento por uso para uso em produção.9

Cerebras Code

  • Medidor: 24M a 120M tokens por dia.
  • Visão geral: $50 ou $200/mês para GLM 4.7 no hardware Cerebras; todos os planos ainda apareciam esgotados em 23-07-2026.10

NanoGPT Pro

  • Medidor: 60M tokens de entrada por semana; modelos grandes deduzem a 2x.
  • Visão geral: $12/mês em um conjunto de modelos de código aberto incluídos, web e API.11

Synthetic

  • Medidor: 500 solicitações a cada 5 horas, 1 solicitação concorrente por modelo.
  • Visão geral: $30/mês para sete modelos de peso aberto sempre ativos, UI mais API.12

Chutes

  • Medidor: uso incluído limitado a 5x o preço do plano, depois a cobrança continua por token.
  • Visão geral: $10 ou $20/mês em pacotes pré-pagos em computação descentralizada; um programa de desconto em vez de uma tarifa fixa.13

Assinaturas do Claude e ChatGPT

  • Medidor: sessões de 5 horas mais limites semanais (Claude); níveis de uso com limites (ChatGPT).
  • Visão geral: $20 a $200+/mês; a única rota de preço fixo para modelos fechados de ponta, vendidos como assentos, não como APIs.14 15

Como funciona a precificação com tarifa fixa

1. Faixas de concorrência substituem o medidor de tokens

Um provedor de tarifa fixa limita quantas solicitações você pode executar ao mesmo tempo, em vez de quantos tokens você consome. Uma faixa de solicitação não pode extrair mais do que a saída de um fluxo de GPU, portanto, o custo de serviço no pior caso do provedor é fixo. A aritmética também o limita: uma faixa transmitindo 50 tokens por segundo ininterruptamente produz no máximo cerca de 130M tokens de saída em um mês de 30 dias, e o uso real fica bem abaixo disso porque a faixa fica ociosa entre as chamadas. Tokens por segundo, portanto, torna-se um critério de compra, e nenhum dos três provedores o publica.

2. Economia dos modelos de peso aberto

Todo provedor de tarifa fixa verdadeiro serve modelos de peso aberto em GPUs comuns (Featherless, Awan) ou seu próprio modelo em sua própria infraestrutura (Giotto). Ninguém vende acesso ilimitado fixo a um modelo fechado de ponta, porque um revendedor não pode limitar o custo de serviço de um modelo que licencia por token. Anthropic e OpenAI vendem preços fixos apenas para seus próprios modelos, agrupados em assinaturas de chat com cota limitada.

3. Ponto de equilíbrio em relação ao pagamento por token

Um plano fixo ganha quando o gasto medido para o mesmo modelo excederia o preço do plano, e o ponto de equilíbrio depende muito de qual host medido você compara. Llama 3.3 70B custa $0,10 por milhão de tokens de entrada e $0,32 por milhão de saída no DeepInfra, contra um valor fixo de $1,04 por milhão no Together IA.16 Supondo uma mistura de entrada-saída de 70:30, o Featherless Premium a $25 atinge o ponto de equilíbrio em cerca de 150M tokens por mês em relação ao DeepInfra, mas em apenas cerca de 24M tokens em relação ao Together IA. O uso agentivo pesado de fluxo único supera a barra inferior facilmente e pode superar a superior.

O caso inverso importa igualmente. Uma carga de trabalho de 5M tokens por mês distribuída em vinte sessões curtas paralelas custa menos de $1 medido no DeepInfra, enquanto atender essa concorrência em faixas de tarifa fixa custaria $100 ou mais. A tarifa fixa é adequada para trabalho de alto volume e baixa concorrência; o pagamento por token vence em tráfego de baixo volume ou altamente paralelo. Os números são ilustrativos nas datas de acesso citadas; execute as contagens de tokens do mês passado pela mesma aritmética.

4. Sustentabilidade da precificação ilimitada

Planos ilimitados atraem os usuários mais pesados, e o mercado já mostra a tensão. O Cerebras Code estava esgotado em todos os níveis em 23-07-2026, dez dias após nossa primeira verificação. O NanoGPT aumentou sua assinatura de $8 para $12 em um ano. O desconto de 30% do Z.ai é limitado no tempo.

Os precedentes vão além deste nicho. O CEO da OpenAI disse em janeiro de 2025 que o plano ChatGPT Pro de $200/mês estava dando prejuízo porque os assinantes o usavam mais do que o projetado.17 O GitHub substituiu as unidades de solicitação premium do Copilot por Créditos de IA baseados em uso em 01-06-2026, mantendo os preços das assinaturas inalterados.18 O Cursor trocou sua alocação de 500 solicitações por um pool de uso de $20 em junho de 2025 e emitiu reembolsos após a reação negativa.19 Quando os maiores vendedores de uso de IA com preço fixo recuam para medidores, trate o plano ilimitado de um pequeno provedor como um preço introdutório e a matemática do ponto de equilíbrio como válida por meses, não por anos.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Por que você precisaria de um plano de LLM com tarifa fixa em 2026?

1. Codificação agentiva pesada

Uma única sessão de agente de codificação faz centenas de chamadas sequenciais de modelo e pode queimar dezenas de milhões de tokens. Uma faixa atende a esse padrão continuamente sem variação na fatura. Featherless se encaixa; Giotto o fará quando estiver disponível para compra.

2. Residência de dados na UE

Giotto hospeda em data centers na Suíça e na UE, serve seu próprio modelo e oferece o mesmo sistema para implantação privada, o que atende equipes regulamentadas que não podem enviar dados para APIs hospedadas nos EUA.

3. Experimentação de modelos

Featherless expõe 30.000+ modelos de peso aberto por trás de uma API e uma taxa, portanto, comparar modelos não custa nada além da assinatura.

4. Projetos paralelos com custo limitado

Um projeto de hobby com uso irregular corre o risco de contas surpresa em um medidor. O Awan LLM a $5 a $20 por mês limita a desvantagem ao preço da assinatura.

5. Processamento em lote e em segundo plano

Tarefas de resumo, classificação ou limpeza de dados noturnas toleram filas, portanto, podem saturar as horas ociosas de uma faixa sem custo marginal. Qualquer um dos três provedores se encaixa se a qualidade do modelo for suficiente.

Como escolher o plano de LLM com tarifa fixa certo?

A forma da carga de trabalho decide mais do que o preço. O trabalho sequencial (um agente, um chat, tarefas em lote) funciona bem em uma única faixa. Frotas de agentes paralelos se serializam atrás de uma faixa e precisam de mais concorrência: Featherless precifica unidades extras explicitamente e rejeita solicitações acima do orçamento com HTTP 429, enquanto um plano de concorrência única como a API anunciada do Giotto não pode ser ampliado de forma alguma.

A qualidade do modelo define o piso. Um plano fixo só economiza dinheiro se o modelo servido puder fazer seu trabalho, portanto, verifique as pontuações de benchmark independentes para o modelo específico antes de comparar preços. Os múltiplos de preço citados em relação a modelos de fronteira comparam diferentes classes de qualidade. Nosso benchmark de LLM agentivo avalia os modelos de peso aberto que esses planos servem, incluindo Kimi, GLM e MiniMax.

O volume mensal e a alternativa medida decidem juntos entre fixo e medido. Em relação a um host de baixo custo, o ponto de crossover para um plano de $25 fica perto de 150M tokens por mês; em relação a um host premium, ele cai para cerca de 24M. Abaixo do seu crossover, o pagamento por uso é mais barato; muito acima dele, um plano fixo retorna múltiplos de seu preço.

Limitações que valem a pena verificar antes de assinar:

  • Números de tokens por segundo e latência, que nenhum provedor publica atualmente.
  • O que uma solicitação de modelo grande custa em unidades de concorrência.
  • Comportamento no limite: solicitações rejeitadas (Featherless), enfileiramento ou recarga medida.
  • Se o catálogo de modelos servidos está documentado (Awan não o lista).
  • Termos de uso comercial e de produção.

A durabilidade do provedor é um critério real neste mercado. Featherless possui uma Série A de $20M; Giotto ainda estava fechando um empréstimo conversível de CHF 5-10M em junho de 2026. Prefira provedores cuja limitação proporcione uma economia unitária sustentável e evite padronizar uma equipe em um plano que pode ser reajustado ou esgotado em um ano.

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Perguntas frequentes

Em julho de 2026: Featherless.ai (a partir de $25/mês, limitado por concorrência), Awan LLM ($5 a $80/mês, limitado por taxa de solicitações) e a API anunciada do Giotto.ai a 49,90 CHF/mês, ainda não disponível para compra pública. Todos os outros planos com preço fixo que verificamos medem o uso por meio de cotas renováveis.

Limitando as solicitações concorrentes. Uma faixa não pode consumir mais do que a saída de um fluxo de GPU, portanto, o custo do provedor no pior caso é fixo, e os modelos servidos são de peso aberto ou de propriedade do fornecedor, portanto, não se aplica nenhum custo de licença por token.

Geralmente, não. O throughput atinge o limite nas faixas adquiridas, nenhum provedor na tabela principal publica um SLA para esses planos, e alternativas baseadas em cotas direcionam explicitamente os usuários de produção para o pagamento por uso.

Cite esta pesquisa

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Berk Kalelioğlu (2026) - "Melhores provedores com tarifa fixa de LLM API". Publicado on-line em AIMultiple.com. Acessado em 7 Agosto 2026, em: https://aimultiple.com/flat-rate-llm-api [Recurso on-line]

Kalelioğlu, B. (2026, 7 Agosto). Melhores provedores com tarifa fixa de LLM API. AIMultiple. https://aimultiple.com/flat-rate-llm-api

@misc{kalelioglu2026,
  author = {Kalelioğlu, Berk},
  title  = {{Melhores provedores com tarifa fixa de LLM API}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/flat-rate-llm-api}},
  note   = {AIMultiple. Acessado em 7 Agosto 2026}
}
Berk Kalelioğlu
Berk Kalelioğlu
Pesquisador de IA
Berk é um Pesquisador de IA na AIMultiple, com foco em sistemas de IA agênticos e language models.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450