Os provedores de LLM com tarifa fixa vendem uso ilimitado de modelos por um preço mensal fixo em vez de cobrar por token. Esse modelo se espalhou porque as sessões de codificação agentic podem usar dezenas de milhões de tokens, então uma conta por token é difícil de prever. Muito poucos provedores oferecem uma tarifa verdadeiramente fixa; a maioria dos planos comercializados como fixos carregam uma cota de uso subjacente. A seguir, comparamos os provedores que realmente vendem uso ilimitado, com os modelos atendidos, o limite de concorrência e o preço de cada um.
Provedor | Foco | Modelos | Concorrência | Preço |
|---|---|---|---|---|
Giotto.ai | Implantação soberana hospedada na UE | Giotto 1 (modelo próprio) | 1 solicitação por vez | 49.90 CHF/mês, anunciado |
Featherless.ai | Variedade de modelos de peso aberto a um custo fixo | 30,000+ modelos de peso aberto | 4 a 8 unidades por plano | A partir de $25/mês |
Awan LLM | Acesso econômico com tarifa fixa | Peso aberto, catálogo não listado | 100 a 200 solicitações/min | $5 a $80/mês |
Os provedores nesta tabela atendem a dois critérios:
- Um preço mensal fixo publicado.
- Nenhuma cota de token, prompt ou janela de tempo no uso.
Provedores de LLM com tarifa fixa analisados
Featherless.ai
O Featherless atende mais de 30,000 modelos de peso aberto (DeepSeek, Kimi, GLM, Qwen, Llama, e versões ajustadas) por meio de uma API compatível com OpenAI com tokens e solicitações ilimitados.1 Em vez de um medidor de tokens, ele precifica unidades de concorrência: um modelo pequeno custa 1 unidade por solicitação em andamento, um modelo de classe 70B custa 4, e solicitações que excedem seu orçamento retornam um erro HTTP 429 em vez de uma cobrança.
O plano Premium inclui 4 unidades, então $25 compra uma via de modelo grande ou quatro vias de modelo pequeno. Os planos Agent adicionam 8 unidades e um sandbox para cargas de trabalho autônomas. A empresa levantou uma rodada Série A de $20M coliderada pela AMD Ventures e Airbus Ventures em 04-30 de 2026, o respaldo financeiro mais forte neste mercado.
Melhor caso de uso: Codificação agentic de fluxo único pesada e experimentação de modelos com um teto de custo rígido.
Modelos: 30,000+ modelos de peso aberto; limite de tamanho de 229B nos planos de $100, sem limite nos planos de $200.
Concorrência: 4 unidades (Premium), 8 unidades (Agent e por unidade Business).
Preço: Premium $25/mês. Agent $100 ou $200/mês. Business $100 ou $200 por unidade/mês.
Principais recursos:
- Tokens e solicitações ilimitados em todos os planos.
- Qualquer modelo de peso aberto catalogado, alternável por solicitação.
- OpenAI-compatível API.
- Política documentada de não registro de prompts e conclusões.
- Concorrência escala linearmente nos planos Business.
Limitações:
- Uma solicitação de classe 70B consome todo o orçamento de unidades Premium.
- Solicitações que excedem o orçamento são rejeitadas com HTTP 429, portanto, ferramentas paralelas precisam de sua própria fila de solicitações.
- A taxa de transferência por via não é divulgada; o fornecedor não informa tokens por segundo.
Giotto.ai
O Giotto é um laboratório suíço em Lausanne que atende seu próprio modelo de raciocínio, Giotto 1, o qual posiciona como o modelo mais forte que roda em uma única GPU.2 A empresa vende o mesmo sistema como nuvem hospedada na UE, implantação privada no local ou hardware pré-instalado, com certificação ISO 27001.
A API de tarifa fixa foi anunciada pelo CEO Aldo Podestà em 07-09 de 2026: 49.90 CHF por mês, uma solicitação simultânea, uso ilimitado.3 Até 07-23 de 2026, a oferta não está no giotto.ai, que não tem página de preços e direciona os compradores a um formulário de contato, portanto, todos os termos abaixo são provisórios.
Melhor caso de uso: Requisitos de residência e soberania de dados na UE com um orçamento fixo.
Modelos: Apenas Giotto 1.
Concorrência: 1 solicitação por vez (monoconcorrência).
Preço: 49.90 CHF/mês, apenas anúncio; workspace Giotto Open gratuito com limites de API não declarados.
Principais recursos:
- Uso ilimitado por meio de uma única via de solicitação, conforme o anúncio.
- Hospedagem na UE em data centers parceiros suíços e da UE.
- Mesmo modelo disponível para implantação privada em GPUs próprias.
- Workspace compartilhado gratuito inclui acesso à API.
Limitações:
- Ainda não comprável; nenhuma página de preços pública até 07-23 de 2026.
- O anúncio afirma economia de até 200x em relação ao Fable 5 e 350x em relação à API do GPT Pro; essas comparações são apenas de preço. A própria tabela de benchmarks do Giotto posiciona o Giotto 1 em relação a modelos de GPU única, como Gemma 4 31B e GPT-OSS-120B, não os modelos de fronteira na reivindicação de preço.
- Empresa em estágio inicial: o produto foi lançado em 05-18 de 2026, e o CEO declarou em junho de 2026 que um empréstimo conversível de CHF 5-10M estava previsto para fechar até julho, com uma rodada seed maior planejada para o final do ano.
Awan LLM
Awan LLM vende "tokens ilimitados" a partir de $5 por mês, com limites diários de solicitações que escalam conforme a classe de tamanho do modelo e limites de taxa por minuto.4 Os limites diários (30K a 80K solicitações no plano Pro de $20) ficam muito acima do que um único usuário interativo gera, o que torna o plano de tarifa fixa na prática.
A página de preços não lista quais modelos são atendidos nem quão atuais eles são. Verifique o catálogo em relação à sua carga de trabalho antes de pagar.
Melhor caso de uso: Entrada de tarifa fixa de menor custo para cargas de trabalho leves e médias com modelos de peso aberto.
Modelos: Peso aberto; catálogo e versões não informados na página de preços.
Concorrência: Limitado por taxa a 100 solicitações/min (Pro) a 200 solicitações/min (Max).
Preço: Lite gratuito, Core $5/mês, Plus $10/mês, Pro $20/mês, Max $80/mês.
Principais recursos:
- Tokens ilimitados em todos os planos pagos.
- Plano gratuito disponível para testes em pequena escala.
- Plano Max remove os limites diários de solicitações.
- Entrada paga mais barata neste mercado a $5/mês.
Limitações:
- Modelos atendidos e suas versões não são documentados; a qualidade não é verificada.
- Limites de solicitações por classe de tamanho do modelo substituem o medidor de tokens.
Planos com preço fixo e cotas de uso
A maioria dos planos na conversa sobre tarifa fixa são assinaturas com cota renovável: o preço é fixo e um orçamento de prompt ou token te interrompe em vez de cobrar. O que acontece ao atingir o limite da cota varia conforme o fornecedor e importa tanto quanto o tamanho da cota. Abordamos esses planos nível por nível em nosso guia de preços de LLM.
Plano Z.ai GLM Coding
- Medidor: ~80 a 1,600 prompts por janela de 5 horas mais ~400 a 8,000 por semana, dependendo do plano; cada prompt aciona cerca de 15 a 20 chamadas de modelo; dedução de cota de 3x em horários de pico.
- No limite: bloqueio rígido até a janela reiniciar, sem opção de cobrança por uso.
- Visão geral: $18 a $160/mês, atende GLM-5.2 por meio de um endpoint compatível com Anthropic em mais de 20 ferramentas de codificação.5
Kimi Code
- Medidor: um pool de créditos compartilhado com todos os recursos da assinatura Kimi, renovado semanalmente sem acúmulo, além de uma janela de taxa contínua de 5 horas; volumes de cota não publicados.
- No limite: recarga medida via Uso Extra em vez de bloqueio rígido.
- Visão geral: $19 a $199/mês para K2.7 Code com 2 a 8 tarefas de agente simultâneas; o modo HighSpeed consome 3x cota.6
MiniMax Coding Plan
- Medidor: ~1.7B a 12.5B tokens por mês dentro de janelas de 5 horas e semanais; cota não utilizada não acumula.
- Visão geral: $20 a $120/mês; MiniMax recomenda pagamento por uso para produção.7
Cerebras Code
- Medidor: 24M a 120M tokens por dia.
- Visão geral: $50 ou $200/mês para GLM 4.7 em hardware Cerebras; todos os planos ainda estavam esgotados em 07-23 de 2026.8
NanoGPT Pro
- Medidor: 60M tokens de entrada por semana; modelos grandes deduzem em 2x.
- Visão geral: $12/mês para um conjunto incluído de modelos de código aberto, web e API.9
Synthetic
- Medidor: 500 solicitações por 5 horas, 1 solicitação simultânea por modelo.
- Visão geral: $30/mês para sete modelos de peso aberto sempre ativos, interface do usuário mais API.10
Chutes
- Medidor: uso incluído limitado a 5x o preço do plano, depois a cobrança continua por token.
- Visão geral: $10 ou $20/mês em pacotes pré-pagos em computação descentralizada; um programa de desconto, não uma tarifa fixa.11
Assinaturas Claude e ChatGPT
- Medidor: sessões de 5 horas mais limites semanais (Claude); níveis de uso com limites (ChatGPT).
- Visão geral: $20 a $200+/mês; o único caminho com preço fixo para modelos closed de ponta, vendidos como assentos, não como APIs.12
Como funciona o preço de tarifa fixa
1. Vias de concorrência substituem o medidor de tokens
Um provedor de tarifa fixa limita quantas solicitações você pode executar simultaneamente em vez de quantos tokens você consome. Uma via de solicitação não pode extrair mais do que a saída de um único fluxo de GPU, portanto, o pior custo de serviço do provedor é fixo. A aritmética também te limita: uma via transmitindo 50 tokens por segundo ininterruptamente produz no máximo cerca de 130M tokens de saída em um mês de 30 dias, e o uso real fica bem abaixo disso porque a via fica ociosa entre as chamadas. Tokens por segundo, portanto, torna-se um critério de compra, e nenhum dos três provedores o publica.
2. Economia de modelos de peso aberto
Todo provedor de tarifa realmente fixa atende ou modelos de peso aberto em GPUs de commodity (Featherless, Awan) ou seu próprio modelo em sua própria infraestrutura (Giotto). Ninguém vende acesso ilimitado com preço fixo a um modelo closed de ponta, porque um revendedor não pode limitar o custo de serviço de um modelo que licencia por token. Anthropic e OpenAI vendem preços fixos apenas para seus próprios modelos, incluídos em assinaturas de chat com cota limitada.
3. Ponto de equilíbrio em relação ao pagamento por token
Um plano fixo ganha quando o gasto medido para o mesmo modelo excederia o preço do plano, e o ponto de equilíbrio depende muito de qual host medido você compara. Llama 3.3 70B custa $0.10 por milhão de tokens de entrada e $0.32 por milhão de saída na DeepInfra, contra $1.04 fixos por milhão na Together IA.13 Assumindo uma proporção de entrada-saída de 70:30, o Featherless Premium de $25 atinge o ponto de equilíbrio em aproximadamente 150M tokens por mês contra a DeepInfra, mas em apenas cerca de 24M tokens contra a Together IA. O uso agentic pesado de fluxo único ultrapassa facilmente a barreira mais baixa e pode ultrapassar a mais alta.
O caso inverso importa igualmente. Uma carga de trabalho de 5M tokens por mês distribuída em vinte sessões paralelas curtas custa menos de $1 medido na DeepInfra, enquanto atender essa concorrência em vias de tarifa fixa custaria $100 ou mais. Tarifa fixa combina com trabalho de alto volume e baixa concorrência; pagamento por token vence em tráfego de baixo volume ou altamente paralelo. Os números são ilustrações nas datas de acesso citadas; execute as contagens de tokens do último mês pela mesma aritmética.
4. Sustentabilidade da precificação ilimitada
Planos ilimitados atraem os usuários mais pesados, e o mercado já mostra a pressão. Cerebras Code estava esgotado em todos os planos em 07-23 de 2026, dez dias após nossa primeira verificação. O NanoGPT aumentou sua assinatura de $8 para $12 em um ano. O desconto de 30% do Z.ai é por tempo limitado.
Os precedentes vão além deste nicho. O CEO da OpenAI disse em janeiro de 2025 que o plano ChatGPT Pro de $200/mês estava perdendo dinheiro porque os assinantes o usavam mais que o projetado.14 GitHub substituiu as unidades de solicitação premium do Copilot por Créditos de IA baseados em uso em 06-01 de 2026, mantendo os preços de assinatura inalterados.15 O Cursor trocou sua alocação de 500 solicitações por um pool de uso de $20 em junho de 2025 e emitiu reembolsos após a reação negativa.16 Quando os maiores vendedores de uso de IA com preço fixo recuam para medidores, trate o plano ilimitado de um pequeno provedor como preço introdutório, e a matemática do ponto de equilíbrio como válida por meses, não anos.
Por que você precisaria de um plano de tarifa fixa de LLM em 2026?
1. Codificação agentic pesada
Uma única sessão de agente de codificação faz centenas de chamadas sequenciais de modelo e pode consumir dezenas de milhões de tokens. Uma via atende esse padrão continuamente sem variação na conta. O Featherless se encaixa; o Giotto servirá assim que estiver disponível para compra.
2. Residência de dados na UE
O Giotto hospeda em data centers suíços e da UE, atende seu próprio modelo e oferece o mesmo sistema para implantação privada, o que atende equipes reguladas que não podem enviar dados para APIs hospedadas nos EUA.
3. Experimentação de modelos
O Featherless expõe mais de 30,000 modelos de peso aberto por trás de uma única API e uma única taxa, portanto comparar modelos não custa nada além da assinatura.
4. Projetos paralelos com teto de custo
Um projeto hobby com uso pontual arrisca contas surpresa no medidor. Awan LLM por $5 a $20 por mês limita o lado negativo ao preço da assinatura.
5. Processamento em lote e em segundo plano
Trabalhos noturnos de sumarização, classificação ou limpeza de dados toleram enfileiramento, portanto podem saturar as horas ociosas de uma via com custo marginal zero. Qualquer um dos três provedores se encaixa se a qualidade do modelo for suficiente.
Como escolher o plano de tarifa fixa de LLM certo?
A forma da carga de trabalho decide mais do que o preço. Trabalhos sequenciais (um agente, um chat, trabalhos em lote) rodam bem em uma única via. Frotas de agentes paralelos se serializam atrás de uma via e precisam de mais concorrência: o Featherless precifica unidades extras explicitamente e rejeita solicitações acima do orçamento com HTTP 429, enquanto um plano de monoconcorrência como a API anunciada do Giotto não pode ser ampliado de forma alguma.
A qualidade do modelo estabelece o piso. Um plano fixo só economiza dinheiro se o modelo atendido puder fazer seu trabalho, portanto verifique pontuações de benchmark independentes para o modelo específico antes de comparar preços. Múltiplos de preço citados em relação a modelos de ponta comparam classes de qualidade diferentes.
O volume mensal e a alternativa medida decidem juntos entre fixo e medido. Contra um host de baixo custo, o ponto de cruzamento para um plano de $25 fica perto de 150M tokens por mês; contra um host premium, cai para cerca de 24M. Abaixo do seu ponto de cruzamento, o pagamento por uso é mais barato; muito acima dele, um plano fixo retorna múltiplos do seu preço.
Limitações que vale a pena verificar antes de assinar:
- Números de tokens por segundo e latência, que nenhum provedor publica atualmente.
- Quanto custa uma solicitação de modelo grande em unidades de concorrência.
- Comportamento no limite: solicitações rejeitadas (Featherless), enfileiramento ou recarga medida.
- Se o catálogo de modelos atendidos está documentado (Awan não o lista).
- Termos de uso comercial e de produção.
A durabilidade do provedor é um critério real neste mercado. O Featherless carrega uma Série A de $20M; o Giotto ainda estava fechando um empréstimo conversível de CHF 5-10M em junho de 2026. Prefira provedores cujo controle de taxa lhes dê economia unitária sustentável e evite padronizar uma equipe em um plano que pode ser reajustado ou esgotado dentro de um ano.
Perguntas frequentes
Até julho de 2026: Featherless.ai (a partir de $25/mês, limitado por concorrência), Awan LLM ($5 a $80/mês, limitado por taxa de solicitação) e a 49.90 CHF/mês da API anunciada do Giotto.ai, ainda não disponível para compra pública. Todos os outros planos com preço fixo que verificamos medem o uso por meio de cotas renováveis.
Limitando as solicitações simultâneas. Uma via não pode consumir mais do que a saída de um fluxo de GPU, portanto o pior custo do provedor é fixo, e os modelos atendidos são de peso aberto ou de propriedade do fornecedor, portanto não há custo de licença por token.
Geralmente não. A taxa de transferência atinge o limite nas vias adquiridas, nenhum provedor na tabela principal publica um SLA para esses planos, e as alternativas baseadas em cotas direcionam explicitamente os usuários de produção para o pagamento por uso.
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{Melhores provedores de LLM API com tarifa fixa}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/flat-rate-llm-api}},
note = {AIMultiple. Acessado em 23 Julho 2026}
}
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.