A precificação de LLM abrange quatro ordens de grandeza: os modelos mais baratos foram lançados por menos de US$ 0.03 por milhão de tokens, enquanto os níveis de raciocínio de fronteira foram lançados por até US$ 262.50. O gráfico abaixo acompanha os preços de lançamento: cada ponto é o preço médio dos modelos de uma classe de tamanho lançados em um trimestre civil, combinando 3 partes de entrada para 1 parte de saída, em 8 classes de tamanho. Os preços são a tarifa de tabela padrão do fornecedor, sem descontos de cache ou lote, ou a tarifa hospedada no lançamento para modelos de pesos abertos sem preço de primeira parte; o eixo y é logarítmico.
- Modelos de chat emblemáticos ficam mais baratos. O GPT-4 foi lançado por US$ 37.50 em março de 2023; o Claude Opus 5 por US$ 10.00 em julho de 2026.
- Os planos Reasoning Pro estabelecem um novo teto. O o1-pro atingiu pico de US$ 262.50 em março de 2025; os lançamentos Pro de 2026 da OpenAI mantêm US$ 67.50.
- O nível barato está subindo. O custo mediano de lançamento fechado-pequeno foi de US$ 0.53 em 2024 e US$ 3.00 nos primeiros oito meses de 2026. Seis modelos foram lançados nessa classe este ano e apenas o Solar Pro 4 da Upstage, por US$ 0.53, ficou abaixo de US$ 1.00.
- Os carros-chefe de pesos abertos triplicaram de preço e ainda assim ficaram abaixo dos modelos fechados. O preço mediano de lançamento deles subiu de US$ 0.48 em 2024 para US$ 1.63 em 2026, contra uma mediana de US$ 3.75 para lançamentos fechados de nível intermediário. O Kimi K3 da Moonshot, a US$ 6.00, é o lançamento de pesos abertos mais caro do gráfico.
- Os lançamentos fechados de nível intermediário custam 38% menos do que em 2024. A mediana caiu de US$ 6.00 em 2024 para US$ 4.38 em 2025 e US$ 3.75 em 2026. O Grok 4.5 e o Grok 4.6 foram lançados por US$ 3.00, e o Muse Spark 1.1 da Meta por US$ 2.00.
Os preços são preços de lançamento combinados por milhão de tokens, ponderados em três partes de entrada para uma de saída, e excluem promoções de lançamento por tempo limitado. O trimestre atual é parcial: seu ponto se move à medida que novos modelos são lançados até o fechamento do trimestre.
LLM API: avaliação de preço
Existem duas maneiras de pagar por um LLM: planos de assinatura com precificação de LLM com tarifa fixa dos principais provedores, ou um modelo de API pré-pago cobrado pelo uso de tokens.
Clique nos nomes dos modelos para ver os resultados de benchmark, a latência no mundo real e os preços, a fim de avaliar a eficiência e a relação custo-benefício de cada modelo.
Classificação: os modelos são classificados pela posição média em todos os benchmarks.
Você pode verificar as taxas de alucinação e o desempenho de raciocínio dos principais LLMs em nossos benchmarks.
Comparando planos de assinatura de LLM
Usuários não técnicos podem preferir usar a interface em vez da API. Em 2026, a maioria das assinaturas de provedores inclui muito mais do que uma interface de chat. Agentes de codificação como Claude Code, Codex, Kimi Code e Mistral Vibe vêm dentro dos planos Pro. Para desenvolvedores e usuários intensivos, a assinatura certa de US$ 10–US$ 200 muitas vezes substitui o que seria uma assinatura separada de IDE de codificação, um orçamento de API por token e uma ferramenta de vídeo ou pesquisa combinados.
OpenAI
O plano Free inclui chats de texto diários ilimitados com o GPT-5.6 Luna, modo de voz padrão, uploads limitados e geração básica de imagens. Anúncios contextuais alcançam cerca de 40 mercados em agosto de 2026, incluindo os EUA e a maior parte da Europa, e aparecem apenas nos planos Free e Go.
- ChatGPT Go (US$ 8/mês) é um plano de baixo custo que pode incluir anúncios. Os chats de texto são ilimitados, como no Free; a atualização oferece limites maiores para uploads de arquivos, criação de imagens, voz e memória, tudo no GPT-5.6 Luna.
- ChatGPT Plus (US$ 20/mês) inclui limites de uso estendidos, acesso ao GPT-5.6 Sol, Terra e Luna, modo de voz avançado, agente Codex, geração de imagens e recursos de acesso antecipado.
O plano Pro tem dois níveis a partir de abril de 2026:
- ChatGPT Pro (US$ 100/mês) oferece a mesma linha de modelos que o nível de US$ 200 (incluindo GPT-5.6 Sol) com limites de uso aproximadamente 5x os do Plus.
- ChatGPT Pro (US$ 200/mês) oferece os maiores limites de uso individual (cerca de 20x o Plus), maior cota de Deep Research, voz avançada com vídeo e compartilhamento de tela, Codex com impulso máximo de uso e Sora.
Ambos os níveis Pro incluem acesso prioritário durante horários de pico. A precificação do Codex no Plus, Pro e Business mudou de mensagem por mensagem para uso alinhado a tokens da API em abril de 2026.
O ChatGPT Work, agente da OpenAI para projetos de várias etapas de longa duração (lançado em 9 de julho de 2026), está incluído nos planos pagos, e o aplicativo de desktop que reúne Chat, Work e Codex está disponível em todos os planos, incluindo o Free.
- Plano Business (US$ 20/usuário/mês anual ou US$ 25/usuário/mês mensal) é o plano da OpenAI para equipes pequenas e médias (antigo ChatGPT Team, renomeado em agosto de 2025). Ele adiciona limites de mensagens maiores, console de administração, SSO, dados de equipe excluídos do treinamento e pools de créditos compartilhados para recursos avançados. Aplicativos incluídos: Codex com créditos de workspace compartilhados. Assentos somente Codex foram fechados para novos workspaces em 24 de junho de 2026; a OpenAI anunciou assentos Premium a US$ 100/usuário/mês anual (US$ 125 mensais) com 5x o uso Standard. O plano exige pelo menos 2 assentos.
- O plano Enterprise (preço personalizado) oferece acesso a modelos em alta velocidade, janelas de contexto expandidas, controles de dados de nível empresarial, verificação de domínio, análises e registros de auditoria. Aplicativos incluídos: Codex com pool de créditos compartilhado e assentos opcionais somente Codex.
Anthropic (Claude)
O plano Free inclui acesso web e móvel, análise básica, acesso ao Claude Sonnet 5 e Haiku, e upload de documentos. O uso diário é limitado, e os modelos Opus e Fable não estão disponíveis.
- Plano Pro (US$ 20/mês, ou US$ 17/mês cobrado anualmente) oferece acesso ao Opus 5, Sonnet 5 e Haiku, aproximadamente 5x mais uso que o Free, organização de projetos e acesso prioritário nos horários de pico. O Fable 5 não faz parte dos limites de uso do Pro; ele é cobrado com tarifas de API por meio de créditos de uso pré-pago. Aplicativos incluídos: Claude Code (agente de codificação da Anthropic para terminal e IDE), Cowork, Claude Design e Claude para Microsoft 365, todos compartilhando o mesmo pool de uso do chat.
- Plano Max 5x (US$ 100/mês) oferece cerca de 5x mais uso que o Pro, acesso prioritário aos recursos e modelos mais recentes e acesso completo ao Claude Code no nível de uso Max mais alto.
- Plano Max 20x (US$ 200/mês) oferece cerca de 20x mais uso que o Pro, acesso prioritário máximo e acesso completo ao Claude Code. Projetado para usuários avançados diários que executam cargas de trabalho do Claude Code. Ambos os níveis Max incluem o Fable 5, o modelo mais caro da Anthropic; seu uso pode consumir até metade do limite de uso semanal do plano.
O plano Team oferece dois tipos de assento e suporta de 2 a 150 membros:
- Assento Standard: US$ 20/usuário/mês anual (US$ 25/usuário/mês mensal). Inclui recursos básicos, limites de uso padrão e acesso ao Claude Code.
- Assento Premium: US$ 100/usuário/mês anual (US$ 125/usuário/mês mensal). Tudo do Standard, além de limites de uso maiores para usuários avançados que executam cargas de trabalho mais pesadas do Claude Code.
Aplicativos incluídos: o Claude Code e o Cowork estão incluídos em cada assento Team (Standard e Premium); a diferença está na cota de uso, não no acesso. Ambos os tipos de assento incluem cobrança central, ferramentas de colaboração e controles administrativos.
- Plano Enterprise (US$ 20/assento/mês mais uso com tarifas de API no nível autosserviço; preço personalizado com vendas) oferece janelas de contexto expandidas, SSO, captura de domínio, acesso baseado em funções, SCIM, registros de auditoria e integrações de dados. Aplicativos incluídos: nos planos Enterprise novos e de autosserviço, o Claude Code e o Cowork estão incluídos em cada assento; contratos Enterprise mais antigos podem distinguir entre assentos somente Chat e assentos Chat + Claude Code com cobrança baseada em uso.
Google (Gemini)
O plano gratuito oferece acesso ao Gemini 3.6 Flash e acesso variável ao Gemini 3.1 Pro, geração básica de imagens, Deep Research, Gemini Live, Canvas e Gems. Aplicativos incluídos: Gemini Notebook (antigo NotebookLM) e Flow com acesso limitado ao Nano Banana Pro.
O Google usa preços regionais, por isso os preços podem variar por região.
- Google IA Plus (US$ 4.99/mês, EUA) é o nível pago de entrada com 2x os limites de uso do Free. Aplicativos incluídos: mais acesso ao Gemini 3.1 Pro no chat, geração de imagens com Nano Banana Pro, geração de vídeo com Gemini Omni Flash, 200 créditos Flow, Gemini Notebook com mais Audio Overviews, Gemini no Gmail, Docs e Vids, e Gemini no Chrome com acesso antecipado. Inclui 400 GB de armazenamento.
- Google IA Pro (US$ 19.99/mês, EUA) oferece 4x os limites de uso do Free e 5 TB de armazenamento. Aplicativos incluídos: Jules (agente de codificação assíncrono), Google Antigravity (plataforma de desenvolvimento agêntico), limites expandidos do IA Studio, US$ 40/mês em créditos do Google Cloud, Gemini Notebook com 5x Audio Overviews, Deep Research, 1.000 créditos Flow, YouTube Premium Lite e Google Home Premium (plano Standard).
- Google IA Ultra (EUA) custa US$ 99.99/mês para 5x os limites de uso do IA Pro ou US$ 199.99/mês para 20x. Aplicativos incluídos: raciocínio Deep Think, Gemini Agent (somente EUA), Gemini Spark, Project Genie (modelo de mundo interativo), Jules nos limites mais altos, Antigravity de primeira linha, 10.000 ou 25.000 créditos Flow, Google Home Premium (plano Advanced) e uma assinatura individual do YouTube Premium. O armazenamento começa em 20 TB.
Microsoft Copilot
O plano gratuito (Copilot Chat) está disponível sem custo adicional para todos os usuários do Microsoft Entra com uma assinatura elegível do Microsoft 365. Ele inclui chat básico do Copilot em aplicativos da Microsoft sem os recursos mais profundos dentro dos documentos.
- Microsoft 365 Premium (US$ 19.99/mês ou US$ 199.99/ano) agora é o plano Copilot para consumidores. Ele reúne os aplicativos do Office, até 6 TB de armazenamento (1 TB cada para até seis pessoas) e os maiores limites do Copilot para consumidores; os recursos de IA se aplicam apenas ao titular da assinatura. O antigo Copilot Pro (US$ 20/mês) está fechado para novas compras, e os assinantes existentes podem mantê-lo ou mudar para o Premium.
- Microsoft 365 Copilot Business (US$ 21/usuário/mês anual; US$ 18/usuário/mês no primeiro ano para compras até 30 de setembro de 2026; US$ 25.20/usuário/mês mensal) adiciona o Copilot em aplicativos do Microsoft 365, integração com o Teams e controles administrativos. Aplicativos incluídos: Copilot Studio Lite para criar agentes leves, Copilot no SharePoint e Copilot Pages para rascunhos colaborativos. Limitado a organizações com até 300 usuários.
- Microsoft 365 Copilot Enterprise (US$ 30/usuário/mês anual, ou US$ 31.50/usuário/mês cobrado mensalmente; requer uma licença qualificada do Microsoft 365) oferece segurança avançada, conformidade e análises sobre os recursos do Business. Aplicativos incluídos: criação de agentes com o Copilot Studio (agentes de dados de trabalho e pré-criados podem ser medidos; o Copilot Studio autônomo é vendido separadamente), Copilot no Microsoft Purview e Intune para fluxos de trabalho de TI e segurança, e governança sobre os agentes implantados.
xAI (Grok)
O plano gratuito oferece acesso limitado ao Grok.
- SuperGrok Lite (US$ 10/mês) é o nível pago de entrada. Inclui conversas 2x mais longas, limites de taxa maiores e criação de imagens e vídeos com IA. Aplicativos incluídos: Grok Build (agente de criação de aplicativos da xAI, também gratuito na web desde agosto de 2026) e Grok Imagine para geração de imagens e vídeos.
- SuperGrok (US$ 30/mês, ou US$ 300/ano) inclui raciocínio aprimorado com o Grok 4.6, conversas 5x mais longas, uploads de arquivos mais longos, modo de voz para chat falado e 20x mais gerações de imagem e vídeo do Grok Imagine, incluindo vídeo HD de 720p e 30 segundos.
- SuperGrok Plus (US$ 100/mês) adiciona acesso ao Grok Bot, geração de vídeo 1080p, limites de uso maiores, respostas mais rápidas e acesso prioritário.
- SuperGrok Heavy (US$ 300/mês) oferece tudo do Plus, uma equipe de agentes para trabalho paralelo, limites de taxa máximos, prévias antecipadas dos próximos recursos da xAI e uma assinatura X Premium+. Em julho de 2026, a xAI também lançou suplementos para Excel, Outlook e Google Workspace, além de Automações agendadas; a maioria é gratuito, com o suplemento do Outlook e as Automações acionadas por e-mail reservados para usuários pagos.
O Grok também está incluído nas assinaturas do X: o X Premium (US$ 8/mês) é o caminho pago mais barato para o Grok dentro do aplicativo X e inclui status verificado e menos anúncios. O X Premium+ (US$ 40/mês) remove anúncios em todo o X e tem os maiores limites de uso do Grok, juntamente com monetização completa para criadores.
Moonshot IA (Kimi)
Os planos de consumo da Kimi são nomeados de acordo com andamentos musicais, do mais lento ao mais rápido. Os preços internacionais estão em USD; os usuários chineses pagam em CNY com tarifas mais baixas. A partir de agosto de 2026, novas compras estão em lista de espera. A página de preços anuncia planos futuros que separam os benefícios do Kimi e do Kimi Code, e o aviso da Moonshot de 20 de julho cita restrições de capacidade computacional para o lançamento adiado, quatro dias após o lançamento do K3. Os assinantes existentes mantêm seus planos e podem renovar.
- Adagio (Free) oferece conversas básicas ilimitadas com 6 usos de agente, consultas limitadas do Deep Research e tarefas básicas do agente OK Computer.
- Moderato (US$ 19/mês) adiciona o Kimi K3 no chat e em tarefas de agente, além de sessões expandidas do Deep Research. Aplicativos incluídos: Kimi Code (agente de codificação de IA com foco no terminal; estimativa de 300 a 1.200 solicitações por janela de 5 horas, cobradas do pool de créditos compartilhado), além das ferramentas de autoria Slides e Websites.
- Allegretto (US$ 39/mês) oferece maior uso em tudo do Moderato. Aplicativos incluídos: Agent Swarm (orquestração paralela de subagentes, até 4 subtarefas paralelas neste nível), implantação em nuvem do Kimi Claw para grupos de agentes heterogêneos com memória persistente e 2x os créditos de agente do Moderato.
- Allegro (US$ 99/mês) oferece 5x créditos de agente, Agent Swarm com até 8 subtarefas paralelas e chat K3 com até 1M tokens de contexto.
- Vivace (US$ 199/mês) oferece 10x créditos de agente, 4 tarefas simultâneas, Agent Swarm com até 8 subtarefas paralelas e chat K3 com até 1M tokens de contexto, voltado para cargas de trabalho intensivas de pesquisa e agênticas.
A assinatura inclui chaves de API do Kimi Code para uso em ferramentas de codificação de terceiros; a API separada do Kimi Open Platform é cobrada por token.
MiniMax
A MiniMax vende um Token Plan unificado sobre seus modelos M3 e M2.7. Ele substituiu os planos de crédito Agent e o Coding Plan separados em meados de 2026.
MiniMax Token Plan (uma cota para agentes, codificação e trabalho multimodal):
- Plus (US$ 20/mês): janelas de cota rotativas de 5 horas e semanais, suficientes para 3 a 4 agentes de codificação em paralelo; para projetos pessoais e prototipagem.
- Max (US$ 50/mês): as mesmas janelas para 4 a 5 agentes paralelos; para codificação diária com agentes e trabalho multimodal.
- Ultra (US$ 120/mês): 6 a 7 agentes paralelos; para fluxos de trabalho de agentes intensivos e sessões prolongadas.
- Pacotes de crédito: US$ 5 por 5.000 créditos, US$ 25 por 25.000, US$ 100 por 100.000 (1.000 créditos = US$ 1, válido por 365 dias), utilizáveis sobre qualquer plano.
O Token Plan cobre toda a linha de modelos (M3, M2.7, imagem e fala) em uma única cota, tornando-o um dos caminhos mais baratos para um modelo de codificação de fronteira quando combinado com uma CLI como Cline ou Kilo Code.
Mistral AI
O plano Free do Mistral Vibe (antigo Le Chat) inclui navegação na web, análise básica de arquivos, geração de imagens, sessões limitadas de codificação, 100+ conectores e US$ 10/mês em créditos de API.
- Plano Pro (US$ 14.99/usuário/mês) inclui mais mensagens e pesquisas na web, mais relatórios de pensamento estendido e Deep Research, 15 GB de armazenamento de documentos, até 1.000 projetos, geração de imagens e US$ 30/mês em créditos de API. Aplicativos incluídos: modo Code do Mistral Vibe na CLI, IDE ou web, com pagamento conforme o uso além da cota incluída. Estudantes verificados obtêm o Pro por US$ 5.99/mês.
- Plano Team (US$ 24.99/usuário/mês) inclui tudo do Pro com até 30 GB de armazenamento por usuário, cobrança central, controle de acesso baseado em funções, verificação de nome de domínio e exportação de dados. Aplicativos incluídos: Mistral Vibe no nível de uso da equipe com controles administrativos compartilhados.
- Plano Enterprise (preço personalizado) oferece opções seguras de implantação, incluindo auto-hospedagem e nuvem privada, SAML SSO, registros de auditoria, suporte premium e análises detalhadas. Aplicativos incluídos: Mistral Vibe com opções de implantação local para cargas de trabalho regulamentadas.
DeepSeek
A DeepSeek não oferece planos de assinatura tradicionais. O acesso ao chat na web e no móvel para os modelos mais recentes (atualmente DeepSeek V4-Flash e V4-Pro) é gratuito para todos os usuários, com limitação por uso justo.
O acesso à API é pagamento por token com tarifas de pico e fora de pico desde 16 de agosto de 2026. Fora de pico, o V4-Flash custa US$ 0.22 por milhão de tokens de entrada (cache miss) e US$ 0.66 por milhão de tokens de saída; as tarifas de pico são o dobro (US$ 0.44 e US$ 1.32). O V4-Pro custa US$ 0.66 e US$ 1.98 fora de pico. Acertos de cache custam cerca de 3% da tarifa de miss, e os horários de pico são 01:00-04:00 e 06:00-10:00 UTC em dias úteis.
A DeepSeek também entrou em ferramentas de agentes. O DeepSeek Harness, um kit de ferramentas de código aberto baseado em plugins para criar e executar agentes de IA, está em prévia para desenvolvedores com código-fonte público. Ele não tem preço próprio e é independente de modelo; o uso é cobrado pelo API do modelo que o agente chamar.
Meta (Muse Spark)
O Meta IA continua gratuito no WhatsApp, Instagram, Facebook, Messenger, no aplicativo Meta IA e nos óculos Ray-Ban Meta, com tecnologia Muse Spark (lançado em 8 de abril de 2026, agora na versão 1.2). A Meta começou testes limitados das assinaturas pagas Meta One. Os planos Plus e Premium aumentam a cota mensal de uso de IA e o acesso ao modo Thinking, relatados a US$ 7.99 e US$ 19.99 por mês.1
A Meta Model API está em prévia pública, autosserviço e compatível com o SDK da OpenAI. O preço pré-pago do Muse Spark 1.2 começa em US$ 1.25 por milhão de tokens de entrada e US$ 4.25 por milhão de tokens de saída com uma janela de contexto de 1M tokens. O Muse Code, um agente de codificação para terminal, foi lançado em beta em 5 de agosto de 2026.
Entendendo LLM: precificação
Tokens: a unidade fundamental de precificação
Figura 1: Exemplo de tokenização usando o tokenizador GPT-4o e GPT-4o mini para a frase “Identifique Novas Tecnologias, Acelere Sua Empresa.”2
Embora os provedores ofereçam diversas estruturas de preços, a precificação por token é a mais comum. Os métodos de tokenização variam entre os modelos; exemplos incluem:
- Byte-Pair Encoding (BPE): divide palavras em unidades de subpalavras frequentes, equilibrando tamanho de vocabulário e eficiência.3
- Exemplo: “unbelievable” → [“un”, “believ”, “able”]
- WordPiece: Semelhante ao BPE, mas otimiza a probabilidade do modelo de linguagem, usado no BERT.4
- Exemplo: “tokenization” → [“token”, “##ization”]. “token” é uma palavra independente; “##ization” é um sufixo.
- SentencePiece: Tokeniza o texto sem depender de espaços, eficaz para modelos multilíngues como o T5.5
- Exemplo: “natural language” → [“ natural”, “ lan”, “guage”] ou [“ natu”, “ral”, “ language”].
Observe que as subpalavras exatas dependem dos dados de treinamento e do processo BPE/WordPiece. Para entender melhor esses métodos de tokenização, assista ao vídeo abaixo:
Depois de entender a tokenização, um preço médio pode ser estimado com base no comprimento de tokens do projeto. A Tabela 2 descreve as faixas de tokens por tipo de conteúdo, incluindo prompts de interface, trechos de e-mail, blogs de marketing, relatórios detalhados e artigos de pesquisa, e observa que as contagens de tokens variam entre os modelos. Uma vez escolhido um modelo, seu tokenizador pode ser usado para estimar a contagem média de tokens para o conteúdo.
Tabela 2: Tipos de conteúdo típicos, suas faixas de tamanho e considerações empresariais (as faixas são estimativas e podem variar).
Implicações da janela de contexto
A janela de contexto define um limite rígido para o número de tokens de entrada e saída por chamada, incluindo quaisquer tokens usados por modelos de raciocínio para raciocínio em cadeia de pensamento. Se o total exceder esse limite, a resposta será truncada ou a solicitação falhará imediatamente.
Figura 2: Ilustração das limitações da janela de contexto que levam ao truncamento da saída em uma conversa de várias turnos.6
Para aplicações que mantêm conversas longas, cada turno adicional empurra mais histórico para a entrada. Sem intervenção, os tokens de entrada crescem linearmente com a duração da conversa, e a fatura também. Os usuários de API geralmente lidam com isso de uma das três maneiras:
- Cache de prompt. A OpenAI, a Anthropic, o Google e a DeepSeek todos fazem cache de prefixos de prompt repetidos no lado do servidor e cobram acertos de cache a uma fração da tarifa de entrada padrão, normalmente de 3 a 10 por cento do preço de cache miss. Para aplicações que reutilizam um prompt de sistema longo ou prefixo de conversa, o cache pode reduzir o custo de entrada em uma ordem de grandeza.
- Janela deslizante ou geração aumentada por recuperação (RAG). Descarte os turnos mais antigos quando um limite for atingido ou recupere apenas mensagens passadas relevantes de um armazenamento vetorial em cada chamada.
- Resumo. Condense periodicamente os turnos mais antigos em um resumo em vez de reenviá-los literalmente.
Para cargas de trabalho agênticas, como sessões de codificação ou pesquisa profunda, os agentes de codificação modernos lidam com isso automaticamente na sessão. O Claude Code, por exemplo, vem com compactação de contexto: quando a conversa se aproxima do limite, ele resume as mensagens mais antigas em uma versão condensada, mantendo os turnos recentes intactos. Os turnos subsequentes enviam apenas o resumo e o contexto recente de volta ao modelo.
O impacto na precificação é direto. Em APIs por token, a compactação limita o crescimento da entrada de cada chamada e o cache reduz o preço do prefixo repetido, de modo que o custo por turno permanece previsível em sessões longas. Em assinaturas de tarifa fixa como Claude Pro, ChatGPT Plus ou Kimi Moderato, a compactação amplia os limites de uso diários e semanais porque cada chamada carrega menos contexto. Uma sessão de codificação que, de outra forma, esgotaria um limite de taxa de 5 horas pode durar mais quando os turnos mais antigos são comprimidos.
A desvantagem é que qualquer forma de resumo é com perdas. O resumo pode omitir detalhes que se mostram importantes mais tarde, forçando o usuário a fornecê-los novamente
Máximo de tokens de saída
O máximo de tokens de saída limita o comprimento da resposta de um modelo. Embora muitas documentações mencionem que isso pode ser ajustado com o parâmetro max_tokens, é crucial revisar a documentação da API específica usada para identificar o parâmetro correto. Ele deve ser ajustado de acordo com as necessidades específicas:
Se definido muito baixo, pode resultar em saídas incompletas, fazendo o modelo cortar respostas antes de entregar a resposta completa.
Se definido muito alto, dependendo da temperatura (um parâmetro que controla a criatividade da resposta), pode levar a saídas desnecessariamente prolixas, tempos de resposta mais longos e custo maior.
Portanto, é um parâmetro que exige consideração cuidadosa para otimizar o uso de recursos, equilibrando qualidade da saída, custo e desempenho.
Tabela 3: Exemplos de prompts de entrada e contagens estimadas de tokens por tipo de conteúdo.
*Isso pressupõe que cada modelo produz respostas com um número igual de tokens de saída, embora a contagem de tokens para entrada e saída possa variar dependendo da tokenização de cada modelo; o número foi mantido constante aqui para cada modelo.
Combinar as faixas de tokens da Tabela 2 com as tarifas por token de um modelo resulta no custo esperado por tipo de conteúdo; os prompts de exemplo da Tabela 3 mostram os tamanhos de entrada e saída por trás dessas estimativas.
Usando vários modelos de linguagem
Um gateway de IA como a OpenRouter permite que o mesmo prompt seja enviado a vários modelos simultaneamente. As respostas, o consumo de tokens, o tempo de resposta e os preços podem então ser comparados para determinar qual modelo é mais adequado para a tarefa.
Figura 3: Interface mostrando um prompt enviado a vários Large Language Models por meio da OpenRouter.7
Benefícios e desafios
- Maior adaptabilidade e eficiência: A orquestração melhora a capacidade de resposta, permitindo avaliação em tempo real da eficiência do modelo e identificação de um modelo com boa relação custo-benefício e possíveis economias.
- Sensibilidade e otimização de prompts: Prompts idênticos podem gerar resultados muito diferentes entre modelos, exigindo engenharia de prompt adaptada a cada modelo para alcançar os resultados desejados, o que aumenta a complexidade de desenvolvimento e manutenção.
Mecânica de precificação e custos ocultos
Tokens de raciocínio vs. tokens de saída
Um número crescente de provedores introduziu modelos de raciocínio que gastam computação adicional para realizar raciocínio em cadeia de pensamento internamente. A OpenAI, a Anthropic e o Google cobram esses tokens de raciocínio como tokens de saída à taxa de saída padrão do modelo, de modo que o aumento de custo vem do volume, não de um preço por token mais alto.
Modelos como o GPT-5.5 Pro, o Claude Opus 5 com pensamento estendido ou o Gemini 3.1 Pro Deep Think geram rastros internos de raciocínio
mesmo quando você não os solicita explicitamente. Esses tokens internos contam para sua fatura e podem aumentar substancialmente o custo, especialmente em tarefas analíticas longas, como revisão jurídica, análise de dados ou raciocínio em várias etapas.
Isso torna essencial:
- Escolha um modelo de raciocínio apenas quando a precisão superar substancialmente o custo.
- Desative a cadeia de pensamento ou defina uma contagem máxima de tokens de saída menor quando possível.
- Teste a mesma tarefa em modelos sem raciocínio para ver se o desempenho é comparável por uma fração do preço.
Como um modelo de raciocínio pode emitir 10 a 30 vezes mais tokens de saída do que o mesmo prompt produziria sem raciocínio, é essencial entender essa distinção para o planejamento de custos.
Diferenças de precificação impulsionadas pela arquitetura
As arquiteturas de LLM influenciam diretamente a eficiência do modelo e, portanto, a precificação da API. Por exemplo:
- Modelos Mixture-of-Experts (MoE) ativam apenas um subconjunto de parâmetros por solicitação, reduzindo o custo computacional e permitindo que os provedores ofereçam tarifas por token mais baixas.
- A decodificação especulativa combina um modelo de rascunho menor com um maior, melhorando a vazão e reduzindo o custo para tarefas determinísticas.
- Variantes quantizadas (por exemplo, 4 bits ou 8 bits) podem realizar inferência com menor precisão, permitindo preços mais baixos para versões implantadas localmente ou hospedadas na nuvem.
Entender essas escolhas de arquitetura ajuda os usuários a prever não apenas diferenças de preços, mas também latência, qualidade e como um modelo escala sob cargas de trabalho de produção.
Custos operacionais além das tarifas de API
Embora a precificação por token seja o principal fator de custo, muitas implantações em produção incorrem em custos adicionais além do uso da API:
- Embeddings e bancos de dados vetoriais: Armazenar e recuperar vetores (por exemplo, Pinecone, Weaviate, ChromaDB) adiciona custo por consulta e por GB de armazenamento.
- Reordenação e modelos de pós-processamento: Muitas aplicações usam modelos menores para resumo, filtragem ou classificação antes de enviar uma solicitação final a um modelo maior.
- Camadas de cache: Provedores como a OpenAI agora oferecem cache no nível de prompt, mas a infraestrutura de cache local pode exigir computação adicional.
- Registro, monitoramento e auditoria: As empresas frequentemente incorrem em custos de monitoramento no nível de token, rastreamento de latência e auditorias de segurança.
Esses custos ocultos geralmente representam 20–40% das despesas operacionais totais com LLM e devem ser considerados ao avaliar estruturas de preços.
Considerações de precificação específicas para empresas
Muitos fornecedores de LLM cobram taxas adicionais por recursos de segurança e conformidade de nível empresarial, como:
- Implantações single-tenant
- Clusters de GPU dedicados
- SLAs aprimorados (por exemplo, garantias de uptime e latência)
- Residência de dados e controles regionais
- Modos de conformidade SOC2, HIPAA ou GDPR
Essas ofertas podem aumentar significativamente os custos, mas são essenciais para setores regulamentados, como saúde, finanças, serviços jurídicos e instituições públicas.
Tendências futuras na precificação de LLM
Três coisas definiram a precificação de LLM em 2025: os modelos de commodity ficaram baratos, quase todos os principais provedores lançaram uma assinatura de chat e os modelos de raciocínio permaneceram caros. A diferença é estrutural e tende a aumentar: um milhão de tokens de saída custa US$ 0.66 no DeepSeek V4-Flash (fora de pico) e US$ 180 no GPT-5.5 Pro. As questões interessantes a partir de 2026 são sobre o que muda além dessa base.
A cobrança por token dá lugar à precificação por tarefa
Os agentes agora impulsionam a maior parte do uso intenso de LLM. Uma única tarefa de codificação com o Claude Code, uma execução de pesquisa com o Cowork ou uma sessão de navegação autônoma com o Operator pode fazer centenas de chamadas sequenciais de modelo. A cobrança por token se torna imprevisível tanto para o comprador quanto para o vendedor.
Em resposta, os provedores estão trocando medidores de tokens por cotas de tarefas e sessões. A Moonshot estima de 300 a 1.200 solicitações do Kimi Code por janela de 5 horas a partir de um pool de créditos compartilhado. O Claude Code limita o uso por sessão de 5 horas, e não por mensagem. A MiniMax define as cotas do Token Plan como janelas rotativas de 5 horas e semanais dimensionadas pelo número de agentes de codificação paralelos. A Kimi define limites específicos por nível para subagentes paralelos do Agent Swarm.
Os harnesses de agentes entre provedores, como OpenClaw e MaxHermes, levam isso adiante. Eles ficam entre os usuários e várias APIs de modelos, e seus preços acompanham cada vez mais a vazão por tarefa, em vez de por milhão de tokens. Espere que mais provedores publiquem SKUs por tarefa ou por sessão no próximo ano.
Modelos de raciocínio pequenos migram para o dispositivo
O Apple Intelligence executa inferência no dispositivo para consultas rotineiras, recorrendo ao Private Cloud Compute apenas para solicitações complexas. Os PCs Copilot+ da Microsoft vêm com um modelo local. Os dispositivos Pixel executam o Gemini Nano. Modelos pequenos recentes, como o Phi-4 da Microsoft e o Gemma 3 da Google, têm capacidade de raciocínio em tamanhos que cabem na unidade de processamento neural de um telefone ou laptop.
A implicação para a precificação é um mercado consumidor de dois níveis. O trabalho rotineiro roda gratuito no token marginal no dispositivo. As assinaturas em nuvem competem no que o local não consegue fazer: raciocínio de fronteira, contexto grande, geração multimodal e orquestração de agentes. O piso gratuito local empurra as assinaturas somente de chat para zero, deixando os aplicativos incluídos como o verdadeiro motivo para pagar.
Contexto longo e memória decidem quem vence o trabalho agêntico
Tarefas agênticas de longo horizonte falham quando os modelos perdem o fio das instruções anteriores ou alucinam fatos que deveriam lembrar. O trabalho agêntico sustentado depende de três coisas: uma grande janela de contexto, memória persistente e uma baixa taxa de alucinação.
Em um ano, três capacidades de fronteira colapsaram para a linha de base. O Claude Opus 5, o Gemini 3.1 Pro, o GPT-5.6 e o Kimi K3 oferecem janelas de contexto de 1M tokens. Na OpenAI, na Anthropic, no Google e na DeepSeek, os acertos de cache custam de 3 a 10 por cento dos cache misses. O ChatGPT e o Claude agora incluem memória persistente em seus níveis gratuito.
Modelos agênticos especializados estão surgindo no topo desse mercado. Em junho de 2026, a Anthropic lançou o Claude Fable 5, um modelo de classe Mythos geralmente disponível8, com preço de US$ 10 para entrada e US$ 50 para saída por milhão de tokens, o dobro da taxa do Opus 5. O Fable 5 tem como alvo codificação agêntica, uso de computador e pesquisa de longo horizonte; o Claude Mythos 5, o mesmo modelo com salvaguardas removidas em algumas áreas, permanece limitado a parceiros aprovados pelo mesmo preço.
A questão competitiva muda de “quão grande é a janela de contexto” para “quão barata e confiavelmente o modelo consegue sustentar uma tarefa agêntica longa?” Os provedores que resolverem isso bem cobrarão prêmios. Aqueles que não resolverem perderão cargas de trabalho agênticas, independentemente do preço de token anunciado.
Perguntas frequentes
Acessar Modelos de linguagem grandes (LLMs) por meio de uma Application Programming Interface (API) concede acesso remoto a modelos de IA. Esse acesso está sujeito a uma taxa, geralmente chamada de “taxa de API”, cobrada pelo provedor de serviços. Essa taxa é uma consideração crítica ao integrar LLMs às suas aplicações.
Representa o custo associado a cada consulta, solicitação ou tarefa realizada por meio da API do provedor. Como as estruturas de preços podem variar amplamente (com base em fatores como uso de tokens, volume de chamadas de API, utilização de recursos ou modelos de assinatura), entender como os provedores calculam esses custos é essencial.
A precificação de LLM API pode ser complexa devido a fatores como consumo de tokens, comprimento de contexto e escolha do modelo. Os procedimentos de tokenização variam entre os modelos; alguns usam Byte-Pair Encoding (BPE), WordPiece ou SentencePiece, cada um influenciando como o texto é dividido em tokens e impactando a eficiência de custos. Entender essas diferenças ajuda a otimizar o uso e a precificação da API.
Os custos de LLM são determinados principalmente pelo uso de tokens (entrada e saída), pelo volume de chamadas de API e pelo modelo de precificação (por exemplo, por token ou assinatura).
Compare os preços de tokens de entrada e saída, os limites de janela de contexto e quaisquer taxas adicionais. Ferramentas como o OpenRouter permitem enviar o mesmo prompt a vários modelos e comparar diretamente resultados, uso de tokens, velocidade e preços. Considere o comprimento típico do seu conteúdo e os padrões de uso para estimar os custos gerais.
Os tokens de entrada são aqueles no prompt que você envia ao LLM, enquanto os tokens de saída são aqueles na resposta gerada. Para modelos de raciocínio, os tokens gerados durante o próprio processo de raciocínio também são contados como tokens de saída, impactando o custo final. Tanto a entrada quanto a saída contribuem para o custo geral.
Solicitações de texto maiores exigem mais processamento, aumentando o tempo de resposta e os custos. Otimize os tamanhos de entrada e use uma calculadora de precificação de LLM API para estimar contagens de tokens e gerenciar seu orçamento de forma eficaz.
A comunidade de LLM desenvolveu várias ferramentas e benchmarks para ajudar os usuários a entender e otimizar a precificação de LLM. Esses recursos geralmente incluem calculadoras e gráficos comparativos que oferecem insights sobre o poder e a eficiência de diferentes modelos.
Plataformas como Hugging Face e GitHub hospedam ferramentas e códigos desenvolvidos pela comunidade para analisar o desempenho e os custos dos modelos. Muitos serviços oferecem suporte à comunidade por meio de fóruns ou recursos de chat.
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{LLM Precificação: Top 15+ provedores comparados}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/llm-pricing}},
note = {AIMultiple. Acessado em 27 agosto 2026}
}Resultados e carimbos de data/hora de 177 pontos de dados. Baixe os dados resumidos exibidos nos gráficos e tabelas deste artigo como um arquivo ZIP contendo 4 arquivos CSV e um README.
Quer os dados granulares por trás disso? Assine o Premium
Registro de alterações
8 atualizaçõesAtualizada a descrição do gráfico na introdução.
Adicionado um gráfico à seção de tipos de preços LLM.
Removida a seção 'Compreendendo os preços do LLM'.
Expandida a seção "Implicações da janela de contexto" com estratégias para gerenciar o uso de tokens em conversas longas.
Adicionado ChatGPT Go à seção OpenAI.
Links de referência
O trabalho de Cem na AIMultiple foi citado por publicações globais líderes, incluindo Business Insider, Forbes, Morning Brew e Washington Post, por empresas globais como Deloitte e HPE, ONGs como o World Economic Forum e organizações supranacionais como a European Commission. [1], [2], [3], [4], [5]
Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas sobre suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.
Ele liderou a estratégia de tecnologia e as compras de uma operadora de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de deep tech Hypatos, que atingiu uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia líderes como TechCrunch e Business Insider.
Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou como engenheiro da computação pela Bogazici University e possui um MBA pela Columbia Business School.



Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.