Serviços
Contate-nos

LLM Parameters: GPT-5 High, Medium, Low and Minimal

Sıla Ermut
Sıla Ermut
atualizado em 26 jun. 2026

Alguns LLMs, como a família GPT-5 da OpenAI, vêm em diferentes versões (por exemplo, GPT-5, GPT-5-mini e GPT-5-nano) e com várias configurações de parâmetros, incluindo alta, média, baixa e mínima.

Abaixo, exploramos as diferenças entre essas versões de modelo reunindo seu desempenho em benchmarks e os custos para executá-los.

Preço vs. sucesso: Principais conclusões

Usamos a família GPT-5 em nossa análise. Utilizamos seis benchmarks em várias áreas, incluindo raciocínio, codificação, seguimento de instruções e matemática.

Loading Chart

Nossa análise revelou:

  • Em média, nos benchmarks, GPT-5 (high) e GPT-5 (medium) oferecem taxas de sucesso quase idênticas (65% vs. 64%), mas o GPT-5 (high) custa quase o dobro ($511 vs. $280). Eles são seguidos por GPT-5-mini (high), GPT-5 (low) e GPT-5-mini (medium), com taxas de sucesso de 62%, 61% e 60%, respetivamente, a preços muito mais baixos de $105, $90 e $28. Isto mostra que, ao aceitar uma queda de apenas ~5% na taxa de sucesso, as tarefas podem ser concluídas a um custo até 18 vezes menor, mudando do GPT-5 (high) para o GPT-5-mini (medium).
  • GPT-5-mini (high) supera o GPT-5 (low) em quase todos os benchmarks, e fá-lo ao mesmo custo ou a um custo inferior. No IFBench, as taxas de sucesso são de 75% vs. 67%; no AIME 2025, 97% vs. 83%; no Humanity's Last Exam, 20% vs. 18%; e no GPQA Diamond, 83% vs. 81%. Eles empatam no SciCode com 39%, mas o GPT-5-mini (high) ainda tem um custo mais baixo.
  • O modelo mais caro, GPT-5 (high), supera o segundo melhor desempenho em apenas três benchmarks e, mesmo nesses casos, a margem não é superior a 3%. Em todos os outros benchmarks, é superado por alternativas mais baratas.

Configurações de parâmetros alta-média-baixa-mínima

Embora os parâmetros de LLM sejam frequentemente descritos em termos de ajustes numéricos, eles também podem ser expressos como faixas qualitativas, como alta, média e baixa. Essas faixas não são padrões fixos; em vez disso, são categorias conceituais que descrevem quanta influência um parâmetro exerce na saída do modelo.

Usar esses três níveis ajuda a selecionar rapidamente as configurações para diferentes tarefas, dependendo do nível desejado de criatividade, determinismo ou extensão. Esses níveis são benéficos ao ajustar os parâmetros top-P, máximo de tokens e penalidades.

O parâmetro médio refere-se à versão regular (não parametrizada) de um modelo.

Configuração mínima:

  • Top-p / Top-k: Muito baixo (top-p ≈ 0.1–0.2, top-k = 1–5)
  • Máximo de tokens: Limite curto
  • Penalidades: Muito baixas ou nenhuma
  • Efeitos:
    • Altamente determinístico, resultados quase idênticos a cada execução.
    • Muito conciso, factual e rígido.
    • Ideal para código, matemática, consultas de banco de dados ou respostas de conformidade estrita.
    • Muito restrito, com baixa aleatoriedade, favorecendo a previsibilidade e a precisão.

Configuração baixa:

  • Top-p / Top-k: Baixo (top-p ≈ 0.3–0.5, top-k = 5–10)
  • Máximo de tokens: Curto a médio
  • Penalidades: Baixas a moderadas
  • Efeitos:
    • Maioritariamente determinístico, mas permite pequenas variações.
    • Reduz a repetição robótica em comparação com o mínimo.
    • Adequado para resumos, explicações estruturadas ou redação profissional com um estilo consistente.

Configuração média:

  • Top-p / Top-k: Moderado (top-p ≈ 0.7–0.9, top-k = 20–50)
  • Máximo de tokens: Comprimento médio
  • Penalidades: Moderadas, para evitar repetições, mas permitir alguma criatividade
  • Efeitos:
    • Equilibrado entre precisão e criatividade.
    • Produz respostas naturais que variam ligeiramente entre execuções.
    • Adequado para perguntas e respostas gerais, rascunhos e brainstorming.

Configuração alta:

  • Top-p / Top-k: Alto (top-p ≈ 0.95–1.0, top-k = 50–100)
  • Máximo de tokens: Limite grande para saídas mais longas
  • Penalidades: Médias a altas, incentivando a variedade e a novidade
  • Efeitos:
    • Resultados altamente criativos e diversos.
    • Menos previsível, com maior risco de alucinações.
    • Ideal para narração de histórias, ideação, roleplay e escrita criativa.

Para decidir qual nível usar, considere:

  • Tipo/propósito da tarefa: Se precisa de precisão (jurídico, médico, código, factual), escolha mínimo ou médio. Se precisa de criatividade, voz, novidade, alto pode ser melhor.
  • Tolerância a erros: Quão graves são as peculiaridades ou erros ocasionais? Se for baixa, evite alta aleatoriedade.
  • Restrições computacionais: Comprimentos de saída elevados e alta aleatoriedade geralmente requerem mais computação e memória.
  • Tamanho do modelo: Modelos maiores tendem a lidar melhor com alta aleatoriedade, enquanto modelos menores podem degradar-se significativamente sob configurações altas.
  • Comprimento de saída desejado: Textos gerados mais longos podem divagar, pelo que alta aleatoriedade combinada com grande comprimento é mais arriscado.

GPT-5

GPT-5 equilibra maior capacidade de raciocínio com velocidade média, tornando-o adequado para tarefas complexas e de múltiplas etapas, onde a precisão e a adaptabilidade são cruciais.

  • Janela de contexto: 400,000
  • Máximo de tokens de saída: 128,000
  • Data limite de conhecimento: 30 de setembro de 2024
  • Raciocínio: Superior, com suporte a tokens de raciocínio

Preços (por 1M tokens)

  • Entrada: $1.25
  • Entrada em cache: $0.125
  • Saída: $10.00

Modalidades

  • Texto: entrada e saída
  • Imagem: apenas entrada
  • Áudio: não suportado

GPT-5 mini

GPT-5 mini é uma versão mais pequena, rápida e acessível do GPT-5. Mantém uma forte capacidade de raciocínio, sendo mais adequado para tarefas bem definidas.

  • Janela de contexto: 400,000
  • Máximo de tokens de saída: 128,000
  • Data limite de conhecimento: 31 de maio de 2024
  • Funcionalidades: Suporta pesquisa na web, pesquisa de ficheiros e interpretador de código.

Preços por 1M tokens:

  • Entrada: $0.25
  • Entrada em cache: $0.025
  • Saída: $2.00

GPT-5 nano

GPT-5 nano é a opção mais rápida e barata, projetada para tarefas leves, como classificação e sumarização.

  • Janela de contexto: 400,000
  • Máximo de tokens de saída: 128,000
  • Data limite de conhecimento: 31 de maio de 2024
  • Funcionalidades: Suporta pesquisa de ficheiros, geração de imagens e interpretador de código (mas não pesquisa na web).

Preços por 1M tokens:

  • Entrada: $0.05
  • Entrada em cache: $0.005
  • Saída: $0.40

Funcionalidades da série GPT-5

A série GPT-5 introduz várias capacidades que melhoram o controlo, a formatação e a eficiência. Estas funcionalidades aplicam-se ao GPT-5, GPT-5 Mini e GPT-5 Nano.

Parâmetro de verbosidade

O parâmetro de verbosidade permite que os programadores influenciem o nível de detalhe nos resultados do modelo sem modificar o prompt.
Aceita três valores:

  • Baixo: resultados curtos e concisos
  • Médio: resultados equilibrados (padrão)
  • Alto: resultados detalhados adequados para explicação, documentação ou revisão

Maior verbosidade leva a respostas mais longas e maior uso de tokens de saída.

Chamada de função de forma livre

A série GPT-5 suporta chamadas de ferramentas personalizadas que aceitam saída de texto bruto em vez de JSON estruturado. Isto torna possível gerar código, consultas SQL ou texto de configuração que é passado diretamente para runtimes externos, tais como:

  • Sandboxes de código
  • Motores de SQL
  • Ambientes de shell
  • Sistemas de configuração

O tipo de ferramenta personalizada não suporta chamadas de ferramentas paralelas. Destina-se a situações em que o texto natural é preferível a um esquema JSON estrito.

Suporte a gramática livre de contexto (CFG)

Os modelos podem produzir texto restrito por uma gramática definida com sintaxe Lark ou regex. Isto garante que o texto gerado segue regras estruturais estritas. Os casos de uso comuns incluem:

  • Impor dialetos SQL específicos
  • Restringir timestamps ou identificadores
  • Validar formatos de configuração

Ao usar CFGs, os programadores definem terminais e regras que descrevem o conjunto de strings aceitáveis. O modelo produz apenas saídas que correspondem a essas regras.

Modo de raciocínio mínimo

O modo de raciocínio mínimo reduz ou remove os tokens de raciocínio. Isto reduz a latência e melhora o tempo até ao primeiro token.
É adequado para tarefas como:

  • Classificação
  • Reescritas curtas
  • Extração estruturada
  • Operações básicas de formatação

Quando nenhuma configuração de raciocínio é fornecida, o nível de esforço padrão é médio.

Principais diferenças

Os três modelos diferem principalmente na profundidade de raciocínio, velocidade e custo. As novas funcionalidades podem ser usadas em todos os modelos, mas o seu impacto varia consoante o modelo.

Raciocínio

  • GPT-5 fornece a capacidade de raciocínio mais forte. É apropriado para problemas complexos de múltiplos passos em codificação, análise científica ou suporte à decisão.
  • GPT-5 mini oferece raciocínio forte para prompts estruturados com limites de tarefa previsíveis.
  • GPT-5 nano tem desempenho de raciocínio moderado e funciona melhor em tarefas que não requerem análise profunda.
  • O modo de raciocínio mínimo pode ser usado com todos os modelos e fornece o benefício mais significativo para o GPT-5 nano e GPT-5 mini, dada a sua vantagem de velocidade.

Velocidade

  • GPT-5 nano é a opção mais rápida e é eficaz para cargas de trabalho em tempo real ou em grande escala.
  • GPT-5 mini equilibra velocidade com raciocínio, tornando-o adequado para cargas de trabalho de produção regulares.
  • GPT-5 é mais lento porque realiza mais raciocínio interno, mas isso resulta numa saída mais precisa.
  • O modo de raciocínio mínimo pode reduzir ainda mais a latência, particularmente para o nano.

Custo

  • GPT-5 nano tem o menor custo por token. É preferido para tarefas de alto volume, como classificação em lote ou sumarização.
  • GPT-5 mini situa-se na gama média, oferecendo um equilíbrio entre capacidade e custo.
  • GPT-5 é o modelo mais caro e é tipicamente usado quando a precisão e a consistência têm prioridade.
  • As configurações de verbosidade influenciam o custo porque maior verbosidade produz mais tokens de saída.
Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

O que são parâmetros de LLM?

Os parâmetros de LLM são configurações que influenciam como os grandes modelos de linguagem (LLMs) geram texto durante a inferência. Estes controlos de parâmetros não modificam os pesos aprendidos de um modelo pré-treinado. Em vez disso, moldam a forma como o modelo de linguagem faz a amostragem de uma distribuição de probabilidade sobre os tokens prováveis ao gerar respostas.

Os grandes modelos de linguagem são sistemas de redes neurais, tipicamente construídos sobre a arquitetura do modelo transformer. Durante o treino, o modelo aprende valores numéricos chamados pesos e vieses. Os pesos representam a importância atribuída a diferentes entradas, permitindo que o modelo capture relações entre palavras, conceitos e contexto. Os vieses são valores constantes adicionados dentro das camadas que ajudam a ativar neurónios sob certas condições. Together, estes valores definem a capacidade do modelo de reconhecer padrões complexos na linguagem.

Os parâmetros de inferência, por outro lado, operam após o treino. Eles moldam a forma como o conhecimento aprendido pelo modelo é usado, sem alterar os pesos subjacentes. Ajustar os parâmetros de LLM permite que os utilizadores influenciem a diversidade, previsibilidade, repetição e comprimento da saída, o que é essencial para otimizar o desempenho do modelo em tarefas específicas, como escrita criativa, geração estruturada ou explicações técnicas.

Os parâmetros-chave incluem amostragem top-p (nucleus sampling), máximo de tokens, penalidade de frequência, penalidade de presença e sequências de paragem. Together, estes parâmetros de amostragem controlam a saída gerada enquanto equilibram a qualidade da saída, o custo computacional e a eficiência da inferência.

Tamanho do modelo, parâmetros e fundamentos do treino

O número de parâmetros em grandes modelos de linguagem pode chegar aos milhares de milhões. Modelos maiores têm tipicamente uma capacidade mais forte de lidar com linguagem com nuances, dependências de longo alcance e raciocínio complexo. Este desempenho melhorado do modelo tem o custo de maiores requisitos de poder computacional, tanto durante o treino como na inferência.

Modelos mais pequenos requerem menos recursos computacionais e oferecem melhor eficiência computacional, mas podem ter dificuldades com padrões mais complexos ou janelas de contexto mais longas. A escolha entre modelos maiores e modelos mais pequenos depende da tarefa, da latência aceitável e da infraestrutura disponível. Veja leis de escala de LLM para saber como os investigadores de IA avaliam o efeito do tamanho do modelo, qualidade dos dados e estratégia de treino.

Vários parâmetros de treino moldam a forma como um modelo aprende antes da inferência:

  • Tamanho do lote (Batch size) refere-se ao número de amostras de treino processadas antes de o modelo atualizar os seus pesos. Tamanhos de lote maiores melhoram a eficiência do treino, mas aumentam o uso de memória.
  • Taxa de aprendizagem (Learning rate) controla a rapidez com que o modelo ajusta os seus pesos e vieses. Valores mais altos aceleram a aprendizagem, mas arriscam instabilidade, enquanto valores mais baixos promovem uma convergência estável.
  • Hiperparâmetros definem configurações externas, como tamanho do modelo, tamanho do lote e taxa de aprendizagem, moldando o processo geral de treino.

Após o pré-treino, o fine-tuning e o alinhamento são essenciais. O fine-tuning adapta um modelo pré-treinado a dados ou tarefas de domínio específico, enquanto o alinhamento garante que o texto gerado reflete a intenção humana.

O fine-tuning eficiente em termos de parâmetros (PEFT) melhora a eficiência computacional ao congelar a maioria dos parâmetros e atualizar apenas um pequeno subconjunto de parâmetros relevantes para a tarefa.

Amostragem Top-p

A amostragem top-p, também conhecida como nucleus sampling, limita a seleção de tokens ao menor grupo cuja probabilidade cumulativa excede um determinado limiar p. Em vez de selecionar de um número fixo de tokens, o modelo escolhe dinamicamente de entre os tokens prováveis que, juntos, representam a massa de probabilidade especificada.

  • Valores mais baixos (por exemplo, p = 0.5) restringem a amostragem a um conjunto estreito dos tokens de maior probabilidade, resultando em texto coerente mas menos variado.
  • Valores mais altos (por exemplo, p = 0.9) permitem a amostragem de um grupo mais amplo, aumentando a diversidade da saída, mas também o risco de divagar do tópico.

Amostragem Top k

A amostragem top k restringe a escolha do modelo aos k tokens de maior probabilidade para o próximo passo na geração de texto. Ao estreitar o conjunto de candidatos, este parâmetro afeta diretamente a previsibilidade e a variedade.

  • Valores top-k mais baixos limitam a seleção a um pequeno conjunto de tokens altamente prováveis, produzindo saídas mais previsíveis e focadas.
  • Valores mais altos expandem o conjunto de candidatos, aumentando a variabilidade e suportando uma linguagem mais diversa.

Enquanto a amostragem top-p se adapta dinamicamente com base na massa de probabilidade, a amostragem top-k usa um ponto de corte fixo. As duas são frequentemente comparadas durante a avaliação do modelo para determinar as configurações ideais para tarefas específicas.

Máximo de tokens (O número de tokens)

O parâmetro max_tokens define o número máximo de tokens que o modelo pode gerar numa única resposta. Determina diretamente o comprimento da saída e influencia o custo computacional.

  • Valores máximos mais baixos impõem respostas concisas, mas podem cortar detalhes importantes.
  • Valores mais altos permitem explicações mais detalhadas, mas requerem mais recursos computacionais e aumentam o tempo de inferência.

O número máximo de tokens é restringido pela janela de contexto, que inclui tanto os dados de entrada como a saída gerada. Se o número combinado de tokens exceder o limite de tokens do modelo, a geração será interrompida, independentemente da configuração de máximo de tokens.

Parâmetro de penalidade de frequência

A penalidade de frequência ajusta a probabilidade dos tokens com base na frequência com que já apareceram no texto gerado.

  • Valores positivos reduzem a repetição, melhorando a qualidade da saída em respostas mais longas.
  • Valores negativos incentivam a reutilização, o que pode ser útil para documentos que requerem terminologia consistente.

Penalidades excessivamente altas podem prejudicar a coerência, pois a repetição natural é frequentemente necessária para um texto semelhante ao humano. Este parâmetro é mais eficaz ao otimizar o desempenho do modelo para geração de texto de formato longo.

Penalidade de presença

A penalidade de presença reduz a probabilidade de tokens que apareceram pelo menos uma vez, independentemente da frequência. Isto incentiva o modelo a introduzir novas ideias.

  • Valores positivos promovem novidade e exploração, o que é útil em brainstorming e escrita criativa.
  • Valores negativos reforçam os termos existentes, o que pode ajudar em saídas estruturadas ou restritas.

A penalidade de presença é um controlo valioso para guiar a diversidade de ideias, mas deve ser aplicada com cuidado para evitar a evitação não natural de termos-chave.

Sequências de paragem

As sequências de paragem definem tokens ou strings específicos que sinalizam ao modelo para interromper a geração. São comummente usadas em aplicações estruturadas.

  • Úteis para impor templates em sistemas de diálogo ou geração de código.
  • Ajudam a controlar o comprimento da saída e a evitar continuações irrelevantes.

As sequências de paragem melhoram a previsibilidade nas saídas de texto geradas sem depender apenas dos limites de tokens.

Semente e determinismo

Alguns sistemas permitem que os utilizadores especifiquem uma semente aleatória, garantindo que os mesmos dados de entrada e configurações de parâmetros produzem a mesma saída gerada.

  • Útil para avaliação e teste de modelos.
  • Ajuda a comparar diferentes configurações de parâmetros sem que a variação aleatória afete os resultados.

A geração determinística suporta a reprodutibilidade, embora as saídas exatas possam ainda variar entre diferentes modelos de IA ou ambientes de implementação.

Veja mais dos nossos benchmarks e insights baseados em dados na Pesquisa Google.
GoogleAdicionar como fonte preferencial

Diferenças entre parâmetros-chave

Compreender como os parâmetros-chave diferem ajuda ao ajustar os parâmetros de LLM para obter resultados ideais.

  • Penalidade de frequência vs penalidade de presença: A penalidade de frequência escala com a frequência com que um token aparece, enquanto a penalidade de presença se aplica uma vez após a primeira aparição de um token.
  • Amostragem Top k vs top p: Top k limita a seleção a um número fixo de tokens, enquanto top p seleciona dinamicamente os tokens com base na probabilidade cumulativa.
  • Máximo de tokens vs janela de contexto: O máximo de tokens limita o comprimento da saída, enquanto a janela de contexto é um limite superior fixo que cobre tanto os tokens de entrada como de saída.

O ajuste cuidadoso destes parâmetros permite que os profissionais equilibrem a qualidade da saída, a eficiência computacional e o desempenho do LLM em aplicações como geração aumentada por recuperação, tarefas analíticas e geração de texto aberta.

Cite esta pesquisa

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Sıla Ermut and Şevval Alper (2026) - "LLM Parameters: GPT-5 High, Medium, Low and Minimal". Publicado on-line em AIMultiple.com. Acessado em 26 Junho 2026, em: https://aimultiple.com/llm-parameters [Recurso on-line]

Ermut, S., & Alper, Ş. (2026, 26 Junho). LLM Parameters: GPT-5 High, Medium, Low and Minimal. AIMultiple. https://aimultiple.com/llm-parameters

@misc{ermut2026,
  author = {Ermut, Sıla and Alper, Şevval},
  title  = {{LLM Parameters: GPT-5 High, Medium, Low and Minimal}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/llm-parameters}},
  note   = {AIMultiple. Acessado em 26 Junho 2026}
}
Sıla Ermut
Sıla Ermut
Analista do Setor
Sıla Ermut é analista do setor na AIMultiple com foco em marketing por email e vídeos de vendas. Anteriormente, trabalhou como recrutadora em empresas de gerenciamento de projetos e consultoria. Sıla possui mestrado em Psicologia Social e bacharelado em Relações Internacionais.
Ver perfil completo
Pesquisado por
Şevval Alper
Şevval Alper
Pesquisador de IA
Şevval é analista da AIMultiple, especializada em ferramentas de codificação de IA, agentes de IA e tecnologias quânticas.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450