Serviços
Contate-nos

Teste de Benchmark de Análise de Sentimentos: ChatGPT, Claude e Qwen

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
atualizado em 1 set. 2026

Conseguir uma rotulagem precisa de emoções e sentimentos, bem como detectar ironia, ódio e ofensividade, continua sendo um desafio, exigindo mais testes e refinamento. Testamos 10 large language models em cinco tarefas de sentimento: emoção, ódio, ironia, ofensividade e sentimento. Classificamo-los pela acurácia média nas cinco.

Os resultados destacam distinções claras entre as ferramentas:

  • GPT 5.5 alcançou a melhor acurácia geral (80%),
  • Minimax M2.7 (72%) registrou o desempenho geral mais baixo.

Resultados experimentais: benchmark de análise de sentimentos

Loading Chart

Ranking: As ferramentas são classificadas de acordo com suas taxas de acurácia médias agregadas em todas as categorias testadas: emoção, ódio, ironia, ofensividade e sentimento.

Para mais detalhes, leia a metodologia do nosso benchmark.

Acurácia geral

Combinando todas as tarefas, as pontuações totais de acurácia dos models oferecem uma visão holística de suas capacidades:

  • GPT 5.5 ficou em primeiro lugar com 80%. Nunca ficou abaixo de 73% em nenhuma tarefa, o que o tornou o model mais consistente do teste.
  • Claude Sonnet 4.6 ficou em segundo lugar com 79%. Obteve o maior resultado isolado do benchmark: 82% em detecção de ódio.
  • Qwen 3.6 Plus e ChatGPT 5.4 mini empataram em terceiro lugar com 78%. O ChatGPT 5.4 mini é o menor model perto do topo, mas liderou a detecção de ofensividade e empatou em primeiro lugar em ironia.
  • Kimi k2.6 marcou 77%, com resultados estáveis e nenhuma tarefa claramente fraca.
  • Gemini 3.1-pro e GLM 5.1 empataram com 76%. O Gemini 3.1-pro empatou em primeiro lugar na detecção de emoção, mas ficou mal classificado em ódio.
  • Claude Opus 4.8 marcou 74%. Foi prejudicado pela detecção de emoção (68%), sua categoria mais fraca.
  • Gemini 3.5 Flash marcou 73%. Seu resultado em ódio (65%) foi o mais baixo nessa tarefa.
  • Minimax M2.7 ficou em último lugar com 72%. Obteve as menores pontuações em emoção, ironia e ofensividade.

1. Detecção de emoção

A detecção de emoção é uma tarefa desafiadora na análise de sentimentos, geralmente exigindo que os models discernam pistas sutis na linguagem. Veja como os models se saíram:

  • GPT 5.5 e Gemini 3.1-pro empataram em primeiro lugar com 80%.
  • Qwen 3.6 Plus veio em seguida com 79%.
  • Kimi k2.6 marcou 78%, e GLM 5.1 marcou 77%.
  • ChatGPT 5.4 mini alcançou 76%, e Claude Sonnet 4.6 alcançou 75%.
  • Gemini 3.5 Flash marcou 73%.
  • Claude Opus 4.8 marcou 68%.
  • Minimax M2.7 marcou a menor pontuação, 66%.

A detecção de emoção teve uma ampla dispersão: 14 pontos entre os models do topo e da base. Isso a torna uma das duas tarefas que mais claramente separam os models.

2. Detecção de ódio

Detectar conteúdo de ódio é crucial para a classificação de sentimento no Twitter e outras tarefas de moderação. Os resultados revelaram diferenças notáveis:

  • Claude Sonnet 4.6 liderou com 82%, a maior pontuação isolada do benchmark.
  • GPT 5.5 veio logo atrás com 80%.
  • Qwen 3.6 Plus marcou 77%.
  • Kimi k2.6 e GLM 5.1 ambos marcaram 76%.
  • Minimax M2.7 marcou 75%.
  • ChatGPT 5.4 mini marcou 72%.
  • Gemini 3.1-pro e Claude Opus 4.8 ambos marcaram 71%.
  • Gemini 3.5 Flash marcou a menor pontuação, 65%.

A detecção de ódio teve a maior dispersão de todas as tarefas: 17 pontos. Se moderação é o seu caso de uso, escolha a partir do topo desta coluna em vez do ranking médio.

3. Detecção de ironia

A detecção de ironia é uma área onde a avaliação semântica desempenha um papel fundamental. Ambos os models apresentaram alto desempenho no benchmark de análise de sentimentos, mas o GPT-4o emergiu como o líder claro:

  • GPT 5.5, Claude Sonnet 4.6, Qwen 3.6 Plus e ChatGPT 5.4 mini empataram em primeiro lugar com 91%.
  • Gemini 3.1-pro, GLM 5.1 e Gemini 3.5 Flash marcaram 87% cada.
  • Claude Opus 4.8 marcou 86%, e Kimi k2.6 marcou 85%.
  • Minimax M2.7 marcou a menor pontuação, 82%.

Esta foi a tarefa mais fácil do conjunto. Mesmo a menor pontuação foi 82%. Para trabalhos que dependem de captar ironia ou sarcasmo, qualquer um desses models é um ponto de partida seguro.

4. Detecção de ofensividade

Detectar conteúdo ofensivo é fundamental para manter comunidades online saudáveis. Os desempenhos dos models no benchmark de análise de sentimentos nesta tarefa foram os seguintes:

  • ChatGPT 5.4 mini liderou com 75%.
  • GPT 5.5 marcou 73%, e Claude Sonnet 4.6 marcou 72%. Claude Opus 4.8 marcou 70%.
  • Qwen 3.6 Plus, Kimi k2.6, Gemini 3.1-pro e GLM 5.1 todos marcaram 69%.
  • Gemini 3.5 Flash marcou 68%.
  • Minimax M2.7 marcou a menor pontuação, 65%.

Nenhum model alcançou 76% na métrica de ofensividade. Todo o grupo variou de 65% a 75%. O contexto impulsiona essa tarefa, e os casos limítrofes do dataset confundem todos os models.

5. Análise de sentimentos

A tarefa abrangente de análise de sentimentos concentrou-se em classificar dados em sentimentos positivos, negativos e neutros. As pontuações de acurácia para esta tarefa variaram significativamente entre os models:

  • GPT 5.5, Qwen 3.6 Plus, ChatGPT 5.4 mini e Gemini 3.1-pro empataram em primeiro lugar com 75%.
  • Kimi k2.6, Claude Opus 4.8, Gemini 3.5 Flash e Minimax M2.7 todos marcaram 74%.
  • Claude Sonnet 4.6 marcou 73%.
  • GLM 5.1 marcou a menor pontuação, 72%.

A faixa total foi de 3 pontos, de 72% a 75%. Nenhum model lidou bem com o sentimento de três classes. Se o projeto precisa de rótulos confiáveis de positivo, negativo e neutro, nenhum desses models está pronto para rodar sem uma verificação humana.

Observações e insights

As tarefas não são igualmente difíceis

Ironia foi fácil para todos os models (82% a 91%). Sentimento e ofensividade foram difíceis para todos os models, com todas as pontuações entre 65% e 75%. Escolha um model para a tarefa que você realmente tem, não pela sua classificação média.

Emoção e ódio separam melhor os models

Essas duas tarefas tiveram as maiores lacunas de pontuação: 14 e 17 pontos. Se o seu caso de uso é rastreamento de emoção ou moderação, a escolha do model importa mais aqui do que em qualquer outro lugar.

Uma média alta pode esconder uma tarefa fraca

O GPT 5.5 ficou em primeiro lugar no geral e permaneceu forte em todos os aspectos. Mas o Claude Opus 4.8 ficou em oitavo lugar no geral, marcando 86% em ironia. Leia a coluna da sua tarefa, não a média.

Dataset e metodologia do benchmark

Dataset de análise

Usamos o dataset TweetEval, criado para análise de sentimentos em mensagens reais do Twitter.1 Ele faz parte do trabalho da Association for Computational Linguistics (ACL) sobre avaliação semântica. O dataset vem com conjuntos de treinamento e teste pré-rotulados em cinco tipos de tarefa:

  • Detecção de emoção: nomear o sentimento em um tweet, como raiva, alegria, otimismo ou tristeza. Exemplo de tweet e rótulo: “#Deppression é real. Parceiros de pessoas #depressed realmente não entendem a profundidade com que nos afetam. Adicione #anxiety e piora ainda mais” é rotulado como triste.2
  • Detecção de ódio: sinalizar discurso de ódio em um tweet. Exemplo de tweet e rótulo: “Trump quer deportar estrangeiros ilegais com ‘sem juízes ou processos judiciais’ #MeToo Estou totalmente a favor dessa ação A ideia de que alguém que entra ilegalmente em um país e não demonstra respeito pelas suas leis deva ser protegido pelas mesmas leis é absurda! #DeportThemAll” é rotulado como odioso.3
  • Detecção de ironia: identificar intenção irônica. Exemplo de tweet e rótulo: “Pessoas que dizem a pessoas com ansiedade para ‘simplesmente parar de se preocupar com isso’ são meu tipo favorito de gente #not #educateyourself” é rotulado como ironia.4
  • Detecção de ofensividade: classificar tweets com linguagem ofensiva. Exemplo de tweet e rótulo: “#ConstitutionDay É muito estranho que os conservadores da alt right digam que estamos arruinando a constituição porque queremos #GunControlNow, mas são eles que estão arruinando a constituição ao ficarem chateados porque estrangeiros que não são brancos estão vindo para esta terra querendo viver” é rotulado como ofensivo.5
  • Classificação de sentimento: atribuir um rótulo positivo, negativo ou neutro. Exemplo de tweet e rótulo: “Mal posso esperar para experimentar isto – Google Earth VR – este negócio é realmente o futuro da exploração….” é rotulado como positivo.6

Essas tarefas se alinham com abordagens de aprendizado de máquina do mundo real, tornando-as ideais para avaliar os resultados experimentais dos dois models.

Models testados

Testamos 10 large language models, todos por meio da OpenRouter API para que a configuração fosse a mesma para cada um:

GPT 5.5, ChatGPT 5.4 mini, Claude Sonnet 4.6, Claude Opus 4.8, Gemini 3.1-pro, Gemini 3.5 Flash, Qwen 3.6 Plus, Kimi k2.6, GLM 5.1 e Minimax M2.7.

Configuração experimental

Mantivemos todas as configurações iguais em todos os 10 models.

Amostra

Usamos os primeiros 200 tweets do conjunto de teste oficial de cada tarefa, com os rótulos gold do próprio dataset. Os mesmos 200 tweets foram enviados a todos os models, para que a comparação seja justa.

Criação de prompts

Usamos prompts zero-shot: uma instrução simples de tarefa e o tweet bruto, sem exemplos resolvidos. O model retornou um rótulo e nada mais.

Escrevemos os prompts para que não entregassem nada. Não nomeamos o benchmark, não chamamos o model de “anotador” nem sugerimos que ele estava sendo avaliado. Nomear o teste pode mudar como um model responde, então o omitimos. O prompt de emoção, por exemplo, pedia que o model escolhesse uma entre raiva, alegria, otimismo ou tristeza e respondesse com essa palavra.

Configurações de geração

Definimos a temperatura como 0, o que torna a saída tão estável quanto o model permite. Definimos o limite de token como 4.096. O limite alto é importante para models que raciocinam: com um limite pequeno, eles gastam todo o orçamento em raciocínio oculto e retornam uma resposta em branco. O espaço extra permite que terminem o raciocínio e ainda imprimam o rótulo. Models que não raciocinam respondem em uma palavra curta, então o limite não custa nada nesse caso.

Leitura das respostas

Mapeamos cada resposta para um rótulo em etapas: primeiro uma correspondência exata, depois uma lista curta de sinônimos (por exemplo, “feliz” mapeia para alegria) e, em seguida, uma busca por qualquer rótulo dentro de uma resposta mais longa. Respostas que não conseguimos ler foram contadas como erradas.

Métrica

A pontuação de cada tarefa não é acurácia bruta. Usamos a métrica que os autores do TweetEval definiram para cada tarefa:

  • Emoção: macro-F1
  • Sentimento: macro-recall
  • Ódio: macro-F1
  • Ironia: F1 da classe de ironia
  • Ofensividade: macro-F1

Macro-F1 e macro-recall ponderam cada classe igualmente, independentemente da frequência com que aparece. Essa é a escolha certa aqui porque classes como ódio ou ironia são raras, e a acurácia simples permitiria que um model parecesse bom ao escolher sempre o rótulo comum. A coluna de média é a média dessas cinco pontuações.

Confiabilidade

Alguns models atingiram limites de taxa durante a execução e perderam algumas chamadas. Reexecutamos as linhas com falha em baixa velocidade para evitar os limites e repetimos isso até que nada falhasse. Os resultados finais não têm chamadas com falha nem respostas ilegíveis.

Limitações da configuração

Usamos uma fatia de 200 tweets de cada conjunto de teste, não o conjunto completo, então esses números não correspondem ao leaderboard publicado do TweetEval. A comparação entre nossos 10 models ainda é válida, porque todos os models viram os mesmos tweets.

A fatia de 200 tweets é fixa, não aleatória, portanto é reproduzível, mas não é uma amostra aleatória. Cada tarefa também usou um único prompt com temperatura 0. Um prompt diferente, ou exemplos few-shot, mudaria os números absolutos.

Usamos datasets com rótulos gold públicos. Isso traz risco de contaminação, em que um model já tenha visto os rótulos durante o treinamento. Não podemos descartar isso, mas as pontuações ficaram bem abaixo do perfeito, o que sugere que não foi um fator importante. Para a próxima versão, planejamos testar tweets cujos rótulos não foram publicados.

Como a amostra é de 200 tweets por tarefa, pequenas diferenças carregam ruído amostral. Tratamos uma diferença de um a dois pontos como empate, em vez de ranking.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Qual model escolher

As pontuações completas estão na tabela acima. Esta seção é mais curta: ela mapeia necessidades comuns para o model que se encaixa.

  • Melhor escolha geral: GPT 5.5. Ficou em primeiro lugar e permaneceu forte em todas as tarefas, por isso é a opção padrão segura quando seu trabalho combina várias tarefas de sentimento.
  • Moderação de conteúdo e discurso de ódio: Claude Sonnet 4.6. Obteve a maior pontuação de todos os models em ódio. O GPT 5.5 é um segundo colocado próximo.
  • Detecção de linguagem ofensiva com orçamento limitado: ChatGPT 5.4 mini. Liderou em ofensividade e igualou as melhores pontuações de ironia, o que é raro para um model menor e mais barato.
  • Rastreamento de emoção e sentimento: Gemini 3.1-pro ou Qwen 3.6 Plus. Ambos estão no topo dessas duas colunas. Use-os para trabalhos de humor e opinião, em vez de moderação.
  • Ironia e sarcasmo: quase qualquer model aqui. As pontuações variaram de 82% a 91%, então essa tarefa raramente orienta a escolha. Escolha o model mais barato que atenda às suas outras necessidades.
  • Uso estável e de propósito geral: Kimi k2.6. Nenhuma tarefa de destaque, mas também nenhuma fraca.
  • Use com cuidado em trabalhos de alto risco: Gemini 3.5 Flash e Minimax M2.7 ficaram na parte inferior. O Gemini 3.5 Flash foi o mais fraco em discurso de ódio, então evite-o especialmente para moderação.

Um lembrete que percorre tudo isso: leia a coluna da sua tarefa, não a média. Um model pode ficar no meio da tabela no geral e ainda liderar a única tarefa que importa para você.

Leitura adicional

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Ezgi Arslan, PhD. (2026) - "Teste de Benchmark de Análise de Sentimentos: ChatGPT, Claude e Qwen". Publicado on-line em AIMultiple.com. Acessado em 1 Setembro 2026, em: https://aimultiple.com/sentiment-analysis-benchmark [Recurso on-line]

PhD., E. A. (2026, 1 Setembro). Teste de Benchmark de Análise de Sentimentos: ChatGPT, Claude e Qwen. AIMultiple. https://aimultiple.com/sentiment-analysis-benchmark

@misc{phd2026,
  author = {PhD., Ezgi Arslan,},
  title  = {{Teste de Benchmark de Análise de Sentimentos: ChatGPT, Claude e Qwen}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/sentiment-analysis-benchmark}},
  note   = {AIMultiple. Acessado em 1 Setembro 2026}
}

Registro de alterações

6 atualizações
  1. 2025

    Adicionado ChatGPT 5.o, Claude 4.5 e Grok 4 à seção Resultados experimentais: benchmark de análise de sentimento.

  2. Substituídos os modelos na seção de metodologia de análise.

  3. Adicionados ChatGPT 4.5, Claude 3.7 e DeepSeek V3 à lista de modelos testados.

  4. Substituído ChatGPT 4.0 por GPT-4o na seção de metodologia.

  5. 2024

    Removida a seção "Precisão geral" do final do documento.

  6. Removida a seção "Conjunto de dados de benchmark e metodologia".

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Analista da Indústria
Ezgi possui um doutorado em Administração de Empresas com especialização em finanças e atua como Analista da Indústria na AIMultiple. Ela conduz pesquisas e insights na interseção entre tecnologia e negócios, com experiência em sustentabilidade, análise de pesquisas e de sentimento, aplicações de agentes de IA em finanças, otimização de mecanismos de resposta, gerenciamento de firewall e tecnologias de compras.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450