Serviços
Contate-nos

Pesquisa Aprofundada de IA: Claude vs ChatGPT vs Grok

Cem Dilmegani
Cem Dilmegani
atualizado em 22 jun. 2026

A pesquisa aprofundada de IA oferece aos utilizadores uma gama mais ampla de resultados de pesquisa do que os motores de busca de IA. Para ver o desempenho de diferentes ferramentas de pesquisa aprofundada de IA, introduzimos três novos benchmarks:

Bench DR-50 (Deep Research 50), que avalia ferramentas em 50 perguntas abrangendo seis tipos de perguntas, Bench DR-2T (Deep Research 2 Task), que avalia ferramentas através de duas tarefas de investigação reais focadas na qualidade da geração de relatórios, cobertura de fontes e apresentação estruturada de dados, e Agente vs Modelos de Pesquisa Aprofundada, que demonstra que os agentes são mais baratos do que os modelos de pesquisa aprofundada, proporcionando níveis de precisão comparáveis.

Benchmark de Agentes vs Modelos de Pesquisa Aprofundada

Loading Chart

Os agentes de IA como o Claude Code e o OpenAI Codex podem pesquisar na web, aceder a páginas específicas e extrair dados através de chamadas de ferramentas direcionadas. Testámos se esta abordagem agêntica iguala o desempenho dos modelos de pesquisa aprofundada especialmente concebidos para tarefas de investigação factual. Seis ferramentas foram avaliadas em 5 tarefas com 33 pontos de verificação de verdade absoluta, abrangendo eventos empresariais, F&A, documentação de software e investigação em IA. Consulte a nossa metodologia.

O Parallel Ultra e o Claude Code empataram no topo com 97% de precisão. O Codex seguiu-se com 93,9%. O Perplexity Sonar pontuou 87,9%. Os modelos de pesquisa aprofundada da OpenAI (o3 e o4-mini) pontuaram entre 75,8% e 81,8%, apesar de executarem 27-125 pesquisas na web por tarefa e de custarem 2-6x mais do que o Sonar.

Os melhores desempenhos partilham um padrão: navegam para fontes primárias e leem-nas cuidadosamente. O Codex acedeu ao documento SEC 8-K para a Tarefa 2 e à declaração de procuração da SEC para a Tarefa 3. O Claude Code obteve as páginas de documentação da Unity diretamente na Tarefa 1. O Parallel encontrou o valor específico do pagamento de Zaslav ($886,8M) que três outras ferramentas não encontraram. O o3 e o o4-mini pesquisaram amplamente, mas extraíram informações menos precisas das páginas que encontraram.

O Claude Code e o Codex ocupam o canto superior direito: alta precisão a baixo custo ($1,54 e $1,30, respetivamente). O Parallel atinge a mesma precisão por $2,10. O o3 custa $10,92 para 75,8% de precisão. No separador de latência, o Claude Code é o mais rápido, com 1,7 minutos por tarefa em média. O Parallel é o mais lento, com 16,7 minutos, mas iguala a precisão máxima. O Sonar ocupa uma posição intermédia sólida, com 2,3 minutos e 87,9%.

O Sonar produz uma média de 5.253 palavras por tarefa. Os agentes produzem 398-483. O Sonar escreveu 4.509 palavras sobre a struct Unity EntityId, mas só conseguiu nomear um dos seus cinco métodos públicos. O Codex escreveu 248 palavras e nomeou todos os cinco. O Parallel escreveu 1.037 palavras e acertou. Mais palavras e mais citações não previram maior precisão.

Análise aprofundada: Migração de Unity 2022.3 para Unity 6 (Tarefa 5)

A Tarefa 5 é a mais complexa do benchmark. Pedia a cada ferramenta que criasse um guia de transição de Unity 2022.3 LTS para Unity 6.3 LTS. O prompt especificava números de versão exatos: 2022.3.62f3, 2022.3.74f1 e 6000.3.12f1. Uma resposta correta exige a leitura da página de requisitos de sistema do Unity 6.3, da página de ciclo de vida de suporte e de quatro guias de atualização separados (6.0, 6.1, 6.2, 6.3).

Três das seis ferramentas devolveram os requisitos de sistema do Unity 6.0 em vez dos do Unity 6.3.

O o3, o o4-mini e o Claude Code referenciaram todos a página de documentação do Unity 6.0 em vez da página do 6.3, apesar de o prompt especificar “Unity 6.3” e o número de build “6000.3.12f1”.

Uma equipa que seguisse o guia do o3 visaria Android API 23 (Android 6.0). O Unity 6.3 requer API 25 (Android 7.1). A build falharia ou seria lançada visando uma plataforma não suportada. O guia em si parece profissional: tabelas limpas, estrutura sensata, tom correto. Os números estão errados.

Tanto o Codex como o Parallel acertaram todos os números. O Codex navegou diretamente para a página de requisitos de sistema do 6.3 e comparou-a linha a linha com a página do 2022.3. Chegou mesmo a identificar que o mínimo do iOS passou de 12 para 13 na linha do 2022.3 na build 2022.3.72f1, antes de saltar para 15 no 6.3. O Parallel produziu um guia abrangente com números corretos e 35 fontes citadas.

Como cada ferramenta abordou o problema:

O Claude Code gerou 4 subagentes paralelos, cada um tratando de uma parte diferente da pergunta: datas de suporte, caminho de atualização, alterações disruptivas e requisitos de sistema. Rápido (3 minutos e 59 segundos), mas o subagente de requisitos de sistema foi buscar a página de documentação errada.

O Codex executou 90 pesquisas web sequenciais ao longo de 6 minutos e 17 segundos. Foi buscar o guia de atualização do 6.3, a página de requisitos de sistema do 6.3 e a página de requisitos de sistema do 2022.3 individualmente. Mais lento, mas metódico. Todos os números estavam corretos.

O o3 gastou 8 minutos e 32 pesquisas web. Produziu 2.132 palavras de conselhos gerais de migração, mas foi buscar prazos de suporte e requisitos de sistema à documentação do 6.0. Não mencionou nenhuma alteração disruptiva específica do 6.3 (remoção do URP Compatibility Mode, depreciação do Netcode 1.x, depreciação do Relay/Lobby).

Nenhuma ferramenta leu todos os quatro guias de atualização (6.0, 6.1, 6.2, 6.3) em sequência. A documentação da Unity afirma que os programadores devem segui-los por ordem, porque cada um contém alterações disruptivas únicas. Todas as ferramentas encontraram a página mais proeminente e extraíram a partir dela. Esta é uma limitação estrutural para qualquer tarefa de investigação que exija percorrer uma série de documentos relacionados em vez de encontrar uma única resposta.

Resultados do Bench DR-50

Comparação de precisão e latência

Testámos ferramentas de pesquisa aprofundada de IA em 50 perguntas com 6 tipos de perguntas distintos. Consulte a nossa metodologia do benchmark

O Perplexity Sonar Deep Research apresenta a maior precisão, com 34%, e uma latência moderada. O Parallel Ultra e o o4 mini deep research demonstram níveis de precisão semelhantes, em torno de 22-24%, embora o Parallel Ultra exija significativamente mais tempo. O o3-deep-research exibe a precisão mais baixa com uma latência elevada.

Custo e latência na única tarefa bem-sucedida

Medimos o custo e a latência numa única pergunta em que todas as ferramentas foram bem-sucedidas. O o4 mini deep research e o Perplexity Ultra ocupam a região eficiente, com custos baixos e tempos de conclusão mais rápidos. O o3 deep research opera com um custo mais elevado e maior latência. O Parallel mostra a maior latência, apesar de um custo moderado.

Citações

A quantidade de citações varia independentemente do custo e da latência. O o4 mini deep research fornece significativamente mais citações, mantendo a eficiência, sugerindo abordagens diferentes para a obtenção e referência de informações. As citações mínimas no o3 deep research, apesar do seu custo premium, indicam que a contagem de citações não está ligada ao consumo de recursos.

Resultados do Bench DR-2T

Também realizámos um segundo benchmark com as 7 principais ferramentas de pesquisa aprofundada de IA, com duas tarefas, e avaliámo-las em cinco dimensões.

Avaliámo-las com base na precisão e no número de fontes. Consulte a metodologia para ver como avaliámos estas soluções.

O Gemini lidera em termos de precisão dos dados fornecidos:

O Claude é o líder com base no número de fontes indexadas:

Tarefa 1:

Pedimos-lhes que criassem tabelas sobre software empresarial de gestão de palavras-passe de acordo com o nosso prompt. Veja o prompt completo.

Quase todas as ferramentas forneceram tabelas detalhadas contendo as informações solicitadas, embora as suas abordagens à apresentação dos dados variassem significativamente.

Para uma geração abrangente de relatórios:

  • O Gemini e o Claude surgiram como as soluções líderes, fornecendo extensos relatórios analíticos com insights sintetizados e análise contextual.
  • Em contraste, o Bright Data Deep Lookup* focou-se principalmente na extração de dados, fornecendo tabelas estruturadas com conteúdo narrativo limitado.

Os investigadores devem selecionar as ferramentas com base nas suas necessidades específicas de investigação. Aqueles que necessitam de uma análise abrangente e de soluções focadas em relatórios acharão o Gemini e o Claude mais adequados, uma vez que estas ferramentas estão mais focadas em sintetizar informação em relatórios detalhados.

Por outro lado, os investigadores que priorizam a recolha de dados em bruto e que necessitam de pesquisas web em grande escala beneficiarão mais do Bright Data, que fornece uma extensa cobertura de dados web com níveis de confiança e explicações detalhadas sobre a relevância e fiabilidade das fontes.

Esta abordagem centrada nos dados torna o Bright Data valioso para revisões sistemáticas que exijam verificação de fontes em grande volume.

O Kimi emprega uma metodologia distinta para a geração de relatórios, produzindo um relatório interativo que incorpora resumos executivos, secções direcionadas de "melhor para" e recomendações estratégicas.

O relatório apresenta visualizações de dados integradas e atribuição de fontes, resultando num produto final completo, adequado para implementação imediata sem necessidade de modificações adicionais.

Nota: O Perplexity forneceu um relatório detalhado, mas não conseguiu criar uma tabela com a informação recolhida. Uma vez que o nosso prompt solicitava especificamente resultados em tabela, recebeu zero pontos nessa tarefa.

*Atualizaremos o Bright Data Deep Lookup quando o produto sair da fase beta.

Tarefa 2:

O objetivo desta tarefa é avaliar a sua velocidade e cobertura na investigação. Solicitámos um relatório detalhado sobre a adoção de RPA para determinar o número de páginas indexadas e o tempo necessário para gerar um relatório.

Naturalmente, o número de fontes não tem de estar correlacionado com a qualidade da investigação. No entanto, uma vez que estas ferramentas são concebidas para acelerar a investigação, considerámo-la uma métrica importante.

Devemos também notar que os tempos de pesquisa variam significativamente entre estas ferramentas. O Grok Deep Search é aproximadamente 10 vezes mais rápido do que o ChatGPT Deep Research e pesquisa aproximadamente 3 vezes mais páginas web.

O Claude Deep Search também é altamente responsivo, tendo pesquisado 261 fontes em mais de 6 minutos. No entanto, o Gemini pode não ser a escolha ideal para quem procura uma solução rápida e responsiva, uma vez que pesquisou 62 fontes em mais de 15 minutos.

Desenvolvimentos nas ferramentas de pesquisa aprofundada de IA

Kimi K2.5

O Kimi K2.5 pode processar texto, imagens e vídeo, gerar código pronto para produção e executar fluxos de trabalho complexos usando uma arquitetura de enxame de agentes.

O Agent Swarm é o mecanismo do Kimi K2.5 para lidar com tarefas complexas, transformando um único modelo numa equipa coordenada de agentes de IA. Em vez de executar a tarefa sequencialmente, o Kimi cria múltiplos subagentes especializados, cada um com uma função específica, como investigação, análise, codificação, verificação ou estruturação de conteúdo. Estes agentes operam em paralelo, utilizam ferramentas de forma independente e partilham resultados intermédios, o que reduz significativamente o tempo de execução para fluxos de trabalho de longa duração.

O enxame decompõe um objetivo de alto nível em subtarefas, atribui-as a agentes, monitoriza o progresso e integra os resultados num resultado final coerente. Esta abordagem é especialmente útil para pesquisa aprofundada, criação de documentos em grande escala, processamento em lote e resolução de problemas em várias etapas, em que diferentes partes do trabalho podem prosseguir em simultâneo.

Kimi K2.5 Deep Research

O Kimi K2.5 Deep Research suporta investigação e geração de relatórios de ponta a ponta para perguntas complexas. Recolhe informação de múltiplas fontes, analisa tópicos de múltiplas perspetivas e sintetiza os resultados em relatórios visuais.

A pesquisa aprofundada foi concebida principalmente para análise de investimento, investigação setorial, trabalho académico e planeamento estratégico, onde é necessária uma análise orientada para a decisão.

Figura 1: Um exemplo de investigação do Kimi K2.5 Deep Research sobre métricas ESG e retornos de investimento.

Claude para ciências da vida

O Claude para Ciências da Vida foi concebido para apoiar o trabalho científico ao longo do ciclo de vida do desenvolvimento de medicamentos e dispositivos para organizações de biotecnologia, farmacêuticas e de investigação. Atualizações recentes expandem o seu âmbito para além da investigação pré-clínica, abrangendo operações de ensaios clínicos e fluxos de trabalho regulamentares, adicionando novos conectores de dados e competências de agente adaptadas a casos de uso reais em ciências da vida.

Principais funcionalidades e capacidades:

  • Conectores científicos expandidos: Acesso a plataformas como Medidata, ClinicalTrials.gov, bioRxiv/medRxiv, Open Targets, ChEMBL, ToolUniverse e Owkin, juntamente com as integrações existentes com Benchling, PubMed, 10x Genomics, BioRender, Synapse.org e Wiley.
  • Inteligência para ensaios clínicos: Utilização segura de dados históricos de inscrição em ensaios e de desempenho de centros para apoiar a análise de viabilidade, o planeamento do recrutamento de doentes e a monitorização de ensaios.
  • Apoio à descoberta precoce: Ferramentas para auxiliar na identificação de alvos, análise de compostos e teste de hipóteses, utilizando bases de dados científicas com curadoria e ferramentas computacionais.
  • Fluxos de trabalho de bioinformática: Competências de agente e pacotes de ferramentas que suportam pipelines de processamento e análise de dados, incluindo scVI-tools e implementações Nextflow.
  • Redação e planeamento de protocolos: Uma competência de redação de protocolos de ensaios clínicos que incorpora vias regulamentares, contexto competitivo, recomendações de endpoints e orientações relevantes da FDA.
  • Preparação regulamentar: Assistência na identificação de lacunas em documentos regulamentares, na redação de respostas a questões das agências e na navegação pelas diretrizes aplicáveis.1

Integração do Gemini Deep Research com o Gmail, Docs, Drive e Chat

A Google introduziu uma atualização significativa no Gemini Deep Research, expandindo a sua capacidade de aceder a dados de todo o ecossistema da Google. A ferramenta pode agora conectar-se ao Gmail, ao Google Drive (incluindo Docs, Slides, Sheets e PDFs) e ao Google Chat, permitindo aos utilizadores incluir fontes privadas e partilhadas diretamente no seu processo de investigação.

Com esta atualização, os utilizadores podem:

  • Construir relatórios abrangentes combinando dados de e-mails, documentos e chats com informações da web.
  • Realizar uma análise competitiva que integre planos de projeto, folhas de cálculo de comparação e discussões de equipa.
  • Lançar um plano de investigação em várias etapas para um novo produto, analisando materiais iniciais de brainstorming e tópicos de comunicação relacionados.

Esta funcionalidade permite que o Gemini Deep Research apoie tanto revisões de literatura académica como estudos de mercado. Ao combinar múltiplas fontes de dados, os utilizadores podem gerar análises mais detalhadas e descobrir insights chave de forma mais eficiente.2

Gemini no Chrome: Navegação automática

A Google está a atualizar o Gemini no Chrome para macOS, Windows e Chromebook Plus com o Gemini 3, adicionando um painel lateral, suporte mais integrado para aplicações da Google e funcionalidades agênticas, como a navegação automática:

  • Navegação e ações agênticas em várias etapas: A nova funcionalidade de Navegação Automática do Chrome utiliza o Gemini 3 para atuar como um agente web que pode realizar tarefas complexas e em várias etapas de forma autónoma, como pesquisar opções de viagem, preencher formulários, comparar produtos e navegar entre websites, interpretando instruções e interagindo com páginas em nome do utilizador.
  • Disponibilidade: A Navegação Automática está atualmente a ser lançada em pré-visualização para os subscritores do Google IA Pro e IA Ultra nos Estados Unidos e requer o Chrome em plataformas como Windows, macOS ou Chromebook Plus.
  • Cobertura de Aplicações Conectadas: O Gemini atualizado no Chrome suporta integrações de Aplicações Conectadas com serviços como Gmail, Calendário, YouTube, Maps, Google Shopping e Voos.
    • Para ações que envolvam passos sensíveis ou de alto risco, como concluir uma compra ou publicar nas redes sociais, o sistema pausa e solicita uma confirmação explícita do utilizador antes de prosseguir.3

A Microsoft introduz a Pesquisa Aprofundada no Azure IA Foundry Agent Service

A Microsoft lançou a pré-visualização pública da Pesquisa Aprofundada no Azure IA Foundry Agent Service, oferecendo a tecnologia de investigação agêntica da OpenAI através da plataforma empresarial do Azure. O serviço permite a automatização de tarefas de investigação complexas, integração entre sistemas de negócio e criação de resultados de investigação transparentes e auditáveis.4

As principais funcionalidades são:

  • Investigação automatizada em várias etapas: Utiliza o modelo o3-deep-research para planear, analisar e sintetizar dados da web e de sistemas empresariais.
  • Fundação na web com o Bing Search: Garante que a informação se baseia em fontes verificadas e atuais.
  • Resultados transparentes: Cada relatório inclui fontes citadas, passos de raciocínio e esclarecimentos.
  • Integração com ferramentas do Azure: Funciona com Logic Apps, Azure Functions e outros conectores para relatórios e automatização de fluxos de trabalho.
  • Flexibilidade programática: Disponível via API e SDK, permitindo aos programadores incorporar ferramentas de pesquisa aprofundada de IA em aplicações e fluxos de trabalho.

Como funciona

  1. Esclarecimento da intenção de investigação: O sistema utiliza o GPT-4o e o GPT-4.1 para definir a pergunta de investigação.
  2. Recolha de dados: O Bing Search recolhe dados web fiáveis para fundamentação.
  3. Análise dos resultados: O modelo de pesquisa aprofundada realiza raciocínio e síntese para produzir relatórios abrangentes com insights chave.
  4. Garantia de conformidade: Cada resultado é rastreável e auditável para uso empresarial.
Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Benefícios das ferramentas de pesquisa aprofundada de IA

Eficiência e produtividade melhoradas

  • Revisões de literatura: As ferramentas de investigação de IA atuam como um assistente de investigação, realizando uma pesquisa profunda de literatura em vastas bases de dados de artigos científicos. Identificam artigos relevantes e podem sintetizar informação para gerar resumos concisos, reduzindo significativamente o tempo e o esforço necessários para uma revisão manual da literatura.
  • Recolha e análise de dados: Um assistente de investigação de IA pode automatizar a recolha de dados através da mineração de grandes bases de dados e páginas web. Estas ferramentas possuem capacidades de pesquisa aprofundada que lhes permitem processar e analisar conjuntos de dados massivos muito mais rapidamente do que os métodos tradicionais. Podem identificar padrões e tendências que poderiam ser ignorados numa revisão manual, o que é crucial para tarefas de investigação complexas, como a análise de mercado ou a criação de um relatório de pesquisa aprofundada.
  • Automatização de tarefas repetitivas: A IA pode lidar com tarefas repetitivas, como a introdução de dados e a formatação de citações de fontes. Ao automatizar estes processos demorados, os investigadores podem concentrar-se em tópicos mais complexos e nos aspetos criativos do seu trabalho.

Insights e descobertas mais profundas

  • Identificação de lacunas de investigação: Ao analisar a literatura académica existente, as ferramentas de IA podem ajudar os investigadores a identificar lacunas no conhecimento atual. Este é um passo crítico para formular uma nova pergunta de investigação ou desenvolver um plano de investigação em várias etapas. Estas ferramentas fornecem insights de fácil leitura num formato estruturado e bem organizado.
  • Síntese de informação: Os assistentes de investigação de IA podem sintetizar informação de múltiplas fontes, gerando um relatório abrangente e destacando as principais conclusões. Isto dá aos investigadores uma visão geral ampla sem necessidade de ler cada artigo na íntegra, o que poupa tempo, ao mesmo tempo que fornece insights abrangentes.
    • Por exemplo, a ferramenta de pesquisa aprofundada do Claude gerou um relatório detalhado. O relatório pode ser publicado como um Artefacto, que é acessível online e pode ser visível nos motores de busca.
  • Exploração de conexões: As ferramentas que visualizam redes de citações podem ajudar os investigadores a ver como diferentes artigos científicos estão interligados. Isto pode levar a descobertas e a uma compreensão mais abrangente de um campo de investigação.

Por exemplo, o Grok indexou mais de 100 páginas diferentes na nossa segunda tarefa. Normalmente, um ser humano demora horas a ler e recolher informação de todas estas páginas, mas o Grok demorou ∼2 minutos.

Portanto, estas ferramentas podem acelerar o processo de investigação. No entanto, os utilizadores devem sempre lembrar-se de que estas ferramentas podem alucinar e gerar informações erradas, por isso, tenha cuidado ao usar informações retiradas diretamente de um LLM.

Desafios e limitações das ferramentas de pesquisa aprofundada de IA

Precisão e fiabilidade

A maioria das pessoas desconfia da precisão da informação gerada por LLMs e verifica-a por si mesma, porque sabe que os LLMs podem alucinar. O problema com a pesquisa aprofundada é que, como realiza uma investigação mais abrangente do que o chat padrão e fornece fontes, os utilizadores podem assumir erradamente que fornece sempre informações precisas. Os LLMs (mesmo com pesquisa aprofundada) ainda tendem a alucinar, e isto pode resultar em graves mal-entendidos.

  • Falta de contexto e nuance: Um assistente de investigação de IA pode ter dificuldade em compreender o contexto completo de uma tarefa de investigação, potencialmente resumindo a informação sem compreender o seu significado mais profundo. Isto pode levar a conclusões incompletas ou incorretas.
  • Informação desatualizada: Os dados de treino de alguns modelos de IA podem não estar atualizados, fazendo com que percam desenvolvimentos recentes em artigos científicos ou outra literatura académica.
  • Credibilidade das fontes: As ferramentas de IA muitas vezes têm dificuldade em diferenciar fontes autorizadas de fontes não fiáveis, tratando toda a informação da web aberta como igualmente válida. O julgamento humano é essencial para verificar a credibilidade das fontes de um relatório de pesquisa aprofundada.

Preconceito e preocupações éticas

  • Preconceito algorítmico: Se os conjuntos de dados utilizados para treinar os modelos de IA contiverem preconceitos sociais, a IA irá aprendê-los e perpetuá-los. Isto pode resultar em resultados enviesados contra grupos demográficos específicos, afetando a integridade da pesquisa aprofundada.
  • Privacidade dos dados: A utilização de ferramentas de IA implica o processamento de grandes quantidades de dados, o que levanta preocupações significativas de privacidade e segurança. Dados proprietários ou confidenciais introduzidos por um investigador podem ser utilizados para treinar modelos futuros, levando a um risco de fuga de dados.
  • Propriedade e direitos de autor: Quando uma ferramenta de IA sintetiza informação de múltiplas fontes, surgem questões relativas à propriedade intelectual e à atribuição adequada. Muitas vezes, é difícil determinar a propriedade do resultado final e garantir que todas as citações de fontes estão corretas.

Competência humana e dependência excessiva

  • A ilusão da especialização: As ferramentas de IA podem produzir um relatório polido e estruturado, criando a falsa impressão de uma análise abrangente e especializada. A ferramenta é um assistente de investigação, não um substituto do julgamento, da experiência e do escrutínio que um investigador humano proporciona em tarefas de investigação complexas. Isto é especialmente relevante para os decisores que enfrentam decisões de alto risco.
  • Erosão do pensamento crítico: Uma dependência excessiva das ferramentas de investigação de IA pode diminuir o pensamento crítico e as capacidades analíticas do investigador. Fornecer todas as respostas pode reduzir o envolvimento do utilizador nos processos de investigação complexos essenciais para artigos académicos de alta qualidade.
  • Curva de aprendizagem acentuada: Apesar do seu design fácil de utilizar, muitas ferramentas de investigação têm uma ligeira curva de aprendizagem, particularmente nas suas funcionalidades avançadas. Os investigadores podem necessitar de investir tempo para aproveitar plenamente as capacidades de pesquisa aprofundada da ferramenta.

Gary Marcus também alertou que pode causar um declínio na qualidade dos artigos científicos.5

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Metodologia

No nosso benchmark DR-50, avaliámos as ferramentas de investigação de IA utilizando 50 perguntas de seis tipos diferentes:

 1. Pesquisa Factual Simples

Perguntas de um único passo que exigem a recuperação direta de dados de uma única fonte.

Exemplo: “Qual é o preço de input para 1M tokens do modelo llama-3-70b da DeepInfra?”

2. Análise Comparativa

Avaliação entre fontes que exige a recolha de dados de vários fornecedores para comparar produtos ou serviços.

Exemplo: “Que fornecedor oferece o llama-3.2-1b ao preço combinado mais barato?”

3. Raciocínio em Várias Etapas

Cadeias de raciocínio sequencial que exigem vários passos dependentes de recuperação de informação.

Exemplo: “Qual é o preço de input por 1 milhão de tokens no OpenRouter para o modelo que ficou em 1º no benchmark de Raciocínio Financeiro da AIMultiple?”

4. Baseado em Cálculo

Operações matemáticas realizadas sobre dados numéricos recuperados.

Exemplo: “Qual é a diferença de preço combinado entre os dois modelos mais baratos da Mistral IA?”

5. Extração Estruturada de JSON

A recolha de dados exige uma formatação rigorosa em JSON com múltiplos valores estruturados.

Exemplo: “Quais são a arquitetura, memória e largura de banda da NVIDIA H200 SXM? Formato: {“architecture”: “…”, “memory”: “…”, “bandwidth”: “…”}”

6. Listagem Categórica

Enumeração completa de todos os itens dentro de uma categoria específica.

Exemplo: “Forneça todos os servidores MCP na categoria blockchain.”

Métricas de Avaliação

Precisão

Comparámos cada resposta com respostas de verdade absoluta predefinidas, utilizando o GPT-4o-mini como juiz automatizado via OpenRouter. A pontuação final de precisão representa a percentagem de respostas corretas em todas as 50 consultas.

Contagem de Tokens

Utilizámos a biblioteca tiktoken para medir os tokens no lado do cliente e validámos estas medições com as contagens de tokens reportadas pelas APIs dos fornecedores e pelas UIs, quando disponíveis.

Latência

Medimos a latência como o tempo de relógio desde o início do pedido até à receção da resposta completa, reportada em segundos. Validámos estas medições com as métricas de latência reportadas pelas APIs dos fornecedores e pelas UIs, quando disponíveis.

Custo

Acompanhámos os custos manualmente através do painel de faturação de cada fornecedor.

Citações

Extraímos automaticamente as citações dos metadados de resposta de cada API e contámos os URLs únicos citados por resposta.

Configuração Técnica

Executámos o benchmark sequencialmente, com cada API a completar todas as 50 consultas antes de a próxima API começar. Implementámos um atraso de 5 segundos entre consultas consecutivas para evitar limitação de taxa, e não impusemos quaisquer limites de tempo, permitindo que os pedidos aguardassem indefinidamente pela conclusão.

Para o benchmark DR-2T baseado em tarefas diferentes, cada dado no prompt pontuou como 1 ponto. Se o resultado não estivesse em formato de tabela, classificámo-lo como 0.

Prompt da Tarefa 1

Investigue e avalie as 5 principais soluções empresariais de gestão de palavras-passe com base nos seguintes critérios para identificar a solução mais eficaz para implementação empresarial.

Critérios

1. Funcionalidades de Segurança

  • Padrão de encriptação utilizado 
  • Implementação de arquitetura de conhecimento zero
  • Opções de MFA suportadas
  • Certificações de segurança de terceiros
  • Funcionalidades de monitorização da saúde das palavras-passe

2. Implementação e Integração

  • Opções de implementação
  • Capacidades de integração com diretórios
  • Disponibilidade e funcionalidade da API
  • Integração de SSO

3. Experiência do Utilizador

  • Compatibilidade com extensões de navegador
  • Disponibilidade e classificação da aplicação móvel
  • Capacidades de acesso offline
  • Funcionalidade de partilha de palavras-passe

4. Administração

  • Opções de aplicação de políticas de palavras-passe
  • Automatização de provisionamento/desprovisionamento de utilizadores
  • Funcionalidades de relatórios e conformidade
  • Protocolos de acesso de emergência

5. Custo e Escalabilidade

  • Comparar preços utilizando cenários empresariais padronizados (100 utilizadores, 500 utilizadores, 1000+ utilizadores)

Formato de Entrega

  1. Tabela detalhada para cada critério
  2. Tabela de comparação de custos com cenários padronizados

Prompt para a Tarefa 2

Na nossa segunda tarefa, pretendíamos descobrir o âmbito da investigação realizada. Para isso, comparámos o número de referências citadas. A comparação de artigos não é um método objetivo neste caso, uma vez que não é viável estabelecer uma verdade absoluta definitiva.

No entanto, o número de referências pode dar-nos uma ideia sobre a sua capacidade de fornecer informação, uma vez que a força destas ferramentas reside na sua capacidade de indexar centenas de páginas web em minutos.

Metodologia do Benchmark de Agentes vs Pesquisa Aprofundada

Criámos 5 tarefas de investigação em diferentes domínios. Cada tarefa coloca perguntas diretas com respostas factuais e verificáveis. Cada ponto de verificação é pontuado de forma binária: correto ou errado.

Todas as perguntas visam informações publicadas após as datas de corte dos dados de treino dos modelos. O benchmark foi executado na primeira semana de abril de 2026.

A verdade absoluta foi construída a partir de fontes primárias: documentação oficial do Unity 6.4, documento SEC 8-K da Atlassian, comunicados de imprensa da Paramount, o artigo arxiv do ARC-AGI-3 e os guias de atualização do Unity. Cada ferramenta recebeu prompts idênticos. Todos os prompts terminavam com “Cite todas as fontes que utilizou com URLs.”

Pontuação: correspondência automática de padrões para números, datas e nomes. Juiz LLM (GPT-4o) para pontos de verificação de qualidade de explicação. Um revisor humano validou todos os resultados.

Os modelos de pesquisa aprofundada foram chamados através da API do OpenRouter (o3, o4-mini, Sonar) e da API do Parallel. Os agentes foram executados através das suas interfaces CLI com pesquisa web ativada, sem ferramentas MCP.

No Claude Code, utilizámos o Opus 4.6, e no Codex, utilizámos o GPT 5.4. Ambos em esforço médio, e o cálculo de custos é feito por utilização de tokens para ambos os agentes.

Perguntas frequentes

As ferramentas de investigação com recurso a IA transformam a forma como os cientistas conduzem a investigação, tornando-a mais rápida e eficiente. As ferramentas de pesquisa aprofundada, em particular, têm o potencial de impactar significativamente a comunidade científica. Podem ajudar a acelerar o processo, mas os utilizadores devem ter cuidado com os erros antes de publicarem essa informação.
Relatórios da indústria e estudos demonstraram que as ferramentas de IA podem ser altamente eficazes em certas áreas, como a análise de dados e as revisões de literatura. Estas ferramentas utilizam modelos de IA capazes para sintetizar informação de múltiplas fontes, fornecendo conclusões e insights chave.
Estes modelos utilizam modelos de raciocínio e IA generativa para sintetizar informação e fornecer insights. Podem também responder a tópicos complexos e fornecer respostas detalhadas. Os utilizadores pro podem aproveitar as ferramentas de IA para obter uma vantagem competitiva na sua investigação.
Tal como a Pesquisa Aprofundada, novos modelos e tecnologias, como as ferramentas de IA Python e os subconjuntos apenas de texto, estão a surgir, e a integração de todas estas ferramentas aumentará o âmbito e a fiabilidade da Pesquisa Aprofundada.

As ferramentas de IA podem ajudar em vários aspetos das revisões de literatura, incluindo a identificação de artigos relevantes, o resumo das principais conclusões e a organização de temas de investigação. Estas ferramentas podem processar grandes volumes de literatura académica rapidamente e ajudar os investigadores a identificar lacunas ou padrões entre estudos. No entanto, a IA não pode substituir totalmente o julgamento humano na avaliação da qualidade das fontes, na síntese de argumentos complexos ou no fornecimento de análise crítica. Os investigadores devem ainda rever, verificar e interpretar o conteúdo gerado pela IA para garantir a exatidão e manter o rigor académico nas suas revisões de literatura.

As ferramentas de IA podem ajudar na análise de dados e no trabalho estatístico, limpando conjuntos de dados, realizando testes estatísticos, criando visualizações e identificando padrões em grandes conjuntos de dados. Estas ferramentas podem sugerir métodos estatísticos apropriados com base no tipo de dados e nas perguntas de investigação. No entanto, os investigadores devem compreender o contexto dos seus dados e validar os resultados, uma vez que a IA pode perder nuances específicas do domínio ou fazer suposições inadequadas.

A maioria das ferramentas modernas de investigação de IA utiliza interfaces de linguagem natural que não exigem conhecimentos de programação. No entanto, a literacia básica de dados e a compreensão de conceitos fundamentais de investigação ajudam os utilizadores a formular melhores consultas e a interpretar os resultados de forma mais eficaz. As aplicações avançadas podem beneficiar de conhecimentos técnicos para análises personalizadas ou fluxos de trabalho especializados.

Os investigadores devem cruzar os resultados da IA com as fontes originais e a literatura revista por pares. As citações e referências fornecidas pela IA requerem verificação, uma vez que podem ser imprecisas ou fabricadas. As principais conclusões devem ser confirmadas através de múltiplas fontes, com especial cuidado para desenvolvimentos recentes ou tópicos de nicho. As análises estatísticas beneficiam da validação através de múltiplas ferramentas, e os especialistas no assunto devem rever resultados complexos sempre que possível.

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Cem Dilmegani (2026) - "Pesquisa Aprofundada de IA: Claude vs ChatGPT vs Grok". Publicado on-line em AIMultiple.com. Acessado em 22 Junho 2026, em: https://aimultiple.com/ai-deep-research [Recurso on-line]

Dilmegani, C. (2026, 22 Junho). Pesquisa Aprofundada de IA: Claude vs ChatGPT vs Grok. AIMultiple. https://aimultiple.com/ai-deep-research

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{Pesquisa Aprofundada de IA: Claude vs ChatGPT vs Grok}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/ai-deep-research}},
  note   = {AIMultiple. Acessado em 22 Junho 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem é o analista principal da AIMultiple desde 2017. A AIMultiple fornece informações para centenas de milhares de empresas (segundo o SimilarWeb), incluindo 55% das empresas da Fortune 500, todos os meses. O trabalho de Cem foi citado por importantes publicações globais, como Business Insider, Forbes e Washington Post, além de empresas globais como Deloitte e HPE, ONGs como o Fórum Econômico Mundial e organizações supranacionais como a Comissão Europeia. Você pode ver mais empresas e recursos renomados que mencionaram a AIMultiple. Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor na área. Ele assessorou empresas em suas decisões tecnológicas na McKinsey & Company e na Altman Solon por mais de uma década. Também publicou um relatório da McKinsey sobre digitalização. Liderou a estratégia de tecnologia e a área de compras de uma empresa de telecomunicações, reportando-se diretamente ao CEO. Além disso, liderou o crescimento comercial da empresa de tecnologia avançada Hypatos, que atingiu uma receita recorrente anual de sete dígitos e uma avaliação de nove dígitos, partindo de zero, em apenas dois anos. O trabalho de Cem no Hypatos foi noticiado por importantes publicações de tecnologia, como TechCrunch e Business Insider. Cem participa regularmente como palestrante em conferências internacionais de tecnologia. Ele se formou em engenharia da computação pela Universidade Bogazici e possui um MBA pela Columbia Business School.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450