La recherche approfondie par IA offre aux utilisateurs un éventail plus large de résultats de recherche que les moteurs de recherche IA. Pour voir les performances des différents outils de recherche approfondie par IA, nous présentons trois nouveaux benchmarks :
DR-50 (Deep Research 50) Bench, qui évalue les outils sur 50 questions couvrant six types de questions, DR-2T (Deep Research 2 Task) Bench, qui évalue les outils à travers deux tâches de recherche concrètes axées sur la qualité de la génération de rapports, la couverture des sources et la présentation de données structurées, et Agent vs Deep Research Models, démontre que les agents sont moins chers que les modèles de recherche approfondie tout en offrant des niveaux de précision comparables.
Benchmark Agents vs Modèles de recherche approfondie
Agents IA tels que Claude Code et OpenAI Codex peuvent rechercher sur le web, récupérer des pages spécifiques et extraire des données via des appels d'outils ciblés. Nous avons testé si cette approche agentique égalait les performances des modèles de recherche approfondie dédiés sur des tâches de recherche factuelle. Six outils ont été évalués sur 5 tâches avec 33 points de contrôle de vérité terrain couvrant les événements d'entreprise, les fusions-acquisitions, la documentation logicielle et la recherche en IA. Consultez notre méthodologie.
Parallel Ultra et Claude Code sont à égalité en tête avec une précision de 97%. Codex suit avec 93,9%. Perplexity Sonar a obtenu 87,9%. Les modèles de recherche approfondie d'OpenAI (o3 et o4-mini) ont obtenu entre 75,8% et 81,8%, bien qu'ils aient effectué 27 à 125 recherches web par tâche et coûté 2 à 6x plus cher que Sonar.
Les meilleurs outils partagent un point commun : ils naviguent vers les sources primaires et les lisent attentivement. Codex est allé au dépôt SEC 8-K pour la tâche 2 et à la déclaration de procuration SEC pour la tâche 3. Claude Code a récupéré directement les pages de documentation Unity dans la tâche 1. Parallel a trouvé le montant spécifique du versement de Zaslav (886,8 millions de dollars) que trois autres outils ont manqué. o3 et o4-mini ont cherché largement mais ont extrait des informations moins précises des pages trouvées.
Claude Code et Codex occupent le coin supérieur droit : haute précision à faible coût (1,54 $ et 1,30 $, respectivement). Parallel atteint la même précision pour 2,10 $. o3 coûte 10,92 $ pour une précision de 75,8%. Sur l'onglet de latence, Claude Code est le plus rapide à 1,7 minutes par tâche en moyenne. Parallel est le plus lent à 16,7 minutes mais correspond à la meilleure précision. Sonar se situe dans une position intermédiaire forte à 2,3 minutes et 87,9%.
Sonar produit en moyenne 5 253 mots par tâche. Les agents produisent entre 398 et 483 mots. Sonar a écrit 4 509 mots sur la structure Unity EntityId, mais n'a pu nommer qu'une de ses cinq méthodes publiques. Codex a écrit 248 mots et les a nommées toutes les cinq. Parallel a écrit 1 037 mots et a réussi. Plus de mots et plus de citations n'ont pas prédit une précision plus élevée.
Analyse approfondie : migration de Unity 2022.3 à Unity 6 (Tâche 5)
La tâche 5 est la plus complexe du benchmark. Elle demande à chaque outil de créer un guide de transition de Unity 2022.3 LTS à Unity 6.3 LTS. Le prompt spécifiait les numéros de version exacts : 2022.3.62f3, 2022.3.74f1 et 6000.3.12f1. Une réponse correcte nécessite de lire la page des exigences système de Unity 6.3, la page du cycle de vie du support, et quatre guides de mise à niveau distincts (6.0, 6.1, 6.2, 6.3).
Trois outils sur six ont renvoyé les exigences système de Unity 6.0 au lieu de Unity 6.3.
o3, o4-mini et Claude Code ont tous référencé la page de documentation de Unity 6.0 au lieu de la page 6.3, malgré le prompt spécifiant « Unity 6.3 » et le numéro de build « 6000.3.12f1. »
Une équipe suivant le guide d'o3 ciblerait Android API 23 (Android 6.0). Unity 6.3 nécessite API 25 (Android 7.1). La compilation échouerait ou serait livrée en ciblant une plateforme non supportée. Le guide lui-même a l'air professionnel : tableaux clairs, structure sensée, ton correct. Les chiffres sont faux.
Codex et Parallel ont tous deux obtenu chaque chiffre correctement. Codex a navigué directement vers la page des exigences système de 6.3 et l'a comparée ligne par ligne avec la page de 2022.3. Il a même identifié que le minimum iOS est passé de 12 à 13 au sein de la ligne 2022.3 au build 2022.3.72f1, avant de passer à 15 dans 6.3. Parallel a produit un guide complet avec des chiffres corrects et 35 sources citées.
Comment chaque outil a abordé la tâche :
Claude Code a lancé 4 sous-agents parallèles, chacun traitant une partie différente de la question : dates de support, chemin de mise à niveau, changements de rupture et exigences système. Rapide (3 minutes 59 secondes), mais le sous-agent des exigences système a récupéré la mauvaise page de documentation.
Codex a effectué 90 recherches web séquentielles en 6 minutes 17 secondes. Il a récupéré le guide de mise à niveau de 6.3, la page des exigences système de 6.3 et la page des exigences système de 2022.3 individuellement. Plus lent mais méthodique. Chaque chiffre était correct.
o3 a passé 8 minutes et 32 recherches web. Il a produit 2 132 mots de conseils généraux sur la migration, mais a tiré les calendriers de support et les exigences système de la documentation de 6.0. Il n'a mentionné aucun changement de rupture spécifique à 6.3 (suppression du mode de compatibilité URP, dépréciation de Netcode 1.x, dépréciation de Relay/Lobby).
Aucun outil n'a lu les quatre guides de mise à niveau (6.0, 6.1, 6.2, 6.3) dans l'ordre. La documentation d'Unity indique que les développeurs doivent les suivre dans l'ordre car chacun contient des changements de rupture uniques. Chaque outil a trouvé la page la plus importante et en a extrait des informations. C'est une limitation structurelle pour toute tâche de recherche qui nécessite de parcourir une série de documents connexes plutôt que de trouver une réponse unique.
Résultats du benchmark DR-50
Comparaison de la précision et de la latence
Nous avons testé les outils de recherche approfondie par IA sur 50 questions avec 6 types de questions distincts. Consultez notre méthodologie du benchmark
Perplexity Sonar Deep Research affiche la meilleure précision à 34% avec une latence modérée. Parallel Ultra et o4 mini deep research démontrent des niveaux de précision similaires autour de 22-24%, bien que Parallel Ultra nécessite nettement plus de temps. o3-deep-research présente la précision la plus faible avec une latence prolongée.
Coût et latence sur la tâche réussie
Nous avons mesuré le coût et la latence sur une seule question où tous les outils ont réussi. o4 mini deep research et Perplexity Ultra occupent la région efficace avec des coûts bas et des temps de complétion plus rapides. o3 deep research opère à un coût plus élevé avec une latence plus longue. Parallel affiche la latence la plus longue malgré un coût modéré.
Citations
La quantité de citations varie indépendamment du coût et de la latence. o4 mini deep research fournit nettement plus de citations tout en maintenant l'efficacité, suggérant des approches différentes pour sourcer et référencer les informations. Le faible nombre de citations dans o3 deep research, malgré son coût premium, indique que le nombre de citations n'est pas lié à la consommation de ressources.
Résultats du benchmark DR-2T
Nous avons également mené un second benchmark sur les 7 meilleurs outils de recherche approfondie par IA avec deux tâches et les avons évalués sur cinq dimensions.
Nous les avons évalués sur la base de la précision et du nombre de sources. Consultez la méthodologie pour voir comment nous avons évalué ces solutions.
Gemini est en tête en termes de précision des données fournies :
Claude est le leader en termes de nombre de sources indexées :
Tâche 1 :
Nous leur avons demandé de créer des tableaux sur les logiciels de gestion de mots de passe d'entreprise conformément à notre prompt. Voir le prompt complet.
Presque tous les outils ont fourni des tableaux détaillés contenant les informations demandées, bien que leurs approches de présentation des données aient varié considérablement.
Pour la génération de rapports complets :
- Gemini et Claude sont apparus comme les solutions de premier plan, fournissant des rapports analytiques approfondis avec des synthèses et une analyse contextuelle.
- En revanche, Bright Data Deep Lookup* s'est principalement concentré sur l'extraction de données, fournissant des tableaux structurés avec un contenu narratif limité.
Les chercheurs devraient sélectionner les outils en fonction de leurs besoins de recherche spécifiques. Ceux qui nécessitent une analyse complète et des solutions axées sur les rapports trouveront Gemini et Claude les plus adaptés, car ces outils sont davantage axés sur la synthèse d'informations en rapports détaillés.
À l'inverse, les chercheurs qui privilégient la collecte de données brutes et nécessitent des recherches web à grande échelle bénéficieront davantage de Bright Data, qui offre une couverture étendue des données web avec des niveaux de confiance et des explications détaillées sur la pertinence et la fiabilité des sources.
Cette approche centrée sur les données rend Bright Data précieux pour les revues systématiques nécessitant une vérification de sources à grande échelle.
Kimi emploie une méthodologie distinctive pour la génération de rapports, produisant un rapport interactif qui intègre des résumés exécutifs, des sections ciblées « meilleur pour » et des recommandations stratégiques.
Le rapport comprend des visualisations de données intégrées et l'attribution des sources, ce qui donne un livrable complet adapté à une mise en œuvre immédiate sans modification supplémentaire.
Remarque : Perplexity a fourni un rapport détaillé mais n'a pas réussi à créer un tableau avec les informations recueillies. Étant donné que notre prompt demandait spécifiquement des sorties sous forme de tableau, il a reçu zéro point pour cette tâche.
*Nous mettrons à jour Bright Data Deep Lookup lorsque le produit sortira de la phase bêta.
Tâche 2 :
L'objectif de cette tâche est d'évaluer leur vitesse et leur couverture en recherche. Nous avons demandé un rapport détaillé sur l'adoption de la RPA pour déterminer le nombre de pages indexées et le temps nécessaire pour générer un rapport.
Bien sûr, le nombre de sources n'est pas nécessairement corrélé à la qualité de la recherche. Cependant, comme ces outils sont conçus pour accélérer la recherche, nous avons considéré cela comme une métrique importante.
Il convient également de noter que les temps de recherche varient considérablement d'un outil à l'autre. Grok Deep Search est environ 10 fois plus rapide que ChatGPT Deep Research et recherche environ 3 fois plus de pages web.
Claude Deep Search est également très réactif, ayant recherché 261 sources en un peu plus de 6 minutes. Cependant, Gemini pourrait ne pas être un choix idéal pour ceux qui recherchent une solution rapide et réactive, car il a recherché 62 sources en plus de 15 minutes.
Développements des outils de recherche approfondie par IA
Kimi K2.5
Kimi K2.5 peut traiter du texte, des images et de la vidéo, générer du code prêt pour la production et exécuter des workflows complexes en utilisant une architecture d'essaim d'agents.
Agent Swarm est le mécanisme de Kimi K2.5 pour gérer les tâches complexes en transformant un seul modèle en une équipe coordonnée d'agents IA. Au lieu d'exécuter une tâche de manière séquentielle, Kimi crée plusieurs sous-agents spécialisés, chacun assigné à un rôle spécifique tel que recherche, analyse, codage, vérification ou structuration de contenu. Ces agents fonctionnent en parallèle, utilisent des outils indépendamment et partagent les résultats intermédiaires, ce qui réduit considérablement le temps d'exécution des workflows à long terme.
L'essaim décompose un objectif de haut niveau en sous-tâches, les assigne aux agents, suit la progression et intègre les résultats en un résultat final cohérent. Cette approche est particulièrement utile pour la recherche approfondie, la création de documents à grande échelle, le traitement par lots et la résolution de problèmes en plusieurs étapes, où différentes parties du travail peuvent avancer simultanément.
Kimi K2.5 Deep Research
Kimi K2.5 Deep Research prend en charge la recherche de bout en bout et la génération de rapports pour des questions complexes. Il collecte des informations à partir de sources multiples, analyse les sujets sous plusieurs angles et synthétise les résultats dans des rapports visuels.
La recherche approfondie est principalement conçue pour l'analyse d'investissement, la recherche sectorielle, les travaux universitaires et la planification stratégique, où une analyse orientée décision est requise.
Figure 1 : Un exemple de recherche de Kimi K2.5 Deep Research sur les métriques ESG et les rendements des investissements.
Claude for Life Sciences
Claude for Life Sciences est conçu pour soutenir le travail scientifique tout au long du cycle de vie du développement de médicaments et de dispositifs pour les organisations de biotechnologie, pharmaceutiques et de recherche. Des mises à jour récentes étendent sa portée au-delà de la recherche préclinique aux opérations d'essais cliniques et aux workflows réglementaires, en ajoutant de nouveaux connecteurs de données et des compétences d'agent adaptées aux cas d'utilisation réels des sciences de la vie.
Principales fonctionnalités et capacités :
- Connecteurs scientifiques étendus : Accès aux plateformes telles que Medidata, ClinicalTrials.gov, bioRxiv/medRxiv, Open Targets, ChEMBL, ToolUniverse et Owkin, parallèlement aux intégrations existantes avec Benchling, PubMed, 10x Genomics, BioRender, Synapse.org et Wiley.
- Intelligence des essais cliniques : Utilisation sécurisée des données historiques d'inscription aux essais et de performance des sites pour soutenir l'analyse de faisabilité, la planification du recrutement des patients et la surveillance des essais.
- Soutien à la découverte précoce : Outils pour aider à l'identification de cibles, à l'analyse de composés et aux tests d'hypothèses en utilisant des bases de données scientifiques organisées et des outils informatiques.
- Workflows bioinformatiques : Compétences d'agent et ensembles d'outils qui prennent en charge les pipelines de traitement et d'analyse de données, y compris les déploiements scVI-tools et Nextflow.
- Rédaction et planification de protocole : Une compétence de rédaction de protocole d'essai clinique qui intègre les voies réglementaires, le contexte concurrentiel, les recommandations de critères d'évaluation et les directives pertinentes de la FDA.
- Préparation réglementaire : Aide à l'identification des lacunes dans les documents réglementaires, à la rédaction de réponses aux questions des agences et à la navigation dans les directives applicables.1
Gemini Deep Research : intégration avec Gmail, Docs, Drive et Chat
Google a introduit une mise à jour significative de Gemini Deep Research, élargissant sa capacité à accéder aux données de l'écosystème Google. L'outil peut désormais se connecter à Gmail, Google Drive (y compris Docs, Slides, Sheets et PDF) et Google Chat, permettant aux utilisateurs d'inclure des sources privées et partagées directement dans leur processus de recherche.
Avec cette mise à jour, les utilisateurs peuvent :
- Créer des rapports complets en combinant les données des e-mails, des documents et des discussions avec les informations web.
- Mener une analyse concurrentielle qui intègre des plans de projet, des feuilles de calcul comparatives et des discussions d'équipe.
- Lancer un plan de recherche en plusieurs étapes pour un nouveau produit en analysant les premiers documents de brainstorming et les fils de communication associés.
Cette fonctionnalité permet à Gemini Deep Research de soutenir à la fois les revues de littérature académique et les études de marché. En combinant plusieurs sources de données, les utilisateurs peuvent générer des analyses plus détaillées et découvrir des informations clés plus efficacement.2
Gemini dans Chrome : navigation automatique
Google met à jour Gemini dans Chrome sur macOS, Windows et Chromebook Plus avec Gemini 3, ajoutant un panneau latéral, une intégration plus poussée des applications Google et des fonctionnalités agentiques telles que la navigation automatique :
- Navigation et actions agentiques en plusieurs étapes : La nouvelle fonctionnalité Auto Browse de Chrome utilise Gemini 3 pour agir comme un web agent capable d'effectuer de manière autonome des tâches complexes en plusieurs étapes, telles que la recherche d'options de voyage, le remplissage de formulaires, la comparaison de produits et la navigation entre les sites web en interprétant les instructions et en interagissant avec les pages au nom de l'utilisateur.
- Disponibilité : Auto Browse est actuellement déployé en aperçu pour les abonnés Google IA Pro et IA Ultra aux États-Unis et nécessite Chrome sur des plateformes telles que Windows, macOS ou Chromebook Plus.
- Couverture des applications connectées : La version mise à jour de Gemini dans Chrome prend en charge l'intégration avec des applications connectées telles que Gmail, Agenda, YouTube, Maps, Google Shopping et Flights.
- Pour les actions impliquant des étapes sensibles ou à enjeux élevés, comme la finalisation d'un achat ou la publication sur les réseaux sociaux, le système s'interrompt et demande une confirmation explicite de l'utilisateur avant de continuer.3
Microsoft introduit Deep Research dans Azure IA Foundry Agent Service
Microsoft a lancé la version préliminaire publique de Deep Research au sein de Azure IA Foundry Agent Service, offrant la technologie de recherche agentique d'OpenAI via la plateforme d'entreprise Azure. Le service permet l'automatisation de tâches de recherche complexes, l'intégration entre les systèmes d'entreprise et la création de résultats de recherche transparents et auditables.4
Les principales fonctionnalités sont :
- Recherche automatisée en plusieurs étapes : Utilise le modèle o3-deep-research pour planifier, analyser et synthétiser des données à partir du web et des systèmes d'entreprise.
- Ancrage web avec Bing Search : Garantit que les informations sont basées sur des sources vérifiées et actuelles.
- Résultats transparents : Chaque rapport comprend des sources citées, des étapes de raisonnement et des clarifications.
- Intégration avec les outils Azure : Fonctionne avec Logic Apps, Azure Functions et d'autres connecteurs pour la création de rapports et l'automatisation des workflows.
- Flexibilité programmatique : Disponible via API et SDK, permettant aux développeurs d'intégrer des outils de recherche approfondie par IA dans les applications et les workflows.
Comment ça fonctionne
- Clarification de l'intention de recherche : Le système utilise GPT-4o et GPT-4.1 pour définir la question de recherche.
- Collecte des données : Bing Search collecte des données web fiables pour l'ancrage.
- Analyse des résultats : Le modèle de recherche approfondie effectue un raisonnement et une synthèse pour produire des rapports complets avec des informations clés.
- Assurance de la conformité : Chaque résultat est traçable et auditable pour une utilisation en entreprise.
Avantages des outils de recherche approfondie par IA
Efficacité et productivité améliorées
- Revues de littérature : Les outils de recherche IA agissent comme un assistant de recherche, effectuant une recherche documentaire approfondie sur de vastes bases de données d'articles scientifiques. Ils identifient les articles pertinents et peuvent synthétiser l'information pour générer des résumés concis, réduisant considérablement le temps et les efforts nécessaires pour une revue de littérature manuelle.
- Collecte et analyse de données : Un assistant de recherche IA peut automatiser la collecte de données en explorant de grandes bases de données et des pages web. Ces outils possèdent des capacités de recherche approfondie qui leur permettent de traiter et d'analyser des ensembles de données massifs bien plus rapidement que les méthodes traditionnelles. Ils peuvent identifier des motifs et des tendances qui pourraient échapper à une analyse manuelle, ce qui est crucial pour les tâches de recherche complexes comme l'analyse de marché ou la création d'un rapport de recherche approfondie.
- Automatisation des tâches répétitives : L'IA peut gérer des tâches répétitives telles que la saisie de données et le formatage des citations de sources. En automatisant ces processus chronophages, les chercheurs peuvent se concentrer sur des sujets plus complexes et les aspects créatifs de leur travail.
Aperçus et découvertes plus approfondis
- Identification des lacunes de recherche : En analysant la littérature académique existante, les outils d'IA peuvent aider les chercheurs à identifier les lacunes dans les connaissances actuelles. C'est une étape cruciale pour formuler une nouvelle question de recherche ou élaborer un plan de recherche en plusieurs étapes. Ces outils fournissent des informations faciles à lire dans un format structuré et bien organisé.
- Synthèse de l'information : Les assistants de recherche IA peuvent synthétiser des informations provenant de sources multiples, générant un rapport complet et mettant en évidence les principales conclusions. Cela donne aux chercheurs une vue d'ensemble sans avoir besoin de lire chaque article en entier, ce qui permet de gagner du temps tout en fournissant des informations complètes.
- Par exemple, l'outil de recherche approfondie de Claude a généré un rapport détaillé. Le rapport peut être publié en tant qu'Artifact, accessible en ligne et visible sur les moteurs de recherche.
- Exploration des connexions : Les outils qui visualisent les réseaux de citations peuvent aider les chercheurs à voir comment différents articles scientifiques sont interconnectés. Cela peut conduire à des découvertes et à une compréhension plus complète d'un domaine de recherche.
Par exemple, Grok a indexé plus de 100 pages différentes dans notre deuxième tâche. Normalement, il faut des heures à un humain pour lire et recueillir des informations à partir de toutes ces pages, mais il a fallu environ 2 minutes à Grok.
Par conséquent, ces outils peuvent accélérer le processus de recherche. Cependant, les utilisateurs doivent toujours se souvenir que ces outils peuvent halluciner et générer des informations erronées, il faut donc être prudent lorsqu'on utilise des informations directement issues d'un LLM.
Défis et limites des outils de recherche approfondie par IA
Précision et fiabilité
La plupart des gens se méfient de l'exactitude des informations générées par les LLM et les vérifient eux-mêmes car ils savent que les LLM peuvent halluciner. Le problème avec la recherche approfondie est que, parce qu'elle effectue une recherche plus complète que le chat standard et fournit des sources, les utilisateurs peuvent supposer à tort qu'elle fournit toujours des informations précises. Les LLM (même avec la recherche approfondie) ont toujours tendance à halluciner, ce qui peut entraîner de graves malentendus.
- Manque de contexte et de nuances : Un assistant de recherche IA peut avoir du mal à saisir tout le contexte d'une tâche de recherche, pouvant résumer des informations sans en comprendre la signification profonde. Cela peut conduire à des conclusions incomplètes ou incorrectes.
- Informations obsolètes : Les données d'entraînement de certains modèles d'IA peuvent ne pas être à jour, ce qui leur fait manquer les développements récents dans les articles scientifiques ou autres littératures académiques.
- Crédibilité des sources : Les outils d'IA peinent souvent à différencier les sources autorisées des sources non fiables, traitant toutes les informations du web ouvert comme également valides. Le jugement humain est essentiel pour vérifier la crédibilité des sources pour un rapport de recherche approfondie.
Biais et préoccupations éthiques
- Biais algorithmique : Si les ensembles de données utilisés pour entraîner les modèles d'IA contiennent des biais sociétaux, l'IA les apprendra et les perpétuera. Cela peut aboutir à des résultats biaisés contre certaines catégories démographiques, ce qui nuit à l'intégrité de la recherche approfondie.
- Confidentialité des données : L'utilisation d'outils d'IA implique le traitement de grandes quantités de données, ce qui soulève d'importantes préoccupations en matière de confidentialité et de sécurité. Les données propriétaires ou confidentielles saisies par un chercheur pourraient être utilisées pour entraîner de futurs modèles, entraînant un risque de fuite de données.
- Propriété et droits d'auteur : Lorsqu'un outil d'IA synthétise des informations provenant de sources multiples, des questions se posent concernant la propriété intellectuelle et l'attribution appropriée. Il est souvent difficile de déterminer la propriété du résultat final et de s'assurer que toutes les citations de sources sont correctes.
Compétence humaine et dépendance excessive
- L'illusion de l'expertise : Les outils d'IA peuvent produire un rapport soigné et structuré, créant la fausse impression d'une analyse experte et complète. L'outil est un assistant de recherche, pas un remplacement du jugement, de l'expertise et de l'examen qu'un chercheur humain apporte aux tâches de recherche complexes. Cela est particulièrement pertinent pour les décideurs confrontés à des décisions à enjeux élevés.
- Érosion de la pensée critique : Une dépendance excessive aux outils de recherche IA peut diminuer la pensée critique et les compétences analytiques d'un chercheur. Fournir toutes les réponses peut réduire l'engagement de l'utilisateur dans les processus de recherche complexes essentiels pour des articles académiques de haute qualité.
- Courbe d'apprentissage abrupte : Malgré leur conception conviviale, de nombreux outils de recherche ont une légère courbe d'apprentissage, en particulier pour leurs fonctionnalités avancées. Les chercheurs peuvent avoir besoin d'investir du temps pour exploiter pleinement les capacités de recherche approfondie de l'outil.
Gary Marcus a également averti que cela peut entraîner une baisse de la qualité des articles scientifiques.5
Méthodologie
Dans notre benchmark DR-50, nous avons évalué les outils de recherche IA en utilisant 50 questions réparties en six types de questions différents :
1. Recherche factuelle simple
Les questions à saut unique nécessitent une récupération simple de données à partir d'une seule source.
Exemple : « Quel est le prix d'entrée pour 1M tokens du modèle llama-3-70b de DeepInfra ? »
2. Analyse comparative
L'évaluation inter-sources nécessite la collecte de données auprès de plusieurs fournisseurs pour comparer des produits ou services.
Exemple : « Quel fournisseur propose llama-3.2-1b au prix mixte le plus bas ? »
3. Raisonnement multi-sauts
Les chaînes de raisonnement séquentiel nécessitent plusieurs étapes dépendantes de récupération d'informations.
Exemple : « Quel est le prix d'entrée par million de tokens sur OpenRouter pour le modèle qui s'est classé 1er dans le benchmark de raisonnement financier d'AIMultiple ? »
4. Basé sur le calcul
Des opérations mathématiques sont effectuées sur des données numériques récupérées.
Exemple : « Quelle est la différence de prix mixte entre les deux modèles Mistral IA les moins chers ? »
5. Extraction structurée en JSON
La collecte de données nécessite un formatage strict en JSON avec plusieurs valeurs structurées.
Exemple : « Quelles sont l'architecture, la mémoire et la bande passante du NVIDIA H200 SXM ? Format : {“architecture”: “…”, “memory”: “…”, “bandwidth”: “…”} »
6. Listage catégoriel
Énumération complète de tous les éléments d'une catégorie spécifique.
Exemple : « Fournissez tous les serveurs MCP de la catégorie blockchain. »
Métriques d'évaluation
Précision
Nous avons comparé chaque réponse à des réponses de référence prédéfinies en utilisant GPT-4o-mini comme juge automatisé via OpenRouter. Le score de précision final représente le pourcentage de réponses correctes sur l'ensemble des 50 requêtes.
Comptage de tokens
Nous avons utilisé la bibliothèque tiktoken pour mesurer les tokens côté client et avons validé ces mesures avec les comptages de tokens rapportés par les APIs des fournisseurs et les interfaces utilisateur lorsque disponibles.
Latence
Nous avons mesuré la latence comme le temps écoulé entre le début de la requête et la réception de la réponse complète, rapporté en secondes. Nous avons validé ces mesures avec les métriques de latence rapportées par les APIs des fournisseurs et les interfaces utilisateur lorsque disponibles.
Coût
Nous avons suivi les coûts manuellement via le tableau de bord de facturation de chaque fournisseur.
Citations
Nous avons extrait automatiquement les citations des métadonnées de réponse de chaque API et compté les URL uniques citées par réponse.
Configuration technique
Nous avons exécuté le benchmark de manière séquentielle, chaque API complétant toutes les 50 requêtes avant que l'API suivante ne démarre. Nous avons mis en place un délai de 5 secondes entre les requêtes consécutives pour éviter les limitations de débit, et nous n'avons imposé aucune limite de temps d'attente, permettant aux requêtes d'attendre indéfiniment leur complétion.
Pour le benchmark DR-2T basé sur différentes tâches, chaque donnée du prompt a été notée 1 point. Si la sortie n'était pas au format tableau, nous l'avons notée 0.
Prompt de la tâche 1
Recherchez et évaluez les 5 meilleures solutions de gestion de mots de passe d'entreprise selon les critères suivants pour identifier la solution la plus efficace pour un déploiement en entreprise.
Critères
1. Fonctionnalités de sécurité
- Norme de chiffrement utilisée
- Mise en œuvre de l'architecture zéro connaissance
- Options MFA prises en charge
- Certifications de sécurité tierces
- Fonctionnalités de surveillance de la santé des mots de passe
2. Déploiement et intégration
- Options de déploiement
- Capacités d'intégration d'annuaire
- Disponibilité et fonctionnalité de l'API
- Intégration SSO
3. Expérience utilisateur
- Compatibilité des extensions de navigateur
- Disponibilité et évaluation de l'application mobile
- Capacités d'accès hors ligne
- Fonctionnalité de partage de mots de passe
4. Administration
- Options de mise en œuvre de la politique de mots de passe
- Automatisation de l'approvisionnement/désapprovisionnement des utilisateurs
- Fonctionnalités de reporting et de conformité
- Protocoles d'accès d'urgence
5. Coût et évolutivité
- Comparez les prix en utilisant des scénarios d'entreprise standardisés (100 utilisateurs, 500 utilisateurs, plus de 1000 utilisateurs)
Format de livraison
- Tableau détaillé pour chaque critère
- Tableau comparatif des coûts avec des scénarios standardisés
Prompt pour la tâche 2
Dans notre deuxième tâche, nous avons cherché à découvrir l'étendue de la recherche effectuée. Pour ce faire, nous avons comparé le nombre de références citées. Comparer les articles n'est pas une méthode objective dans ce cas, car établir une vérité de référence définitive n'est pas faisable.
Cependant, le nombre de références peut nous donner une idée de leur capacité à fournir des informations, puisque la force de ces outils est leur capacité à indexer des centaines de pages web en quelques minutes.
Méthodologie du benchmark Agent vs Deep Research
Nous avons créé 5 tâches de recherche dans différents domaines. Chaque tâche pose des questions directes avec des réponses factuelles et vérifiables. Chaque point de contrôle est noté de manière binaire : correct ou incorrect.
Chaque question cible des informations publiées après les dates de coupure des données d'entraînement des modèles. Le benchmark a été exécuté la première semaine d'avril 2026.
La vérité de référence a été établie à partir de sources primaires : la documentation officielle de Unity 6.4, le dépôt SEC 8-K d'Atlassian, les communiqués de presse de Paramount, l'article arxiv d'ARC-AGI-3 et les guides de mise à niveau de Unity. Chaque outil a reçu des prompts identiques. Tous les prompts se terminaient par « Citez toutes les sources que vous avez utilisées avec les URL. »
Notation : correspondance de motifs automatisée pour les nombres, les dates et les noms. Juge LLM (GPT-4o) pour les points de contrôle de qualité des explications. Un examinateur humain a validé tous les résultats.
Les modèles de recherche approfondie ont été appelés via l'API OpenRouter (o3, o4-mini, Sonar) et l'API Parallel. Les agents ont été exécutés via leurs interfaces CLI avec la recherche web activée, sans outils MCP.
Dans Claude Code, nous avons utilisé Opus 4.6, et dans Codex, nous avons utilisé GPT 5.4. Les deux en effort moyen, et le calcul du coût est effectué en fonction de l'utilisation des tokens pour les deux agents.
FAQ
Les outils de recherche assistée par IA transforment la manière dont les scientifiques mènent leurs recherches, en les rendant plus rapides et plus efficaces. Les outils de recherche approfondie, en particulier, ont le potentiel d'avoir un impact significatif sur la communauté scientifique. Ils peuvent contribuer à accélérer le processus, mais les utilisateurs doivent faire attention aux erreurs avant de publier ces informations.
Des rapports et des études sectorielles ont montré que les outils d'IA peuvent être très efficaces dans certains domaines, tels que l'analyse de données et les revues de littérature. Ces outils utilisent des modèles d'IA performants pour synthétiser des informations provenant de sources multiples, fournissant des conclusions et des perspectives clés.
Ces modèles utilisent des modèles de raisonnement et l'IA générative pour synthétiser des informations et fournir des perspectives. Ils peuvent également répondre à des sujets complexes et fournir des réponses détaillées. Les utilisateurs avancés peuvent tirer parti des outils d'IA pour obtenir un avantage concurrentiel dans leurs recherches.
À l'instar de Deep Research, de nouveaux modèles et technologies, tels que les outils Python IA et les sous-ensembles texte seul, émergent, et l'intégration de tous ces outils augmentera la portée et la fiabilité de Deep Research.
Les outils d'IA peuvent aider à divers aspects des revues de littérature, notamment l'identification des articles pertinents, le résumé des principales conclusions et l'organisation des thèmes de recherche. Ces outils peuvent traiter rapidement de grands volumes de littérature académique et aider les chercheurs à identifier les lacunes ou les motifs entre les études. Cependant, l'IA ne peut pas remplacer totalement le jugement humain pour évaluer la qualité des sources, synthétiser des arguments complexes ou fournir une analyse critique. Les chercheurs doivent toujours examiner, vérifier et interpréter le contenu généré par l'IA pour garantir l'exactitude et maintenir la rigueur académique dans leurs revues de littérature.
Les outils d'IA peuvent aider à l'analyse de données et au travail statistique en nettoyant les ensembles de données, en effectuant des tests statistiques, en créant des visualisations et en identifiant des motifs dans de grands ensembles de données. Ces outils peuvent suggérer des méthodes statistiques appropriées en fonction du type de données et des questions de recherche. Cependant, les chercheurs doivent comprendre le contexte de leurs données et valider les résultats, car l'IA peut manquer des nuances spécifiques au domaine ou faire des hypothèses inappropriées.
La plupart des outils modernes de recherche IA utilisent des interfaces en langage naturel qui ne nécessitent pas de compétences en programmation. Cependant, une culture de base des données et une compréhension des concepts fondamentaux de la recherche aident les utilisateurs à formuler de meilleures requêtes et à interpréter les résultats plus efficacement. Les applications avancées peuvent bénéficier de connaissances techniques pour des analyses personnalisées ou des flux de travail spécialisés.
Les chercheurs devraient vérifier les résultats de l'IA par recoupement avec les sources originales et la littérature évaluée par les pairs. Les citations et références fournies par l'IA nécessitent une vérification, car elles peuvent être inexactes ou fabriquées. Les conclusions principales doivent être confirmées en utilisant plusieurs sources, avec une prudence particulière pour les développements récents ou les sujets de niche. Les analyses statistiques bénéficient d'une validation par plusieurs outils, et les experts du domaine devraient examiner les résultats complexes lorsque cela est possible.
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Recherche approfondie par IA: Claude vs ChatGPT vs Grok}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/ai-deep-research}},
note = {AIMultiple. Consulté le 22 Juin 2026}
}
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.