Nous avons évalué 8 serveurs MCP sur des tâches de recherche et extraction Web, ainsi que d'automatisation de navigateur, en exécutant 4 tâches différentes 5 fois sur tous les MCPs appropriés. Nous avons également effectué un test de charge impliquant 250 agents IA simultanés.
Serveurs MCP avec capacités d'accès Web
Produit | Taux de réussite pour la recherche
et l'extraction Web | Taux de réussite pour
l'automatisation de navigateur | Vitesse de recherche et
d'extraction Web (s) | Vitesse d'automatisation
de navigateur (s) | Score d'évolutivité |
|---|---|---|---|---|---|
100% | 90% | 30 | 30 | 77% | |
78% | 0% | 32 | N/A | 19% | |
75% | N/A | 14 | N/A | 54% | |
Nimble | 93% | N/A | 16 | N/A | 51% |
Firecrawl | 83% | N/A | 7 | N/A | 65% |
Hyperbrowser | 63% | 90% | 118 | 93 | N/A |
Browserbase | 48% | 5% | 51 | 104 | N/A |
Tavily | 38% | N/A | 14 | N/A | 45% |
Exa | 23% | N/A | 15 | N/A | N/A |
*Les tâches de recherche et extraction Web sont exécutées avec le serveur Bright Data MCP par défaut, les tâches d'automatisation de navigateur sont exécutées avec le Bright Data MCP Pro Mode, car les outils nécessaires à l'automatisation de navigateur sont disponibles sur le Pro Mode.
**Le tableau est trié en fonction des scores dans la catégorie recherche et extraction Web, avec les sponsors affichés en haut.
Chacune des dimensions ci-dessus et leurs méthodes de mesure sont décrites ci-dessous :
Taux de réussite des serveurs MCP dans l'accès Web
*N/A indique que le serveur MCP ne possède pas cette capacité.
Nous avons évalué les produits dans deux catégories différentes : recherche et extraction Web et automatisation de navigateur. Les résultats de notre benchmark révèlent que Bright Data a le taux de réussite le plus élevé dans les tâches de recherche et extraction Web, complétant 100% de ces tâches avec succès. Dans les tâches d'automatisation de navigateur, Bright Data (Pro Mode) et Hyperbrowser ont les taux de réussite les plus élevés, avec 90% de taux de complétion des tâches.
Parmi tous les outils que nous avons évalués, Apify, Bright Data, Browserbase, et Hyperbrowser sont les seuls à posséder les deux capacités requises pour les agents travaillant sur le Web :
- Recherche et extraction Web inclut la recherche sur le Web et l'utilisation des liens sur la page pour naviguer entre les pages afin de collecter et traiter des données.
- Automatisation de navigateur inclut l'interaction avec des éléments JS pour remplir des formulaires, etc.
Pour voir en détail les tâches utilisées dans le benchmark, consultez notre méthodologie.
Vitesse
Notre évaluation montre :
- Recherche et extraction Web : Firecrawl est le MCP le plus rapide avec un temps d'exécution MCP moyen pour des résultats corrects de 7 secondes et son taux de précision était de 83%.
- Automatisation de navigateur : Bright Data est le plus rapide avec 30 secondes de temps d'exécution MCP moyen pour des résultats corrects et son taux de précision était de 90%.
Toutes les métriques de vitesse concernent les tâches correctement complétées. Parfois, les serveurs MCP produisent des réponses rapides indiquant un échec, ce qui n'est pas comparable au temps nécessaire pour terminer une tâche.
Notre jeu de données pour la navigation incluait la participation de toutes les marques et a généré 80 points de données (c.-à-d. 8 marques, 2 tâches et 5 répétitions pour chaque tâche). Sur la base de ces points de données, il semble y avoir une corrélation négative entre les taux de réussite et la vitesse :
Cette corrélation est intuitive :
- Parfois, les sites Web identifient les bots comme un trafic suspect et déclenchent des fonctionnalités anti-scraping.
- Cela conduit certains serveurs MCP à échouer.
- Ceux qui n'échouent pas doivent utiliser une technologie de déblocage qui peut être plus lente (c.-à-d. que l'intervalle de confiance à 95% inclut 4 secondes pour l'un des fournisseurs dans notre benchmark de débloqueurs Web).
Évolutivité
Ce benchmark mesure la performance et la fiabilité des serveurs MCP lorsqu'ils sont soumis à un volume élevé de tâches d'agents IA autonomes simultanées. L'axe X, Taux de réussite (%), représente le score du fournisseur issu de notre benchmark de recherche et extraction Web à agent unique. L'axe Y, Score d'évolutivité (%), est dérivé du test de charge à haute concurrence détaillé ci-dessous, qui mesure la stabilité et la fiabilité du serveur sous stress.
Chaque agent a été construit sur le framework LangChain create_react_agent, propulsé par le modèle de langage gpt-4.1-nano-2025-04-14. Les agents ont reçu diverses invites de recherche e-commerce, telles que « Va sur target.com, trouve un coussin décoratif à moins de 20 dollars. » Une tâche était considérée comme réussie uniquement si l'agent naviguait sur le site Web, trouvait un produit correspondant et retournait les données requises (url, prix, note) dans un format JSON structuré dans un délai de 5 minutes.
Le test a révélé les différences clés suivantes à la fois dans le taux de réussite et le temps moyen requis pour terminer une tâche réussie :
- Lors du test de stress avec 250 agents simultanés, Bright Data a atteint un taux de réussite de 76,8% avec un temps de complétion moyen compétitif de 48,7 secondes par tâche réussie, et est ressorti comme le leader global.
- Firecrawl a délivré un taux de réussite de 64,8%, avec une durée moyenne de tâche de 77,6 secondes.
- Oxylabs a démontré la performance la plus rapide, complétant ses tâches réussies en une moyenne de seulement 31,7 secondes, tout en maintenant un taux de réussite solide de 54,4%.
- Nimble a enregistré un taux de réussite de 51,2%, mais ses tâches réussies ont pris significativement plus de temps, avec une moyenne de 182,3 secondes pour se terminer.
- Tavily a complété les tâches avec un taux de réussite de 45%, avec le deuxième temps de complétion moyen le plus rapide de 41,3 secondes.
- Apify a complété le test avec un taux de réussite plus faible de 18,8%, bien que ses tâches réussies aient été relativement rapides, avec une moyenne de 45,9 secondes.
Méthodologie pour évaluer les capacités d'accès Web des serveurs MCP
Les MCPs fonctionnent à travers divers environnements de développement, y compris Claude Desktop, VSCode, et Cursor. Dans notre évaluation, nous avons intégré les MCPs dans un framework d'agent LangGraph en utilisant la bibliothèque langchain-mcp-adapters. Nous avons utilisé quatre invites dans le benchmark. Invites de recherche et extraction Web :
- Assistant shopping : “Va sur Amazon et trouve 3 écouteurs à moins de 30 dollars. Fournis leurs noms, notes et URLs.”
- SDR IA pour la génération de leads : “Va sur LinkedIn, trouve 2 personnes qui travaillent chez AIMultiple, fournis leurs noms et URLs de profil.”
Invites d'automatisation de navigateur :
- Assistant de voyage : “Trouve le meilleur prix pour le Betsy Hotel, South Beach, Miami le 16 juin 2025. Fournis le prix et l'URL.”
- Remplisseur de formulaire : “https://aimultiple.com/ va sur cette page, entre mon e-mail xxx@aimultiple.com dans l'abonnement à la newsletter et clique sur le bouton s'abonner.”
Nous avons exécuté chaque tâche 5 fois par agent IA et évalué la performance sur la base de points de données spécifiques.
Chaque tâche constituait une part égale du score total, des points étant attribués pour la récupération réussie de chaque élément de données requis. Notre code a suivi à la fois le temps d'exécution des outils MCP et la durée totale de traitement de l'agent, en utilisant claude-3-5-sonnet-20241022 comme LLM de l'agent IA.
Pour être équitable envers tous les MCPs, nous avons utilisé le même agent avec les mêmes invites et les mêmes invites système. L'invite système est écrite dans un langage adapté à tous les agents (pas de mentions d'outils spécifiques ni d'instructions détaillées).
Les trois premières tâches mesuraient les capacités de recherche et d'extraction des MCPs, et la dernière tâche mesurait leurs capacités d'automatisation de navigateur.
Fonctionnalités
Nous avons également mesuré certaines fonctionnalités importantes de ces serveurs MCP. Pour une explication des fonctionnalités, veuillez consulter la section méthodologie dans le benchmark de navigateur agent.
Support des moteurs de recherche
Ciblage
Sécurité
La sécurité des données est cruciale pour les opérations d'entreprise. Nous avons vérifié si les entreprises de ces navigateurs agents possédaient une certification de sécurité des données. Toutes les entreprises affirment sur leurs sites Web avoir une certification ISO 27001 ou SOC 2.
Benchmark de prix
Étant donné que tous les serveurs MCP avec capacités d'accès Web utilisent des paramètres différents dans la tarification, il est difficile de les comparer.
Par conséquent, nous avons mesuré leur prix pour une seule tâche. Il est difficile de mesurer le coût uniquement pour les tâches correctes, car la plupart des fournisseurs ne décomposent pas les coûts de manière granulaire dans le temps. Par conséquent, pour être équitable envers tous les produits, nous choisissons la première tâche pour mesurer le succès du benchmark de recherche et extraction Web, car elle a le taux de réussite global le plus élevé. Pour le benchmark d'automatisation de navigateur, nous choisissons la dernière tâche pour mesurer le coût de la tâche.
La plupart des produits sont disponibles via divers plans avec différentes limites, et certains de ces plans permettent également l'achat de crédits supplémentaires. Ils mesurent les crédits dépensés selon différents paramètres comme par appel API, par Go, ou par page.
Veuillez noter que ces prix n'incluent pas le coût du LLM et que notre coût d'utilisation de Claude Sonnet 3.5 était supérieur aux coûts de navigation durant ces tâches. Par conséquent, la tarification des LLM est probablement plus importante que la tarification du serveur MCP lors de la construction d'agents pour des tâches liées au Web.
*Les prix peuvent varier en fonction du plan choisi et des remises entreprise.
Participants
Nous avons inclus tous les serveurs MCP qui fournissent des capacités de navigation Web basées sur le cloud :
- Apify
- Bright Data
- Browserbase
- Exa
- Firecrawl
- Hyperbrowser
- Nimble
- Oxylabs
- Tavily
Apify, Bright Data et Oxylabs sont sponsors de AIMultiple.
Pour cette version de notre benchmark, nous avons exclu les serveurs MCP qui fonctionnaient sur les propres appareils des utilisateurs car ils ont des capacités limitées pour répondre à un nombre élevé de requêtes. Si nous avons manqué des serveurs MCP basés sur le cloud avec des capacités de navigation Web, veuillez nous le faire savoir dans les commentaires.
Défis et atténuations de la navigation Web MCP
Lorsqu'ils sont configurés dans un client MCP tel que Claude Desktop, les LLMs peuvent tirer parti de serveurs MCP spécialisés. Les MCPs d'accès Web sont particulièrement précieux car ils permettent l'extraction de données Web, y compris la capacité de rendre des pages riches en JavaScript, de contourner les restrictions d'accès courantes, d'effectuer des actions, de remplir des formulaires et d'accéder à du contenu géo-restreint depuis divers emplacements mondiaux, mais ils présentent certains défis.
Bien que nous ayons rencontré des défis similaires au benchmark de navigateur agent, les MCPs présentent de nouveaux défis pour le benchmarking. Les LLMs, avec l'ajout d'une fonction de mémoire externe, peuvent être utilisés comme une machine de Turing, et avec un serveur MCP qui fournit des capacités de navigation, il est théoriquement possible d'accomplir n'importe quelle tâche de navigation Web ou d'automatisation de navigateur avec les serveurs MCP qui fournissent ces capacités.
Par conséquent, en écrivant du code personnalisé pour chaque agent, il est possible d'atteindre des taux de réussite de 100%. Cependant, ce n'est pas un bon proxy pour les utilisateurs de MCP qui veulent fournir des instructions simples et atteindre des taux de réussite élevés. Par conséquent, nous avons choisi des invites aussi simples et universelles que possible et ne faisant pas référence aux fonctionnalités de serveurs MCP spécifiques.
Fenêtre de contexte
La fenêtre de contexte peut être dépassée lors de longues tâches. Les agents consomment des pages entières pendant qu'ils naviguent sur le Web et, par conséquent, la fenêtre de contexte limitée des LLMs est tôt ou tard dépassée. Par conséquent, pour construire des agents qui accomplissent des tâches impliquant de nombreuses pages, les utilisateurs ont besoin
- de LLMs avec de grandes fenêtres de contexte
- d'optimiser les tailles des pages passées au LLM. Par exemple, vous pourriez être en mesure de supprimer programmatiquement les parties inutiles des pages et de faire en sorte que le LLM se concentre uniquement sur les parties importantes des pages.
Expérience développeur
Les développeurs expérimentés peuvent utiliser les serveurs MCP sur des clients MCP qui nécessitent du codage, et peuvent facilement exécuter des tests parallèles ou utiliser l'exécution de code MCP. De plus, les clients MCP sans code comme Claude ou Cursor peuvent être utilisés facilement sans expérience de développeur requise.
FAQ
MCP (Model Context Protocol) établit un pont de communication standardisé entre les agents IA et les applications, permettant aux applications IA et aux LLMs d'interagir avec des outils et services externes.
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Alper, Şevval},
title = {{MCP Benchmark: Meilleurs serveurs MCP pour l'accès Web}},
year = {2026},
month = mar,
howpublished = {\url{https://aimultiple.com/browser-mcp}},
note = {AIMultiple. Consulté le 16 Mars 2026}
}
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.