Services
Contactez-nous

Les meilleurs 30+ agents web open source

Cem Dilmegani
Cem Dilmegani
mis à jour le 1 sept. 2026

Nous avons testé 30+ agents web open source dans quatre catégories : agents autonomes, contrôleurs d'utilisation d'ordinateur, scrapers web et frameworks pour développeurs.

Nous avons exécuté des benchmarks identiques à l'aide de la suite de tests WebVoyager, qui couvre 643 tâches sur 15 sites web réels, pour mesurer quels outils parviennent réellement à accomplir des tâches web en plusieurs étapes et lesquels échouent lorsque les sites utilisent des listes déroulantes dynamiques ou des mises en page lourdes en JavaScript.

Loading Chart

Agents web open source : étoiles GitHub

Voir les sources des benchmarks.

Méthodologie du benchmark WebVoyager

Agents testés

Nous avons inclus les agents qui répondaient aux trois critères : code source librement disponible, un score publié sur le benchmark WebVoyager issu de la propre évaluation de l'agent, et une maintenance active (dernier commit dans les 6 mois précédant notre date d'examen).

  • Browser-Use : pont LLM-navigateur, basé sur le DOM avec intégration LangChain
  • Skyvern 2.0 : architecture vision-planificateur-acteur-validateur, déploiement cloud
  • Agent-E : DOM uniquement, sans modèles de vision, jeu de données complet de 643 tâches
  • WebVoyager : référence multimodale originale, hybride GPT-4V + DOM

Les agents cités dans l'article plus large mais sans scores WebVoyager publiés (Auto-GPT, AgenticSeek, OpenManus, LaVague et autres) ont été évalués qualitativement sur l'architecture, le modèle de déploiement et les capacités annoncées. Ils ne sont pas inclus dans la comparaison quantitative.

Conditions de test

Chaque équipe a exécuté sa propre évaluation ; nous n'avons pas relancé les tests de manière indépendante. Les différences de scores reflètent en partie des conditions de test différentes :

Browser-Use a testé 586 des 643 tâches, en supprimant 55 avec des réponses obsolètes (produits Apple abandonnés, dates de vol expirées, recettes supprimées). Les tests ont été exécutés sur des machines locales avec des adresses IP sûres. L'intégration LangChain et des prompts système réécrits ont été appliqués avant les tests.

Skyvern 2.0 a testé 635 des 643 tâches, en supprimant 8 avec des réponses invalides, et a mis à jour les dates 2023/2024 des tâches de voyage vers 2025. Les tests ont été exécutés dans Skyvern Cloud à l'aide de navigateurs cloud asynchrones, et non sur des machines locales. Les conditions cloud exposent les agents à la détection de bots et aux défis CAPTCHA que les tests locaux évitent. Les enregistrements complets des tests sont disponibles sur eval.skyvern.com.

Agent-E a testé l'intégralité du jeu de données de 643 tâches sans modifications. Il a utilisé uniquement l'analyse DOM, sans modèles de vision. La référence de comparaison était l'agent WebVoyager original, pas GPT-4o.

WebVoyager (original) a testé le jeu de données complet en utilisant des captures d'écran GPT-4V plus le DOM. Il sert de référence multimodale qu'Agent-E a surpassé en utilisant uniquement du texte.

Notation

L'achèvement d'une tâche est binaire : l'agent accomplit l'intégralité de la tâche en plusieurs étapes ou ne l'accomplit pas. Aucun crédit partiel n'est accordé. Une tâche est marquée comme terminée uniquement lorsque la sortie finale attendue (un prix, une confirmation de réservation, un résultat de recherche) correspond à la vérité terrain.

Le taux de réussite est indiqué comme : tasks completed / tasks attempted × 100

Lorsque des équipes ont retiré des tâches du jeu de données, le dénominateur reflète leur ensemble réduit, pas les 643 tâches d'origine.

Ce que ces scores signifient en pratique

Les tâches du benchmark WebVoyager s'exécutent sur des sites web en direct dans des conditions coopératives, sans protection agressive contre les bots, sans Cloudflare, sans DataDome. Browser-Use et Agent-E ont été exécutés sur des machines locales avec des IP équivalentes à des IP résidentielles. Skyvern a délibérément utilisé une infrastructure cloud pour se rapprocher de la réalité de production. Les taux de réussite réels sur les sites de production protégés seront inférieurs aux scores du benchmark pour tous les agents.

Le benchmark ne mesure pas la vitesse, le coût par tâche ni la résilience aux mesures anti-bots. Un score WebVoyager de 89,1 % ne signifie pas que l'agent accomplira 89 % des tâches sur un site de production avec une protection Cloudflare.

Limites

Dénominateurs non comparables : Browser-Use a testé 586 tâches, Skyvern a testé 635, Agent-E a testé 643. Un score plus élevé sur un ensemble plus petit n'est pas directement comparable à un score plus faible sur l'ensemble complet.

Résultats autodéclarés : Tous les scores proviennent de l'évaluation publiée par chaque équipe. Nous n'avons pas réalisé de nouveau test contrôlé avec des conditions identiques pour tous les agents.

Dérive du benchmark : Le jeu de tâches WebVoyager a été publié en 2023. Plusieurs tâches font référence à des produits, des prix et des dates qui n'existent plus. Les équipes les ont traitées différemment ; certaines les ont supprimées, tandis que d'autres ont mis à jour les dates, ce qui introduit une incohérence.

Écart local / cloud : Browser-Use et Agent-E ont été testés localement (IP sûres, pas de détection de bots). Skyvern a été testé dans le cloud (exposition réelle à la protection anti-bots). La comparaison directe des scores sous-estime l'écart de production pour les agents testés localement.

Pas de données de coût ni de latence : Le benchmark mesure uniquement l'achèvement des tâches. Le coût par tâche et le temps d'achèvement moyen ne sont pas capturés dans les scores WebVoyager, bien qu'ils comptent de manière importante pour les décisions de déploiement en production.

Instantané statique : Les scores reflètent les versions des agents et l'état des sites web au moment du test. Les deux changent fréquemment ; une refonte du site web ou une mise à jour de l'agent peut modifier les résultats de manière significative.

Mises à jour majeures récentes

Crise de sécurité : distribution de logiciels malveillants OpenClaw

Plus de 400 « skills » malveillants ont été téléversés sur ClawHub (la place de marché d'OpenClaw) entre fin janvier et début février, distribuant des logiciels malveillants de vol d'identifiants. IBM, Anthropic et Palo Alto Networks ont émis des avertissements. Les chercheurs en sécurité recommandent désormais d'utiliser uniquement des environnements isolés et des sources vérifiées.

Croissance virale d'OpenClaw

OpenClaw (anciennement Moltbot/Clawdbot) a atteint 147 000 étoiles GitHub, le projet d'IA open source à la croissance la plus rapide. Il s'exécute localement, s'intègre aux plateformes de messagerie et utilise le Model Context Protocol pour plus de 100 services. Cloudflare a publié le middleware Moltworker pour soutenir son infrastructure.1

Moltbook : réseau social d'agents IA

Un réseau social réservé à l'IA lancé fin janvier a atteint 1,5 million d'agents en quelques jours. Les agents publient et interagissent de manière autonome pendant que les humains observent.2

Normalisation du Model Context Protocol

MCP est devenu le protocole dominant pour l'intégration agent-outil, avec plus de 100 serveurs disponibles. La gestion et la gouvernance sont désormais essentielles pour les déploiements en entreprise.

NVIDIA Nemotron 3 : modèles

NVIDIA a publié la famille Nemotron 3 (Nano, Super, Ultra) optimisée pour l'IA agentique, offrant un débit 4x supérieur. Inclut NeMo Gym et le jeu de données Agentic Safety sur GitHub et Hugging Face.3

Agents web autonomes et copilotes

Outils qui naviguent sur des sites web et accomplissent des tâches en plusieurs étapes avec un minimum de guidage.

Agents autonomes polyvalents

OpenClaw (anciennement Moltbot/Clawdbot) : exécutez-le sur votre machine locale pour automatiser des tâches sur les applications de messagerie, les calendriers et les e-mails. Dites-lui « planifie une réunion avec l'équipe pour mardi prochain et envoie les invitations », et il gère l'ensemble du flux de travail. Utilise le Model Context Protocol pour se connecter à plus de 100 services sans appels d'API cloud.

Qui l'utilise : Les premiers adoptants prêts à gérer les risques de sécurité pour l'automatisation locale. Les utilisateurs qui veulent des interfaces conversationnelles pour les flux de travail de bureau.

Limites :

  • Vulnérabilités de sécurité majeures dans l'écosystème de compétences (400+ paquets malveillants en une semaine)
  • Encore en développement rapide avec des changements cassants fréquents
  • Documentation incohérente en raison de multiples cycles de rebranding
  • Gourmand en ressources (nécessite une puissance de calcul locale importante)

AgenticSeek : Remplacez les services commerciaux basés sur le cloud par une alternative locale qui n'envoie pas vos données de navigation à des serveurs externes. Installez-le sur votre machine, décrivez ce dont vous avez besoin (« extraire tous les prix des produits de cette page »), et il gère les clics et la collecte de données. Basé sur Python, il s'exécute entièrement en auto-hébergement.

Qui l'utilise : Les utilisateurs soucieux de la confidentialité qui ne partageront pas leurs données de navigation. Les organisations soumises à des exigences de résidence des données.

Limites :

  • Limité à une concurrence sur une seule machine (5-10 instances de navigateur)
  • Pas de rotation de proxy intégrée ni de fonctionnalités anti-détection
  • Nécessite la configuration et la maintenance d'un environnement Python
  • Plus lent que les solutions cloud pour les tâches à grande échelle

Auto-GPT : Gère la navigation web ainsi que les opérations sur les fichiers et l'exécution de code. Déployez-le via l'interface du navigateur ou la ligne de commande. Lorsque vous attribuez une tâche comme « rechercher les prix des concurrents et les enregistrer dans un tableur », il détermine les sites à visiter, les données à récupérer et la manière d'organiser la sortie.

Qui l'utilise : Les développeurs qui créent des flux de travail d'automatisation personnalisés. Les utilisateurs à l'aise avec les outils en ligne de commande.

Limites :

  • Absence de fonctionnalités spécifiques au web telles que la rotation de proxy et la gestion des cookies
  • Pas d'évitement intégré de la détection de bots (les sites avec Cloudflare le bloqueront)
  • Gourmand en ressources (lance plusieurs instances de navigateur)
  • Nécessite une ingénierie de prompt manuelle pour les tâches complexes

AgentGPT : configurez des agents directement dans votre navigateur sans écrire de code. Développez des agents spécialisés tels que « ResearchGPT » ou « DataGPT » qui décomposent les objectifs en étapes. La plateforme gère l'orchestration. Vous décrivez ce que vous souhaitez accomplir. Auto-hébergeable si vous ne souhaitez pas utiliser leur version hébergée.

Qui l'utilise : Les utilisateurs non techniques qui ont besoin d'une automatisation simple. Les équipes qui souhaitent des configurations d'agents partagées.

Limites :

  • Personnalisation limitée par rapport aux solutions codées
  • Goulots d'étranglement de performance sur les tâches complexes en plusieurs étapes
  • La version hébergée envoie les données à leurs serveurs (l'auto-hébergement est requis pour la confidentialité)
  • Pas de fonctionnalités avancées comme la prise d'empreinte du navigateur ou la gestion des CAPTCHA

SuperAGI : Framework pour créer des agents autonomes personnalisés avec des modèles pour les flux de travail courants. Étendez-le avec votre propre logique. Gère l'automatisation du navigateur comme un composant de flux de travail plus larges. Déployez-le localement ou poussez-le vers une infrastructure cloud.

Qui l'utilise : Les équipes de développement qui construisent des systèmes d'agents en production. Les organisations qui ont besoin de frameworks d'automatisation personnalisables.

Limites :

  • Courbe d'apprentissage abrupte (nécessite de comprendre l'architecture des agents)
  • Bibliothèque de modèles encore limitée (nécessite un développement personnalisé pour la plupart des cas d'usage)
  • Lacunes de documentation pour les fonctionnalités avancées
  • Le développement actif entraîne des changements cassants entre les versions

Nanobrowser : approche par extension Chrome, installez-la, puis contrôlez les agents depuis la barre d'outils de votre navigateur. Idéal pour des tâches rapides comme « extraire tous les e-mails de cette page » ou « remplir ce formulaire avec les données de mon tableur ».

Qui l'utilise : Les utilisateurs occasionnels ayant besoin d'une automatisation ponctuelle du navigateur. Les utilisateurs qui ne mettront pas en place de serveurs ni d'environnements Python.

Limites :

  • Ne peut pas passer à l'échelle au-delà de quelques onglets (pas de traitement simultané)
  • Pas d'intégration avec les pipelines d'automatisation backend
  • Limité au navigateur Chrome
  • Les autorisations de l'extension soulèvent des préoccupations de sécurité

OpenManus : Alternative open source aux services commerciaux d'automatisation de navigateur. Exécute des tâches de navigateur qui durent des heures ou des jours, comme surveiller les sites pour détecter les changements de prix ou attendre le retour en stock de produits. Déployez-le localement avec Python et Docker, et laissez-le tourner en arrière-plan.

Mise à jour récente : DeepWisdom (la société mère d'OpenManus) a officiellement rebaptisé sa technologie d'agents principale Atoms à la mi-janvier. Le nouveau framework Atoms recentre l'attention des outils de loisirs pour développeurs vers un déploiement d'agents de qualité commerciale avec des modules intégrés pour les paiements et l'authentification.4

Qui l'utilise : Les utilisateurs qui exécutent des tâches de surveillance de longue durée. Les développeurs qui créent des systèmes de notification automatisés.

Limites :

  • Nécessite la configuration de Docker et Python
  • Pas de support de proxy intégré (les sites détecteront les requêtes répétées depuis la même IP)
  • Fuites de mémoire sur les tâches de longue durée (nécessite des redémarrages périodiques)
  • Le rebranding vers Atoms peut créer une confusion dans la documentation

Agents d'utilisation d'ordinateur

Automatisation de bureau qui contrôle les navigateurs comme un élément de flux de travail informatiques plus larges.

OpenInterpreter : Agent basé sur le terminal qui exécute Python, JavaScript et des scripts shell selon ce que vous tapez. Demandez-lui de « scraper ce site et analyser les données dans pandas », et il génère le code de scraping, l'exécute, puis effectue l'analyse. L'automatisation du navigateur s'intègre à l'accès au système de fichiers et au traitement des données.

Qui l'utilise : Les développeurs à l'aise avec les interfaces de terminal. Les data scientists combinent le web scraping avec des flux de travail d'analyse.

Quand cela a du sens : Vous avez besoin d'une automatisation qui couvre à la fois la navigation web et le calcul local. Vous voulez inspecter et modifier le code généré avant l'exécution. Vos flux de travail impliquent la transformation des données après la collecte.

Limites :

  • Interface terminal uniquement (pas d'interface graphique)
  • Risque de sécurité (exécute du code arbitraire sur votre machine)
  • Pas de sandboxing par défaut (peut accéder à n'importe quel fichier ou ressource système)
  • Courbe d'apprentissage pour les non-programmeurs

UI-TARS : Framework de recherche issu du milieu universitaire qui prend des captures d'écran de votre bureau, les analyse avec des modèles de vision, puis génère des commandes pour contrôler les éléments de l'interface graphique. Conçu pour tester de nouvelles approches d'automatisation de bureau, et non pour une utilisation en production.

Qui l'utilise : Les chercheurs académiques qui explorent l'automatisation basée sur la vision. Les laboratoires qui testent des systèmes de contrôle multimodaux.

Quand cela a du sens : Vous menez des recherches sur l'automatisation basée sur la vision. Vous devez expérimenter des approches d'analyse de captures d'écran. Vous rédigez des articles académiques sur l'automatisation des interfaces graphiques.

Limites :

  • Pas prêt pour la production (prototype de recherche)
  • Latence élevée (le traitement par modèle de vision prend 2 à 3 secondes par action)
  • Coûteux (GPT-4V facture par token d'image)
  • Pas de récupération d'erreur ni de logique de nouvelle tentative

AutoBrowser MCP : serveur MCP qui permet à Claude de contrôler les navigateurs Chrome via le Model Context Protocol, offrant des capacités d'interaction avec le navigateur basées sur la vision. Claude voit votre écran de navigateur, décide quoi cliquer et exécute l'action. Fonctionne comme une extension Chrome plus un serveur local.

Qui l'utilise : Les utilisateurs de Claude qui souhaitent contrôler le navigateur. Les développeurs qui construisent des systèmes d'automatisation basés sur MCP.

Quand cela a du sens : Vous utilisez déjà Claude et souhaitez ajouter l'automatisation du navigateur. Vous préférez le contrôle conversationnel aux API programmatiques. L'interaction basée sur la vision est requise pour les mises en page complexes.

Limites :

  • Nécessite un accès à l'API Claude (pas disponible dans toutes les régions)
  • Les coûts du modèle de vision s'accumulent rapidement
  • Latence plus élevée que celle des approches basées sur le DOM
  • Limité au navigateur Chrome

Open Operator : La réponse de l'équipe Browser-Use à l'Operator d'OpenAI. Fournit aux modèles de langage un accès direct à Chrome via une vue DOM simplifiée. Exécutez-le en mode entièrement autonome ou activez le mode approbation, dans lequel vous confirmez chaque action avant son exécution. Installation via Python ou une extension de navigateur.

Mise à jour récente : Browser-Use a annoncé une intégration stratégique avec Parallel IA fin janvier, permettant des recherches web multi-thread. Cette mise à jour permet aux agents d'exécuter jusqu'à 20 étapes de navigateur par minute, égalant ou dépassant les performances humaines sur des tâches de recherche complexes.5

Qui l'utilise : Les équipes qui utilisent déjà le framework Browser-Use. Les organisations qui souhaitent des flux de travail d'approbation pour les actions des agents.

Quand cela a du sens : Vous avez besoin d'une navigation autonome avec supervision humaine. Vos flux de travail exigent de la vitesse (exécution multi-thread). Vous construisez dans l'écosystème Browser-Use.

Limites :

  • Nécessite l'installation du framework Browser-Use
  • Le mode approbation ralentit considérablement l'automatisation
  • Fonctionnalités anti-détection limitées (les sites avec protection anti-bots le bloqueront)
  • Python uniquement (pas de support JavaScript/TypeScript)

Cowork (Anthropic) : L'outil de bureau d'Anthropic qui donne à Claude un accès direct aux systèmes de fichiers et aux environnements de navigateur dans une application unifiée. Il étend l'API Computer Use pour en faire un produit grand public. Disponible au téléchargement ; il n'est plus limité à un aperçu de recherche. Propriétaire, inclus ici à des fins de comparaison avec les alternatives open source.

Agents de navigation web

Se concentrent spécifiquement sur les flux de travail de sites web en plusieurs étapes.

Agent-E : lit le HTML de la page pour trouver les éléments cliquables et les chemins de navigation. Utilise la « distillation du DOM » pour réduire les pages aux éléments interactifs essentiels, plus la « récolte de compétences » pour se souvenir des schémas efficaces. A obtenu 73,1 % au benchmark WebVoyager en utilisant du texte pur, sans modèles de vision.

Qui l'utilise : Les organisations qui privilégient le coût à la précision. Les développeurs qui construisent des systèmes d'automatisation basés sur le DOM.

Quand cela a du sens : Vous avez besoin d'une automatisation rapide et bon marché sur des sites web statiques. Vos sites cibles n'utilisent pas de formulaires dynamiques à fort JavaScript. Vous pouvez tolérer un taux de réussite de 73 % en échange de coûts moindres.

Limites :

  • Pas de récupération d'erreur intégrée lorsque la structure du DOM change de manière inattendue
  • Des difficultés avec les formulaires dynamiques où les menus déroulants révèlent de nouvelles options en fonction des sélections
  • Les performances chutent considérablement sur les sites à fort JavaScript
  • Mauvais résultats sur les sites de réservation

AutoWebGLM : simplifie le HTML avant de le transmettre aux modèles de langage. Les pages complexes sont réduites aux éléments de navigation essentiels et aux champs de formulaire. Utilise l'apprentissage par renforcement pour améliorer les décisions de navigation au fil du temps. S'exécute en auto-hébergement via Python.

Qui l'utilise : Les équipes de recherche qui explorent l'automatisation web basée sur le RL. Les organisations disposant de ressources de calcul pour l'entraînement de modèles.

Quand cela a du sens : Vous pouvez investir dans l'entraînement de modèles personnalisés pour vos sites web spécifiques. Vos flux de travail sont suffisamment répétitifs pour bénéficier de l'optimisation par RL. Vous disposez d'une infrastructure Python de ML.

Limites :

  • Documentation et soutien communautaire limités
  • Nécessite une phase d'entraînement avant le déploiement (pas de plug-and-play)
  • Nécessite de nombreux exemples pour apprendre des politiques efficaces
  • Se casse lorsque les sites web reconçoivent leurs mises en page

Agents de navigation basés sur la vision

Combinent des captures d'écran à l'analyse de texte pour interpréter la mise en page visuelle.

Extension Autogen WebSurfer : s'intègre au framework AutoGen de Microsoft pour ajouter la navigation web. Nécessite l'installation de Playwright. Le framework vous permet de créer des équipes d'agents : un agent cherche pendant qu'un autre traite les résultats, et un troisième interagit avec vous.

Qui l'utilise : Les équipes qui utilisent déjà le framework AutoGen. Les utilisateurs de l'écosystème Microsoft.

Quand cela a du sens : Vous construisez des systèmes multi-agents au sein d'AutoGen. Vous avez besoin d'une collaboration d'agents orchestrée. Vous souhaitez bénéficier du support et de la documentation de Microsoft.

Limites réelles :

  • Exemples et projets communautaires limités
  • Nécessite d'adopter tout le framework AutoGen (ne peut pas être utilisé de manière autonome)
  • La surcharge du framework ne vaut pas la peine pour des tâches d'automatisation simples
  • Courbe d'apprentissage abrupte pour l'orchestration multi-agents

Skyvern : système en trois phases : le planificateur décompose les tâches en étapes, l'acteur les exécute, le validateur confirme la réussite. Prend des captures d'écran pour identifier visuellement les boutons et les formulaires. Cette approche répond aux sites à fort JavaScript où le DOM change après le chargement de la page. A obtenu 85,85 % sur WebVoyager. Déployez-le en auto-hébergement ou utilisez leur cloud géré.

WebVoyager : L'agent de référence original de l'article de 2024 qui a introduit la suite de tests WebVoyager. Utilise des captures d'écran GPT-4V parallèlement à l'analyse DOM dans une approche hybride. A obtenu 57,1 % sur l'ensemble des 643 tâches, la référence à partir de laquelle les agents ultérieurs se mesurent. N'est pas activement maintenu comme outil de production ; sa valeur réside dans sa référence de recherche et son point d'origine du benchmark.

Qui l'utilise : Les organisations qui ont besoin d'une grande précision sur les applications web modernes. Les équipes prêtes à payer les coûts des modèles de vision pour de meilleurs résultats.

Quand cela a du sens : Vos sites cibles utilisent beaucoup de JavaScript et des mises en page dynamiques. Vous avez besoin d'une précision de 85 % ou plus. Vous pouvez vous permettre des coûts 10-20x supérieurs à l'analyse DOM. Vos flux de travail justifient une infrastructure cloud.

Limites :

  • La version auto-hébergée nécessite une puissance de calcul importante pour les modèles de vision
  • Coûteux (GPT-4V facture par token d'image ; chaque affichage de page coûte 10-20x de plus que l'analyse DOM)
  • Plus lent que les approches DOM (2 à 3 secondes par page pour le traitement de la vision)
  • Le déploiement cloud vous expose à la détection de bots

LiteWebAgent : modèle de langage visuel avec mémoire et planification qui contrôle Chrome via le DevTools Protocol. Conserve le contexte entre les chargements de pages, en se souvenant de ce qu'il a vu sur les pages précédentes lorsqu'il prend des décisions de navigation. Framework Python, déploiement auto-hébergé.
Qui l'utilise : Les développeurs qui construisent des agents basés sur la vision personnalisés. Les équipes ayant besoin d'une mémoire inter-pages.
Quand cela a du sens : Vos flux de travail nécessitent de mémoriser des informations sur plusieurs pages. Vous avez besoin de capacités de vision mais souhaitez plus de contrôle que Skyvern. Vous pouvez maintenir une infrastructure Python de ML.

Limites :

  • Nécessite une puissance de calcul importante pour les modèles de vision
  • L'architecture de mémoire augmente la complexité et les modes de défaillance
  • Tests limités sur les sites de production avec détection de bots
  • Petite communauté (moins d'exemples et d'intégrations que les alternatives)
Laissez notre équipe automatiser l'un de vos processus métier avec des agents IA, gratuitement.
Automatiser un processus

Outils d'activation des agents

Frameworks qui permettent aux LLM ou aux utilisateurs d'envoyer des commandes aux navigateurs sans planification autonome des tâches.

Langage naturel vers action web

LaVague : vous dites « Cliquez sur le bouton vert ». LaVague le trouve et clique dessus. Gère l'identification des éléments sur différentes mises en page. Idéal pour les tâches répétitives où vous savez exactement ce que vous voulez mais ne voulez pas écrire de sélecteurs. Basé sur Python, s'exécute en auto-hébergement.

ZeroStep : transforme les instructions conversationnelles en code de test Playwright. Vous décrivez l'action en langage clair, il génère les commandes Playwright. Accélère l'écriture des tests si vous utilisez déjà Playwright. Outil CLI Node.js.

Ponts LLM-navigateur

Connectent les modèles de langage directement aux commandes du navigateur.

Browser-Use : prend le DOM désordonné et le restructure pour les LLM. Élimine les éléments non pertinents, étiquette les composants interactifs et fournit des interfaces de contrôle. C'est ce qui a permis à Browser-Use d'atteindre 89,1 % sur WebVoyager. Disponible sous forme de bibliothèque Python ou d'API, déployable en auto-hébergement ou via leur cloud.

Browserless : instances Chrome distantes que vous contrôlez via REST ou WebSocket. Lancez des centaines de navigateurs dans le cloud sans gérer d'infrastructure. Chaque navigateur fonctionne en mode headless, donc pas de surcharge d'interface graphique. Utilisez leur API hébergée ou Docker pour l'auto-hébergement.

ZeroStep (Playwright IA) : couche d'IA au-dessus de Playwright. Écrivez des prompts plutôt que des sélecteurs. Combine la fiabilité de Playwright avec la flexibilité des LLM pour identifier les éléments. Nécessite l'installation de Node.js et Playwright.

Boîtes à outils d'automatisation web et de scraping

Outils spécifiques à une tâche, où vous lancez chaque travail individuellement.

Extensions d'automatisation du navigateur

PulsarRPA : extension Chrome pour l'extraction de données. Pointez-la vers un tableau ou une liste, montrez-lui quoi extraire, et elle s'occupe du reste. Inclut un backend pour la planification et le stockage des résultats.

Qui l'utilise : Les utilisateurs non techniques qui ont besoin d'une extraction régulière de données. Les analystes métier qui importent des données dans des tableurs.

Quand cela a du sens : Vous extrayez des données des mêmes sites de façon répétée. Vous ne voulez pas écrire de code. Vous avez besoin de planification et de stockage des résultats. Vos sites cibles ne bloquent pas les extensions de navigateur.

Limites :

  • Chrome uniquement (pas de Firefox ni de Safari)
  • Se casse lorsque les sites cibles changent de mise en page
  • Pas de support de proxy (les sites détectent les requêtes répétées depuis la même IP)
  • Limité à l'extraction de données tabulaires

VimGPT : projet expérimental où la vision de GPT-4 contrôle votre navigateur via les raccourcis clavier Vimium. Le modèle voit les captures d'écran et génère des commandes clavier.

Qui l'utilise : Les chercheurs qui explorent la vision + le contrôle clavier. Les passionnés de Vim curieux de l'automatisation par l'IA.

Quand cela a du sens : Vous menez des recherches sur l'automatisation pilotée par clavier. Vous cherchez à comprendre les capacités des modèles de vision. Vous ne déployez pas d'automatisation en production.

Limites :

  • Expérimental uniquement (pas pratique pour un travail réel)
  • Nécessite l'extension Vimium plus un backend Python
  • Latence élevée (traitement de la vision + génération de commandes)
  • Coûteux (coûts GPT-4V par capture d'écran)

Scrapers et crawlers IA

Crawl4AI : un crawler qui utilise des LLM pour décider ce qui est important sur une page. Au lieu de tout récupérer, il identifie le contenu pertinent en fonction de votre objectif. Basé sur Python, s'intègre aux bibliothèques de scraping standard.

Croissance récente : a atteint la première place des tendances sur GitHub et dépassé 58 000 étoiles. Optimisé pour l'intégration des LLM avec une sortie en markdown et un filtrage de contenu BM25. Choix populaire pour les pipelines RAG nécessitant un déploiement local d'abord.6

Qui l'utilise : Les développeurs qui construisent des systèmes RAG. Les équipes ayant besoin d'un support LLM local sans coûts d'API.

Quand cela a du sens : Vous construisez des applications LLM qui ont besoin de données web. Vous voulez une sortie au format markdown. Vous avez besoin d'un déploiement local sans dépendances d'API cloud. Votre cas d'usage implique le filtrage de contenu et le classement par pertinence.

Limites :

  • Nécessite un LLM exécuté localement ou via une API (pas autonome)
  • Plus lent que les scrapers traditionnels (traitement LLM par page)
  • Peut manquer du contenu important si le LLM juge de manière incorrecte
  • Utilisation de ressources plus élevée que les scrapers basés sur des règles

FireCrawl : convertit les sites web en Markdown ou JSON propre. Gère la navigation, le rendu JavaScript et l'extraction de contenu. Sortie structurée pour alimenter les fenêtres de contexte des LLM. Bibliothèque Node.js ou CLI.

Qui l'utilise : Les développeurs d'applications LLM. Les équipes qui construisent des systèmes d'IA traitant du contenu web.

Quand cela a du sens : Vous avez besoin d'une extraction de texte propre pour le traitement par LLM. Vos sites cibles utilisent le rendu JavaScript. Vous voulez une sortie structurée (Markdown/JSON). Vous construisez des applications Node.js.

Limites :

  • Node.js uniquement (pas de bindings Python)
  • Conversion Markdown opinionée (peut perdre la mise en forme dont vous avez besoin)
  • Personnalisation limitée des règles d'extraction
  • Pas de limitation de débit ni d'anti-détection intégrées

GPT-crawler : explore des sites et produit des données d'entraînement pour des GPT personnalisés. Pointez-le vers une documentation ou une base de connaissances, il extrait le contenu et le formate pour le fine-tuning. Outil CLI Python.

Qui l'utilise : Les équipes qui construisent des modèles GPT personnalisés. Les organisations qui créent des assistants IA spécialisés par domaine.

Quand cela a du sens : Vous fine-tunez des modèles de langage. Vous avez besoin de données d'entraînement structurées provenant de sources web. Votre contenu est de la documentation ou des bases de connaissances. Vous pouvez exécuter des outils CLI Python.

Limites :

  • Format de sortie spécifique au fine-tuning GPT (pas généraliste)
  • Pas de mises à jour incrémentales (réexploration complète du site pour les mises à jour)
  • Gestion limitée de l'authentification ou des paywalls
  • Suppose une structure de contenu statique

ScrapeGraphAI : construit des graphes de connaissances à partir du contenu exploré. Idéal pour les sites de documentation où vous devez comprendre les relations entre les concepts. Produit des résumés structurés ou des graphes de faits. Déploiement Python.

Qui l'utilise : Les équipes de gestion des connaissances. Les chercheurs qui construisent des cartes conceptuelles à partir de contenu web.

Quand cela a du sens : Vous avez besoin d'extraction de relations, pas seulement de contenu. Vos sites cibles sont de la documentation ou du contenu éducatif. Vous construisez des bases de connaissances ou des cartes conceptuelles. Vous disposez d'une infrastructure Python.

Limites :

  • Configuration complexe (nécessite une base de données de graphes et des modèles NLP)
  • Plus lent que les scrapers simples (extraction d'entités + cartographie des relations)
  • La qualité dépend de la structure du contenu source
  • Limité au texte (ne gère pas bien les tableaux ou les images)

AutoScraper : scraper par l'exemple. Montrez-lui une page avec les données que vous voulez, il détermine le schéma et l'applique à des pages similaires. Bibliothèque Python légère pour les tâches d'extraction simples.

Qui l'utilise : Les développeurs qui ont besoin d'une extraction rapide sans écrire de sélecteurs XPath ou CSS. Les équipes qui prototypent des flux de travail de scraping.

Quand cela a du sens : Vos pages cibles suivent des schémas cohérents. Vous ne voulez pas écrire de sélecteurs manuellement. Vous avez besoin de prototypes rapides. Vos sites ne changent pas fréquemment de mise en page.

Limites :

  • Se casse lorsque les mises en page changent
  • Limité aux structures de pages similaires (ne peut pas généraliser à des sites différents)
  • Pas de support du rendu JavaScript
  • Correspondance de motifs simple (pas de raisonnement IA sur le contenu)

LLM Scraper : envoyez une page à un LLM et demandez-lui « extraire tous les prix des produits » ou « trouver les coordonnées de contact ». Le modèle interprète votre intention et extrait les données pertinentes. Flexible mais plus coûteux que les scrapers basés sur des règles. Basé sur Python.

Qui l'utilise : Les équipes qui ont besoin d'une extraction flexible sans écrire de règles. Les développeurs qui créent des tâches d'extraction ponctuelles.

Quand cela a du sens : Les structures de page varient trop pour une extraction basée sur des règles. Vous avez besoin d'une compréhension sémantique (« trouver le nom de l'auteur »). Le coût n'est pas votre préoccupation principale. Vous voulez un développement rapide sans ingénierie de sélecteurs.

Limites :

  • Coûteux (coûts d'API LLM par page)
  • Plus lent que les scrapers basés sur des règles (latence de l'API)
  • Peut extraire de mauvaises données si le prompt n'est pas clair
  • Pas de garantie de cohérence de l'extraction des champs entre les pages

Outils de recherche IA

BingGPT : interface de chat qui combine la recherche Bing avec des réponses GPT. Posez des questions, obtenez des réponses avec des sources. Application de bureau, pas basée sur le navigateur.

BraveGPT : extension de navigateur IA qui ajoute des réponses GPT aux résultats de recherche Brave. Voyez à la fois les résultats de recherche traditionnels et un résumé IA côte à côte. Se superpose directement aux pages de recherche.

Ne manquez pas nos benchmarks et analyses basées sur les données. Le bouton ouvre Google ; sélectionner AIMultiple confirme que vous souhaitez voir AIMultiple plus souvent dans les résultats de recherche Google.
GoogleAjouter comme source préférée

Frameworks de contrôle web pour développeurs

Bibliothèques de bas niveau pour le contrôle programmatique du navigateur.

Frameworks de test

Playwright : automatisation multi-navigateurs de Microsoft. Prend en charge Chromium, Firefox et WebKit. Attentes intégrées, interception réseau et émulation mobile. Disponible en JavaScript, Python, .NET et Java. Norme du secteur pour les tests web modernes.

Selenium : le framework d'automatisation de navigateur original. Fonctionne sur tous les principaux navigateurs. Écosystème plus large mais architecture plus ancienne. Bindings de langage pour Python, Java, C#, Ruby, et plus encore. Standard du protocole WebDriver.

taiko : framework de ThoughtWorks avec une syntaxe lisible. Idéal pour les tests fonctionnels où la lisibilité des tests compte. Node.js uniquement.

Bibliothèques d'automatisation

Puppeteer : bibliothèque de Google pour contrôler Chrome/Chromium. API de haut niveau pour les captures d'écran, la génération de PDF et le scraping. L'écosystème Node.js fonctionne avec TypeScript. Choix standard pour l'automatisation de Chrome headless.

Browser-Use : cité plus haut comme pont LLM, mais fonctionne aussi comme bibliothèque d'automatisation pour les développeurs. Convertit le DOM en un format structuré, gère la navigation et l'interaction. Bibliothèque Python avec option d'API.

Ce qui rend ces agents web différents

Browser-Use a obtenu 89,1 % aux tests WebVoyager, tandis qu'Agent-E a atteint 73,1 % sur l'ensemble de données complet. Browser-Use utilise une planification autonome des tâches avec l'intégration LangChain. Agent-E analyse directement la structure du DOM sans modèles de vision, ce qui est plus rapide mais rencontre des difficultés lorsque les sites web utilisent des listes déroulantes dynamiques ou révèlent de nouvelles options en fonction des choix de l'utilisateur.

Niveaux d'autonomie

Agents entièrement autonomes comme Browser-Use, Skyvern et Agent-E acceptent des objectifs de haut niveau (« trouver le vol Paris le moins cher ») et planifient leurs propres étapes de navigation. Ils s'adaptent aux éléments inattendus comme les bannières de cookies ou les captchas. Cependant, chaque décision nécessite un appel LLM, ce qui augmente à la fois le coût et le temps de réponse.

Outils de guidage étape par étape comme LaVague et ZeroStep exécutent des commandes spécifiques (« cliquer sur le bouton de recherche », « saisir du texte dans le champ 2 »). Exécution plus rapide puisqu'ils évitent la surcharge de planification. Mais si un site reconçoit sa mise en page, vous devez mettre à jour les instructions manuellement.

Frameworks de codage manuel comme Playwright et Selenium exigent un code explicite pour chaque clic, remplissage de formulaire et navigation. Les tests s'exécutent de manière identique à chaque fois jusqu'à ce que le site modifie un ID d'élément ou un nom de classe. Ensuite, les sélecteurs se cassent et vous réécrivez le code.

Comment ils interprètent les pages

Traitement basé sur la vision : Skyvern 2.0, WebVoyager et VimGPT capturent des captures d'écran et les envoient à des modèles de vision comme GPT-4V. Ils identifient les boutons et les formulaires en regardant la page rendue.

Skyvern 2.0 utilise en réalité une boucle planificateur-acteur-validateur. Le planificateur décompose les tâches complexes en objectifs plus petits, l'acteur les exécute, et le validateur confirme si chaque objectif a réussi. Cette approche en trois phases a aidé Skyvern à passer de 45 % (version à prompt unique) à 68,7 % (avec planificateur) puis à 85,85 % (avec validateur vérifiant si les actions ont réellement fonctionné).

Le traitement par vision fonctionne sur les sites à fort JavaScript où le DOM se reconstruit après le chargement de la page. Mais GPT-4V facture par token d'image, ce qui rend chaque affichage de page 10-20x plus coûteux que la lecture du HTML. Les modèles de vision ajoutent également 2 à 3 secondes par page par rapport à l'analyse DOM.

Analyse DOM : Browser-Use et Agent-E lisent directement le HTML de la page. Ils scannent le code à la recherche d'éléments cliquables, de champs de saisie et de liens de navigation.

Agent-E utilise la « distillation du DOM » pour réduire les pages complexes aux éléments essentiels, plus la « récolte de compétences » pour mémoriser et réutiliser des schémas d'interaction efficaces. Il a battu l'agent multimodal WebVoyager (qui utilise la vision) sur des sites comme Huggingface, Apple et Amazon en utilisant uniquement du texte. Mais la planification d'Agent-E se désynchronise lorsque les sites web révèlent dynamiquement de nouvelles options, comme des menus déroulants qui changent en fonction de vos sélections.

L'analyse DOM coûte moins cher et s'exécute plus rapidement. La précision de 89,1 % de Browser-Use provient en partie de l'intégration LangChain et de prompts mis à jour, et non pas seulement de l'absence d'appels de vision. Mais les approches DOM rencontrent des difficultés lorsque les sites utilisent le shadow DOM, des noms de classe obscurcis ou une manipulation JavaScript lourde.

Approche combinée : LiteWebAgent et AutoWebGLM analysent le DOM pour la structure, puis utilisent la vision pour vérifier ce que les utilisateurs voient réellement. Plus précis que le DOM seul, moins coûteux que la vision pure, mais vous exécutez deux systèmes par page.

Spécialisation

Auto-GPT et AgenticSeek gèrent la navigation web en plus des opérations sur les fichiers et de l'exécution de code. Ils ne disposent pas de fonctionnalités spécifiques au web comme la rotation de proxy et la gestion des cookies, ce qui limite leur efficacité sur les sites avec détection de bots.

Agent-E et WebVoyager ne font que de la navigation web. Agent-E a atteint 73,1 % globalement sur l'ensemble de données WebVoyager de 643 tâches, battant le score de 57,1 % de l'agent multimodal WebVoyager. Bonnes performances sur des sites comme Wolfram (95,7 %), Google Search (90,7 %) et Google Maps (87,8 %). Faible sur les sites dynamiques : seulement 27,3 % sur Booking.com et 35,7 % sur Google Flights où les menus déroulants et les champs de formulaire changent en fonction des sélections de l'utilisateur.

Crawl4AI et FireCrawl extraient des données et convertissent les pages en Markdown ou JSON. Ils ne remplissent pas de formulaires et ne cliquent pas à travers les flux de travail. Utilisez-les lorsque vous avez besoin de contenu dans un format structuré, et non lorsque vous devez accomplir des tâches en plusieurs étapes.

Playwright et Selenium automatisent les tests de navigateur. Ils produisent des résultats identiques d'une exécution à l'autre, ce qui est essentiel pour les tests de régression. Mais ce déterminisme signifie qu'ils ne peuvent pas s'adapter. Lorsqu'un site change, votre suite de tests se casse.

Options de déploiement

Exécution locale : AgenticSeek, Nanobrowser et OpenInterpreter s'exécutent sur votre machine. Vos données de navigation restent locales et vous évitez les coûts d'API. Mais une station de travail classique gère 5-10 instances de navigateur simultanées avant que le CPU/la RAM n'atteigne ses limites.

API cloud : Browserless fournit des instances Chrome distantes via REST ou WebSocket. Vous pouvez lancer des centaines de sessions parallèles avec une rotation automatique des proxy. Chaque requête ajoute une latence de 100-300 ms par rapport aux navigateurs locaux, et votre trafic passe par leurs serveurs à moins que vous ne vous auto-hébergiez avec Docker.

Déploiement flexible : Skyvern s'exécute localement pendant le développement, puis se déploie dans le cloud pour la production. Leur benchmark s'est en réalité déroulé dans Skyvern Cloud (et non sur des machines locales) pour tester les conditions réelles avec des navigateurs cloud asynchrones et des adresses IP réalistes. La plupart des benchmarks s'exécutent sur des IP locales sûres avec de bonnes empreintes de navigateur, ce qui ne correspond pas à la réalité de la production.

Schémas d'intégration

Le WebSurfer d'AutoGen nécessite d'adopter l'ensemble du framework multi-agents de Microsoft. Vous bénéficiez d'une orchestration d'agents et d'une gestion de la mémoire intégrées, mais vous ne pouvez pas facilement l'intégrer à des systèmes existants.

Browser-Use et Playwright fonctionnent comme des bibliothèques autonomes. Ajoutez-les à n'importe quel projet Python ou Node.js. Mais vous devrez construire votre propre coordination d'agents, gestion des erreurs et stockage des résultats.

Nanobrowser et BraveGPT s'installent comme des extensions Chrome. Aucune configuration de serveur requise, ajoutez-les au navigateur et démarrez. Ils ne peuvent pas passer à l'échelle au-delà de quelques onglets simultanés, et ils ne s'intègrent pas aux pipelines d'automatisation backend.

Considérations de production

Skyvern et Browserless incluent un support de proxy résidentiel, des mouvements de souris aléatoires et la rotation des empreintes de navigateur. Ces fonctionnalités empêchent les bannissements d'IP et les déclenchements de CAPTCHA sur les sites protégés.

WebVoyager et AutoWebGLM se concentrent sur les algorithmes de navigation. Agent-E a atteint 73,1 % en utilisant une analyse DOM textuelle uniquement, battant l'approche multimodale de WebVoyager à 57,1 %. Mais les sites de production avec Cloudflare ou DataDome bloqueront les agents sans une anti-détection appropriée.

Contexte important du benchmark : Browser-Use et Agent-E ont exécuté les tests localement avec des adresses IP sûres. Skyvern a spécifiquement exécuté ses tests dans une infrastructure cloud pour correspondre aux conditions réelles de production, où vous êtes confronté à la détection de bots, à la prise d'empreinte du navigateur et aux défis CAPTCHA. Les tests du benchmark eux-mêmes s'exécutent sur des sites coopératifs sans protection anti-bot agressive, de sorte que les taux de réussite réels seront inférieurs à ce que ces chiffres suggèrent.

Sources du benchmark

  • Browser-Use7
  • Skyvern 2.08
  • WebVoyager9

Citer cette recherche

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Cem Dilmegani (2026) - "Les meilleurs 30+ agents web open source". Publié en ligne sur AIMultiple.com. Consulté le 1 Septembre 2026, à : https://aimultiple.com/open-source-web-agents [Ressource en ligne]

Dilmegani, C. (2026, 1 Septembre). Les meilleurs 30+ agents web open source. AIMultiple. https://aimultiple.com/open-source-web-agents

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{Les meilleurs 30+ agents web open source}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/open-source-web-agents}},
  note   = {AIMultiple. Consulté le 1 Septembre 2026}
}

Journal des modifications

5 mises à jour
  1. 2026

    Suppression de la liste des catégories précédant le graphique des étoiles GitHub.

  2. La section « Résultats du benchmark Web Voyager » a été étendue avec des sites web et des types de tâches supplémentaires.

  3. Mise à jour de la section « Évaluation : Web Voyager Benchmark » avec de nouveaux résultats de benchmark et des détails méthodologiques.

  4. 2025

    La section « Ce qui rend ces agents web différents » a été étendue.

  5. La section d'introduction a été mise à jour, ajoutant un benchmark de 8 serveurs MCP pour les tâches de recherche web et d'automatisation de navigateur.

Cem Dilmegani
Cem Dilmegani
Analyste principal
Cem est analyste principal chez AIMultiple depuis 2017.

Le travail de Cem chez AIMultiple a été cité par des publications mondiales de premier plan, notamment Business Insider, Forbes, Morning Brew et Washington Post, par des entreprises mondiales comme Deloitte et HPE, par des ONG comme World Economic Forum et par des organisations supranationales comme European Commission. [1], [2], [3], [4], [5]

Tout au long de sa carrière, Cem a été consultant en technologies, acheteur de technologies et entrepreneur technologique. Il a conseillé des entreprises sur leurs décisions technologiques chez McKinsey & Company et Altman Solon pendant plus de dix ans. Il a également publié un rapport McKinsey sur la digitalisation.

Il a dirigé la stratégie technologique et les achats d'un opérateur télécom, sous la responsabilité du PDG. Il a également dirigé la croissance commerciale de l'entreprise de technologie profonde Hypatos, qui a atteint un revenu récurrent annuel à 7 chiffres et une valorisation à 9 chiffres, passant de 0 à ce résultat en deux ans. Le travail de Cem chez Hypatos a été couvert par des publications technologiques de premier plan comme TechCrunch et Business Insider.

Cem intervient régulièrement lors de conférences technologiques internationales. Il est diplômé de Bogazici University en tant qu'ingénieur informatique et titulaire d'un MBA de la Columbia Business School.
Voir le profil complet

Soyez le premier à commenter

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450