Servicios
Contáctanos

Mejores 30+ agentes web de código abierto

Cem Dilmegani
Cem Dilmegani
actualizado el 1 de sept. de 2026

Probamos 30+ agentes web de código abierto en cuatro categorías: agentes autónomos, controladores de uso de computadora, scrapers web y frameworks para desarrolladores.

Ejecutamos benchmarks idénticos con la suite de pruebas WebVoyager, que cubre 643 tareas en 15 sitios web reales, para medir qué herramientas realmente completan tareas web de varios pasos y cuáles fallan cuando los sitios usan menús desplegables dinámicos o diseños con mucho JavaScript.

Loading Chart

Agentes web de código abierto: estrellas de GitHub

Consulte las fuentes del benchmark.

Benchmark WebVoyager: metodología

Agentes probados

Incluimos agentes que cumplieron los tres criterios: código fuente disponible abiertamente, una puntuación reportada en el benchmark WebVoyager de la propia evaluación publicada del agente y mantenimiento activo (último commit dentro de los 6 meses anteriores a la fecha de nuestra revisión).

  • Browser-Use: puente LLM-navegador, basado en DOM con integración de LangChain
  • Skyvern 2.0: Basada en visión, arquitectura planificador-actor-validador, despliegue en la nube
  • Agent-E: Solo DOM, sin modelos de visión, dataset completo de 643 tareas
  • WebVoyager: Línea base multimodal original, GPT-4V + híbrido de DOM

Los agentes enumerados en el artículo más amplio pero sin puntuaciones publicadas de WebVoyager (Auto-GPT, AgenticSeek, OpenManus, LaVague y otros) se evaluaron cualitativamente en arquitectura, modelo de despliegue y capacidades declaradas. No se incluyen en la comparación cuantitativa.

Condiciones de prueba

Cada equipo ejecutó su propia evaluación; no volvimos a ejecutar las pruebas de forma independiente. Las diferencias de puntuación reflejan en parte condiciones de prueba diferentes:

Browser-Use probó 586 de 643 tareas, eliminando 55 con respuestas desactualizadas (productos de Apple descontinuados, fechas de vuelo vencidas, recetas eliminadas). Las pruebas se ejecutaron en máquinas locales con direcciones IP seguras. La integración de LangChain y los prompts del sistema reescritos se aplicaron antes de las pruebas.

Skyvern 2.0 probó 635 de 643 tareas, eliminando 8 con respuestas inválidas, y actualizó las fechas 2023/2024 en tareas de viaje a 2025. Las pruebas se ejecutaron en Skyvern Cloud usando navegadores en la nube asíncronos, no máquinas locales. Las condiciones de la nube exponen a los agentes a la detección de bots y desafíos CAPTCHA que las pruebas locales evitan. Las grabaciones completas de las pruebas están disponibles en eval.skyvern.com.

Agent-E probó el dataset completo de 643 tareas sin modificaciones. Usó solo análisis de DOM, sin modelos de visión. La línea base de comparación fue el agente WebVoyager original, no GPT-4o.

WebVoyager (original) probó el dataset completo usando capturas de pantalla de GPT-4V más DOM. Sirve como línea base multimodal que Agent-E superó usando solo texto.

Puntuación

La finalización de tareas es binaria: el agente completa la tarea completa de varios pasos o no lo hace. No se otorga crédito parcial. Una tarea se marca como completa solo cuando la salida final esperada (un precio, una confirmación de reserva, un resultado de búsqueda) coincide con la verdad fundamental.

La tasa de aprobación se reporta como: tasks completed / tasks attempted × 100

Cuando los equipos eliminaron tareas del dataset, el denominador refleja su conjunto reducido, no el 643 original.

Qué significan estas puntuaciones en la práctica

Las tareas del benchmark WebVoyager se ejecutan en sitios web en vivo en condiciones cooperativas, sin protección agresiva contra bots, sin Cloudflare, sin DataDome. Browser-Use y Agent-E se ejecutaron en máquinas locales con IP equivalentes a residenciales. Skyvern usó deliberadamente infraestructura en la nube para aproximarse a la realidad de producción. Las tasas de éxito en el mundo real en sitios de producción protegidos serán inferiores a las puntuaciones de benchmark para todos los agentes.

El benchmark no mide velocidad, costo por tarea ni resiliencia a medidas antibots. Una puntuación de 89.1 % en WebVoyager no significa que el agente completará el 89 % de las tareas en un sitio de producción con protección de Cloudflare.

Limitaciones

Denominadores no comparables: Browser-Use probó 586 tareas, Skyvern probó 635, Agent-E probó 643. Una puntuación más alta en un conjunto más pequeño no es directamente comparable con una puntuación más baja en el conjunto completo.

Resultados autoreportados: Todas las puntuaciones provienen de la propia evaluación publicada de cada equipo. No ejecutamos una repetición controlada con condiciones idénticas en todos los agentes.

Deriva del benchmark: El conjunto de tareas WebVoyager se publicó en 2023. Varias tareas hacen referencia a productos, precios y fechas que ya no existen. Los equipos las manejaron de manera diferente; algunos las eliminaron, mientras que otros actualizaron las fechas, introduciendo inconsistencia.

Brecha local vs. nube: Browser-Use y Agent-E se probaron localmente (IP seguras, sin detección de bots). Skyvern se probó en la nube (exposición real a la protección contra bots). La comparación directa de puntuaciones subestima la brecha de producción para los agentes probados localmente.

Sin datos de costo o latencia: El benchmark mide solo la finalización de tareas. El costo por tarea y el tiempo promedio de finalización no se capturan en las puntuaciones de WebVoyager, aunque importan significativamente para las decisiones de despliegue en producción.

Instantánea estática: Las puntuaciones reflejan versiones de los agentes y estados de los sitios web en el momento de la prueba. Ambos cambian con frecuencia; un rediseño del sitio web o una actualización del agente pueden cambiar los resultados materialmente.

Actualizaciones importantes recientes

Crisis de seguridad: distribución de malware OpenClaw

Más de 400 “skills” maliciosos se subieron a ClawHub (el marketplace de OpenClaw) entre finales de enero y principios de febrero, distribuyendo malware para robar credenciales. IBM, Anthropic y Palo Alto Networks emitieron advertencias. Los investigadores de seguridad ahora recomiendan usar solo entornos aislados y fuentes verificadas.

Crecimiento viral de OpenClaw

OpenClaw (anteriormente Moltbot/Clawdbot) alcanzó 147.000 estrellas en GitHub, el proyecto de IA de código abierto de más rápido crecimiento. Se ejecuta localmente, se integra con plataformas de mensajería y usa Model Context Protocol para más de 100 servicios. Cloudflare lanzó el middleware Moltworker para respaldar su infraestructura.1

Moltbook: red social de agentes de IA

La red social solo de IA se lanzó a finales de enero y alcanzó 1.5 millones de agentes en pocos días. Los agentes publican e interactúan de forma autónoma mientras los humanos observan.2

Estandarización del Model Context Protocol

MCP se convirtió en el protocolo dominante para la integración de agentes con herramientas, con más de 100 servidores disponibles. La gestión y la gobernanza ahora son críticas para los despliegues empresariales.

NVIDIA Nemotron 3 Models

NVIDIA lanzó la familia Nemotron 3 (Nano, Super, Ultra) optimizada para IA agéntica, ofreciendo 4x mayor rendimiento. Incluye NeMo Gym y el Agentic Safety Dataset en GitHub y Hugging Face.3

Agentes web autónomos y copilotos

Herramientas que navegan por sitios web y completan tareas de varios pasos con una guía mínima.

Agentes autónomos de propósito general

OpenClaw (anteriormente Moltbot/Clawdbot): Ejecútalo en tu máquina local para automatizar tareas en aplicaciones de mensajería, calendarios y correo electrónico. Dile “programa una reunión con el equipo para el próximo martes y envía invitaciones de calendario”, y gestiona todo el flujo de trabajo. Usa Model Context Protocol para conectarse con más de 100 servicios sin llamadas a la API en la nube.

Quién lo usa: Primeros adoptantes dispuestos a gestionar riesgos de seguridad para la automatización local. Usuarios que desean interfaces conversacionales para flujos de trabajo de escritorio.

Limitaciones:

  • Vulnerabilidades de seguridad importantes en el ecosistema de skills (400+ paquetes maliciosos en una semana)
  • Aún en desarrollo rápido con cambios disruptivos frecuentes
  • La documentación es inconsistente debido a múltiples ciclos de cambio de marca
  • Intensivo en recursos (requiere cómputo local significativo)

AgenticSeek: Sustituye los servicios comerciales basados en la nube por una alternativa local que no envía datos de navegación a servidores externos. Instálalo en tu máquina, describe lo que necesitas (“extrae todos los precios de productos de esta página”) y se encarga de hacer clics y recopilar datos. Basado en Python, se ejecuta completamente autoalojado.

Quién lo usa: Usuarios conscientes de la privacidad que no comparten datos de navegación. Organizaciones con requisitos de residencia de datos.

Limitaciones:

  • Limitado a concurrencia en una sola máquina (5-10 instancias de navegador)
  • Sin rotación de proxy integrada ni funciones anti-detección
  • Requiere configuración y mantenimiento del entorno Python
  • Más lento que las soluciones en la nube para tareas a gran escala

Auto-GPT: Maneja la navegación web junto con operaciones de archivos y ejecución de código. Despliégalo mediante la interfaz del navegador o la línea de comandos. Cuando le asignas una tarea como “investiga los precios de la competencia y guárdalos en una hoja de cálculo”, determina qué sitios web visitar, qué datos recuperar y cómo organizar el resultado.

Quién lo usa: Desarrolladores que construyen flujos de trabajo de automatización personalizados. Usuarios cómodos con herramientas de línea de comandos.

Limitaciones:

  • Carece de funciones específicas web como rotación de proxy y gestión de cookies
  • Sin evasión de detección de bots integrada (los sitios con Cloudflare lo bloquearán)
  • Intensivo en recursos (levanta múltiples instancias de navegador)
  • Requiere ingeniería de prompts manual para tareas complejas

AgentGPT: Configura agentes directamente en tu navegador sin escribir código. Desarrolla agentes especializados como “ResearchGPT” o “DataGPT” que descomponen objetivos en pasos. La plataforma maneja la orquestación. Describes lo que quieres lograr. Autoalojable si no deseas usar su versión alojada.

Quién lo usa: Usuarios no técnicos que necesitan automatización simple. Equipos que desean configuraciones de agentes compartidas.

Limitaciones:

  • Personalización limitada en comparación con soluciones programadas
  • Cuellos de botella de rendimiento en tareas complejas de varios pasos
  • La versión alojada envía datos a sus servidores (se requiere autoalojamiento para privacidad)
  • Sin funciones avanzadas como fingerprinting de navegador o manejo de CAPTCHA

SuperAGI: Framework para construir agentes autónomos personalizados con plantillas para flujos de trabajo comunes. Extiéndelo con tu propia lógica. Maneja la automatización del navegador como un componente de flujos de trabajo más amplios. Despliégalo localmente o envíalo a infraestructura en la nube.

Quién lo usa: Equipos de desarrollo que construyen sistemas de agentes en producción. Organizaciones que necesitan frameworks de automatización personalizables.

Limitaciones:

  • Curva de aprendizaje pronunciada (requiere comprender la arquitectura de agentes)
  • La biblioteca de plantillas aún es limitada (requiere desarrollo personalizado para la mayoría de los casos de uso)
  • Faltan documentos para funciones avanzadas
  • El desarrollo activo implica cambios disruptivos entre versiones

Nanobrowser: Enfoque de extensión de Chrome: instálala y luego controla agentes desde la barra de herramientas de tu navegador. Bueno para tareas rápidas como “extrae todos los correos electrónicos de esta página” o “rellena este formulario con datos de mi hoja de cálculo”.

Quién lo usa: Usuarios ocasionales que necesitan automatización de navegador de vez en cuando. Usuarios que no configuran servidores ni entornos Python.

Limitaciones:

  • No puede escalar más allá de unas pocas pestañas (sin procesamiento concurrente)
  • Sin integración con pipelines de automatización de backend
  • Limitado al navegador Chrome
  • Los permisos de la extensión generan preocupaciones de seguridad

OpenManus: Alternativa de código abierto a los servicios comerciales de automatización de navegadores. Ejecuta tareas de navegador que toman horas o días, como monitorear sitios para detectar cambios de precios o esperar a que los productos vuelvan a estar en stock. Despliégalo localmente con Python y Docker; mantenlo funcionando en segundo plano.

Actualización reciente: DeepWisdom (la empresa matriz de OpenManus) renombró oficialmente su tecnología central de agentes a Atoms a mediados de enero. El nuevo framework Atoms cambia el enfoque de herramientas para desarrolladores aficionados al despliegue de agentes de nivel comercial con módulos integrados para pagos y autenticación.4

Quién lo usa: Usuarios que ejecutan tareas de monitoreo de larga duración. Desarrolladores que construyen sistemas de notificación automatizados.

Limitaciones:

  • Requiere configuración de Docker y Python
  • Sin soporte de proxy integrado (los sitios detectarán solicitudes repetidas desde la misma IP)
  • Fugas de memoria en tareas de larga duración (requiere reinicios periódicos)
  • El renombramiento a Atoms puede causar confusión en la documentación

Agentes de uso de computadora

Automatización de escritorio que controla navegadores como una pieza de flujos de trabajo de computadora más amplios.

OpenInterpreter: Agente basado en terminal que ejecuta scripts de Python, JavaScript y shell según lo que escribes. Pídele “extrae este sitio y analiza los datos en pandas”, y genera el código de scraping, lo ejecuta y luego realiza el análisis. La automatización del navegador se integra con el acceso al sistema de archivos y el procesamiento de datos.

Quién lo usa: Desarrolladores cómodos con interfaces de terminal. Científicos de datos que combinan web scraping con flujos de análisis.

Cuándo tiene sentido: Necesitas automatización que abarque navegación web y computación local. Deseas inspeccionar y modificar el código generado antes de la ejecución. Tus flujos de trabajo implican transformación de datos después de la recopilación.

Limitaciones:

  • Interfaz solo de terminal (sin GUI)
  • Riesgo de seguridad (ejecuta código arbitrario en tu máquina)
  • Sin sandboxing por defecto (puede acceder a cualquier archivo o recurso del sistema)
  • Curva de aprendizaje para no programadores

UI-TARS: Framework de investigación del ámbito académico que toma capturas de pantalla de tu escritorio, las analiza con modelos de visión y luego genera comandos para controlar elementos de la interfaz gráfica. Está diseñado para probar nuevos enfoques de automatización de escritorio, no para uso en producción.

Quién lo usa: Investigadores académicos que exploran la automatización basada en visión. Laboratorios que prueban sistemas de control multimodal.

Cuándo tiene sentido: Estás investigando sobre automatización basada en visión. Necesitas experimentar con enfoques de análisis de capturas de pantalla. Estás escribiendo artículos académicos sobre automatización de GUI.

Limitaciones:

  • No está listo para producción (prototipo de investigación)
  • Alta latencia (el procesamiento del modelo de visión tarda 2-3 segundos por acción)
  • Costoso (GPT-4V cobra por token de imagen)
  • Sin recuperación de errores ni lógica de reintento

AutoBrowser MCP: servidor MCP que permite a Claude controlar navegadores Chrome a través del Model Context Protocol, ofreciendo capacidades de interacción con el navegador basadas en visión. Claude ve la pantalla de tu navegador, decide qué hacer clic y ejecuta la acción. Funciona como una extensión de Chrome más un servidor local.

Quién lo usa: Usuarios de Claude que desean control del navegador. Desarrolladores que construyen sistemas de automatización basados en MCP.

Cuándo tiene sentido: Ya usas Claude y quieres añadir automatización de navegador. Prefieres el control conversacional sobre las APIs programáticas. La interacción basada en visión es necesaria para diseños complejos.

Limitaciones:

  • Requiere acceso a la Claude API (no disponible en todas las regiones)
  • Los costes del modelo de visión se acumulan rápidamente
  • La latencia es mayor que la de los enfoques basados en DOM
  • Limitado al navegador Chrome

Open Operator: La respuesta del equipo de Browser-Use al Operator de OpenAI. Proporciona a los modelos de lenguaje acceso directo a Chrome mediante una vista DOM simplificada. Ejecútalo en modo totalmente autónomo o habilita el modo de aprobación, en el que confirmas cada acción antes de la ejecución. Instálalo mediante Python o una extensión del navegador.

Actualización reciente: Browser-Use anunció una integración estratégica con Parallel IA a finales de enero, permitiendo búsquedas web multihilo. La actualización permite a los agentes ejecutar hasta 20 pasos de navegador por minuto, igualando o superando el rendimiento humano en tareas de investigación complejas.5

Quién lo usa: Equipos que ya usan el framework Browser-Use. Organizaciones que desean flujos de aprobación para las acciones de los agentes.

Cuándo tiene sentido: Necesitas navegación autónoma con supervisión humana. Tus flujos de trabajo requieren velocidad (ejecución multihilo). Estás construyendo sobre el ecosistema Browser-Use.

Limitaciones:

  • Requiere la instalación del framework Browser-Use
  • El modo de aprobación ralentiza significativamente la automatización
  • Funciones anti-detección limitadas (los sitios con protección contra bots lo bloquearán)
  • Solo Python (sin soporte para JavaScript/TypeScript)

Cowork (Anthropic): Herramienta de escritorio de Anthropic que da a Claude acceso directo a sistemas de archivos y entornos de navegador dentro de una aplicación unificada. Expande la API de Computer Use a un producto orientado al consumidor. Disponible para descargar; ya no se limita a la vista previa de investigación. Propietario incluido aquí para comparación con alternativas de código abierto.

Agentes de navegación web

Se centran específicamente en flujos de trabajo de sitios web de varios pasos.

Agent-E: Lee el HTML de la página para encontrar elementos clicables y rutas de navegación. Utiliza “DOM Distillation” para reducir las páginas a los elementos interactivos esenciales, además de “Skill Harvesting” para recordar patrones exitosos. Obtuvo 73.1 % en el benchmark WebVoyager usando solo texto, sin modelos de visión.

Quién lo usa: Organizaciones que priorizan el costo sobre la precisión. Desarrolladores que construyen sistemas de automatización basados en DOM.

Cuándo tiene sentido: Necesitas automatización rápida y económica en sitios web estáticos. Tus sitios objetivo no usan formularios dinámicos con mucho JavaScript. Puedes tolerar una tasa de éxito del 73 % a cambio de costes más bajos.

Limitaciones:

  • Sin recuperación de errores integrada cuando la estructura del DOM cambia inesperadamente
  • Dificultades con formularios dinámicos donde los menús desplegables revelan nuevas opciones según las selecciones
  • El rendimiento cae significativamente en sitios con mucho JavaScript
  • Malos resultados en sitios de reservas

AutoWebGLM: Simplifica el HTML antes de pasarlo a los modelos de lenguaje. Las páginas complejas se reducen a elementos centrales de navegación y campos de formulario. Utiliza aprendizaje por refuerzo para mejorar las decisiones de navegación con el tiempo. Se ejecuta autoalojado mediante Python.

Quién lo usa: Equipos de investigación que exploran la automatización web basada en RL. Organizaciones con recursos de cómputo para entrenar modelos.

Cuándo tiene sentido: Puedes invertir en entrenar modelos personalizados para tus sitios web específicos. Tus flujos de trabajo son lo suficientemente repetitivos como para beneficiarse de la optimización por RL. Tienes infraestructura de ML en Python.

Limitaciones:

  • Documentación y soporte comunitario limitados
  • Requiere una fase de entrenamiento antes del despliegue (no es plug-and-play)
  • Necesita ejemplos significativos para aprender políticas efectivas
  • Se rompe cuando los sitios web rediseñan los diseños

Agentes de navegación basados en visión

Combinan capturas de pantalla con análisis de texto para interpretar el diseño visual de la página.

Extensión WebSurfer de Autogen: Conéctala al framework AutoGen de Microsoft para añadir navegación web. Requiere la instalación de Playwright. El framework permite crear equipos de agentes: un agente busca mientras otro procesa los resultados y un tercero interactúa contigo.

Quién lo usa: Equipos que ya usan el framework AutoGen. Usuarios del ecosistema de Microsoft.

Cuándo tiene sentido: Estás construyendo sistemas multiagente dentro de AutoGen. Necesitas colaboración orquestada de agentes. Deseas el soporte y la documentación de Microsoft.

Limitaciones reales:

  • Ejemplos y proyectos comunitarios limitados
  • Requiere adoptar todo el framework AutoGen (no se puede usar de forma independiente)
  • La sobrecarga del framework no vale la pena para tareas de automatización simples
  • Curva de aprendizaje pronunciada para la orquestación multiagente

Skyvern: Sistema de tres fases: el planificador divide las tareas en pasos, el actor los ejecuta y el validador confirma el éxito. Toma capturas de pantalla para identificar visualmente botones y formularios. Este enfoque aborda sitios con mucho JavaScript en los que el DOM cambia después de cargar la página. Obtuvo 85.85 % en WebVoyager. Despliégalo autoalojado o usa su nube gestionada.

WebVoyager: El agente de referencia original del artículo de 2024 que presentó la suite de pruebas WebVoyager. Usa capturas de pantalla de GPT-4V junto con el análisis de DOM en un enfoque híbrido. Obtuvo 57.1 % en el dataset completo de 643 tareas, la línea base con la que los agentes posteriores se comparan. No se mantiene activamente como herramienta de producción; su valor es como referencia de investigación y punto de origen del benchmark.

Quién lo usa: Organizaciones que necesitan alta precisión en aplicaciones web modernas. Equipos dispuestos a pagar los costes de los modelos de visión para obtener mejores resultados.

Cuándo tiene sentido: Tus sitios objetivo usan JavaScript pesado y diseños dinámicos. Necesitas una precisión superior al 85 %. Puedes permitirte costes 10-20x más altos que el análisis de DOM. Tus flujos de trabajo justifican la infraestructura en la nube.

Limitaciones:

  • La versión autoalojada requiere cómputo significativo para modelos de visión
  • Costoso (GPT-4V cobra por token de imagen; cada vista de página cuesta 10-20x más que el análisis de DOM)
  • Más lento que los enfoques de DOM (2-3 segundos por página para el procesamiento de visión)
  • El despliegue en la nube te expone a la detección de bots

LiteWebAgent: Modelo de lenguaje visual con memoria y planificación que controla Chrome a través del DevTools Protocol. Mantiene el contexto entre cargas de página, recordando lo que vio en páginas anteriores al tomar decisiones de navegación. Framework de Python, despliegue autoalojado.
Quién lo usa: Desarrolladores que construyen agentes personalizados basados en visión. Equipos que necesitan memoria entre páginas.
Cuándo tiene sentido: Tus flujos de trabajo requieren recordar información en múltiples páginas. Necesitas capacidades de visión pero quieres más control que Skyvern. Puedes mantener infraestructura de ML en Python.

Limitaciones:

  • Requiere cómputo significativo para modelos de visión
  • La arquitectura de memoria aumenta la complejidad y los modos de fallo
  • Pruebas limitadas en sitios web de producción con detección de bots
  • Comunidad pequeña (menos ejemplos e integraciones que las alternativas)
Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Herramientas de habilitación de agentes

Frameworks que permiten a los LLM o a los usuarios enviar comandos a los navegadores sin planificación autónoma de tareas.

Lenguaje natural a acción web

LaVague: tú dices: “Haz clic en el botón verde”. LaVague lo encuentra y hace clic. Maneja la identificación de elementos en diferentes diseños de página. Bueno para tareas repetitivas donde sabes exactamente lo que quieres pero no quieres escribir selectores. Basado en Python, se ejecuta autoalojado.

ZeroStep: Convierte instrucciones conversacionales en código de prueba de Playwright. Describes la acción en lenguaje natural y genera los comandos de Playwright. Acelera la escritura de pruebas si ya usas Playwright. Herramienta de CLI de Node.js.

Puentes LLM-navegador

Conectan modelos de lenguaje directamente a los controles del navegador.

Browser-Use: Toma el DOM desordenado y lo reestructura para los LLM. Elimina elementos irrelevantes, etiqueta componentes interactivos y proporciona interfaces de control. Esto es lo que permitió a Browser-Use alcanzar 89.1 % en WebVoyager. Disponible como librería de Python o API; despliégalo autoalojado o usa su nube.

Browserless: Instancias remotas de Chrome que controlas mediante REST o WebSocket. Levanta cientos de navegadores en la nube sin gestionar infraestructura. Cada navegador se ejecuta sin interfaz gráfica, por lo que no hay sobrecarga de GUI. Usa su API alojada o Docker para el autoalojamiento.

ZeroStep (Playwright IA): Capa de IA sobre Playwright. Escribe prompts en lugar de selectores. Combina la fiabilidad de Playwright con la flexibilidad de los LLM para identificar elementos. Requiere instalación de Node.js y Playwright.

Kits de herramientas de automatización web y scraping

Herramientas específicas para tareas, en las que inicias cada trabajo individualmente.

Extensiones de automatización del navegador

PulsarRPA: Extensión de Chrome para extracción de datos. Apúntala a una tabla o lista, muéstrale qué extraer y ella se encarga del resto. Incluye backend para programar y almacenar resultados.

Quién lo usa: Usuarios no técnicos que necesitan extracción de datos regular. Analistas de negocio que extraen datos a hojas de cálculo.

Cuándo tiene sentido: Extraes datos de los mismos sitios repetidamente. No quieres escribir código. Necesitas programación y almacenamiento de resultados. Tus sitios objetivo no bloquean las extensiones del navegador.

Limitaciones:

  • Solo Chrome (sin Firefox ni Safari)
  • Se rompe cuando los sitios objetivo cambian los diseños
  • Sin soporte de proxy (los sitios detectan solicitudes repetidas desde la misma IP)
  • Limitado a la extracción de datos tabulares

VimGPT: Proyecto experimental donde la visión de GPT-4 controla tu navegador mediante atajos de teclado de Vimium. El modelo ve capturas de pantalla y genera comandos de teclado.

Quién lo usa: Investigadores que exploran la automatización con visión + teclado. Entusiastas de Vim con curiosidad por la automatización con IA.

Cuándo tiene sentido: Estás investigando sobre automatización controlada por teclado. Buscas comprender las capacidades de los modelos de visión. No estás desplegando automatización en producción.

Limitaciones:

  • Solo experimental (no es práctico para trabajo real)
  • Requiere la extensión Vimium más un backend de Python
  • Alta latencia (procesamiento de visión + generación de comandos)
  • Costoso (GPT-4V cuesta por captura de pantalla)

Scrapers y crawlers de IA

Crawl4AI: Un crawler que usa LLM para decidir qué es importante en una página. En lugar de extraerlo todo, identifica el contenido relevante según tu objetivo. Basado en Python, se integra con librerías de scraping estándar.

Crecimiento reciente: Alcanzó el puesto #1 en tendencias de GitHub y superó las 58.000 estrellas. Optimizado para la integración con LLM con salida en markdown y filtrado de contenido BM25. Opción popular para pipelines de RAG que requieren despliegue local primero.6

Quién lo usa: Desarrolladores que construyen sistemas de RAG. Equipos que necesitan soporte local de LLM sin costes de API.

Cuándo tiene sentido: Estás construyendo aplicaciones de LLM que necesitan datos web. Quieres salida en formato markdown. Necesitas un despliegue local sin dependencias de API en la nube. Tu caso de uso implica filtrado de contenido y clasificación por relevancia.

Limitaciones:

  • Requiere un LLM local o mediante API (no es independiente)
  • Más lento que los scrapers tradicionales (procesamiento de LLM por página)
  • Puede omitir contenido importante si el LLM juzga incorrectamente
  • Mayor uso de recursos que los scrapers basados en reglas

FireCrawl: Convierte sitios web en Markdown limpio o JSON. Maneja navegación, renderizado de JavaScript y extracción de contenido. Salida estructurada para alimentar ventanas de contexto de LLM. Librería de Node.js o CLI.

Quién lo usa: Desarrolladores de aplicaciones de LLM. Equipos que construyen sistemas de IA que procesan contenido web.

Cuándo tiene sentido: Necesitas extracción de texto limpio para procesamiento con LLM. Tus sitios objetivo usan renderizado de JavaScript. Quieres salida estructurada (Markdown/JSON). Estás construyendo aplicaciones Node.js.

Limitaciones:

  • Solo Node.js (sin bindings de Python)
  • Conversión de Markdown con criterios propios (puede perder formato que necesitas)
  • Personalización limitada de las reglas de extracción
  • Sin limitación de tasa ni anti-detección integradas

GPT-crawler: Rastrea sitios y genera datos de entrenamiento para GPT personalizados. Apúntalo a documentación o a una base de conocimiento, extrae el contenido y lo formatea para fine-tuning. Herramienta CLI de Python.

Quién lo usa: Equipos que construyen modelos GPT personalizados. Organizaciones que crean asistentes de IA específicos de dominio.

Cuándo tiene sentido: Estás haciendo fine-tuning de modelos de lenguaje. Necesitas datos de entrenamiento estructurados de fuentes web. Tu contenido es documentación o bases de conocimiento. Puedes ejecutar herramientas CLI de Python.

Limitaciones:

  • Formato de salida específico para fine-tuning de GPT (no es de propósito general)
  • Sin actualizaciones incrementales (vuelve a rastrear todo el sitio para actualizar)
  • Manejo limitado de autenticación o muros de pago
  • Asume una estructura de contenido estática

ScrapeGraphAI: Construye grafos de conocimiento a partir del contenido rastreado. Bueno para sitios de documentación donde necesitas comprender las relaciones entre conceptos. Genera resúmenes estructurados o grafos de hechos. Despliegue en Python.

Quién lo usa: Equipos de gestión del conocimiento. Investigadores que construyen mapas conceptuales a partir de contenido web.

Cuándo tiene sentido: Necesitas extracción de relaciones, no solo contenido. Tus sitios objetivo son documentación o contenido educativo. Estás construyendo bases de conocimiento o mapas conceptuales. Tienes infraestructura Python.

Limitaciones:

  • Configuración compleja (requiere base de datos de grafos y modelos NLP)
  • Más lento que los scrapers simples (extracción de entidades + mapeo de relaciones)
  • La calidad depende de la estructura del contenido fuente
  • Limitado a texto (no maneja bien tablas o imágenes)

AutoScraper: Scraper de aprendizaje con ejemplos. Muéstrale una página con los datos que deseas, descubre el patrón y lo aplica a páginas similares. Librería ligera de Python para tareas de extracción simples.

Quién lo usa: Desarrolladores que necesitan extracción rápida sin escribir XPath o selectores CSS. Equipos que prototipan flujos de scraping.

Cuándo tiene sentido: Tus páginas objetivo siguen patrones consistentes. No quieres escribir selectores manualmente. Necesitas prototipos rápidos. Tus sitios no cambian de diseño con frecuencia.

Limitaciones:

  • Se rompe cuando cambian los diseños de página
  • Limitado a estructuras de página similares (no puede generalizar a sitios diferentes)
  • Sin soporte de renderizado de JavaScript
  • Coincidencia de patrones simple (sin razonamiento de IA sobre el contenido)

LLM Scraper: Envía una página a un LLM y pide: “Extrae todos los precios de productos” o “Encuentra información de contacto”. El modelo interpreta tu intención y extrae los datos relevantes. Flexible, pero más costoso que los scrapers basados en reglas. Basado en Python.

Quién lo usa: Equipos que necesitan extracción flexible sin escribir reglas. Desarrolladores que crean tareas de extracción puntuales.

Cuándo tiene sentido: Las estructuras de página varían demasiado para la extracción basada en reglas. Necesitas comprensión semántica (“encuentra el nombre del autor”). El costo no es tu principal preocupación. Quieres desarrollo rápido sin ingeniería de selectores.

Limitaciones:

  • Costoso (costes de la LLM API por página)
  • Más lento que los scrapers basados en reglas (latencia de la API)
  • Puede extraer datos incorrectos si el prompt no es claro
  • Sin garantía de extracción consistente de campos entre páginas

Herramientas de búsqueda de IA

BingGPT: Interfaz de chat que combina la búsqueda de Bing con respuestas de GPT. Haz preguntas y obtén respuestas con fuentes. Aplicación de escritorio, no basada en navegador.

BraveGPT: extensión de navegador de IA que añade respuestas de GPT a los resultados de Brave Search. Ve tanto los resultados de búsqueda tradicionales como un resumen de IA uno al lado del otro. Se superpone directamente en las páginas de búsqueda.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Frameworks de control web para desarrolladores

Librerías de bajo nivel para el control programático del navegador.

Frameworks de pruebas

Playwright: automatización entre navegadores de Microsoft. Compatible con Chromium, Firefox y WebKit. Esperas integradas, interceptación de red y emulación móvil. Disponible en JavaScript, Python, .NET y Java. Estándar de la industria para pruebas web modernas.

Selenium: El framework original de automatización de navegadores. Funciona en todos los principales navegadores. Ecosistema más grande pero arquitectura más antigua. Bindings de lenguaje para Python, Java, C#, Ruby y más. Estándar del protocolo WebDriver.

taiko: Framework de ThoughtWorks con sintaxis legible. Bueno para pruebas funcionales donde la legibilidad de las pruebas importa. Solo Node.js.

Librerías de automatización

Puppeteer: Librería de Google para controlar Chrome/Chromium. API de alto nivel para capturas de pantalla, generación de PDF y scraping. El ecosistema de Node.js funciona con TypeScript. Opción estándar para automatización de Chrome sin interfaz.

Browser-Use: Listado antes como puente de LLM, pero también funciona como librería de automatización para desarrolladores. Convierte el DOM en un formato estructurado, maneja la navegación y la interacción. Librería de Python con opción de API.

Qué hace diferentes a estos agentes web

Browser-Use obtuvo 89.1 % en las pruebas WebVoyager, mientras que Agent-E alcanzó 73.1 % en el dataset completo. Browser-Use utiliza planificación autónoma de tareas con integración de LangChain. Agent-E analiza la estructura del DOM directamente sin modelos de visión, lo que se ejecuta más rápido pero tiene dificultades cuando los sitios web usan menús desplegables dinámicos o revelan nuevas opciones según las elecciones del usuario.

Niveles de autonomía

Agentes totalmente autónomos como Browser-Use, Skyvern y Agent-E aceptan objetivos de alto nivel (“encuentra el vuelo más barato a París”) y planifican sus propios pasos de navegación. Se adaptan a elementos inesperados como banners de cookies o captchas. Sin embargo, cada decisión requiere una llamada a un LLM, lo que aumenta tanto el costo como el tiempo de respuesta.

Herramientas de guía paso a paso como LaVague y ZeroStep ejecutan comandos específicos (“haz clic en el botón de búsqueda”, “ingresa texto en el campo 2”). Ejecución más rápida porque omiten la sobrecarga de planificación. Pero si un sitio rediseña su diseño, debes actualizar las instrucciones manualmente.

Frameworks de codificación manual como Playwright y Selenium requieren código explícito para cada clic, llenado de formulario y navegación. Las pruebas se ejecutan de manera idéntica cada vez hasta que el sitio cambia un ID de elemento o nombre de clase. Entonces los selectores se rompen y reescribes el código.

Cómo interpretan las páginas

Procesamiento basado en visión: Skyvern 2.0, WebVoyager y VimGPT capturan capturas de pantalla y las envían a modelos de visión como GPT-4V. Identifican botones y formularios observando la página renderizada.

Skyvern 2.0 en realidad usa un bucle planificador-actor-validador. El planificador descompone tareas complejas en objetivos más pequeños, el actor los ejecuta y el validador confirma si cada objetivo tuvo éxito. Este enfoque de tres fases ayudó a Skyvern a saltar del 45 % (versión de un solo prompt) al 68.7 % (con planificador) y al 85.85 % (con validador comprobando si las acciones realmente funcionaron).

El procesamiento de visión funciona en sitios con mucho JavaScript donde el DOM se reconstruye después de cargar la página. Pero GPT-4V cobra por token de imagen, lo que hace que cada vista de página sea 10-20x más costosa que leer HTML. Los modelos de visión también añaden 2-3 segundos por página en comparación con el análisis de DOM.

Análisis de DOM: Browser-Use y Agent-E leen el HTML de la página directamente. Escanean el código en busca de elementos clicables, campos de entrada y enlaces de navegación.

Agent-E usa “DOM Distillation” para reducir páginas complejas a elementos esenciales, además de “Skill Harvesting” para recordar y reutilizar patrones de interacción exitosos. Superó al agente multimodal WebVoyager (que usa visión) en sitios como Huggingface, Apple y Amazon usando solo texto. Pero la planificación de Agent-E se desincroniza cuando los sitios web revelan dinámicamente nuevas opciones, como menús desplegables que cambian según tus selecciones.

El análisis de DOM cuesta menos y se ejecuta más rápido. La precisión del 89.1 % de Browser-Use proviene en parte de la integración de LangChain y de prompts actualizados, no solo de omitir llamadas de visión. Pero los enfoques de DOM tienen dificultades cuando los sitios usan shadow DOM, nombres de clase ofuscados o manipulación intensa de JavaScript.

Enfoque combinado: LiteWebAgent y AutoWebGLM analizan el DOM para la estructura y luego usan visión para verificar lo que los usuarios realmente ven. Más preciso que solo el DOM, más económico que la visión pura, pero estás ejecutando dos sistemas por página.

Especialización

Auto-GPT y AgenticSeek manejan la navegación web junto con operaciones de archivos y ejecución de código. Carecen de funciones específicas web como rotación de proxy y gestión de cookies, lo que limita su efectividad en sitios con detección de bots.

Agent-E y WebVoyager solo realizan navegación web. Agent-E logró un 73.1 % general en el dataset completo de 643 tareas de WebVoyager, superando el 57.1 % del agente multimodal WebVoyager. Rendimiento sólido en sitios como Wolfram (95.7 %), Google Search (90.7 %) y Google Maps (87.8 %). Débil en sitios dinámicos: solo 27.3 % en Booking.com y 35.7 % en Google Flights, donde los menús desplegables y los campos de formulario cambian según las selecciones del usuario.

Crawl4AI y FireCrawl extraen datos y convierten páginas a Markdown o JSON. No rellenan formularios ni hacen clic en flujos de trabajo. Úsalos cuando necesites contenido en formato estructurado, no cuando necesites completar tareas de varios pasos.

Playwright y Selenium automatizan las pruebas de navegador. Producen resultados idénticos entre ejecuciones, algo esencial para las pruebas de regresión. Pero este determinismo significa que no pueden adaptarse. Cuando un sitio cambia, tu suite de pruebas se rompe.

Opciones de despliegue

Ejecución local: AgenticSeek, Nanobrowser y OpenInterpreter se ejecutan en tu máquina. Tus datos de navegación permanecen locales y evitas costes de API. Pero una estación de trabajo típica maneja de 5 a 10 instancias de navegador concurrentes antes de que la CPU/RAM se sature.

APIs en la nube: Browserless ofrece instancias remotas de Chrome mediante REST o WebSocket. Puedes levantar cientos de sesiones paralelas con rotación automática de proxy. Cada solicitud añade 100-300ms de latencia en comparación con los navegadores locales, y tu tráfico se enruta a través de sus servidores a menos que te autoalojes con Docker.

Despliegue flexible: Skyvern se ejecuta localmente durante el desarrollo y luego se despliega en la nube para producción. Su benchmark en realidad se ejecutó en Skyvern Cloud (no en máquinas locales) para probar condiciones del mundo real con navegadores en la nube asíncronos y direcciones IP realistas. La mayoría de los benchmarks se ejecutan en IP locales seguras con buenas huellas de navegador, lo que no coincide con la realidad de producción.

Patrones de integración

El WebSurfer de AutoGen requiere adoptar todo el framework multiagente de Microsoft. Obtienes orquestación de agentes y gestión de memoria integradas, pero no puedes integrarlo fácilmente con sistemas existentes.

Browser-Use y Playwright funcionan como librerías independientes. Incorpóralos en cualquier proyecto de Python o Node.js. Pero tendrás que construir tu propia coordinación de agentes, manejo de errores y almacenamiento de resultados.

Nanobrowser y BraveGPT se instalan como extensiones de Chrome. No requieren configuración de servidor; se agregan al navegador y empiezan. No pueden escalar más allá de unas pocas pestañas concurrentes y no se integran con pipelines de automatización de backend.

Consideraciones de producción

Skyvern y Browserless incluyen soporte de proxy residencial, movimientos de ratón aleatorios y rotación de huellas de navegador. Estas funciones evitan bloqueos de IP y desencadenantes de CAPTCHA en sitios protegidos.

WebVoyager y AutoWebGLM se centran en algoritmos de navegación. Agent-E alcanzó 73.1 % usando análisis de DOM solo con texto, superando el 57.1 % del enfoque multimodal de WebVoyager. Pero los sitios de producción con Cloudflare o DataDome bloquearán a los agentes sin una protección anti-detección adecuada.

Contexto importante del benchmark: Browser-Use y Agent-E ejecutaron las pruebas localmente con direcciones IP seguras. Skyvern ejecutó específicamente sus pruebas en infraestructura en la nube para igualar las condiciones reales de producción, donde te enfrentas a la detección de bots, la toma de huellas del navegador y los desafíos CAPTCHA. Las propias pruebas de benchmark se ejecutan en sitios cooperativos sin protección agresiva contra bots, por lo que las tasas de éxito en el mundo real serán más bajas de lo que sugieren estos números.

Fuentes del benchmark

  • Browser-Use7
  • Skyvern 2.08
  • WebVoyager9

Cita esta investigación

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Cem Dilmegani (2026) - "Mejores 30+ agentes web de código abierto". Publicado en línea en AIMultiple.com. Recuperado el 1 de Septiembre de 2026, de: https://aimultiple.com/open-source-web-agents [Recurso en línea]

Dilmegani, C. (2026, 1 de Septiembre). Mejores 30+ agentes web de código abierto. AIMultiple. https://aimultiple.com/open-source-web-agents

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{Mejores 30+ agentes web de código abierto}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/open-source-web-agents}},
  note   = {AIMultiple. Recuperado el 1 de Septiembre de 2026}
}

Registro de cambios

4 actualizaciones
  1. 2026

    Se amplió la sección "Resultados del Benchmark Web Voyager" con sitios web y tipos de tareas adicionales.

  2. Se actualizó la sección "Evaluación: Web Voyager Benchmark" con nuevos resultados de benchmark y detalles de metodología.

  3. 2025

    Se amplió la sección "Qué hace diferentes a estos agentes web".

  4. Se actualizó la introducción, añadiendo un benchmark de 8 servidores MCP en tareas de búsqueda web y automatización de navegadores.

Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem ha sido el analista principal en AIMultiple desde 2017.

El trabajo de Cem en AIMultiple ha sido citado por publicaciones líderes mundiales como Business Insider, Forbes, Morning Brew y Washington Post, empresas globales como Deloitte y HPE, ONG como World Economic Forum y organizaciones supranacionales como European Commission. [1], [2], [3], [4], [5]

A lo largo de su carrera, Cem trabajó como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.

Dirigió la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando al CEO. También lideró el crecimiento comercial de la empresa de deep tech Hypatos, que alcanzó unos ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.

Cem participa habitualmente en conferencias internacionales de tecnología. Se graduó en Bogazici University como ingeniero informático y tiene un MBA de Columbia Business School.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450