Probamos más de 30 agentes web de código abierto en cuatro categorías: agentes autónomos, controladores de uso de ordenador, scrapers web y frameworks para desarrolladores.
Ejecutamos benchmarks idénticos usando la suite de pruebas WebVoyager, que cubre 643 tareas en 15 sitios web reales, para medir qué herramientas completan realmente tareas web de varios pasos y cuáles fallan cuando los sitios usan menús desplegables dinámicos o diseños con mucho JavaScript.
Agentes web de código abierto: estrellas en GitHub
Benchmark WebVoyager: metodología
Agentes probados
Incluimos agentes que cumplían los tres criterios: código fuente disponible públicamente, una puntuación reportada en el benchmark WebVoyager proveniente de la propia evaluación publicada del agente, y mantenimiento activo (último commit dentro de los 6 meses posteriores a nuestra fecha de revisión).
- Browser-Use: puente LLM-navegador, basado en DOM con integración con LangChain
- Skyvern 2.0: basado en visión, arquitectura planificador-actor-validador, despliegue en la nube
- Agent-E: solo DOM, sin modelos de visión, dataset completo de 643 tareas
- WebVoyager: línea base multimodal original, híbrido GPT-4V + DOM
Los agentes listados en el artículo más amplio pero sin puntuaciones publicadas en WebVoyager (Auto-GPT, AgenticSeek, OpenManus, LaVague y otros) fueron evaluados cualitativamente en cuanto a arquitectura, modelo de despliegue y capacidades declaradas. No se incluyen en la comparación cuantitativa.
Condiciones de prueba
Cada equipo ejecutó su propia evaluación; no volvimos a ejecutar las pruebas de forma independiente. Las diferencias de puntuación reflejan en parte distintas condiciones de prueba:
Browser-Use probó 586 de 643 tareas, eliminando 55 con respuestas obsoletas (productos de Apple descontinuados, fechas de vuelos vencidas, recetas eliminadas). Las pruebas se ejecutaron en máquinas locales con direcciones IP seguras. Se aplicaron la integración con LangChain y prompts de sistema reescritos antes de las pruebas.
Skyvern 2.0 probó 635 de 643 tareas, eliminando 8 con respuestas inválidas, y actualizó las fechas de 2023/2024 en tareas de viajes a 2025. Las pruebas se ejecutaron en Skyvern Cloud usando navegadores en la nube asíncronos, no en máquinas locales. Las condiciones en la nube exponen a los agentes a detección de bots y desafíos CAPTCHA que las pruebas locales evitan. Las grabaciones completas de las pruebas están disponibles en eval.skyvern.com.
Agent-E probó el dataset completo de 643 tareas sin modificaciones. Usó solo análisis DOM, sin modelos de visión. La línea base de comparación fue el agente WebVoyager original, no GPT-4o.
WebVoyager (original) probó el dataset completo usando capturas de pantalla de GPT-4V más DOM. Sirve como la línea base multimodal que Agent-E superó usando solo texto.
Puntuación
La finalización de tareas es binaria: el agente completa la tarea completa de varios pasos o no lo hace. No se otorga crédito parcial. Una tarea se marca como completada solo cuando el resultado final esperado (un precio, una confirmación de reserva, un resultado de búsqueda) coincide con la verdad de referencia.
La tasa de aprobación se reporta como: tasks completed / tasks attempted × 100
Cuando los equipos eliminaron tareas del dataset, el denominador refleja su conjunto reducido, no el original de 643.
Qué significan estas puntuaciones en la práctica
Las tareas del benchmark WebVoyager se ejecutan en sitios web reales en condiciones cooperativas, sin protección agresiva contra bots, sin Cloudflare, sin DataDome. Browser-Use y Agent-E se ejecutaron en máquinas locales con IP equivalentes a residenciales. Skyvern usó deliberadamente infraestructura en la nube para aproximarse a la realidad de producción. Las tasas de éxito en el mundo real en sitios de producción protegidos serán más bajas que las puntuaciones del benchmark para todos los agentes.
El benchmark no mide la velocidad, el coste por tarea ni la resistencia a las medidas anti-bot. Una puntuación del 89,1% en WebVoyager no significa que el agente completará el 89% de las tareas en un sitio de producción con protección de Cloudflare.
Limitaciones
Denominadores no comparables: Browser-Use probó 586 tareas, Skyvern probó 635, Agent-E probó 643. Una puntuación más alta en un conjunto más pequeño no es directamente comparable a una puntuación más baja en el conjunto completo.
Resultados auto-reportados: Todas las puntuaciones provienen de la propia evaluación publicada de cada equipo. No realizamos una repetición controlada con condiciones idénticas para todos los agentes.
Deriva del benchmark: El conjunto de tareas de WebVoyager se publicó en 2023. Varias tareas hacen referencia a productos, precios y fechas que ya no existen. Los equipos lo manejaron de manera diferente; algunos las eliminaron, mientras que otros actualizaron las fechas, introduciendo inconsistencia.
Brecha local vs. nube: Browser-Use y Agent-E probaron localmente (IP seguras, sin detección de bots). Skyvern probó en la nube (exposición real a protección anti-bot). La comparación directa de puntuaciones subestima la brecha de producción para los agentes probados localmente.
Sin datos de coste o latencia: El benchmark mide solo la finalización de tareas. El coste por tarea y el tiempo medio de finalización no se capturan en las puntuaciones de WebVoyager, aunque importan significativamente para las decisiones de despliegue en producción.
Instantánea estática: Las puntuaciones reflejan las versiones de los agentes y los estados de los sitios web en el momento de la prueba. Ambos cambian con frecuencia; un rediseño del sitio web o una actualización del agente pueden modificar los resultados de forma sustancial.
Actualizaciones importantes recientes
Crisis de seguridad: distribución de malware en OpenClaw
Más de 400 "skills" maliciosas se subieron a ClawHub (el marketplace de OpenClaw) entre finales de enero y principios de febrero, distribuyendo malware de robo de credenciales. IBM, Anthropic y Palo Alto Networks emitieron advertencias. Los investigadores de seguridad ahora recomiendan usar solo entornos aislados y fuentes verificadas.
Crecimiento viral de OpenClaw
OpenClaw (anteriormente Moltbot/Clawdbot) alcanzó 147.000 estrellas en GitHub, el proyecto de IA de código abierto de más rápido crecimiento. Se ejecuta localmente, se integra con plataformas de mensajería y usa Model Context Protocol para más de 100 servicios. Cloudflare lanzó el middleware Moltworker para soportar su infraestructura.1
Moltbook: red social de agentes de IA
Red social solo para IA lanzada a finales de enero, alcanzó 1,5 millones de agentes en cuestión de días. Los agentes publican e interactúan de forma autónoma mientras los humanos observan.2
Estandarización de Model Context Protocol
MCP se convirtió en el protocolo dominante para la integración agente-herramienta, con más de 100 servidores disponibles. La gestión y la gobernanza son ahora críticas para los despliegues empresariales.
Modelos Nemotron 3 de NVIDIA
NVIDIA lanzó la familia Nemotron 3 (Nano, Super, Ultra) optimizada para IA agéntica, ofreciendo 4x mayor rendimiento. Incluye NeMo Gym y Agentic Safety Dataset en GitHub y Hugging Face.3
Agentes web autónomos y copilotos
Herramientas que navegan por sitios web y completan tareas de varios pasos con una guía mínima.
Agentes autónomos de propósito general
OpenClaw (anteriormente Moltbot/Clawdbot): Ejecútalo en tu máquina local para automatizar tareas en aplicaciones de mensajería, calendarios y correo electrónico. Dile "programa una reunión con el equipo para el próximo martes y envía invitaciones de calendario" y gestiona todo el flujo de trabajo. Usa Model Context Protocol para conectarse con más de 100 servicios sin llamadas a API en la nube.
Quién lo usa: Early adopters dispuestos a gestionar riesgos de seguridad para la automatización local. Usuarios que quieren interfaces conversacionales para flujos de trabajo de escritorio.
Limitaciones:
- Vulnerabilidades de seguridad importantes en el ecosistema de skills (más de 400 paquetes maliciosos en una semana)
- Todavía en desarrollo rápido con cambios disruptivos frecuentes
- Documentación inconsistente debido a múltiples ciclos de cambio de marca
- Uso intensivo de recursos (requiere capacidad de cómputo local significativa)
AgenticSeek: Sustituye los servicios comerciales basados en la nube por una alternativa local que no envía datos de navegación a servidores externos. Instálalo en tu máquina, describe lo que necesitas ("extrae todos los precios de productos de esta página") y él se encarga de hacer clics y recopilar datos. Basado en Python, se ejecuta completamente autoalojado.
Quién lo usa: Usuarios preocupados por la privacidad que no comparten datos de navegación. Organizaciones con requisitos de residencia de datos.
Limitaciones:
- Limitado a concurrencia en una sola máquina (5-10 instancias de navegador)
- Sin rotación de proxy incorporada ni funciones anti-detección
- Requiere configuración y mantenimiento del entorno Python
- Más lento que las soluciones en la nube para tareas a gran escala
Auto-GPT: Gestiona la navegación web junto con operaciones de archivos y ejecución de código. Despliéguelo a través de la interfaz del navegador o la línea de comandos. Cuando le asignas una tarea como "investiga los precios de la competencia y guárdalos en una hoja de cálculo", determina qué sitios web visitar, qué datos recuperar y cómo organizar el resultado.
Quién lo usa: Desarrolladores que crean flujos de trabajo de automatización personalizados. Usuarios familiarizados con herramientas de línea de comandos.
Limitaciones:
- Carece de funciones específicas para la web como rotación de proxy y gestión de cookies
- Sin evasión de detección de bots incorporada (los sitios con Cloudflare lo bloquearán)
- Uso intensivo de recursos (lanza múltiples instancias de navegador)
- Requiere ingeniería de prompts manual para tareas complejas
AgentGPT: Configura agentes directamente en tu navegador sin escribir código. Desarrolla agentes especializados como "ResearchGPT" o "DataGPT" que descomponen objetivos en pasos. La plataforma gestiona la orquestación. Tú describes lo que quieres lograr. Autoalojable si no quieres usar su versión alojada.
Quién lo usa: Usuarios no técnicos que necesitan automatización simple. Equipos que quieren configuraciones de agentes compartidas.
Limitaciones:
- Personalización limitada en comparación con soluciones programadas
- Cuellos de botella de rendimiento en tareas complejas de varios pasos
- La versión alojada envía datos a sus servidores (se requiere autoalojamiento para privacidad)
- Sin funciones avanzadas como fingerprinting de navegador o manejo de CAPTCHA
SuperAGI: Framework para construir agentes autónomos personalizados con plantillas para flujos de trabajo comunes. Amplíalo con tu propia lógica. Gestiona la automatización del navegador como un componente de flujos de trabajo más amplios. Despliéguelo localmente o en infraestructura en la nube.
Quién lo usa: Equipos de desarrollo que construyen sistemas de agentes en producción. Organizaciones que necesitan frameworks de automatización personalizables.
Limitaciones:
- Curva de aprendizaje pronunciada (requiere comprensión de la arquitectura de agentes)
- Librería de plantillas aún limitada (requiere desarrollo personalizado para la mayoría de casos de uso)
- Vacios en la documentación para funciones avanzadas
- El desarrollo activo implica cambios disruptivos entre versiones
Nanobrowser: Enfoque de extensión de Chrome: instálalo y luego controla los agentes desde la barra de herramientas de tu navegador. Bueno para tareas rápidas como "extrae todos los correos electrónicos de esta página" o "rellena este formulario con datos de mi hoja de cálculo".
Quién lo usa: Usuarios ocasionales que necesitan automatización de navegador esporádica. Usuarios que no configurarán servidores ni entornos Python.
Limitaciones:
- No puede escalar más allá de unas pocas pestañas (sin procesamiento concurrente)
- Sin integración con pipelines de automatización de backend
- Limitado al navegador Chrome
- Los permisos de la extensión plantean preocupaciones de seguridad
OpenManus: Alternativa de código abierto a los servicios comerciales de automatización de navegadores. Ejecuta tareas de navegador que duran horas o días, como monitorizar sitios para detectar cambios de precios o esperar a que los productos vuelvan a estar disponibles. Despliéguelo localmente con Python y Docker, manténgalo ejecutándose en segundo plano.
Actualización reciente: DeepWisdom (empresa matriz de OpenManus) renombró oficialmente su tecnología de agente principal a Atoms a mediados de enero. El nuevo framework Atoms cambia el enfoque de herramientas para desarrolladores aficionados al despliegue de agentes de nivel comercial con módulos integrados para pagos y autenticación.4
Quién lo usa: Usuarios que ejecutan tareas de monitorización de larga duración. Desarrolladores que construyen sistemas de notificación automatizados.
Limitaciones:
- Requiere configuración de Docker y Python
- Sin soporte de proxy incorporado (los sitios detectarán solicitudes repetidas desde la misma IP)
- Fugas de memoria en tareas de larga duración (requiere reinicios periódicos)
- El cambio de marca a Atoms puede causar confusión en la documentación
Agentes de uso de ordenador
Automatización de escritorio que controla navegadores como una pieza de flujos de trabajo de ordenador más amplios.
OpenInterpreter: Agente basado en terminal que ejecuta scripts de Python, JavaScript y shell basándose en lo que escribes. Pídele que "haga scraping de este sitio y analice los datos en pandas" y genera el código de scraping, lo ejecuta y luego realiza el análisis. La automatización del navegador se integra con el acceso al sistema de archivos y el procesamiento de datos.
Quién lo usa: Desarrolladores familiarizados con interfaces de terminal. Científicos de datos que combinan scraping web con flujos de trabajo de análisis.
Cuándo tiene sentido: Necesitas automatización que abarque navegación web y computación local. Quieres inspeccionar y modificar el código generado antes de la ejecución. Tus flujos de trabajo implican transformación de datos después de la recopilación.
Limitaciones:
- Interfaz solo de terminal (sin GUI)
- Riesgo de seguridad (ejecuta código arbitrario en tu máquina)
- Sin sandboxing por defecto (puede acceder a cualquier archivo o recurso del sistema)
- Curva de aprendizaje para no programadores
UI-TARS: Framework de investigación del ámbito académico que toma capturas de pantalla de tu escritorio, las analiza con modelos de visión y luego genera comandos para controlar elementos de la GUI. Construido para probar nuevos enfoques de automatización de escritorio, no para uso en producción.
Quién lo usa: Investigadores académicos que exploran la automatización basada en visión. Laboratorios que prueban sistemas de control multimodal.
Cuándo tiene sentido: Estás realizando investigación sobre automatización basada en visión. Necesitas experimentar con enfoques de análisis de capturas de pantalla. Estás escribiendo artículos académicos sobre automatización de GUI.
Limitaciones:
- No está listo para producción (prototipo de investigación)
- Alta latencia (el procesamiento del modelo de visión tarda 2-3 segundos por acción)
- Caro (GPT-4V cobra por token de imagen)
- Sin recuperación de errores ni lógica de reintento
AutoBrowser MCP: Servidor MCP que permite a Claude controlar navegadores Chrome a través de Model Context Protocol, proporcionando capacidades de interacción con el navegador basadas en visión. Claude ve la pantalla de tu navegador, decide qué hacer clic y ejecuta la acción. Se ejecuta como una extensión de Chrome más un servidor local.
Quién lo usa: Usuarios de Claude que quieren control del navegador. Desarrolladores que construyen sistemas de automatización basados en MCP.
Cuándo tiene sentido: Ya estás usando Claude y quieres añadir automatización del navegador. Prefieres el control conversacional sobre las API programáticas. Se requiere interacción basada en visión para diseños complejos.
Limitaciones:
- Requiere acceso a la API de Claude (no disponible en todas las regiones)
- Los costes del modelo de visión se acumulan rápidamente
- La latencia es mayor que la de los enfoques basados en DOM
- Limitado al navegador Chrome
Open Operator: La respuesta del equipo de Browser-Use al Operator de OpenAI. Proporciona a los modelos de lenguaje acceso directo a Chrome a través de una vista DOM simplificada. Ejecútalo en modo totalmente autónomo o activa el modo de aprobación, en el que confirmas cada acción antes de la ejecución. Instálalo a través de Python o extensión de navegador.
Actualización reciente: Browser-Use anunció una integración estratégica con Parallel IA a finales de enero, permitiendo búsquedas web multi-hilo. La actualización permite a los agentes ejecutar hasta 20 pasos de navegador por minuto, igualando o superando el rendimiento humano en tareas de investigación complejas.5
Quién lo usa: Equipos que ya usan el framework Browser-Use. Organizaciones que quieren flujos de trabajo de aprobación para acciones de agentes.
Cuándo tiene sentido: Necesitas navegación autónoma con supervisión humana. Tus flujos de trabajo requieren velocidad (ejecución multi-hilo). Estás construyendo sobre el ecosistema Browser-Use.
Limitaciones:
- Requiere instalación del framework Browser-Use
- El modo de aprobación ralentiza significativamente la automatización
- Funciones anti-detección limitadas (los sitios con protección anti-bot lo bloquearán)
- Solo Python (sin soporte para JavaScript/TypeScript)
Cowork (Anthropic): Herramienta de escritorio de Anthropic que da a Claude acceso directo a sistemas de archivos y entornos de navegador dentro de una aplicación unificada. Expande la API de Computer Use a un producto orientado al consumidor. Disponible para descargar; ya no está limitado a la vista previa de investigación. Propietario, incluido aquí para comparación con alternativas de código abierto.
Agentes de navegación web
Se centran específicamente en flujos de trabajo de sitios web de varios pasos.
Agent-E: Lee el HTML de la página para encontrar elementos cliqueables y rutas de navegación. Usa "DOM Distillation" para reducir las páginas a elementos interactivos esenciales, más "Skill Harvesting" para recordar patrones exitosos. Obtuvo un 73,1% en el benchmark WebVoyager usando solo texto, sin modelos de visión.
Quién lo usa: Organizaciones que priorizan el coste sobre la precisión. Desarrolladores que construyen sistemas de automatización basados en DOM.
Cuándo tiene sentido: Necesitas automatización rápida y barata en sitios web estáticos. Tus sitios objetivo no usan formularios dinámicos con mucho JavaScript. Puedes tolerar una tasa de éxito del 73% a cambio de costes más bajos.
Limitaciones:
- Sin recuperación de errores incorporada cuando la estructura del DOM cambia inesperadamente
- Tiene dificultades con formularios dinámicos donde los menús desplegables muestran nuevas opciones según las selecciones
- El rendimiento cae significativamente en sitios con mucho JavaScript
- Malos resultados en sitios de reservas
AutoWebGLM: Simplifica el HTML antes de enviarlo a los modelos de lenguaje. Las páginas complejas se reducen a elementos de navegación principales y campos de formulario. Usa aprendizaje por refuerzo para mejorar las decisiones de navegación con el tiempo. Se ejecuta autoalojado a través de Python.
Quién lo usa: Equipos de investigación que exploran la automatización web basada en RL. Organizaciones con recursos de cómputo para el entrenamiento de modelos.
Cuándo tiene sentido: Puedes invertir en entrenar modelos personalizados para tus sitios web específicos. Tus flujos de trabajo son lo suficientemente repetitivos como para beneficiarse de la optimización RL. Tienes infraestructura de ML en Python.
Limitaciones:
- Documentación y soporte comunitario limitados
- Requiere fase de entrenamiento antes del despliegue (no es plug-and-play)
- Necesita ejemplos significativos para aprender políticas efectivas
- Se rompe cuando los sitios web rediseñan sus layouts
Agentes de navegación basados en visión
Combinan capturas de pantalla con análisis de texto para interpretar el diseño visual de la página.
Extensión WebSurfer de Autogen: Conéctate al framework AutoGen de Microsoft para añadir navegación web. Requiere instalación de Playwright. El framework te permite crear equipos de agentes: un agente busca mientras otro procesa los resultados y un tercero interactúa contigo.
Quién lo usa: Equipos que ya usan el framework AutoGen. Usuarios del ecosistema de Microsoft.
Cuándo tiene sentido: Estás construyendo sistemas multi-agente dentro de AutoGen. Necesitas colaboración orquestada de agentes. Quieres el soporte y la documentación de Microsoft.
Limitaciones reales:
- Ejemplos y proyectos comunitarios limitados
- Requiere adoptar todo el framework AutoGen (no se puede usar de forma independiente)
- La sobrecarga del framework no vale la pena para tareas de automatización simples
- Curva de aprendizaje pronunciada para la orquestación multi-agente
Skyvern: Sistema de tres fases: el planificador divide las tareas en pasos, el actor las ejecuta, el validador confirma el éxito. Toma capturas de pantalla para identificar visualmente botones y formularios. Este enfoque aborda los sitios con mucho JavaScript en los que el DOM cambia después de cargar la página. Obtuvo un 85,85% en WebVoyager. Despliéguelo autoalojado o use su nube gestionada.
WebVoyager: El agente de referencia original del artículo de 2024 que introdujo la suite de pruebas WebVoyager. Usa capturas de pantalla de GPT-4V junto con análisis DOM en un enfoque híbrido. Obtuvo un 57,1% en el dataset completo de 643 tareas, la línea base con la que se miden los agentes posteriores. No se mantiene activamente como herramienta de producción; su valor es como referencia de investigación y punto de origen del benchmark.
Quién lo usa: Organizaciones que necesitan alta precisión en aplicaciones web modernas. Equipos dispuestos a pagar los costes del modelo de visión para obtener mejores resultados.
Cuándo tiene sentido: Tus sitios objetivo usan JavaScript pesado y diseños dinámicos. Necesitas una precisión superior al 85%. Puedes permitirte costes 10-20x más altos que el análisis DOM. Tus flujos de trabajo justifican la infraestructura en la nube.
Limitaciones:
- La versión autoalojada requiere capacidad de cómputo significativa para modelos de visión
- Caro (GPT-4V cobra por token de imagen; cada vista de página cuesta 10-20x más que el análisis DOM)
- Más lento que los enfoques DOM (2-3 segundos por página para procesamiento de visión)
- El despliegue en la nube te expone a la detección de bots
LiteWebAgent: Modelo de lenguaje de visión con memoria y planificación que controla Chrome a través del Protocolo DevTools. Mantiene el contexto a través de las cargas de página, recordando lo que vio en páginas anteriores al tomar decisiones de navegación. Framework Python, despliegue autoalojado.
Quién lo usa: Desarrolladores que construyen agentes personalizados basados en visión. Equipos que necesitan memoria entre páginas.
Cuándo tiene sentido: Tus flujos de trabajo requieren recordar información a través de múltiples páginas. Necesitas capacidades de visión pero quieres más control que Skyvern. Puedes mantener infraestructura de ML en Python.
Limitaciones:
- Requiere capacidad de cómputo significativa para modelos de visión
- La arquitectura de memoria aumenta la complejidad y los modos de fallo
- Pruebas limitadas en sitios web de producción con detección de bots
- Comunidad pequeña (menos ejemplos e integraciones que las alternativas)
Herramientas de habilitación de agentes
Frameworks que permiten a los LLM o a los usuarios enviar comandos a los navegadores sin planificación autónoma de tareas.
De lenguaje natural a acción web
LaVague: tú dices "Haz clic en el botón verde". LaVague lo encuentra y hace clic. Gestiona la identificación de elementos en diferentes diseños de página. Bueno para tareas repetitivas donde sabes exactamente lo que quieres pero no quieres escribir selectores. Basado en Python, se ejecuta autoalojado.
ZeroStep: Convierte instrucciones conversacionales en código de prueba de Playwright. Describes la acción en lenguaje natural y genera los comandos de Playwright. Acelera la escritura de pruebas si ya estás usando Playwright. Herramienta CLI de Node.js.
Puentes LLM-Navegador
Conectan modelos de lenguaje directamente a los controles del navegador.
Browser-Use: Toma el DOM desordenado y lo reestructura para LLM. Elimina elementos irrelevantes, etiqueta componentes interactivos y proporciona interfaces de control. Esto es lo que permitió a Browser-Use alcanzar el 89,1% en WebVoyager. Disponible como librería de Python o API, despliegue autoalojado o use su nube.
Browserless: Instancias remotas de Chrome que controlas a través de REST o WebSocket. Lanza cientos de navegadores en la nube sin gestionar infraestructura. Cada navegador se ejecuta sin cabeza, por lo que no hay sobrecarga de GUI. Usa su API alojada o Docker para autoalojamiento.
ZeroStep (Playwright IA): Capa de IA sobre Playwright. Escribe prompts en lugar de selectores. Combina la fiabilidad de Playwright con la flexibilidad de LLM para identificar elementos. Requiere instalación de Node.js y Playwright.
Kits de herramientas de automatización web y scraping
Herramientas específicas para tareas, donde inicias cada trabajo individualmente.
Extensiones de automatización de navegador
PulsarRPA: Extensión de Chrome para extracción de datos. Apúntala a una tabla o lista, muéstrale qué extraer y ella se encarga del resto. Incluye backend para programar y almacenar resultados.
Quién lo usa: Usuarios no técnicos que necesitan extracción de datos regular. Analistas de negocio que llevan datos a hojas de cálculo.
Cuándo tiene sentido: Extraes datos de los mismos sitios repetidamente. No quieres escribir código. Necesitas programación y almacenamiento de resultados. Tus sitios objetivo no bloquean las extensiones del navegador.
Limitaciones:
- Solo Chrome (sin Firefox ni Safari)
- Se rompe cuando los sitios objetivo cambian de diseño
- Sin soporte de proxy (los sitios detectan solicitudes repetidas desde la misma IP)
- Limitado a extracción de datos tabulares
VimGPT: Proyecto experimental donde GPT-4 Vision controla tu navegador a través de atajos de teclado Vimium. El modelo ve capturas de pantalla y genera comandos de teclado.
Quién lo usa: Investigadores que exploran visión + control por teclado. Entusiastas de Vim con curiosidad por la automatización con IA.
Cuándo tiene sentido: Estás realizando investigación sobre automatización basada en teclado. Buscas comprender las capacidades de los modelos de visión. No estás desplegando automatización en producción.
Limitaciones:
- Solo experimental (no es práctico para trabajo real)
- Requiere extensión Vimium más backend Python
- Alta latencia (procesamiento de visión + generación de comandos)
- Caro (GPT-4V cuesta por captura de pantalla)
Scrapers y crawlers con IA
Crawl4AI: Un crawler que usa LLM para decidir qué es importante en una página. En lugar de tomar todo, identifica el contenido relevante según tu objetivo. Basado en Python, se integra con librerías de scraping estándar.
Crecimiento reciente: Alcanzó el n.º 1 en tendencias de GitHub y superó las 58.000 estrellas. Optimizado para integración con LLM con salida en markdown y filtrado de contenido BM25. Opción popular para pipelines de RAG que requieren despliegue local-first.6
Quién lo usa: Desarrolladores que construyen sistemas de RAG. Equipos que necesitan soporte local de LLM sin costes de API.
Cuándo tiene sentido: Estás construyendo aplicaciones de LLM que necesitan datos web. Quieres salida en formato markdown. Necesitas un despliegue local sin dependencias de API en la nube. Tu caso de uso implica filtrado de contenido y clasificación por relevancia.
Limitaciones:
- Requiere LLM ejecutándose localmente o a través de API (no es independiente)
- Más lento que los scrapers tradicionales (procesamiento de LLM por página)
- Puede omitir contenido importante si el LLM juzga incorrectamente
- Mayor uso de recursos que los scrapers basados en reglas
FireCrawl: Convierte sitios web en Markdown o JSON limpios. Gestiona la navegación, el renderizado de JavaScript y la extracción de contenido. Salida estructurada para alimentar ventanas de contexto de LLM. Librería de Node.js o CLI.
Quién lo usa: Desarrolladores de aplicaciones de LLM. Equipos que construyen sistemas de IA que procesan contenido web.
Cuándo tiene sentido: Necesitas extracción de texto limpio para procesamiento de LLM. Tus sitios objetivo usan renderizado de JavaScript. Quieres salida estructurada (Markdown/JSON). Estás construyendo aplicaciones Node.js.
Limitaciones:
- Solo Node.js (sin bindings de Python)
- Conversión a Markdown opinada (puede perder formato que necesitas)
- Personalización limitada de reglas de extracción
- Sin limitación de tasa ni anti-detección incorporadas
GPT-crawler: Rastrea sitios y genera datos de entrenamiento para GPTs personalizados. Apúntalo a documentación o una base de conocimiento, extrae el contenido y lo formatea para fine-tuning. Herramienta CLI de Python.
Quién lo usa: Equipos que construyen modelos GPT personalizados. Organizaciones que crean asistentes de IA específicos para un dominio.
Cuándo tiene sentido: Estás haciendo fine-tuning de modelos de lenguaje. Necesitas datos de entrenamiento estructurados de fuentes web. Tu contenido es documentación o bases de conocimiento. Puedes ejecutar herramientas CLI de Python.
Limitaciones:
- Formato de salida específico para fine-tuning de GPT (no es de propósito general)
- Sin actualizaciones incrementales (vuelve a rastrear todo el sitio para actualizaciones)
- Manejo limitado de autenticación o muros de pago
- Asume una estructura de contenido estática
ScrapeGraphAI: Construye grafos de conocimiento a partir de contenido rastreado. Bueno para sitios de documentación donde necesitas entender relaciones entre conceptos. Genera resúmenes estructurados o grafos de hechos. Despliegue en Python.
Quién lo usa: Equipos de gestión de conocimiento. Investigadores que construyen mapas conceptuales a partir de contenido web.
Cuándo tiene sentido: Necesitas extracción de relaciones, no solo contenido. Tus sitios objetivo son documentación o contenido educativo. Estás construyendo bases de conocimiento o mapas conceptuales. Tienes infraestructura Python.
Limitaciones:
- Configuración compleja (requiere base de datos de grafos y modelos NLP)
- Más lento que los scrapers simples (extracción de entidades + mapeo de relaciones)
- La calidad depende de la estructura del contenido fuente
- Limitado a texto (no maneja bien tablas o imágenes)
AutoScraper: Scraper de aprendizaje por ejemplo. Muéstrale una página con los datos que quieres, descubre el patrón y lo aplica a páginas similares. Librería ligera de Python para tareas de extracción simples.
Quién lo usa: Desarrolladores que necesitan extracción rápida sin escribir selectores XPath o CSS. Equipos que prototipan flujos de trabajo de scraping.
Cuándo tiene sentido: Tus páginas objetivo siguen patrones consistentes. No quieres escribir selectores manualmente. Necesitas prototipos rápidos. Tus sitios no cambian de diseño con frecuencia.
Limitaciones:
- Se rompe cuando los diseños de página cambian
- Limitado a estructuras de página similares (no puede generalizar a diferentes sitios)
- Sin soporte de renderizado de JavaScript
- Coincidencia de patrones simple (sin razonamiento de IA sobre el contenido)
Scraper LLM: Envía una página a un LLM y pregunta: "Extrae todos los precios de productos" o "Encuentra información de contacto". El modelo interpreta tu intención y extrae los datos relevantes. Flexible pero más caro que los scrapers basados en reglas. Basado en Python.
Quién lo usa: Equipos que necesitan extracción flexible sin escribir reglas. Desarrolladores que construyen tareas de extracción puntuales.
Cuándo tiene sentido: Las estructuras de página varían demasiado para la extracción basada en reglas. Necesitas comprensión semántica ("encuentra el nombre del autor"). El coste no es tu principal preocupación. Quieres desarrollo rápido sin ingeniería de selectores.
Limitaciones:
- Caro (costes de API de LLM por página)
- Más lento que los scrapers basados en reglas (latencia de API)
- Puede extraer datos incorrectos si el prompt no es claro
- Sin garantía de extracción consistente de campos entre páginas
Herramientas de búsqueda con IA
BingGPT: Interfaz de chat que combina la búsqueda de Bing con respuestas de GPT. Haz preguntas, obtén respuestas con fuentes. Aplicación de escritorio, no basada en navegador.
BraveGPT: Extensión de navegador con IA que añade respuestas de GPT a los resultados de Brave Search. Ve tanto los resultados de búsqueda tradicionales como un resumen de IA uno al lado del otro. Se superpone directamente en las páginas de búsqueda.
Frameworks de control web para desarrolladores
Librerías de bajo nivel para el control programático del navegador.
Frameworks de pruebas
Playwright: Automatización multinavegador de Microsoft. Compatible con Chromium, Firefox, WebKit. Esperas integradas, intercepción de red y emulación móvil. Disponible en JavaScript, Python, .NET y Java. Estándar de la industria para pruebas web modernas.
Selenium: El framework original de automatización de navegadores. Funciona en todos los navegadores principales. Ecosistema más amplio pero arquitectura más antigua. Bindings de lenguaje para Python, Java, C#, Ruby y más. Protocolo estándar WebDriver.
taiko: Framework de ThoughtWorks con sintaxis legible. Bueno para pruebas funcionales donde la legibilidad de las pruebas importa. Solo Node.js.
Librerías de automatización
Puppeteer: Librería de Google para controlar Chrome/Chromium. API de alto nivel para capturas de pantalla, generación de PDF y scraping. El ecosistema Node.js funciona con TypeScript. Opción estándar para automatización de Chrome sin cabeza.
Browser-Use: Listado anteriormente como puente LLM, pero también funciona como librería de automatización para desarrolladores. Convierte el DOM en un formato estructurado, gestiona la navegación y la interacción. Librería de Python con opción de API.
Qué hace diferentes a estos agentes web
Browser-Use obtuvo un 89,1% en las pruebas WebVoyager, mientras que Agent-E alcanzó un 73,1% en el dataset completo. Browser-Use utiliza planificación autónoma de tareas con integración con LangChain. Agent-E analiza la estructura del DOM directamente sin modelos de visión, lo que se ejecuta más rápido pero tiene dificultades cuando los sitios web usan menús desplegables dinámicos o revelan nuevas opciones según las elecciones del usuario.
Niveles de autonomía
Agentes totalmente autónomos como Browser-Use, Skyvern y Agent-E aceptan objetivos de alto nivel ("encuentra el vuelo más barato a París") y planifican sus propios pasos de navegación. Se adaptan a elementos inesperados como banners de cookies o captchas. Sin embargo, cada decisión requiere una llamada al LLM, aumentando tanto el coste como el tiempo de respuesta.
Herramientas de guía paso a paso como LaVague y ZeroStep ejecutan comandos específicos ("haz clic en el botón de búsqueda", "introduce texto en el campo 2"). Ejecución más rápida ya que omiten la sobrecarga de planificación. Pero si un sitio rediseña su layout, necesitas actualizar las instrucciones manualmente.
Frameworks de codificación manual como Playwright y Selenium requieren código explícito para cada clic, relleno de formulario y navegación. Las pruebas se ejecutan de forma idéntica cada vez hasta que el sitio cambia un ID de elemento o nombre de clase. Entonces los selectores se rompen y reescribes el código.
Cómo interpretan las páginas
Procesamiento basado en visión: Skyvern 2.0, WebVoyager y VimGPT capturan capturas de pantalla y las envían a modelos de visión como GPT-4V. Identifican botones y formularios mirando la página renderizada.
Skyvern 2.0 realmente usa un bucle planificador-actor-validador. El planificador descompone tareas complejas en objetivos más pequeños, el actor los ejecuta y el validador confirma si cada objetivo tuvo éxito. Este enfoque de tres fases ayudó a Skyvern a saltar del 45% (versión de prompt único) al 68,7% (con planificador) y al 85,85% (con validador comprobando si las acciones realmente funcionaron).
El procesamiento por visión funciona en sitios con mucho JavaScript donde el DOM se reconstruye después de cargar la página. Pero GPT-4V cobra por token de imagen, haciendo que cada vista de página sea 10-20x más cara que leer HTML. Los modelos de visión también añaden 2-3 segundos por página en comparación con el análisis DOM.
Análisis DOM: Browser-Use y Agent-E leen el HTML de la página directamente. Escanean el código en busca de elementos cliqueables, campos de entrada y enlaces de navegación.
Agent-E usa "DOM Distillation" para reducir páginas complejas a elementos esenciales, más "Skill Harvesting" para recordar y reutilizar patrones de interacción exitosos. Superó al agente multimodal WebVoyager (que usa visión) en sitios como Hugging Face, Apple y Amazon usando solo texto. Pero la planificación de Agent-E se desincroniza cuando los sitios web revelan dinámicamente nuevas opciones, como menús desplegables que cambian según tus selecciones.
El análisis DOM cuesta menos y se ejecuta más rápido. La precisión del 89,1% de Browser-Use proviene en parte de la integración con LangChain y prompts actualizados, no solo de omitir llamadas de visión. Pero los enfoques DOM tienen dificultades cuando los sitios usan shadow DOM, nombres de clase ofuscados o manipulación pesada de JavaScript.
Enfoque combinado: LiteWebAgent y AutoWebGLM analizan el DOM para la estructura y luego usan visión para verificar lo que los usuarios realmente ven. Más preciso que solo DOM, más barato que la visión pura, pero estás ejecutando dos sistemas por página.
Especialización
Auto-GPT y AgenticSeek gestionan la navegación web junto con operaciones de archivos y ejecución de código. Carecen de funciones específicas para la web como rotación de proxy y gestión de cookies, lo que limita la efectividad en sitios con detección de bots.
Agent-E y WebVoyager solo hacen navegación web. Agent-E logró un 73,1% general en el dataset completo de 643 tareas de WebVoyager, superando el 57,1% del agente multimodal WebVoyager. Fuerte rendimiento en sitios como Wolfram (95,7%), Google Search (90,7%) y Google Maps (87,8%). Débil en sitios dinámicos: solo 27,3% en Booking.com y 35,7% en Google Flights donde los menús desplegables y los campos de formulario cambian según las selecciones del usuario.
Crawl4AI y FireCrawl extraen datos y convierten páginas a Markdown o JSON. No rellenan formularios ni hacen clic en flujos de trabajo. Úsalos cuando necesites contenido en formato estructurado, no cuando necesites completar tareas de varios pasos.
Playwright y Selenium automatizan pruebas de navegador. Producen resultados idénticos en todas las ejecuciones, esencial para pruebas de regresión. Pero este determinismo significa que no pueden adaptarse. Cuando un sitio cambia, tu suite de pruebas se rompe.
Opciones de despliegue
Ejecución local: AgenticSeek, Nanobrowser y OpenInterpreter se ejecutan en tu máquina. Tus datos de navegación permanecen locales y evitas los costes de API. Pero una estación de trabajo típica maneja 5-10 instancias de navegador concurrentes antes de que la CPU/RAM se sature.
API en la nube: Browserless proporciona instancias remotas de Chrome a través de REST o WebSocket. Puedes lanzar cientos de sesiones paralelas con rotación automática de proxy. Cada solicitud añade 100-300ms de latencia en comparación con los navegadores locales, y tu tráfico pasa por sus servidores a menos que autoalojes con Docker.
Despliegue flexible: Skyvern se ejecuta localmente durante el desarrollo y luego se despliega en la nube para producción. Su benchmark se ejecutó realmente en Skyvern Cloud (no en máquinas locales) para probar condiciones del mundo real con navegadores en la nube asíncronos y direcciones IP realistas. La mayoría de los benchmarks se ejecutan en IP locales seguras con buenas huellas de navegador, lo que no coincide con la realidad de producción.
Patrones de integración
WebSurfer de AutoGen requiere adoptar todo el framework multi-agente de Microsoft. Obtienes orquestación de agentes y gestión de memoria integradas, pero no puedes integrarlo fácilmente con sistemas existentes.
Browser-Use y Playwright funcionan como librerías independientes. Incorpóralas en cualquier proyecto de Python o Node.js. Pero tendrás que construir tu propia coordinación de agentes, manejo de errores y almacenamiento de resultados.
Nanobrowser y BraveGPT se instalan como extensiones de Chrome. No se requiere configuración de servidor, se añaden al navegador y se empieza. No pueden escalar más allá de unas pocas pestañas concurrentes y no se integran con pipelines de automatización de backend.
Consideraciones de producción
Skyvern y Browserless incluyen soporte de proxy residencial, movimientos de ratón aleatorios y rotación de huella de navegador. Estas funciones previenen bloqueos de IP y activaciones de CAPTCHA en sitios protegidos.
WebVoyager y AutoWebGLM se centran en algoritmos de navegación. Agent-E alcanzó el 73,1% usando análisis DOM solo con texto, superando el 57,1% del enfoque multimodal de WebVoyager. Pero los sitios de producción con Cloudflare o DataDome bloquearán a los agentes sin la anti-detección adecuada.
Contexto importante del benchmark: Browser-Use y Agent-E ejecutaron las pruebas localmente con direcciones IP seguras. Skyvern ejecutó específicamente sus pruebas en infraestructura en la nube para igualar las condiciones reales de producción, donde te enfrentas a detección de bots, fingerprinting de navegador y desafíos CAPTCHA. Las propias pruebas del benchmark se ejecutan en sitios cooperativos sin protección agresiva contra bots, por lo que las tasas de éxito en el mundo real serán más bajas de lo que sugieren estos números.
Fuentes del benchmark
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Los mejores 30+ agentes web de código abierto}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/open-source-web-agents}},
note = {AIMultiple. Recuperado el 25 de Junio de 2026}
}
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.