Servicios
Contáctanos

Agentes de uso de computadora: Benchmark y arquitectura

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
actualizado el 22 de jun. de 2026

Los agentes de uso de computadora operan en escritorios reales y aplicaciones web. Sus diseños, limitaciones y compensaciones suelen ser poco claros. Desglosamos cómo funcionan los sistemas líderes, cómo aprenden y cómo difieren sus arquitecturas. También nos referimos a un benchmark de grounding de UI enfocado en 100 capturas de pantalla de escritorio, abarcando 4 tipos de tareas y 5 ejecuciones por muestra. Esto aísla la calidad de la percepción visual y muestra por qué los modelos sólidos de lenguaje-visión son importantes incluso para agentes compuestos.

Resultados del benchmark de grounding de UI

Loading Chart

Para obtener detalles sobre la metodología del benchmark, lea los detalles del benchmark.

  • Los modelos Qwen3-VL alcanzan una precisión de ~90 %, con un error bajo (≈7–9 px).
  • Los modelos especializados en UI como UI-TARS tienen un rendimiento inferior (~38 % de precisión) y muestran alta varianza y grandes errores, especialmente en interfaces dependientes del estado y densas.
  • Las IU dependientes del estado y densas son los casos más difíciles para la mayoría de los modelos.

Principales agentes de uso de computadora

Consulte la sección de características para ver las funciones de la tabla, y examine la sección de enfoques arquitectónicos para obtener detalles sobre la arquitectura de los agentes de uso de computadora.

Vista previa de uso de computadora de OpenAI

La vista previa de uso de computadora de OpenAI es un modelo especializado diseñado para comprender y ejecutar tareas de computadora a través de la API Responses. Se enfoca en entrada y salida de texto, con entrada de imagen opcional, pero no admite audio ni video.

Anthropic Claude Computer Use

Claude Computer Use es una función beta que permite a Claude interactuar con un entorno de escritorio o ventanas, como lo haría una persona. Funciona viendo la pantalla, moviendo el mouse y escribiendo en el teclado.

Claude no puede actuar por sí solo sin la configuración de un desarrollador. No accede automáticamente a su computadora real; interactúa con el sandbox que usted proporcione.

Open Interpreter (modo OS)

Open Interpreter es un agente de terminal de código abierto. Ejecuta código e interactúa con el sistema operativo. Open Interpreter se ejecuta en la máquina local, por lo que accede directamente a archivos, programas y al navegador locales. El usuario da instrucciones en lenguaje natural y el agente las convierte en código. Antes de ejecutar cualquier código, Open Interpreter muestra el comando planificado y espera la aprobación.

Simular Agent S/S3

Simular Agent S3 es un agente de uso de computadora que funciona observando pantallas, planificando acciones y controlando el mouse y el teclado para completar tareas complejas. Forma parte del framework abierto Agent S para interacción autónoma con GUI.

Behavior Best-of-N (bBoN) es un método central que permite a Agent S3 generar múltiples secuencias de acciones posibles (“rollouts”), en lugar de una única ejecución. Convierte cada rollout en una narrativa de comportamiento, que es un resumen simple de lo sucedido. Luego, un paso de juicio separado elige la mejor ejecución.

Cua IA

Cua IA es un framework de código abierto que permite construir, ejecutar y probar agentes de IA de uso de computadora en entornos de escritorio, integrando modelos de visión, modelos de razonamiento y entornos de sistema operativo en sandbox en un solo sistema. Cua puede ejecutar agentes en la nube utilizando sandboxes remotos. También permite ejecutarlos localmente si se desea más control o privacidad.

Cua también ayuda a generar capturas de pantalla de la UI y registros de acciones del agente. Puede grabar interacciones de varios pasos, crear datos de entrenamiento y ejecutar benchmarks para ver el rendimiento de los agentes.

Claude Cowork

Claude Cowork traslada el diseño agéntico de Claude Code a personas que no escriben código. Se ejecuta en la aplicación de escritorio de Claude, en una pestaña junto a Chat y Code. El usuario lo dirige a una carpeta y Claude lee, edita y crea archivos allí para completar una tarea.

Cowork sigue un orden claro: conector primero, navegador segundo, pantalla al final. Recurre a un conector MCP como Slack o Google Drive cuando existe uno. Recurre a Claude en Chrome para páginas web sin API. Controla la pantalla directamente cuando no hay otra vía. El control de pantalla es una vista previa de investigación y solicita permiso antes de cada aplicación.

Cowork puede dividir una tarea entre subagentes que se ejecutan en paralelo y luego fusionar los resultados. También puede ejecutar tareas programadas con una cadencia fija, como un borrador de estado semanal guardado en una carpeta.

Alcance y limitaciones:

  • Disponible en macOS y Windows en los planes de pago, tras una vista previa de investigación en enero de 2026.
  • Sonnet 4.6 es el modelo predeterminado. Opus permanece seleccionable para tareas más difíciles.
  • Las sesiones permanecen en la máquina local. El uso compartido de chats, el uso compartido de artefactos y la Memoria no funcionan en Cowork.
  • Un único hilo persistente en iOS y Android puede asignar trabajo al escritorio, que debe permanecer activo.

Benchmark OSWorld

Resultados para la IA agéntica de uso de computadora

Aviso: El mismo modelo puede aparecer en diferentes puestos porque OSWorld enumera los resultados por configuración de evaluación completa (framework agéntico, modelo de grounding o planificación, configuración Best-of-N, número de ejecuciones y límite de pasos), e incluso pequeños cambios en estos ajustes se tratan como entradas separadas con diferentes resultados de rendimiento.

Metodología

El benchmark incluye 369 tareas del mundo real (o 361 excluyendo las tareas de Google Drive que requieren configuración manual). Las tareas abarcan aplicaciones web y de escritorio, operaciones de archivos del sistema operativo y flujos de trabajo entre múltiples aplicaciones. Cada tarea comienza desde un estado inicial reproducible y se empareja con un script de evaluación personalizado basado en la ejecución, lo que garantiza una puntuación fiable.

Proceso de evaluación

Los agentes interactúan con un entorno de sistema operativo en vivo. El éxito se mide por lo que el agente realmente hace, no por las salidas de texto. Los entornos admiten ejecución en paralelo y sin interfaz gráfica, lo que permite pruebas escalables.

Alcance del benchmark

OSWorld admite tareas abiertas en aplicaciones arbitrarias, entradas multimodales, flujos de trabajo entre aplicaciones y estados iniciales intermedios. En comparación con benchmarks anteriores, ofrece una cobertura más amplia y condiciones más realistas.

Líneas base y análisis

El benchmark evalúa modelos generales, modelos especializados y frameworks agénticos en todas las familias de LLM y VLM. Los resultados muestran una gran brecha entre el rendimiento humano (~72 %) y los agentes actuales, lo que destaca los desafíos en el grounding de GUI y el conocimiento operativo. OSWorld también permite un análisis detallado por tipos de tareas, complejidad de la IU, entradas y sistemas operativos.

Dos enfoques arquitectónicos para los modelos de uso de computadora

Hoy en día, la mayoría de los agentes de uso de computadora se dividen en uno de dos patrones de diseño:

  • Agentes de extremo a extremo (E2E)
  • Agentes compuestos

Ambos buscan completar tareas en una computadora. Difieren en cómo dividen la percepción, el razonamiento y la acción.

Agentes de extremo a extremo (E2E)

Los agentes de extremo a extremo utilizan un único modelo de lenguaje-visión para manejar todo el ciclo. El modelo recibe una captura de pantalla y una descripción de la tarea. Luego, genera directamente la siguiente acción.

No hay un límite claro entre ver, razonar y actuar. Estos procesos se aprenden juntos dentro del mismo modelo.

Cómo funcionan los agentes E2E

Captura de pantalla + Tarea → Representación unificada → Acción

El modelo razona directamente sobre píxeles y texto. No construye una lista explícita de botones o campos. En su lugar, aprende asociaciones entre patrones visuales y acciones durante el entrenamiento.

Fortalezas

  • Diseño del sistema más simple
  • Menos puntos de integración donde pueden ocurrir errores
  • A menudo más estable en tareas largas

Limitaciones

  • Visibilidad limitada sobre por qué se eligió una acción
  • Más difícil de depurar cuando algo sale mal
  • Menos control sobre los pasos intermedios de razonamiento

Implicaciones prácticas

Debido a que la percepción y la planificación están estrechamente vinculadas, es menos probable que los pequeños errores visuales se conviertan en fallos totales. Cuando una acción no funciona, el agente puede reevaluar la pantalla actualizada y adaptarse.

Compensación: Es difícil inspeccionar las decisiones intermedias o aislar la fuente de los fallos.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Agentes compuestos

Los agentes compuestos dividen el ciclo de interacción en etapas separadas. Cada etapa es manejada por un modelo o subsistema diferente.

Cómo funcionan los agentes de IA compuestos

Una arquitectura típica se ve así:

  1. Grounding: Detectar elementos de la interfaz gráfica de usuario a partir de la captura de pantalla
  2. Planificación: Decidir qué hacer a continuación
  3. Ejecución: Realizar tareas en el sistema

Este diseño hace que cada paso sea explícito.

Fortalezas

  • Separación clara de responsabilidades
  • Más fácil de inspeccionar las salidas intermedias
  • Más adecuado para la investigación y experimentos controlados

Limitaciones

  • Mayor complejidad del sistema
  • Los errores pueden propagarse entre componentes
  • A menudo menos fiable en entornos de escritorio reales

Implicaciones prácticas

Los agentes compuestos dependen de representaciones estructuradas de la pantalla, como botones o campos de texto detectados. Esto mejora la transparencia pero añade fragilidad. Si el grounding es inexacto, es probable que las decisiones de planificación fallen.

Compensación: Las tareas largas son especialmente desafiantes. Las pequeñas discrepancias entre el estado percibido y el real de la pantalla pueden acumularse.

Bloques de construcción fundamentales de los agentes de uso de computadora (CUAs)

Los agentes modernos de uso de computadora se construyen utilizando tres componentes principales:

1. Modelos de lenguaje-visión (VLMs)

Los VLMs individuales forman el núcleo de la mayoría de los agentes de extremo a extremo. Procesan capturas de pantalla e instrucciones juntos y generan acciones directamente.

Captura de pantalla + Tarea → Espacio conjunto de lenguaje-visión → Acción

El modelo codifica las entradas visuales y textuales en un espacio interno compartido. En este espacio, aprende cómo los patrones visuales se relacionan con las acciones sin etiquetas explícitas.

No hay un paso de grounding separado. La comprensión de la IU y la planificación de tareas ocurren de manera implícita y simultánea.

Implicaciones prácticas: Los VLMs individuales reducen la complejidad arquitectónica y limitan la propagación de errores. Favorecen la robustez y la simplicidad por encima de la transparencia y el control detallado.

2. Modelos de grounding

Los modelos de grounding se centran únicamente en la percepción y desempeñan un papel crucial en los agentes compuestos. Su trabajo es traducir capturas de pantalla sin procesar en descripciones estructuradas de la interfaz de la computadora. No razonan sobre objetivos ni seleccionan acciones.

Captura de pantalla → Modelo de grounding → Representación estructurada de la IU

Las salidas suelen incluir:

  • Elementos de IU detectados
  • Ubicaciones espaciales (cuadros delimitadores)
  • Etiquetas semánticas (botón, campo de entrada, texto)
  • Texto extraído

Esta representación se pasa a un modelo de planificación.

Fortalezas

  • Percepción clara e inspeccionable
  • Más fácil de registrar y analizar fallos
  • Mayor transparencia

Limitaciones

  • Los errores se propagan hacia abajo
  • Sensible a cambios visuales y diseños dinámicos
  • Difícil mantener la consistencia a lo largo de muchos pasos

Implicaciones prácticas: El grounding suele ser el eslabón más débil en los sistemas compuestos. Los elementos faltantes o desactualizados pueden inducir a error a los modelos de planificación y causar fallos repetidos.

Benchmark de grounding de IU: Por qué importa la calidad de la visión

Para aislar el papel de la percepción visual, nos referimos a un benchmark de grounding de IU enfocado que evalúa qué tan bien los modelos identifican la ubicación exacta en píxeles de un elemento de la IU a partir de una instrucción en lenguaje natural.

Configuración del benchmark

  • 100 capturas de pantalla de escritorio
  • 4 tipos de tareas: simple, relacional, dependiente del estado, IU densa
  • 5 ejecuciones por muestra para medir la consistencia
  • Resolución fija: 2560×1440

Para obtener un conjunto de datos y una metodología más detallados, visite AIMultiple UI Grounding en HuggingFace.

Conclusión
El grounding preciso de la IU sigue siendo un cuello de botella importante. La evidencia actual muestra que la percepción visual robusta y la comprensión implícita de la IU importan más que la especialización estrecha en UI, especialmente para agentes de uso de computadora fiables que operan en escritorios reales.

Modelos de planificación

Los modelos de planificación determinan los siguientes pasos. Trabajan con datos estructurados de la IU, objetivos de la tarea e historial de interacciones. No procesan imágenes sin procesar. Estos modelos desempeñan un papel crucial en la arquitectura de agentes compuestos.

IU estructurada + Objetivo de la tarea → Modelo de planificación → Siguiente acción

Los modelos de planificación pueden:

  • Dividir tareas en pasos
  • Hacer un seguimiento del progreso
  • Aplicar reglas o heurísticas
  • Registrar el razonamiento explícitamente

Desafíos en la práctica

  • Alta sensibilidad a los errores de entrada
    Un grounding incorrecto conduce a planes defectuosos.
  • Deriva del estado con el tiempo
    Los cambios en la IU pueden invalidar suposiciones anteriores.
  • Recuperación limitada ante fallos
    Sin una retroalimentación sólida, los planificadores pueden entrar en bucle o estancarse.
  • Desajustes en la ejecución
    Los errores de tiempo, enfoque o coordinación pueden romper los planes.

Implicaciones prácticas: Los modelos de planificación añaden estructura y transparencia, pero su eficacia depende en gran medida de una percepción precisa y una ejecución fiable.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Explicación de las características clave de los agentes de uso de computadora

Entorno de ejecución

Define dónde se ejecuta el agente de uso de computadora y cómo controla el sistema operativo (máquina virtual en la nube, máquina local o entorno de ejecución basado en contenedores).

Acceso al sistema local

Esto muestra si el agente puede leer o escribir archivos en la máquina real del usuario, no en un sandbox remoto. El acceso local es útil para flujos de trabajo personales, pero plantea mayores preocupaciones de seguridad.

Cómo los agentes acceden a la computadora: pantalla vs terminal

El uso de la computadora ahora se divide en una segunda línea: cómo el agente accede al sistema.

Agentes basados en grounding de pantalla leen la pantalla como una imagen. Localizan botones y campos, y luego hacen clic y escriben en coordenadas específicas. OpenAI Computer Use, Claude Computer Use, Simular Agent S3 y UI-TARS funcionan de esta manera. La fortaleza es un amplio alcance, ya que el agente puede controlar cualquier aplicación que una persona pueda ver. La debilidad es el grounding. Un elemento mal leído rompe el paso, y las tareas largas se desvían a medida que la pantalla cambia.

Agentes de terminal y conector omiten la pantalla cuando existe un camino más limpio. Ejecutan comandos de shell, llaman a las APIs a través de conectores y editan archivos directamente. OpenClaw, Open Interpreter y Claude Cowork se sitúan aquí. Cowork establece el orden claramente: conector primero, navegador segundo, pantalla al final. La fortaleza es la fiabilidad, porque un comando o una llamada a la API no depende de la detección de píxeles. La debilidad es la cobertura, ya que una aplicación sin API o línea de comandos aún necesita control de pantalla.

Muchos sistemas ahora mezclan ambos. Prefieren conectores y comandos por velocidad y precisión, y luego recurren al grounding de pantalla para aplicaciones que no exponen otra interfaz.

¿Cuál es la compensación general entre agentes E2E y compuestos?

Los agentes de extremo a extremo son actualmente más fiables para su uso directo en computadoras personales. Su diseño unificado reduce los problemas de coordinación y los puntos de fallo.

Los agentes compuestos no son inherentemente más débiles. Ofrecen mayor flexibilidad, personalización e interpretabilidad. Sin embargo, requieren un grounding más sólido, una gestión del estado más estricta y una integración cuidadosa para funcionar bien en entornos reales.

La compensación principal no es la capacidad, sino la robustez frente al control.

¿Qué son los agentes de uso de computadora?

Los agentes de uso de computadora son sistemas diseñados para operar una computadora de manera similar a un humano. Observan la pantalla, deciden qué hacer e interactúan a través de acciones como hacer clic, escribir y desplazarse.

A primera vista, esto parece simple. En la práctica, es difícil. Los entornos de escritorio son dinámicos. Las interfaces cambian con frecuencia. No hay APIs fijas ni estructuras estables en las que confiar. Estos agentes deben trabajar a partir de lo que ven en la pantalla y razonar sobre ello en tiempo real.

A pesar de las diferentes implementaciones, la mayoría de los agentes de uso de computadora siguen el mismo bucle básico:

Observar → Interpretar → Decidir → Ejecutar

La forma en que se implementa este bucle determina cuán estable, flexible y fiable es un agente en el uso real.

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Ezgi Arslan, PhD. and Berk Kalelioğlu (2026) - "Agentes de uso de computadora: Benchmark y arquitectura". Publicado en línea en AIMultiple.com. Recuperado el 22 de Junio de 2026, de: https://aimultiple.com/computer-use-agents [Recurso en línea]

PhD., E. A., & Kalelioğlu, B. (2026, 22 de Junio). Agentes de uso de computadora: Benchmark y arquitectura. AIMultiple. https://aimultiple.com/computer-use-agents

@misc{phd2026,
  author = {PhD., Ezgi Arslan, and Kalelioğlu, Berk},
  title  = {{Agentes de uso de computadora: Benchmark y arquitectura}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/computer-use-agents}},
  note   = {AIMultiple. Recuperado el 22 de Junio de 2026}
}
Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Analista de la Industria
Ezgi tiene un doctorado en Administración de Empresas con especialización en finanzas y trabaja como Analista de la Industria en AIMultiple. Ella impulsa la investigación y los conocimientos en la intersección de la tecnología y los negocios, con experiencia en sostenibilidad, análisis de encuestas y sentimientos, aplicaciones de agentes de IA en finanzas, optimización de motores de respuestas, gestión de firewalls y tecnologías de adquisiciones.
Ver perfil completo
Revisado técnicamente por
Berk Kalelioğlu
Berk Kalelioğlu
Investigador de IA
Berk es investigador de IA en AIMultiple, centrado en sistemas de IA agéntica y language models.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450