La identificación de clientes forma parte de la diligencia debida comercial. Probamos 16 models en la investigación de listas de clientes para tres sitios de investigación y reseñas, uno de ellos AIMultiple, puntuando sus entregas con respecto a las claves de respuestas que recopilamos y a las páginas que citaron.
Resultados del benchmark de identificación de clientes
No configuramos el esfuerzo de razonamiento para ningún model. Cada uno se ejecutó con los valores predeterminados de su programa agente, y el model de puntuación se llamó con temperatura 0.
- Fable 5.1 obtiene 90.2, el promedio más alto de los 16 models. Opus 5 le sigue con 89.1 y GLM 5.3 con 81.0.
- GLM 5.3 obtuvo entre 79.6 y 83.3 en los tres objetivos. Claude Sonnet 5 obtuvo 90.8 en uno y 0.0 en otro, y Gemini 3.8 Flash obtuvo 87.0 y 9.2. Los promedios de 48.0 y 60.7 no describen las ejecuciones de ninguno de los dos models.
Dificultad de los objetivos
Las puntuaciones medianas son 64.3 en el primer objetivo, 59.2 en el segundo y 87.0 en el tercero. Diez de los 16 models obtienen al menos 84 en el tercero, cuya clave de respuestas tiene 18 clientes, por lo que un cliente correcto equivale a 5.6 de los 100 puntos de cobertura que representan la mitad de la puntuación.
La puntuación de cada model es la media de los tres objetivos. Descartar un objetivo fácil después de ver las puntuaciones sesgaría la comparación. La próxima ronda necesita empresas objetivo más difíciles.
Comparación de coste y puntuación
- Fable 5.1 promedia 90.2 a $4,38 por tarea. Opus 5 promedia 89.1 a $8,51, el coste más alto de los 15 models con cifras en dólares. GLM 5.3 promedia 81.0 a $1.40.
- Grok 4.6 promedia 80.5 a $0,42 por tarea, una vigésima parte de lo que cuesta Opus 5 por 8.6 puntos menos.
- GPT 6 Astra promedia 74.2. Sus tres tareas de suscripción utilizaron 279.253 tokens, y Codex CLI no registra coste en dólares, por lo que el gráfico de costes lo omite.
¿Por qué el trabajo con listas de clientes pone a prueba a los agentes de IA?
Una lista de clientes requiere un nombre y evidencia de la relación comercial. Una lista plausible puede citar páginas que solo comparan productos.
Las fuentes públicas pueden confirmar una relación individual con un cliente. Este benchmark no evalúa si una lista está completa.
Un cliente real puede estar ausente de la clave de respuestas. Una entrega obtiene crédito por un cliente cuando la página citada establece la relación, y pierde puntos de cobertura por una empresa adicional no respaldada.
Metodología
Cobertura de models
El gráfico de puntuaciones utiliza los 16 models seleccionados para esta campaña de benchmark. Cinco models superados permanecen en los datos históricos y no se representan. Las puntuaciones van de 0 a 100 y las etiquetas de las barras se redondean a puntos enteros.
El benchmark de TI agéntica utiliza una escala diferente, por lo que sus puntuaciones no son comparables.
Tareas y entregas
El primer objetivo es AIMultiple, el editor de este benchmark, y su clave de respuestas fue recopilada por un analista de AIMultiple. El segundo objetivo es un sitio de reseñas de software y el tercero, una firma de investigación de analistas.
Las tres claves de respuestas contienen 45, 65 y 18 clientes y no se mostraron a los models evaluados. La ejecución abarca 48 asignaciones model-empresa y 47 listas de clientes no vacías; Inkling Small no produjo filas de clientes en la segunda empresa y obtuvo cero allí.
Cada puntuación utiliza una entrega por empresa. Las entregas abarcan de julio a septiembre, y algunas reemplazan intentos anteriores.
Reponderar los tres objetivos en todos los 27 sorteos ordenados con reemplazo sitúa el 95 % central de las medias de Fable 5.1 entre 86.0 y 94.8, y las de Opus 5 entre 82.4 y 96.1, de modo que el intervalo de Fable 5.1 queda dentro del de Opus 5. Reponderamos únicamente estos tres objetivos y no medimos la variación entre ejecuciones.
Costes y ejecución
El coste por tarea es la media de las tres ejecuciones de un model, incluida la ejecución que no produjo filas de clientes. Una tarea es una empresa objetivo. Los costes en dólares cubren 15 de los 16 models y los datos de tiempo transcurrido cubren 13.
Las cifras en dólares no se miden todas de la misma manera. Las ejecuciones en opencode incluyen el cargo de OpenRouter de esa sesión. Las ejecuciones en Claude Code y Grok Build se autentican mediante una suscripción, por lo que sus cifras son precios de lista aplicados a los tokens que informó el programa. Codex CLI no registra coste en dólares.
Cada model recibió un prompt congelado que indicaba la empresa y solicitaba un CSV con nombres de empresas, URL de LinkedIn, URL de evidencia y fechas de evidencia. Grok Build utilizó la búsqueda web nativa; los demás programas agente accedieron a la web a través de Bright Data, una de las herramientas de web scraping que comparamos.
Un programa agente proporciona al model un shell y acceso web, por lo que una puntuación refleja tanto el model como el programa en el que se ejecutó. Los precios de lista de los proveedores están en nuestra comparación de LLM precios.
Puntuación y evidencia
La cobertura de clientes representa 50 % de la puntuación, la precisión de LinkedIn 17 %, la calidad de la evidencia 17 % y la actualidad de la evidencia 16 %.
La puntuación se ejecutó el 10 de septiembre de 2026. Acepta evidencia fechada desde el 10 de septiembre de 2025 hasta el 12 de septiembre de 2026, los 12 meses anteriores a la puntuación más dos días. Una URL citada que devuelva 404 o 410 limita esa entrega a 40, y ninguna entrega alcanzó el límite en esta pasada.
El código comprueba el formato, los nombres, los duplicados, las fechas y el estado de las URL. Claude Sonnet 5 lee un extracto de cada página citada y juzga si confirma la relación. Claude Sonnet 5 es también uno de los 16 models puntuados, y los models de Anthropic ocupan los dos primeros puestos. No comprobamos si un juez de Anthropic favorece a los models de Anthropic.
El prompt del juez indica si la empresa está en la clave de respuestas, por lo que el veredicto del juez no es independiente de la clave. Volvimos a ejecutar el evaluador eliminando una empresa de una clave y, en la misma página y el mismo extracto, su veredicto cambió de cliente a mención.
El equipo del benchmark registró una decisión en lugar del veredicto del juez en 58 filas, 30 en contra del model y 28 a favor. Cincuenta y cuatro proceden de una revisión del texto conservado de la página del 9 de septiembre de 2026 y cuatro son dictámenes editoriales registrados el 10 de septiembre.
La evaluación acepta 140 filas fuera de las claves de respuestas, 125 de ellas en el segundo objetivo. Las filas respaldadas obtienen los mismos puntos que las entradas de la clave.
Lecturas adicionales
- AIM Agentic Marketing Benchmark
- Operativa bursátil basada en IA: ¿Qué herramienta de IA generativa es mejor?
- Benchmark de finanzas con IA agéntica
Preguntas frecuentes
Este test verificó relaciones individuales con clientes a partir de evidencia pública. No evaluó si una lista está completa.
Una comparación por sí sola no. Una página también debe establecer una relación comercial, como un cliente nombrado o un suscriptor de los servicios de la firma de investigación.
Los valores de cobertura provienen de la clave de respuestas. El juez comprueba la página que citó un model, de modo que una entrega obtiene crédito por clientes respaldados fuera de la clave.
El test cubre la investigación de listas de clientes. No evalúa la selección de inversiones, la valoración ni la calidad de las decisiones de un fondo.
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{phd2026,
author = {PhD., Ezgi Arslan, and Kalelioğlu, Berk},
title = {{IA VC Benchmark: 16 agentes de IA en identificación de clientes}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/ai-vc}},
note = {AIMultiple. Recuperado el 10 de septiembre de 2026}
}Resultados y marcas de tiempo de 13 puntos de datos. Descargue los datos resumidos que se muestran en los gráficos y las tablas de este artículo como un archivo ZIP que contiene un archivo CSV y un README.
¿Quieres los datos granulares que hay detrás? Únete a Premium
Registro de cambios
1 actualizacionesSustituyó el benchmark de búsqueda de operaciones y mapeo de competidores por uno de identificación de clientes con 14 agentes.
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.