Evaluación comparativa de IA para capital de riesgo: 11 agentes de IA en tareas reales de capital de riesgo
En colaboración con VCs en etapa inicial, convertimos dos flujos de trabajo de analistas en evaluaciones comparativas con verdad fundamental verificada por humanos y calificamos a 11 agentes de IA en ellas. Vea las tareas, los resultados y el método de calificación:
Resultados de la evaluación comparativa de capital de riesgo
Cada uno de los 11 modelos ejecutó cada tarea una vez. Las puntuaciones son sobre 100. Kimi K3 no produjo ninguna ejecución puntuable de búsqueda de oportunidades y se registra como 0.
Ambas tareas requieren acceso a datos recientes y habilidades de razonamiento:
- Búsqueda de oportunidades: los VCs tienen criterios específicos y nuestros socios querían identificar empresas de IA en etapa inicial fundadas por emprendedores de un país específico
- Identificación de competidores durante la diligencia debida
Resultados de búsqueda de oportunidades en la diáspora
La mayoría del campo superó la mitad de los puntos y se situó en una amplia banda intermedia, con una gran diferencia entre el líder y la cola. La rúbrica explica la forma. Una fila gana puntos cuando cada criterio tiene evidencia, por lo que un agente puntúa al ritmo al que puede verificar el origen del fundador, el año de fundación y la financiación, no al ritmo al que puede enumerar nombres plausibles. Las empresas calificadas se fundaron en los 18 meses anteriores, lo que las sitúa fuera del alcance de los datos de entrenamiento, por lo que la dispersión refleja la profundidad de búsqueda y la disciplina de verificación en lugar del conocimiento memorizado. Incluso el agente líder dejó una parte sustancial de los puntos sobre la mesa, lo que significa que un recuerdo completo de un conjunto de referencia nuevo y basado en evidencia sigue estando fuera del alcance de los agentes actuales que trabajan con un presupuesto de tiempo.
Resultados del mapeo de competidores
La distribución se divide en tres niveles, cada uno vinculado a un mecanismo de puntuación. El dúo superior cubrió varias de las categorías de competidores del objetivo y captó parte del grupo de pares cercanos. La banda intermedia es lo que produce la rúbrica cuando un agente mapea correctamente los nombres conocidos de analistas y reseñas y se pierde los pares pequeños y recientes más cercanos al objetivo: ejecución sólida, penalizada dos veces mediante la pérdida de puntos de recuerdo y las penalizaciones por omisión. La cola cercana a cero es la más instructiva, porque una puntuación tan baja no requiere un archivo vacío. Las penalizaciones por pares omitidos y por competidores no válidos devueltos pueden anular todo lo que un CSV ordenado gana, por lo que un mapa confiado y bien formateado de las empresas equivocadas termina valiendo lo mismo que ningún mapa en absoluto.
Por qué divergen los resultados de las dos tareas
La búsqueda de oportunidades premia la verificación mecánica de cinco criterios establecidos; el mapeo de competidores exige un juicio sobre dónde termina el mercado de una empresa de investigación de nicho, sin una lista de criterios con la que contrastar. Ese juicio separó el campo mucho más de lo que lo hicieron el formato o la velocidad, y es la razón por la que el líder cambió entre columnas mientras varios agentes intercambiaron posiciones de manera abrupta. La fortaleza en un flujo de trabajo de investigación dice poco sobre el siguiente, por lo que los equipos que seleccionen un agente deberían probarlo en el flujo de trabajo que planean automatizar en lugar de confiar en una única tabla de clasificación.
Metodología de la evaluación comparativa de capital de riesgo
Cada tarea se entrega como un archivo de especificaciones que elaboramos, que fija el rol del analista, el archivo de salida, el acceso a las herramientas y el presupuesto de tiempo antes de que comience cualquier ejecución. La tabla resume esas especificaciones:
El límite de tiempo limita cada ejecución: un agente debe investigar, verificar y entregar su CSV dentro de ese plazo, y la búsqueda de oportunidades recibe un presupuesto más largo porque verifica docenas de empresas candidatas con respecto a cinco criterios, mientras que el mapeo de competidores investiga un solo objetivo.
Ambas colocan al agente en un rol que desempeña un analista junior en un fondo de capital de riesgo, y ambas requieren un CSV con celdas atómicas, la resolución de las URL de origen y sin comentarios. Todos los hechos se juzgan a partir de una fecha de instantánea congelada, y los conjuntos de referencia se vuelven a verificar trimestralmente porque los datos de financiación cambian.
Tarea 1: Búsqueda de oportunidades en la diáspora
El agente actúa como analista de búsqueda de oportunidades en un fondo en etapa inicial centrado en fundadores de la diáspora. Debe devolver empresas de IA que cumplan todos estos criterios de inversión a la fecha de la instantánea:
- Financiación por debajo de $5M. Capital total divulgado recaudado, no una cifra de valoración o ingresos. Si la financiación no se divulga, la empresa califica si hay evidencia positiva que muestre que el monto está por debajo del umbral. De lo contrario, debe excluirse.
- Fundada en 2025 o 2026. Cualquier cosa anterior falla.
- Origen del fundador con evidencia pública. Al menos un fundador nació en un país específico, se educó en una institución de este país o nació con una nacionalidad específica.
- Sede en el extranjero. La propia empresa está fuera de Türkiye.
- Enfocada en IA. Las empresas de capa de infraestructura y capa de aplicación califican.
Cada fila empareja cada cifra con una URL de origen que el agente abrió. Una URL fabricada o inaccesible invalida la fila que respalda.
Cómo se puntúa
La puntuación se ejecuta contra una verdad fundamental oculta: un conjunto de referencia de empresas calificadas verificadas que el modelo nunca ve. Cuatro dimensiones aplican:
- Recuerdo contra un conjunto de referencia verificado de empresas calificadas.
- Precisión contra un conjunto trampa de casi aciertos, cada uno fallando exactamente un criterio. Los descalificadores nombrados conllevan penalizaciones fijas.
- Exactitud de los datos en una muestra aleatoria fija de filas extraídas con una semilla registrada, para que un pase de puntuación pueda ser reproducible: sede, año de fundación, financiación dentro de la tolerancia, y fuentes que respalden la afirmación junto a ellas.
- Cumplimiento del formato: orden de columnas, celdas atómicas, financiación numérica, CSV válido.
Rellenar una lista con empresas plausibles pero no verificadas pierde más en precisión de lo que gana en recuerdo. El diseño premia menos filas, pero totalmente verificadas.
Tarea 2: Mapeo de competidores
El agente realiza la diligencia debida comercial sobre una empresa objetivo para un inversor potencial. Para la ejecución puntuada, dirigimos a los agentes hacia nuestra propia empresa: el objetivo es AIMultiple, lo que nos permitió verificar la verdad fundamental con conocimiento de primera mano de quién compite con nosotros. La tarea: identificar los competidores directos del objetivo, respaldar cada uno con datos públicos y devolverlos como un documento CSV.
Las reglas de alcance definen lo que cuenta como competidor:
- Sustituibilidad. Una empresa califica cuando ofrece un producto o servicio sustituible a clientes superpuestos, en cualquier categoría donde el objetivo compite.
- Cobertura completa de categorías. El objetivo opera en múltiples categorías. El agente debe cubrir competidores en cada una de ellas, no solo en la más obvia.
- Exclusiones. Empresas sobre las que el objetivo escribe, con las que se asocia o enumera, pero con las que no compite. Jugadores adyacentes en una categoría vecina. El propio objetivo.
Un mapa exhaustivo para un objetivo de esta amplitud abarca de 8 a 15 competidores. Cada fila incluye la página de LinkedIn del competidor, la financiación total divulgada (o No divulgada), el país de la sede, el año de fundación y el número de empleados en LinkedIn, con una URL de origen junto a cada métrica. Dos columnas de razonamiento acompañan las métricas: un diferenciador frente al objetivo y una justificación para la inclusión, cada una de las cuales debe ser específica en lugar de genérica. Una cifra de financiación debe estar respaldada por una fuente de financiación.
Cómo se puntúa
La puntuación se ejecuta contra una verdad fundamental oculta, organizada por categoría de competidor. Cinco dimensiones aplican:
- Precisión. Cada no competidor devuelto reduce la puntuación. Los descalificadores nombrados, como las herramientas de SEO y los proveedores de modelos de IA, que el objetivo simplemente evalúa comparativamente conllevan penalizaciones fijas. Una suave protección contra el relleno reduce el exceso de peso cuando una sola categoría representa la mayor parte del conjunto encontrado. Los competidores tienen dos niveles de peso. Un pequeño conjunto de pares imperdibles, las empresas más cercanas al trabajo central del objetivo, pesan tres veces más que una entrada estándar. Un competidor genuino ausente de la verdad fundamental aún obtiene crédito después de la revisión de expertos, por lo que un conjunto de referencia incompleto no castiga un hallazgo correcto.
- Penalizaciones graduadas. Independientemente del peso del recuerdo, cada par imperdible que el agente no devuelva resta una penalización fija dimensionada por la cercanía. No incluir a los pares más cercanos del objetivo se trata como un fallo central en la diligencia debida, no como una simple brecha de recuerdo.
- Exactitud de la financiación. Filas muestreadas verificadas dentro de la tolerancia, aceptándose No divulgado y N/A (público) como respuestas correctas cuando corresponda.
- Evidencia y razonamiento de métricas. Métricas requeridas presentes, atómicas, con fuente y precisas dentro de la tolerancia. Las celdas de diferenciador y justificación se puntúan por especificidad frente a frases genéricas.
Por qué los criterios resisten el emparejamiento de patrones
Ambas tareas están diseñadas para bloquear los atajos que los agentes toman bajo presión de tiempo:
- Adivinar falla. Cuando una cifra no es pública, la respuesta puntuada es un vacío evidenciado, no una estimación. Un número inventado cuesta puntos dos veces, una vez en exactitud y otra en precisión, por lo que admitir lo desconocido supera a rellenar.
- Las respuestas están más allá de la primera página de búsqueda. Ambos conjuntos de referencia se apoyan en empresas jóvenes o poco documentadas que los datos de entrenamiento no han alcanzado, por lo que las puntuaciones dependen de una búsqueda en vivo y en capas en lugar del recuerdo.
- La evidencia supera a la inferencia. Una señal plausible, un nombre que suena familiar o una página de alto rango, no establece un hecho; un registro citable sí lo hace. Ambas rúbricas puntúan la fuente junto a la afirmación, no la afirmación por sí sola.
- La exhaustividad y la precisión se contraponen. Rellenar con nombres no verificados cuesta más de lo que gana, mientras que una lista corta excesivamente cautelosa pierde recuerdo. La puntuación empuja a los agentes hacia el equilibrio que un fondo espera de un analista: cada hallazgo verificado, ningún hallazgo genuino omitido.
Construyendo las tareas
Cada evaluación comparativa comenzó como un flujo de trabajo real dentro de nuestras operaciones de desarrollo de negocio e investigación. Convertimos las especificaciones originales del analista en archivos de tareas con una estructura fija: rol, reglas de elegibilidad, columnas de salida exactas, acceso a herramientas y un límite de tiempo. Las rúbricas residen en archivos separados con puntos por criterio: el formato y la aritmética pasan por verificaciones automatizadas, y las decisiones de juicio las toma un revisor humano.
Tres reglas de diseño se aplicaron en ambas tareas:
- Cada cifra necesita una fuente que el agente haya abierto. Las páginas de inicio simples y las páginas de resultados de búsqueda no cuentan.
- No divulgado supera a inventado. Escribir 'No divulgado' para una ronda pre-semilla privada puntúa; inventar un número cuesta puntos dos veces, una por exactitud y otra por precisión.
- Salida atómica. Un valor por celda, orden exacto de columnas. Las violaciones de estructura cuestan puntos antes de que se juzgue el contenido.
Control de fugas
Las primeras ejecuciones nos enseñaron la lección más importante en metodología. Cuando el archivo de rúbrica era accesible desde el directorio de trabajo del modelo, el modelo lo leía y copiaba la verdad fundamental. Las puntuaciones subían por razones no relacionadas con la capacidad de investigación.
Ahora, cada rúbrica lleva un requisito de aislamiento del arnés: el modelo recibe el archivo de indicación y nada más, y el evaluador aplica la rúbrica después. Cualquier ejecución en la que la rúbrica fuera accesible se considera inválida. Los constructores de evaluaciones comparativas que omitan este control exagerarán lo que sus agentes pueden hacer.
Lo que miden las rúbricas
Las rúbricas comparten una filosofía de puntuación en ambas tareas:
- Recuerdo contra la verdad fundamental verificada. Cada empresa o competidor calificado en el conjunto de referencia fue confirmado por un investigador humano con registros públicos antes de que se puntuara cualquier modelo.
- Precisión con trampas nombradas. Ambos conjuntos de verdad fundamental contienen casi aciertos que fallan exactamente un criterio y son descalificadores nombrados con penalizaciones fijas, por lo que el emparejamiento de patrones sin verificación queda atrapado.
- Puntos negativos por fabricación. Una cifra de financiación alucinada o una URL de origen muerta resta puntos en lugar de puntuar cero. Los vacíos honestos superan a los errores confiados.
- Gestión de la deriva. La financiación, las valoraciones y el número de empleados cambian. Cada rúbrica lleva una fecha de instantánea, marca los datos propensos a la deriva y requiere una nueva verificación antes de cada pase de puntuación.
- Verificación mixta. Las verificaciones de recuerdo, precisión y formato se ejecutan automáticamente. La evidencia del origen del fundador y las justificaciones de inclusión van a un revisor humano.
Las puntuaciones bajas provienen de hacer la tarea genuinamente difícil, no de aplastar las buenas respuestas con límites. El recuerdo, la precisión, la exactitud y la honestidad tiran cada una de un modo de fallo diferente, por lo que un modelo no puede compensar una investigación débil con un formato confiado.
Por qué el trabajo de capital de riesgo prueba bien a los agentes de IA
Las empresas de capital de riesgo funcionan con el trabajo de los analistas. La selección de flujo de operaciones y la diligencia debida son tareas de investigación de varios pasos. Cada una requiere investigación web, verificación de fuentes y salida estructurada. Cada una también produce respuestas incorrectas de aspecto plausible, lo que las hace difíciles de fingir y útiles para puntuar.
Estas propiedades convierten el trabajo del analista de capital de riesgo en un dominio de evaluación comparativa sólido:
- Verdad fundamental verificable. Las rondas de financiación, los años de fundación y el número de empleados pueden verificarse con registros públicos.
- Presión de fabricación. Los modelos que no pueden encontrar una cifra tienden a inventar una. Las tareas exponen esto directamente.
- Valor económico real. Un fondo que automatiza partes de la diligencia debida cambia su propia estructura de costes. La evaluación comparativa mide el trabajo por el que alguien paga hoy.
Lecturas adicionales
- AIM Agentic Marketing Benchmark
- Trading de acciones basado en IA: ¿Qué herramienta de Gen IA es mejor?
- Agentic IA Finance Benchmark
Preguntas frecuentes
No. Las tareas se corresponden con el trabajo que realizan los analistas junior: búsqueda de oportunidades, mapeo de competidores, comparables. Las decisiones de inversión, el juicio de los socios y las relaciones con los fundadores quedan fuera de su alcance. La IA comprime el tiempo de investigación; los humanos toman la decisión.
Las empresas públicas tienen estados financieros auditados, lo que convierte la valoración en un ejercicio de consulta. Las startups privadas en etapa inicial obligan al agente a estimar, exponer una base y etiquetar la incertidumbre. Ahí es donde la presión de fabricación es más alta y donde se invierte el verdadero esfuerzo de diligencia debida.
¿Muestran estas evaluaciones comparativas que la IA reemplaza a los analistas de capital de riesgo?
No. Las tareas se corresponden con el trabajo que realizan los analistas junior: búsqueda de oportunidades, mapeo de competidores, comparables. Las decisiones de inversión, el juicio de los socios y las relaciones con los fundadores quedan fuera de su alcance. La IA comprime el tiempo de investigación; los humanos toman la decisión.
¿Por qué las tareas se centran en empresas privadas?
Las empresas públicas tienen estados financieros auditados, lo que convierte la valoración en un ejercicio de consulta. Las startups privadas en etapa inicial obligan al agente a estimar, exponer una base y etiquetar la incertidumbre. Ahí es donde la presión de fabricación es más alta y donde se invierte el verdadero esfuerzo de diligencia debida.
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{phd2026,
author = {PhD., Ezgi Arslan, and Kalelioğlu, Berk},
title = {{Evaluación comparativa de IA para capital de riesgo: 11 agentes de IA en tareas reales de capital de riesgo}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ai-vc}},
note = {AIMultiple. Recuperado el 21 de Julio de 2026}
}
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.