Berk Kalelioğlu
Intereses de investigación
Berk se centra en el aprendizaje automático, las herramientas de IA agéntica y los models de lenguaje grandes y pequeños (LLMs y SLMs).Forma parte del equipo de benchmark de AIMultiple, realizando evaluaciones y proporcionando perspectivas para ayudar a los lectores a comprender las tecnologías emergentes y sus aplicaciones en el mundo real.
Experiencia profesional
Comenzó su carrera como líder de proyecto tecnológico en ODTU IVME-R, donde lideró un proyecto para construir generadores físicos cuánticos y de números pseudoaleatorios.Tras su etapa en IVME-R, cofundó una empresa de desarrollo de videojuegos y publicó un juego en Steam.
Más tarde orientó su carrera hacia la IA y se unió a AIMultiple como investigador.
Educación
Berk tiene una licenciatura en Matemáticas por la Universidad de Ankara.Últimos artículos de Berk
AIM-Decision: Jev frente a Kev frente a LLMs
Los modelos de decisión, también llamados modelos System One,1 eligen la siguiente acción de un agente en una sola pasada en lugar de generar texto token por token. Para ver si pueden hacer que la automatización del navegador sea más barata que los LLMs, ejecutamos tres modelos de decisión y dos LLMs, Gemini 3.8 Flash…
AIM Benchmark Web Agéntico
Los agentes dependen de interfaces web para completar tareas en la web. Para medir cómo la elección de la interfaz afecta la finalización de las tareas, creamos el AIM Benchmark Web Agéntico e intentamos 3.500 tareas (100 tareas completadas mediante 7 interfaces web en 5 ejecuciones). Una interfaz de Bright Data lideró todas las ejecuciones.…
TI agéntica: ¿Pueden los agentes de IA diseñar un benchmark?
Probamos 16 modelos en un diseño de benchmark de texto a SQL y llamada de herramientas. Cada modelo creó un benchmark por tema, para un total de 32 envíos. Ningún envío superó todos los criterios de la rúbrica. Los agentes pudieron construir y ejecutar pruebas, pero ninguno demostró a la vez una prueba de respuesta…
AIM Enterprise: Benchmark empresarial agéntico
Las empresas usan LLM todos los días para sus tareas habituales. Para encontrar los LLM más rentables, diseñamos AIM Enterprise, un benchmark empresarial agéntico, donde usamos 69 tareas empresariales reales en estrategia, marketing, RR. HH., ventas y operaciones. Dos modelos jueces puntuaron cada archivo que superó las comprobaciones. En el 32,7 % de las puntuaciones individuales,…
Investigación profunda con IA: Codex vs Claude vs Grok vs Exa
Una herramienta de investigación profunda responde una pregunta con un informe escrito en lugar de una página de enlaces. Ejecutamos cinco formas de producir uno sobre los mismos 20 informes breves de investigación empresarial y puntuamos cada informe según reglas escritas antes de las ejecuciones para encontrar la mejor herramienta para investigación profunda. Cuatro de…
Mejores proveedores de LLM API de tarifa plana
Los proveedores de LLM de tarifa plana venden uso ilimitado del modelo por un precio mensual fijo en lugar de facturar por token. Este modelo se extendió porque las sesiones de codificación agentiva pueden usar decenas de millones de tokens, por lo que una factura por token es difícil de predecir. Muy pocos proveedores ofrecen…
IA VC Benchmark: 16 agentes de IA en identificación de clientes
La identificación de clientes forma parte de la diligencia debida comercial. Probamos 16 models en la investigación de listas de clientes para tres sitios de investigación y reseñas, uno de ellos AIMultiple, puntuando sus entregas con respecto a las claves de respuestas que recopilamos y a las páginas que citaron. No configuramos el esfuerzo de…
Alternativas a OpenClaw: Hermes vs ZeroClaw vs Grok Bot
Los agentes autónomos de IA, como OpenClaw y Hermes Agent, automatizan tareas de varios pasos que normalmente requerirían una intervención humana constante. Si bien OpenClaw se ha convertido en el agente autónomo siempre activo más adoptado, muchos usuarios buscan alternativas debido a su proceso de implementación complicado y a los complejos requisitos de configuración. Ofrecemos…
Agentes de uso de computadora: Benchmark y arquitectura
Los agentes de uso de computadora operan en escritorios reales y aplicaciones web. Sus diseños, limitaciones y compensaciones suelen ser poco claros. Desglosamos cómo funcionan los sistemas líderes, cómo aprenden y cómo difieren sus arquitecturas. También nos referimos a un benchmark de grounding de UI enfocado en 100 capturas de pantalla de escritorio, abarcando 4…
MCP Gateway Benchmark: Latencia y Seguridad de 6 Gateways
Un gateway MCP se sitúa entre un agente de IA y las herramientas a las que llama, y los proveedores lo posicionan como la capa de seguridad para ese tráfico. Evaluamos comparativamente seis gateways MCP contra un backend instrumentado en una única máquina, midiendo la latencia añadida, la autorización por herramienta, la protección de contenido…
Boletín informativo de AIMultiple
Reciba un correo electrónico gratuito a la semana con las últimas noticias tecnológicas B2B y análisis de expertos para impulsar su empresa.