Berk Kalelioğlu
Intereses de investigación
Berk se centra en el aprendizaje automático, las herramientas de IA agéntica y los models de lenguaje grandes y pequeños (LLMs y SLMs).Forma parte del equipo de benchmark de AIMultiple, realizando evaluaciones y proporcionando perspectivas para ayudar a los lectores a comprender las tecnologías emergentes y sus aplicaciones en el mundo real.
Experiencia profesional
Comenzó su carrera como líder de proyecto tecnológico en ODTU IVME-R, donde lideró un proyecto para construir generadores físicos cuánticos y de números pseudoaleatorios.Tras su etapa en IVME-R, cofundó una empresa de desarrollo de videojuegos y publicó un juego en Steam.
Más tarde orientó su carrera hacia la IA y se unió a AIMultiple como investigador.
Educación
Berk tiene una licenciatura en Matemáticas por la Universidad de Ankara.Últimos artículos de Berk
Alternativas a OpenClaw: Hermes vs ZeroClaw vs Grok Bot
Los agentes autónomos de IA, como OpenClaw y Hermes Agent, automatizan tareas de varios pasos que normalmente requerirían una intervención humana constante. Si bien OpenClaw se ha convertido en el agente autónomo siempre activo más adoptado, muchos usuarios buscan alternativas debido a su proceso de implementación complicado y a los complejos requisitos de configuración. Ofrecemos…
Agentes de uso de computadora: Benchmark y arquitectura
Los agentes de uso de computadora operan en escritorios reales y aplicaciones web. Sus diseños, limitaciones y compensaciones suelen ser poco claros. Desglosamos cómo funcionan los sistemas líderes, cómo aprenden y cómo difieren sus arquitecturas. También nos referimos a un benchmark de grounding de UI enfocado en 100 capturas de pantalla de escritorio, abarcando 4…
Evaluación comparativa de IA para capital de riesgo: 11 agentes de IA en tareas reales de capital de riesgo
En colaboración con VCs en etapa inicial, convertimos dos flujos de trabajo de analistas en evaluaciones comparativas con verdad fundamental verificada por humanos y calificamos a 11 agentes de IA en ellas. Vea las tareas, los resultados y el método de calificación: Cada uno de los 11 modelos ejecutó cada tarea una vez. Las puntuaciones…
AIM Enterprise: Benchmark empresarial agéntico
Las empresas usan LLM a diario para sus tareas habituales. Para encontrar los LLM más rentables, diseñamos AIM Enterprise, un benchmark empresarial agéntico, donde utilizamos 69 tareas empresariales reales de estrategia, marketing, RR. HH., ventas y operaciones. Dos modelos jueces puntuaron cada archivo y a menudo no coincidieron. En aproximadamente un tercio de las puntuaciones…
MCP Gateway Benchmark: Latencia y Seguridad de 6 Gateways
Un gateway MCP se sitúa entre un agente de IA y las herramientas a las que llama, y los proveedores lo posicionan como la capa de seguridad para ese tráfico. Evaluamos comparativamente seis gateways MCP contra un backend instrumentado en una única máquina, midiendo la latencia añadida, la autorización por herramienta, la protección de contenido…
Benchmark de Clasificación de Series Temporales: Foundation Models vs Métodos Clásicos
Evaluamos 13 métodos de clasificación de series temporales, desde time series foundation models preentrenados hasta una línea base de 22 características de 2019, en 33 conjuntos de datos UCR/UEA bajo un protocolo congelado. Eso son 14.638 celdas registradas de método-conjunto de datos-remuestreo, 11.874 de ellas puntuadas. El gráfico compara 12 métodos en los 15 conjuntos…
A-CODE-CLI Bench: Benchmark de CLI agénticas
Las herramientas CLI agénticas son herramientas de programación con IA que pueden crear y eliminar archivos, ejecutar comandos, planificar y ejecutar la programación de todo el proyecto. Evaluamos las herramientas líderes en 10 escenarios reales de desarrollo web, realizando ~600 comprobaciones de validación atómicas por agente y más de ~5.000 ejecuciones de pruebas automatizadas totales,…
Comparación de VPS: Hetzner vs Digital Ocean
Comparamos 6 proveedores de servidores privados virtuales (VPS) ejecutando ~1.200 pruebas automatizadas por servidor en CPU, memoria, E/S de disco y velocidad de red usando sysbench, fio y speedtest-cli. También documentamos la experiencia completa desde el registro hasta el acceso SSH para cada proveedor. Usamos planes de 4 vCPU (Compartidos) / 8 GB de cada…
A-CODE-LLM Bench: Evaluación comparativa de codificación agéntica
Evaluamos los principales grandes modelos de lenguaje (LLMs) en 10 tareas de desarrollo de software utilizando una herramienta CLI agéntica. Ejecutamos aproximadamente 3.500 pasos de validación automatizados por modelo en ambas capas API y UI. Cada alias se ejecutó 3 veces en 10 tareas (30 muestras por alias, 400 celdas por iteración en 40 alias).…
Benchmark de Marketing Agéntico AIM
Presentamos el Benchmark de Marketing Agéntico AIM, que mide el rendimiento de los agentes en tres flujos de trabajo de marketing: análisis de brechas competitivas, preparación de lista de objetivos ABM y una presentación de ventas personalizada. También realizamos una auditoría de reputación del sitio web por separado, en la que los agentes examinaron el…
Boletín informativo de AIMultiple
Reciba un correo electrónico gratuito a la semana con las últimas noticias tecnológicas B2B y análisis de expertos para impulsar su empresa.