Servicios
Contáctanos
Berk Kalelioğlu

Berk Kalelioğlu

Investigador de IA
12 Artículos
Mantente al día sobre tecnología B2B.
Berk es investigador de IA en AIMultiple. Tiene experiencia previa en el desarrollo de videojuegos y en el desarrollo de generadores de números pseudoaleatorios mediante sistemas caóticos.

Intereses de investigación

Berk se centra en el aprendizaje automático, las herramientas de IA agéntica y los modelos de lenguaje grandes y pequeños (LLMs y SLMs).

Forma parte del equipo de benchmark de AIMultiple, donde realiza evaluaciones y aporta información para ayudar a los lectores a comprender las tecnologías emergentes y sus aplicaciones en el mundo real.

Experiencia profesional

Comenzó su carrera como líder de proyectos tecnológicos en ODTU IVME-R, donde dirigió un proyecto para construir generadores físicos cuánticos y de números pseudoaleatorios.

Tras su etapa en IVME-R, cofundó una empresa de desarrollo de videojuegos y lanzó un juego en Steam.

Más tarde orientó su carrera hacia la IA y se incorporó a AIMultiple como investigador.

Educación

Berk tiene una licenciatura en Matemáticas por la Universidad de Ankara.

Últimos artículos de Berk

Agentic AI
Benchmark
18 de Ago

Benchmark A-CODE-CLI: Evaluación de CLI Agénticas

Las herramientas CLI agénticas son herramientas de codificación con IA que pueden crear y eliminar archivos, ejecutar comandos, planificar y realizar la codificación de todo el proyecto. Evaluamos las herramientas líderes en 10 escenarios reales de desarrollo web, realizando ~600 verificaciones atómicas por agente y más de ~5.000 ejecuciones de pruebas automatizadas en total, incluyendo…

IA
Benchmark
14 de Ago

AIM Enterprise: Benchmark empresarial agéntico

Las empresas utilizan LLMs a diario para sus tareas habituales. Para encontrar los LLMs más rentables, diseñamos AIM Enterprise, un benchmark empresarial agéntico, donde utilizamos 69 tareas empresariales en diferentes categorías. Cada modelo entregó un archivo por tarea. Las puntuaciones son relativas: los jueces clasifican cada respuesta frente a las demás respuestas de la misma…

Agentic AI
Benchmark
12 de Ago

Benchmark de Marketing Agéntico AIM

Presentamos el Benchmark de Marketing Agéntico AIM, que mide el rendimiento de los agentes en tres flujos de trabajo de marketing: análisis de brechas competitivas, preparación de lista de objetivos ABM y una presentación de ventas personalizada. También realizamos una auditoría de reputación del sitio web por separado, en la que los agentes examinaron el…

IA12 de Ago

Evaluación comparativa de clasificación de series temporales: Modelos fundacionales vs métodos clásicos

Evaluamos 13 métodos de clasificación de series temporales, desde modelos fundacionales de series temporales preentrenados hasta una línea base de 22 características de 2019, en 33 conjuntos de datos UCR/UEA bajo un protocolo congelado. Esto suma 14.638 celdas registradas de método-conjunto-remuestreo, de las cuales 11.874 fueron puntuadas. El gráfico muestra la comparación principal del benchmark:…

Agentic AI
Benchmark
12 de Ago

A-CODE-LLM Bench: Evaluación comparativa de codificación agéntica

Evaluamos los principales grandes modelos de lenguaje (LLMs) en 10 tareas de desarrollo de software utilizando una herramienta CLI agéntica. Ejecutamos aproximadamente 3.500 pasos de validación automatizados por modelo en ambas capas API y UI. Cada alias se ejecutó 3 veces en 10 tareas (30 muestras por alias, 400 celdas por iteración en 40 alias).…

Agentic AI12 de Ago

Moltbook: Redes Sociales Impulsadas por Agentes

El rápido crecimiento de OpenClaw ha desencadenado un experimento social inusual: Moltbook, una plataforma social similar a Reddit donde los agentes interactúan entre sí. Lanzado el 28 de enero de 2026, comenzó a llamar la atención en poco tiempo. Alcanzó 1.5m agentes en su primera semana. Para más plataformas para agentes de IA, lee Dentro…

Software Empresarial
Benchmark
12 de Ago

Comparación de VPS: Hetzner vs Digital Ocean

Comparamos 6 proveedores de servidores privados virtuales (VPS) ejecutando ~1.200 pruebas automatizadas por servidor en CPU, memoria, E/S de disco y velocidad de red usando sysbench, fio y speedtest-cli. También documentamos la experiencia completa desde el registro hasta el acceso SSH para cada proveedor. Usamos planes de 4 vCPU (Compartidos) / 8 GB de cada…

IA
Benchmark
11 de Ago

Agentic IT: Can LLMs Design a Benchmark

We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…

IA
Evaluación en Mundo Abierto
7 de Ago

Mejores proveedores de LLM API de tarifa plana

Los proveedores de LLM de tarifa plana venden uso ilimitado del modelo por un precio mensual fijo en lugar de facturar por token. Este modelo se extendió porque las sesiones de codificación agentiva pueden usar decenas de millones de tokens, por lo que una factura por token es difícil de predecir. Muy pocos proveedores ofrecen…

Agentic AI
Benchmark
29 de Jul

Agentes de uso de computadora: Benchmark y arquitectura

Los agentes de uso de computadora operan en escritorios reales y aplicaciones web. Sus diseños, limitaciones y compensaciones suelen ser poco claros. Desglosamos cómo funcionan los sistemas líderes, cómo aprenden y cómo difieren sus arquitecturas. También nos referimos a un benchmark de grounding de UI enfocado en 100 capturas de pantalla de escritorio, abarcando 4…