Berk Kalelioğlu
Intereses de investigación
Berk se centra en el aprendizaje automático, las herramientas de IA agéntica y los modelos de lenguaje grandes y pequeños (LLMs y SLMs).Forma parte del equipo de benchmark de AIMultiple, donde realiza evaluaciones y aporta información para ayudar a los lectores a comprender las tecnologías emergentes y sus aplicaciones en el mundo real.
Experiencia profesional
Comenzó su carrera como líder de proyectos tecnológicos en ODTU IVME-R, donde dirigió un proyecto para construir generadores físicos cuánticos y de números pseudoaleatorios.Tras su etapa en IVME-R, cofundó una empresa de desarrollo de videojuegos y lanzó un juego en Steam.
Más tarde orientó su carrera hacia la IA y se incorporó a AIMultiple como investigador.
Educación
Berk tiene una licenciatura en Matemáticas por la Universidad de Ankara.Últimos artículos de Berk
Benchmark A-CODE-CLI: Evaluación de CLI Agénticas
Las herramientas CLI agénticas son herramientas de codificación con IA que pueden crear y eliminar archivos, ejecutar comandos, planificar y realizar la codificación de todo el proyecto. Evaluamos las herramientas líderes en 10 escenarios reales de desarrollo web, realizando ~600 verificaciones atómicas por agente y más de ~5.000 ejecuciones de pruebas automatizadas en total, incluyendo…
AIM Enterprise: Benchmark empresarial agéntico
Las empresas utilizan LLMs a diario para sus tareas habituales. Para encontrar los LLMs más rentables, diseñamos AIM Enterprise, un benchmark empresarial agéntico, donde utilizamos 69 tareas empresariales en diferentes categorías. Cada modelo entregó un archivo por tarea. Las puntuaciones son relativas: los jueces clasifican cada respuesta frente a las demás respuestas de la misma…
Benchmark de Marketing Agéntico AIM
Presentamos el Benchmark de Marketing Agéntico AIM, que mide el rendimiento de los agentes en tres flujos de trabajo de marketing: análisis de brechas competitivas, preparación de lista de objetivos ABM y una presentación de ventas personalizada. También realizamos una auditoría de reputación del sitio web por separado, en la que los agentes examinaron el…
Evaluación comparativa de clasificación de series temporales: Modelos fundacionales vs métodos clásicos
Evaluamos 13 métodos de clasificación de series temporales, desde modelos fundacionales de series temporales preentrenados hasta una línea base de 22 características de 2019, en 33 conjuntos de datos UCR/UEA bajo un protocolo congelado. Esto suma 14.638 celdas registradas de método-conjunto-remuestreo, de las cuales 11.874 fueron puntuadas. El gráfico muestra la comparación principal del benchmark:…
A-CODE-LLM Bench: Evaluación comparativa de codificación agéntica
Evaluamos los principales grandes modelos de lenguaje (LLMs) en 10 tareas de desarrollo de software utilizando una herramienta CLI agéntica. Ejecutamos aproximadamente 3.500 pasos de validación automatizados por modelo en ambas capas API y UI. Cada alias se ejecutó 3 veces en 10 tareas (30 muestras por alias, 400 celdas por iteración en 40 alias).…
Moltbook: Redes Sociales Impulsadas por Agentes
El rápido crecimiento de OpenClaw ha desencadenado un experimento social inusual: Moltbook, una plataforma social similar a Reddit donde los agentes interactúan entre sí. Lanzado el 28 de enero de 2026, comenzó a llamar la atención en poco tiempo. Alcanzó 1.5m agentes en su primera semana. Para más plataformas para agentes de IA, lee Dentro…
Comparación de VPS: Hetzner vs Digital Ocean
Comparamos 6 proveedores de servidores privados virtuales (VPS) ejecutando ~1.200 pruebas automatizadas por servidor en CPU, memoria, E/S de disco y velocidad de red usando sysbench, fio y speedtest-cli. También documentamos la experiencia completa desde el registro hasta el acceso SSH para cada proveedor. Usamos planes de 4 vCPU (Compartidos) / 8 GB de cada…
Agentic IT: Can LLMs Design a Benchmark
We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…
Mejores proveedores de LLM API de tarifa plana
Los proveedores de LLM de tarifa plana venden uso ilimitado del modelo por un precio mensual fijo en lugar de facturar por token. Este modelo se extendió porque las sesiones de codificación agentiva pueden usar decenas de millones de tokens, por lo que una factura por token es difícil de predecir. Muy pocos proveedores ofrecen…
Agentes de uso de computadora: Benchmark y arquitectura
Los agentes de uso de computadora operan en escritorios reales y aplicaciones web. Sus diseños, limitaciones y compensaciones suelen ser poco claros. Desglosamos cómo funcionan los sistemas líderes, cómo aprenden y cómo difieren sus arquitecturas. También nos referimos a un benchmark de grounding de UI enfocado en 100 capturas de pantalla de escritorio, abarcando 4…
Boletín informativo de AIMultiple
Reciba un correo electrónico gratuito a la semana con las últimas noticias tecnológicas B2B y análisis de expertos para impulsar su empresa.