Servicios
Contáctanos
Berk Kalelioğlu

Berk Kalelioğlu

Investigador de IA
9 Artículos
Mantente al día sobre tecnología B2B.
Berk es un investigador de IA en AIMultiple. Tiene experiencia previa en desarrollo de videojuegos y en el desarrollo de generadores de números pseudoaleatorios utilizando sistemas caóticos.

Intereses de investigación

Berk se centra en el aprendizaje automático, herramientas de IA agentivas, y modelos de lenguaje grandes y pequeños (LLMs y SLMs).

Él forma parte del equipo de benchmark de AIMultiple, realizando evaluaciones y proporcionando información para ayudar a los lectores a comprender las tecnologías emergentes y sus aplicaciones en el mundo real.

Experiencia profesional

Comenzó su carrera como Líder de Proyectos Tecnológicos en ODTU IVME-R, donde lideró un proyecto para construir generadores físicos de números cuánticos y pseudoaleatorios.

Después de su paso por IVME-R, cofundó una empresa de desarrollo de videojuegos y lanzó un juego en Steam.

Más tarde cambió su carrera hacia la IA y se unió a AIMultiple como Investigador.

Educación

Berk tiene una licenciatura en Matemáticas de la Universidad de Ankara.

Últimos artículos de Berk

Agentic AI
Benchmark
28 de Jul

Benchmark de Marketing Agentic AIM

Presentamos el Benchmark de Marketing Agentic AIM, que mide el rendimiento de los agentes en tres flujos de trabajo de marketing: análisis de brechas competitivas, preparación de listas de cuentas ABM y una presentación de ventas personalizada. Probamos el rendimiento de 11 modelos en tres tareas de la vida real y medimos el rendimiento de…

IA
Evaluación en Mundo Abierto
23 de Jul

Mejores proveedores de LLM API de tarifa plana

Los proveedores de LLM de tarifa plana venden uso ilimitado de modelos por un precio mensual fijo en lugar de facturar por token. Este modelo se extendió porque las sesiones de codificación agentiva pueden usar decenas de millones de tokens, por lo que una factura por token es difícil de predecir. Muy pocos proveedores ofrecen…

Agentic AI
Benchmark
23 de Jul

A-CODE-LLM Bench: Benchmark de codificación agente

Realizamos un benchmark de los mejores modelos de lenguaje grandes (LLMs) en 10 tareas de desarrollo de software usando una herramienta CLI agente. Ejecutamos ~3,500 pasos de validación automatizados por modelo tanto en la capa de API como en la de UI. Cada alias se ejecutó 3 veces en 10 tareas (30 muestras por alias,…

Agentic AI
Benchmark
21 de Jul

Evaluación comparativa de IA para capital de riesgo: 11 agentes de IA en tareas reales de capital de riesgo

En colaboración con VCs en etapa inicial, convertimos dos flujos de trabajo de analistas en evaluaciones comparativas con verdad fundamental verificada por humanos y calificamos a 11 agentes de IA en ellas. Vea las tareas, los resultados y el método de calificación: Cada uno de los 11 modelos ejecutó cada tarea una vez. Las puntuaciones…

Agentic AI16 de Jul

Moltbook: Redes Sociales Impulsadas por Agentes

El rápido crecimiento de OpenClaw ha desencadenado un experimento social inusual: Moltbook, una plataforma social similar a Reddit donde los agentes interactúan entre sí. Lanzado el 28th de enero de 2026, comenzó a llamar la atención en poco tiempo. Alcanzó 1.5m agentes en su primera semana. Para más plataformas para agentes de IA, lee Dentro…

Agentic AI16 de Jul

OpenClaw (Moltbot/Clawdbot): Casos de uso y seguridad

OpenClaw (anteriormente Moltbot y Clawdbot) es un asistente de IA de código abierto y autohospedado diseñado para ejecutar tareas de computación local e interactuar con usuarios a través de plataformas de mensajería estándar. A diferencia de los chatbots tradicionales que funcionan como asesores que generan texto, OpenClaw opera como un agente autónomo que puede ejecutar…

Agentic AI
Benchmark
6 de Jul

Benchmark A-CODE-CLI: Evaluación de CLI Agénticas

Las herramientas CLI agénticas son herramientas de codificación con IA que pueden crear y eliminar archivos, ejecutar comandos, planificar y realizar la codificación de todo el proyecto. Evaluamos las herramientas líderes en 10 escenarios reales de desarrollo web, realizando ~600 verificaciones atómicas por agente y más de ~5,000 ejecuciones de pruebas automatizadas en total, incluyendo…

IA
Benchmark
3 de Jul

Benchmark de Modelos Tabulares: Rendimiento en 19 Conjuntos de Datos

Evaluamos 8 modelos de aprendizaje tabular en 19 conjuntos de datos del mundo real que cubren aproximadamente 260,000 muestras, con tamaños de conjunto desde 435 hasta 48,800 filas. Cada modelo se ejecutó en la misma máquina con validación cruzada de 5 pliegues y divisiones idénticas. Cada conjunto de datos es un round-robin de enfrentamientos cabeza…

Software Empresarial
Benchmark
14 de May

Comparación de VPS: Hetzner vs Digital Ocean

Comparamos 6 proveedores de servidores privados virtuales (VPS) ejecutando ~1.200 pruebas automatizadas por servidor en CPU, memoria, E/S de disco y velocidad de red usando sysbench, fio y speedtest-cli. También documentamos la experiencia completa desde el registro hasta el acceso SSH para cada proveedor. Usamos planes de 4 vCPU (Compartidos) / 8 GB de cada…