Berk Kalelioğlu
Intereses de investigación
Berk se centra en el aprendizaje automático, herramientas de IA agentivas, y modelos de lenguaje grandes y pequeños (LLMs y SLMs).Él forma parte del equipo de benchmark de AIMultiple, realizando evaluaciones y proporcionando información para ayudar a los lectores a comprender las tecnologías emergentes y sus aplicaciones en el mundo real.
Experiencia profesional
Comenzó su carrera como Líder de Proyectos Tecnológicos en ODTU IVME-R, donde lideró un proyecto para construir generadores físicos de números cuánticos y pseudoaleatorios.Después de su paso por IVME-R, cofundó una empresa de desarrollo de videojuegos y lanzó un juego en Steam.
Más tarde cambió su carrera hacia la IA y se unió a AIMultiple como Investigador.
Educación
Berk tiene una licenciatura en Matemáticas de la Universidad de Ankara.Últimos artículos de Berk
Benchmark de Marketing Agentic AIM
Presentamos el Benchmark de Marketing Agentic AIM, que mide el rendimiento de los agentes en tres flujos de trabajo de marketing: análisis de brechas competitivas, preparación de listas de cuentas ABM y una presentación de ventas personalizada. Probamos el rendimiento de 11 modelos en tres tareas de la vida real y medimos el rendimiento de…
Mejores proveedores de LLM API de tarifa plana
Los proveedores de LLM de tarifa plana venden uso ilimitado de modelos por un precio mensual fijo en lugar de facturar por token. Este modelo se extendió porque las sesiones de codificación agentiva pueden usar decenas de millones de tokens, por lo que una factura por token es difícil de predecir. Muy pocos proveedores ofrecen…
A-CODE-LLM Bench: Benchmark de codificación agente
Realizamos un benchmark de los mejores modelos de lenguaje grandes (LLMs) en 10 tareas de desarrollo de software usando una herramienta CLI agente. Ejecutamos ~3,500 pasos de validación automatizados por modelo tanto en la capa de API como en la de UI. Cada alias se ejecutó 3 veces en 10 tareas (30 muestras por alias,…
Evaluación comparativa de IA para capital de riesgo: 11 agentes de IA en tareas reales de capital de riesgo
En colaboración con VCs en etapa inicial, convertimos dos flujos de trabajo de analistas en evaluaciones comparativas con verdad fundamental verificada por humanos y calificamos a 11 agentes de IA en ellas. Vea las tareas, los resultados y el método de calificación: Cada uno de los 11 modelos ejecutó cada tarea una vez. Las puntuaciones…
Moltbook: Redes Sociales Impulsadas por Agentes
El rápido crecimiento de OpenClaw ha desencadenado un experimento social inusual: Moltbook, una plataforma social similar a Reddit donde los agentes interactúan entre sí. Lanzado el 28th de enero de 2026, comenzó a llamar la atención en poco tiempo. Alcanzó 1.5m agentes en su primera semana. Para más plataformas para agentes de IA, lee Dentro…
OpenClaw (Moltbot/Clawdbot): Casos de uso y seguridad
OpenClaw (anteriormente Moltbot y Clawdbot) es un asistente de IA de código abierto y autohospedado diseñado para ejecutar tareas de computación local e interactuar con usuarios a través de plataformas de mensajería estándar. A diferencia de los chatbots tradicionales que funcionan como asesores que generan texto, OpenClaw opera como un agente autónomo que puede ejecutar…
Benchmark A-CODE-CLI: Evaluación de CLI Agénticas
Las herramientas CLI agénticas son herramientas de codificación con IA que pueden crear y eliminar archivos, ejecutar comandos, planificar y realizar la codificación de todo el proyecto. Evaluamos las herramientas líderes en 10 escenarios reales de desarrollo web, realizando ~600 verificaciones atómicas por agente y más de ~5,000 ejecuciones de pruebas automatizadas en total, incluyendo…
Benchmark de Modelos Tabulares: Rendimiento en 19 Conjuntos de Datos
Evaluamos 8 modelos de aprendizaje tabular en 19 conjuntos de datos del mundo real que cubren aproximadamente 260,000 muestras, con tamaños de conjunto desde 435 hasta 48,800 filas. Cada modelo se ejecutó en la misma máquina con validación cruzada de 5 pliegues y divisiones idénticas. Cada conjunto de datos es un round-robin de enfrentamientos cabeza…
Comparación de VPS: Hetzner vs Digital Ocean
Comparamos 6 proveedores de servidores privados virtuales (VPS) ejecutando ~1.200 pruebas automatizadas por servidor en CPU, memoria, E/S de disco y velocidad de red usando sysbench, fio y speedtest-cli. También documentamos la experiencia completa desde el registro hasta el acceso SSH para cada proveedor. Usamos planes de 4 vCPU (Compartidos) / 8 GB de cada…
Boletín informativo de AIMultiple
Reciba un correo electrónico gratuito a la semana con las últimas noticias tecnológicas B2B y análisis de expertos para impulsar su empresa.