Berk Kalelioğlu
Intereses de investigación
Berk se centra en el aprendizaje automático, las herramientas de IA agéntica y los models de lenguaje grandes y pequeños (LLMs y SLMs).Forma parte del equipo de benchmark de AIMultiple, realizando evaluaciones y proporcionando perspectivas para ayudar a los lectores a comprender las tecnologías emergentes y sus aplicaciones en el mundo real.
Experiencia profesional
Comenzó su carrera como líder de proyecto tecnológico en ODTU IVME-R, donde lideró un proyecto para construir generadores físicos cuánticos y de números pseudoaleatorios.Tras su etapa en IVME-R, cofundó una empresa de desarrollo de videojuegos y publicó un juego en Steam.
Más tarde orientó su carrera hacia la IA y se unió a AIMultiple como investigador.
Educación
Berk tiene una licenciatura en Matemáticas por la Universidad de Ankara.Últimos artículos de Berk
Benchmark de Clasificación de Series Temporales: Foundation Models vs Métodos Clásicos
Evaluamos 13 métodos de clasificación de series temporales, desde time series foundation models preentrenados hasta una línea base de 22 características de 2019, en 33 conjuntos de datos UCR/UEA bajo un protocolo congelado. Eso son 14.638 celdas registradas de método-conjunto de datos-remuestreo, 11.874 de ellas puntuadas. El gráfico compara 12 métodos en los 15 conjuntos…
A-CODE-CLI Bench: Benchmark de CLI agénticas
Las herramientas CLI agénticas son herramientas de programación con IA que pueden crear y eliminar archivos, ejecutar comandos, planificar y ejecutar la programación de todo el proyecto. Evaluamos las herramientas líderes en 10 escenarios reales de desarrollo web, realizando ~600 comprobaciones de validación atómicas por agente y más de ~5.000 ejecuciones de pruebas automatizadas totales,…
Benchmark de VPS: Hetzner vs Digital Ocean
Evaluamos 6 proveedores de servidores privados virtuales (VPS) ejecutando ~1.200 pruebas automatizadas por servidor en CPU, memoria, E/S de disco y velocidad de red usando sysbench, fio y speedtest-cli. También documentamos la experiencia completa desde el registro hasta SSH de cada proveedor. Usamos planes de 4 vCPU (compartidos) / 8 GB de cada proveedor, sin…
Benchmark de Marketing Agéntico AIM
Presentamos el Benchmark de Marketing Agéntico AIM, que mide el rendimiento de los agentes en tres flujos de trabajo de marketing: análisis de brechas competitivas, preparación de lista de objetivos ABM y una presentación de ventas personalizada. También realizamos una auditoría de reputación del sitio web por separado, en la que los agentes examinaron el…
Benchmark de Modelos Tabulares: Rendimiento en 19 Conjuntos de Datos
Evaluamos 8 modelos de aprendizaje tabular en 19 conjuntos de datos del mundo real que cubren aproximadamente 260.000 muestras, con tamaños de conjunto desde 435 hasta 48.800 filas. Cada modelo se ejecutó en la misma máquina con validación cruzada de 5 pliegues y divisiones idénticas. Cada conjunto de datos es un round-robin de enfrentamientos cabeza…
Boletín informativo de AIMultiple
Reciba un correo electrónico gratuito a la semana con las últimas noticias tecnológicas B2B y análisis de expertos para impulsar su empresa.