Ekrem Sarı
Ekrem es investigador de IA y científico de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.
Experiencia profesional
En AIMultiple, Ekrem evalúa sistemas de IA de extremo a extremo y crea los flujos de trabajo de datos y los paneles que se usan para rastrear métricas de benchmark y de producto. Sus benchmarks cubren modelos de embedding y reranker, bases de datos vectoriales y de grafos, motores de inference, cuantización, concurrencia de GPU y escalado multi-GPU, precios y proveedores de GPU en la nube, text-to-SQL, y frameworks de RAG y RAG agéntico.
Antes de AIMultiple, trabajó como científico de datos en Yandex, donde consultó y analizó grandes datasets con SQL para evaluar la calidad de búsqueda y ranking según directrices detalladas.
Intereses de investigación
El trabajo de Ekrem se centra en medir cómo funcionan en la práctica los sistemas de LLM y de recuperación. Diseña el banco de pruebas, ejecuta las cargas de trabajo en hardware real y compara modelos, frameworks e infraestructura en precisión, rendimiento, latencia, costo y escalabilidad, en toda la pila, desde modelos de embedding y bases de datos vectoriales hasta motores de inference e infraestructura de GPU. Su tesis de maestría automatiza revisiones sistemáticas de literatura con un pipeline basado en RAG.
Educación
Ekrem tiene un MSc en Sistemas de Información Gerencial por la Universidad de Başkent, donde su tesis automatizó revisiones sistemáticas de literatura con un pipeline basado en RAG, y está cursando un segundo MSc en Ingeniería de Datos y del Conocimiento en la Universidad de Hacettepe.
Últimos artículos de Ekrem
Top 70+ proveedores de GPU en la nube
Los proveedores de GPU en la nube se dividen en tres niveles. Los hiperescaladores ejecutan plataformas de nube amplias con el alquiler de GPU como un producto entre muchos. Los neoclouds especializados se centran en la infraestructura de GPU e IA como su producto principal. Los mercados comunitarios agregan inventario de muchos operadores pequeños, a…
Benchmark de software DLP
Evaluamos Acronis DeviceLock DLP y ManageEngine DLP Plus en máquinas virtuales idénticas con Windows Server 2022 con 28 escenarios: 23 pruebas de fuga de datos (incluidos 12 archivos de evasión adversaria), 3 pruebas de seguridad del agente y 2 pruebas bajo alto consumo de CPU y memoria. Para los demás productos DLP, Netwrix Endpoint Protector,…
LLM Calculadora de VRAM para alojamiento propio
Alojar por tu cuenta un LLM implica ejecutar la inferencia en hardware que controla el operador, en lugar de a través de una API de terceros, lo que cambia el coste, el control de los datos y el perfil de privacidad. El hecho de que un modelo pueda ejecutarse depende de la memoria. La calculadora…
Benchmark multi-GPU: B200 vs H200 vs H100 vs MI300X
Durante más de dos décadas, optimizar el rendimiento computacional ha sido un pilar de mi trabajo. Evaluamos la B200 y H200 de NVIDIA, la H100 y la MI300X de AMD para evaluar qué tan bien escalan en la inference de Large Language Model (LLM). Utilizando el framework vLLM con el model meta-llama/Llama-3.1-8B-Instruct, ejecutamos pruebas en…
GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X
He pasado los últimos 20 años centrado en la optimización del rendimiento computacional a nivel de sistema. Evaluamos las NVIDIA GPU más recientes, incluidas las H100, H200 y B200 de NVIDIA, y la MI300X de AMD, para el análisis de escalado de concurrencia. Utilizando el framework vLLM con el gpt-oss-20b model, probamos cómo estas GPU…
Búsqueda de video API Benchmark: Bright Data vs YouTube
Comparamos Bright Data Video Search con la búsqueda de YouTube en 50 consultas en inglés en cinco tipos de consulta. Se consultó a ambos motores hasta el agotamiento y un panel de tres modelos evaluó los fotogramas de video muestreados. Los clips utilizables por búsqueda estiman cuántos videos devueltos contienen el tema o la acción…
Alternativas a DGX Spark: RTX, Ryzen IA Halo y Mac Studio
Comparamos los benchmarks de inference publicados de DGX Spark, RTX y Ryzen IA Halo, cubriendo el procesamiento de prompt, la generación de tokens y contextos más largos. Las alternativas incluyen Framework Desktop, Mac Studio y sistemas GB10 de otros fabricantes. La velocidad de decodificación mide los tokens de salida generados por segundo. Valores más altos…
Gratuitas GPUs en la nube: modelos, límites y requisitos de acceso
Las GPUs gratuitas en la nube están disponibles a través de notebooks de Python, demos de IA y créditos de cómputo mensuales. Compare el hardware de GPU, las asignaciones gratis y los requisitos de acceso, o compruebe qué servicios se adaptan a su carga de trabajo. Dos T4 proporcionan dos asignaciones de memoria de 16…
Comparación de modelos fundacionales relacionales
Comparamos SAP-RPT-1-OSS contra el gradient boosting (LightGBM, CatBoost) en 17 conjuntos de datos tabulares que abarcan el espectro semántico-numérico, tablas pequeñas/de alta semántica, conjuntos de datos de negocio mixtos y grandes conjuntos de datos numéricos de baja semántica. Nuestro objetivo es medir dónde los priores semánticos preentrenados de un LLM relacional pueden ofrecer ventajas frente…
Benchmark de recuperación ante desastres: Acronis vs Comet vs MSP360
Evaluamos Acronis Cyber Protect Cloud, Comet Backup y MSP360 Managed Backup en recuperación ante desastres. Cada proveedor creó una imagen de un servidor Windows Server 2022 en vivo y de un servidor Ubuntu 24.04 en vivo con la misma carga de trabajo determinista, un servicio web, una base de datos de 10.000 filas y 50…
Boletín informativo de AIMultiple
Reciba un correo electrónico gratuito a la semana con las últimas noticias tecnológicas B2B y análisis de expertos para impulsar su empresa.