Servicios
Contáctanos
Ekrem Sarı

Ekrem Sarı

Investigador de IA
35 Artículos
Mantente al día sobre tecnología B2B.

Ekrem es investigador de IA y analista de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.

Experiencia profesional

En AIMultiple, Ekrem realiza benchmarks de sistemas de IA de extremo a extremo y construye los flujos de trabajo de datos y paneles utilizados para rastrear métricas de benchmark y producto. Sus benchmarks cubren models de embedding y reranker, bases de datos vectoriales y de grafos, motores de inference, cuantización, concurrencia de GPU y escalado multi-GPU, precios y proveedores de GPU en la nube, texto a SQL, y frameworks de RAG y RAG agéntico.

Antes de AIMultiple, trabajó como evaluador en Yandex, donde evaluó la calidad de búsqueda y etiquetó grandes volúmenes de datos según directrices detalladas para respaldar la calidad del ranking y del model.

Interés de investigación

El trabajo de Ekrem se centra en el ciclo de vida de MLOps y LLMOps y en medir el rendimiento de los sistemas de IA. Compara models, frameworks e infraestructura en métricas como precisión, rendimiento, coste de API y escalabilidad, en toda la pila, desde models de embedding y bases de datos vectoriales hasta GPU e infraestructura en la nube. Su tesis de máster automatiza revisiones sistemáticas de literatura con un pipeline basado en RAG.

Educación

Ekrem tiene una licenciatura de la Universidad Hacettepe y está completando un máster en la Universidad de Başkent.

Últimos artículos de Ekrem

Datos
Benchmark
2 de Jul

Navegadores Remotos: Infraestructura Web para Agentes de IA Comparados

Los agentes de IA dependen de navegadores remotos para automatizar tareas web sin ser bloqueados por medidas anti-scraping. El rendimiento de esta infraestructura de navegador es crítico para el éxito de un agente. Comparamos 8 proveedores en tasa de éxito, velocidad y características. Para esto, ejecutamos 160 tareas automatizadas, ejecutando 4 escenarios distintos 5 veces…

IA
Benchmark
1 de Jul

LLM Motores de Inferencia: vLLM vs LMDeploy vs SGLang

Evaluamos comparativamente 3 motores de inferencia de LLM líderes en hardware NVIDIA H100: vLLM, LMDeploy y SGLang. Cada motor procesó cargas de trabajo idénticas: 1.000 prompts de ShareGPT usando Llama 3.1 8B-Instruct para aislar el verdadero impacto en el rendimiento de sus decisiones arquitectónicas y estrategias de optimización. Medimos el rendimiento por lotes sin conexión…

IA
Benchmark
30 de Jun

Los 10 mejores Modelos de Embedding Multilingüe para RAG

Evaluamos 10 modelos de embedding multilingüe en ~606k reseñas de Amazon en 6 idiomas (Alemán, Inglés, Español, Francés, Japonés, Chino). Generamos 1.800 consultas (300 por idioma), cada una haciendo referencia a detalles concretos de su reseña fuente. Los modelos entrenados para búsqueda (separación consulta vs documento) superan a modelos más grandes entrenados para similitud de…

IA
Benchmark
30 de Jun

Múltiple GPU Benchmark: B200 vs H200 vs H100 vs MI300X

Durante más de dos décadas, optimizar el rendimiento de cálculo ha sido una piedra angular de mi trabajo. Realizamos pruebas de rendimiento de las B200, H200, H100 de NVIDIA y la MI300X de AMD para evaluar su escalabilidad en la inferencia de Modelos de Lenguaje Grande (LLM). Utilizando el framework vLLM con el modelo meta-llama/Llama-3.1-8B-Instruct,…

IA
Benchmark
15 de Abr

LLM Cuantización: BF16 vs FP8 vs INT4

Hemos realizado un benchmark de Qwen3-32B en 4 niveles de precisión (BF16, FP8, GPTQ-Int8, GPTQ-Int4) en una sola NVIDIA H100 80GB GPU. Cada configuración fue evaluada en 2 benchmarks (~12.2K preguntas) que cubren conocimiento y generación de código, además de 2.000+ ejecuciones de inferencia para medir el rendimiento. Int4 es 2.7x más rápido que BF16…