Ekrem Sarı
Ekrem es investigador de IA y analista de datos en AIMultiple. Diseña y ejecuta evaluaciones comparativas prácticas para sistemas de IA y LLM.
Experiencia Profesional
En AIMultiple, Ekrem realiza evaluaciones comparativas de sistemas de IA de extremo a extremo y crea los flujos de trabajo de datos y paneles utilizados para realizar el seguimiento de las métricas de los productos y las evaluaciones comparativas. Sus evaluaciones comparativas cubren modelos de embedding y reranker, bases de datos vectoriales y de grafos, motores de inference, cuantificación, concurrencia de GPU y escalado multi-GPU, precios y proveedores de GPU en la nube, texto a SQL, y marcos de trabajo de RAG y RAG agéntico.
Antes de AIMultiple, trabajó como evaluador en Yandex, donde evaluaba la calidad de las búsquedas y etiquetaba grandes volúmenes de datos según pautas detalladas para respaldar la calidad del ranking y de los modelos.
Interés de Investigación
El trabajo de Ekrem se centra en el ciclo de vida de MLOps y LLMOps y en la medición del rendimiento de los sistemas de IA. Compara modelos, marcos de trabajo e infraestructura en métricas como la precisión, el rendimiento, el coste de las API y la escalabilidad, en toda la pila, desde los modelos de embedding y las bases de datos vectoriales hasta la infraestructura de GPU y la nube. Su tesis de maestría automatiza las revisiones sistemáticas de la literatura con un pipeline basado en RAG.
Formación
Ekrem tiene una licenciatura de la Universidad Hacettepe y está completando una maestría en la Universidad Başkent.
Últimos artículos de Ekrem
LLM Motores de Inferencia: vLLM vs LMDeploy vs SGLang
Evaluamos comparativamente 3 motores de inferencia de LLM líderes en hardware NVIDIA H100: vLLM, LMDeploy y SGLang. Cada motor procesó cargas de trabajo idénticas: 1.000 prompts de ShareGPT usando Llama 3.1 8B-Instruct para aislar el verdadero impacto en el rendimiento de sus decisiones arquitectónicas y estrategias de optimización. Medimos el rendimiento por lotes sin conexión…
Los 10 mejores Modelos de Embedding Multilingüe para RAG
Evaluamos 10 modelos de embedding multilingüe en ~606k reseñas de Amazon en 6 idiomas (Alemán, Inglés, Español, Francés, Japonés, Chino). Generamos 1.800 consultas (300 por idioma), cada una haciendo referencia a detalles concretos de su reseña fuente. Los modelos entrenados para búsqueda (separación consulta vs documento) superan a modelos más grandes entrenados para similitud de…
Múltiple GPU Benchmark: B200 vs H200 vs H100 vs MI300X
Durante más de dos décadas, optimizar el rendimiento de cálculo ha sido una piedra angular de mi trabajo. Realizamos pruebas de rendimiento de las B200, H200, H100 de NVIDIA y la MI300X de AMD para evaluar su escalabilidad en la inferencia de Modelos de Lenguaje Grande (LLM). Utilizando el framework vLLM con el modelo meta-llama/Llama-3.1-8B-Instruct,…
LLM Cuantización: BF16 vs FP8 vs INT4
Hemos realizado un benchmark de Qwen3-32B en 4 niveles de precisión (BF16, FP8, GPTQ-Int8, GPTQ-Int4) en una sola NVIDIA H100 80GB GPU. Cada configuración fue evaluada en 2 benchmarks (~12.2K preguntas) que cubren conocimiento y generación de código, además de 2.000+ ejecuciones de inferencia para medir el rendimiento. Int4 es 2.7x más rápido que BF16…
Boletín informativo de AIMultiple
Reciba un correo electrónico gratuito a la semana con las últimas noticias tecnológicas B2B y análisis de expertos para impulsar su empresa.