Ekrem Sarı
Ekrem es investigador de IA y analista de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.
Experiencia profesional
En AIMultiple, Ekrem realiza benchmarks de sistemas de IA de extremo a extremo y crea los flujos de trabajo de datos y paneles utilizados para realizar el seguimiento de métricas de benchmarks y productos. Sus benchmarks cubren embedding and reranker models, bases de datos vectoriales y de grafos, inference engines, cuantización, concurrencia de GPU y escalado multi-GPU, precios y proveedores de GPU en la nube, text-to-SQL, y RAG y frameworks de RAG agéntico.
Antes de AIMultiple, trabajó como evaluador en Yandex, donde evaluó la calidad de búsqueda y etiquetó grandes volúmenes de datos según directrices detalladas para respaldar la calidad del ranking y del model.
Interés de investigación
El trabajo de Ekrem se centra en el ciclo de vida de MLOps y LLMOps y en medir el rendimiento de los sistemas de IA. Compara models, frameworks e infraestructura según métricas como precisión, throughput, coste de API y escalabilidad, en toda la pila, desde embedding models y bases de datos vectoriales hasta la infraestructura de GPU y nube. Su tesis de máster automatiza las revisiones sistemáticas de la literatura con un pipeline basado en RAG.
Educación
Ekrem tiene una licenciatura de Hacettepe University y está completando un máster en Başkent University.
Últimos artículos de Ekrem
RAG Frameworks: LangChain vs LangGraph vs LlamaIndex
Evaluamos 5 frameworks de RAG: LangChain, LangGraph, LlamaIndex, Haystack y DSPy, construyendo el mismo flujo de trabajo de RAG agéntico con componentes estandarizados: modelos idénticos (GPT-4.1-mini), embeddings (BGE-small), recuperador (Qdrant) y herramientas (búsqueda web Tavily). Esto aísla la sobrecarga real y la eficiencia de tokens de cada framework. La evaluación consistió en 100 consultas, ejecutando…
Benchmark de software de copia de seguridad: Acronis vs NinjaOne vs Comet vs MSP360
Realizamos pruebas comparativas de NinjaOne Backup, Acronis Cyber Protect Cloud Backup, Comet Backup y MSP360 Managed Backup en una infraestructura AWS idéntica. Cada proveedor ejecutó una copia de seguridad en modo archivo de la misma carga de trabajo de 625.946 archivos / 50 GB y una copia de seguridad completa de la imagen del disco…
Comparación de modelos fundacionales relacionales
Comparamos SAP-RPT-1-OSS contra el gradient boosting (LightGBM, CatBoost) en 17 conjuntos de datos tabulares que abarcan el espectro semántico-numérico, tablas pequeñas/de alta semántica, conjuntos de datos de negocio mixtos y grandes conjuntos de datos numéricos de baja semántica. Nuestro objetivo es medir dónde los priores semánticos preentrenados de un LLM relacional pueden ofrecer ventajas frente…
Comparativa de recuperación ante desastres: Acronis vs Comet vs MSP360
Evaluamos Acronis Cyber Protect Cloud, Comet Backup y MSP360 Managed Backup en recuperación ante desastres. Cada proveedor creó una imagen de un servidor en vivo Windows Server 2022 y un servidor Ubuntu 24.04 en vivo que ejecutaban la misma carga de trabajo determinista, un servicio web, una base de datos de 10.000 filas y 50…
Búsqueda agéntica: Comparativa de 8 APIs de búsqueda para agentes
La búsqueda agentic desempeña un papel crucial para cerrar la brecha entre los motores de búsqueda tradicionales y las capacidades de búsqueda de IA. Las APIs de búsqueda son la primera capa de una herramienta agentic, donde el rendimiento limita la calidad de todo lo que viene después. Hemos realizado una comparativa de 8 APIs…
Evaluación comparativa de software DLP
Realizamos pruebas de rendimiento en Acronis DeviceLock DLP y ManageEngine DLP Plus en máquinas virtuales idénticas con Windows Server 2022 y 28 escenarios: 23 pruebas de fuga de datos (incluyendo 12 archivos de evasión adversaria), 3 pruebas de seguridad del agente y 2 pruebas bajo alto consumo de CPU y memoria. Para los demás productos…
Benchmark de rerankers: comparación de los 8 mejores modelos
Comparamos 8 modelos de reranking en ~145k reseñas en inglés de Amazon para medir cuánto mejora la recuperación densa una etapa de reranking. Recuperamos los 100 candidatos principales con multilingual-e5-base, los rerankeamos con cada modelo y evaluamos los 10 mejores resultados frente a 300 consultas, cada una haciendo referencia a detalles concretos de su reseña…
GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X
He pasado los últimos 20 años centrado en la optimización del rendimiento computacional a nivel de sistema. Hemos comparado las últimas GPUs de NVIDIA, incluyendo la H100 de NVIDIA, la H200, la B200 y la MI300X de AMD, para analizar el escalado de concurrencia. Utilizando el framework vLLM con el gpt-oss-20b modelo, comprobamos cómo estas…
Web Scraping a Gran Escala: 7 Proveedores Comparados
Ejecutamos dos pruebas de rendimiento contra sitios web en vivo, desde 5 hasta 5.000 solicitudes concurrentes. La primera envió 260.000 solicitudes a través de cuatro desbloqueadores web en los 10.000 dominios principales de Tranco, además de una prueba de extracción de Markdown en 10.000 URLs. La segunda recuperó 65.000 páginas de productos y búsqueda de…
Comparación de los 6 mejores servicios gratuitos de Cloud GPU
El mejor nivel gratis de GPU vale alrededor de $19 al mes en tarifas de alquiler, y ocho plataformas ofrecen una GPU real sin tarjeta de crédito. Seis de ellas limitan el uso gratis por mes, y hemos valorado esos precios según la tarifa bajo demanda más barata actual para cada GPU en nuestros datos…
Boletín informativo de AIMultiple
Reciba un correo electrónico gratuito a la semana con las últimas noticias tecnológicas B2B y análisis de expertos para impulsar su empresa.