Ekrem Sarı
Ekrem es investigador de IA y científico de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.
Experiencia profesional
En AIMultiple, Ekrem evalúa sistemas de IA de extremo a extremo y crea los flujos de trabajo de datos y los paneles que se usan para rastrear métricas de benchmark y de producto. Sus benchmarks cubren modelos de embedding y reranker, bases de datos vectoriales y de grafos, motores de inference, cuantización, concurrencia de GPU y escalado multi-GPU, precios y proveedores de GPU en la nube, text-to-SQL, y frameworks de RAG y RAG agéntico.
Antes de AIMultiple, trabajó como científico de datos en Yandex, donde consultó y analizó grandes datasets con SQL para evaluar la calidad de búsqueda y ranking según directrices detalladas.
Intereses de investigación
El trabajo de Ekrem se centra en medir cómo funcionan en la práctica los sistemas de LLM y de recuperación. Diseña el banco de pruebas, ejecuta las cargas de trabajo en hardware real y compara modelos, frameworks e infraestructura en precisión, rendimiento, latencia, costo y escalabilidad, en toda la pila, desde modelos de embedding y bases de datos vectoriales hasta motores de inference e infraestructura de GPU. Su tesis de maestría automatiza revisiones sistemáticas de literatura con un pipeline basado en RAG.
Educación
Ekrem tiene un MSc en Sistemas de Información Gerencial por la Universidad de Başkent, donde su tesis automatizó revisiones sistemáticas de literatura con un pipeline basado en RAG, y está cursando un segundo MSc en Ingeniería de Datos y del Conocimiento en la Universidad de Hacettepe.
Últimos artículos de Ekrem
Navegadores remotos: comparativa de infraestructura web para agentes de IA
Los agentes de IA dependen de navegadores remotos para automatizar tareas web sin ser bloqueados por medidas anti-scraping. El rendimiento de esta infraestructura de navegador es fundamental para el éxito de un agente. Comparamos 8 proveedores en tasa de éxito, velocidad y características. Para ello, ejecutamos 160 tareas automatizadas, ejecutando 4 escenarios distintos 5 veces…
Mejores RAG herramientas, frameworks y bibliotecas
RAG mejora las respuestas de los LLM al fundamentarlas en datos externos en lugar de solo en lo que el modelo memorizó durante el entrenamiento. Evaluamos los componentes con los que se construye un sistema RAG y reunimos los resultados en un solo lugar, junto con una guía práctica para elegir cada parte del stack.…
Los 30+ principales fabricantes de chips de IA: NVIDIA y sus competidores
Según nuestra experiencia ejecutando el benchmark de GPU en la nube de AIMultiple con 10 modelos de GPU diferentes en 4 escenarios distintos, estas son las principales empresas de hardware de IA para cargas de trabajo de centros de datos. *El chip de IA seleccionado es la pieza, plataforma o proyecto anunciado que mejor representa…
Índice de precios de alquiler de GPU en la nube
Las tarifas bajo demanda para las GPUs de última generación en la nube (B200, B300, MI300X, RTX 5090) casi se duplicaron durante el último año, mientras que las tarjetas convencionales (H100, H200, A100) se mantuvieron en una banda estrecha. Recopilamos el índice de GPU mensualmente a partir de 69 proveedores y 17 GPU models, cubriendo…
Text-to-SQL: Comparación de la precisión de los LLM
Ejecutamos 36 grandes modelos de lenguaje sobre 759 preguntas de BIRD-SQL; cada modelo escribió SQL contra una base de datos que tuvo que identificar por sí mismo entre 11 candidatas. Todas las consultas analizables se ejecutaron contra la base de datos real y su conjunto de resultados se comparó con el conjunto de resultados de…
GPU Benchmark de concurrencia: H100 vs H200 vs B200 vs MI300X
He pasado los últimos 20 años centrado en la optimización del rendimiento computacional a nivel de sistema. Evaluamos las NVIDIA GPU más recientes, incluidas las H100, H200 y B200 de NVIDIA, y la MI300X de AMD, para el análisis de escalado de concurrencia. Utilizando el framework vLLM con el gpt-oss-20b model, probamos cómo estas GPU…
Detección de bots: 9 proveedores anti-bot evaluados con benchmarks
Ejecutamos dos benchmarks contra sitios web reales, luego identificamos la empresa anti-bot que protege cada dominio y medimos con qué frecuencia los dominios de cada empresa devolvieron el contenido que solicitamos. Esto abarca más de 3.800 dominios etiquetados y más de 50.000 solicitudes. El primer benchmark recuperó páginas de producto y búsqueda en 100 dominios…
Scraper de comercio electrónico: 4 proveedores comparados
Comparamos cuatro proveedores de datos web en 100 dominios de comercio electrónico, obteniendo 65.000 páginas de producto y de búsqueda cada uno a entre 5 y 5.000 solicitudes simultáneas. Promediando entre los niveles de concurrencia, Bright Data alcanzó la mayor tasa de éxito (76 %) con una mediana de 16 segundos. Apify registró el mayor tiempo…
Búsqueda agéntica: Benchmark de 8 APIs de búsqueda para agentes
La búsqueda agéntica desempeña un papel crucial para cerrar la brecha entre los motores de búsqueda tradicionales y las capacidades de búsqueda con IA. Las APIs de búsqueda son la primera capa de una herramienta agéntica, donde el rendimiento limita la calidad de todo lo que viene después. Evaluamos comparativamente 8 APIs de búsqueda en…
Modelos de embedding multimodal: Apple vs Meta vs OpenAI
Los modelos de embedding multimodal destacan en la identificación de objetos, pero tienen dificultades con las relaciones. Los modelos actuales luchan por distinguir “teléfono sobre un mapa” de “mapa sobre un teléfono”. Comparamos 7 modelos líderes en MS-COCO y Winoground para medir esta limitación específica. Para garantizar una comparación justa, evaluamos cada modelo en condiciones…
Boletín informativo de AIMultiple
Reciba un correo electrónico gratuito a la semana con las últimas noticias tecnológicas B2B y análisis de expertos para impulsar su empresa.