Premium
Servicios
Premium
Ekrem Sarı

Ekrem Sarı

Investigador de IA
37 Artículos
Mantente al día sobre tecnología B2B.

Ekrem es investigador de IA y científico de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.

Experiencia profesional

En AIMultiple, Ekrem evalúa sistemas de IA de extremo a extremo y crea los flujos de trabajo de datos y los paneles que se usan para rastrear métricas de benchmark y de producto. Sus benchmarks cubren modelos de embedding y reranker, bases de datos vectoriales y de grafos, motores de inference, cuantización, concurrencia de GPU y escalado multi-GPU, precios y proveedores de GPU en la nube, text-to-SQL, y frameworks de RAG y RAG agéntico.

Antes de AIMultiple, trabajó como científico de datos en Yandex, donde consultó y analizó grandes datasets con SQL para evaluar la calidad de búsqueda y ranking según directrices detalladas.

Intereses de investigación

El trabajo de Ekrem se centra en medir cómo funcionan en la práctica los sistemas de LLM y de recuperación. Diseña el banco de pruebas, ejecuta las cargas de trabajo en hardware real y compara modelos, frameworks e infraestructura en precisión, rendimiento, latencia, costo y escalabilidad, en toda la pila, desde modelos de embedding y bases de datos vectoriales hasta motores de inference e infraestructura de GPU. Su tesis de maestría automatiza revisiones sistemáticas de literatura con un pipeline basado en RAG.

Educación

Ekrem tiene un MSc en Sistemas de Información Gerencial por la Universidad de Başkent, donde su tesis automatizó revisiones sistemáticas de literatura con un pipeline basado en RAG, y está cursando un segundo MSc en Ingeniería de Datos y del Conocimiento en la Universidad de Hacettepe.

Últimos artículos de Ekrem

IA
Benchmark
23 de sep

Agentic RAG Benchmark: enrutamiento entre 11 bases de datos SQL

La precisión de enrutamiento es el porcentaje de preguntas puntuadas en las que el modelo menciona explícitamente la base de datos correcta en su respuesta final. El titular utiliza las 184 preguntas marcadas como difíciles tanto por nuestra prueba de similitud como por un jurado de tres LLMs. Las declaraciones explícitas faltantes no reciben crédito.…

Ciberseguridad
Benchmark
22 de sep

Benchmark de software de copias de seguridad: Acronis vs NinjaOne vs Comet vs MSP360

Evaluamos NinjaOne Backup, Acronis Cyber Protect Cloud Backup, Comet Backup y MSP360 Managed Backup en una infraestructura AWS idéntica. Cada proveedor ejecutó una copia de seguridad en modo de archivos de la misma carga de trabajo de 625.946 archivos / 50 GB y una copia de seguridad completa de imagen del disco del sistema, y…

IA
Benchmark
22 de sep

Text-to-SQL: Comparación de la precisión de los LLM

Ejecutamos 36 grandes modelos de lenguaje sobre 759 preguntas de BIRD-SQL; cada modelo escribió SQL contra una base de datos que tuvo que identificar por sí mismo entre 11 candidatas. Todas las consultas analizables se ejecutaron contra la base de datos real y su conjunto de resultados se comparó con el conjunto de resultados de…

IA
Comparación de Funciones
22 de sep

Índice de precios de alquiler de GPU en la nube

Realizamos un seguimiento de los precios publicados de alquiler de GPU en la nube para 17 modelos entre 75 proveedores, con tarifas bajo demanda, spot y reservadas. El último lanzamiento registró el mayor aumento de precios entre los tres grupos. Su mediana bajo demanda subió de $2,12 por GPU-hora en octubre de 2024 a $4,72…

IA
Benchmark
22 de sep

Reranker Benchmark: Top 8 Models comparados

Evaluamos 8 models de reranker en ~145k reseñas en inglés de Amazon para medir cuánto mejora la recuperación densa una etapa de reranking. Recuperamos los 100 principales candidatos con multilingual-e5-base, los rerankeamos con cada model y evaluamos los 10 primeros resultados frente a 300 consultas, cada una referenciando detalles concretos de su reseña de origen.…

IA
Comparación de Funciones
21 de sep

Los 30+ principales fabricantes de chips de IA: NVIDIA y sus competidores

Según nuestra experiencia ejecutando el benchmark de GPU en la nube de AIMultiple, comparamos a los fabricantes de chips por producto, disponibilidad y arquitectura, abarcando GPUs de centros de datos, chips móviles, aceleradores de borde y fundiciones. Cada fila nombra un producto representativo, su tipo y su disponibilidad. La disponibilidad distingue entre hardware ofrecido para…

Ciberseguridad
Benchmark
21 de sep

Detección de bots: 9 proveedores anti-bot evaluados con benchmarks

Ejecutamos dos benchmarks contra sitios web reales, luego identificamos la empresa anti-bot que protege cada dominio y medimos con qué frecuencia los dominios de cada empresa devolvieron el contenido que solicitamos. Esto abarca más de 3.800 dominios etiquetados y más de 50.000 solicitudes. El primer benchmark recuperó páginas de producto y búsqueda en 100 dominios…

Datos
Benchmark
21 de sep

Navegadores remotos: comparativa de infraestructura web para agentes de IA

Los agentes de IA dependen de navegadores remotos para automatizar tareas web sin ser bloqueados por medidas anti-scraping. El rendimiento de esta infraestructura de navegador es fundamental para el éxito de un agente. Comparamos 8 proveedores en tasa de éxito, velocidad y características. Para ello, ejecutamos 160 tareas automatizadas, ejecutando 4 escenarios distintos 5 veces…

Datos
Benchmark
21 de sep

Web Scraping a Gran Escala: 7 Proveedores Comparados

Ejecutamos dos pruebas de rendimiento contra sitios web en vivo, desde 5 hasta 5.000 solicitudes concurrentes. La primera envió 260.000 solicitudes a través de cuatro desbloqueadores web en los 10.000 dominios principales de Tranco, además de una prueba de extracción de Markdown en 10.000 URLs. La segunda recuperó 65.000 páginas de productos y búsqueda de…

Datos
Benchmark
21 de sep

Scraper de comercio electrónico: 4 proveedores comparados

Comparamos cuatro proveedores de datos web en 100 dominios de comercio electrónico, obteniendo 65.000 páginas de producto y de búsqueda cada uno a entre 5 y 5.000 solicitudes simultáneas. Promediando entre los niveles de concurrencia, Bright Data alcanzó la mayor tasa de éxito (76 %) con una mediana de 16 segundos. Apify registró el mayor tiempo…