Servicios
Contáctanos
Ekrem Sarı

Ekrem Sarı

Investigador de IA
35 Artículos
Mantente al día sobre tecnología B2B.

Ekrem es investigador de IA y analista de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.

Experiencia profesional

En AIMultiple, Ekrem realiza benchmarks de sistemas de IA de extremo a extremo y construye los flujos de trabajo de datos y paneles utilizados para rastrear métricas de benchmark y producto. Sus benchmarks cubren models de embedding y reranker, bases de datos vectoriales y de grafos, motores de inference, cuantización, concurrencia de GPU y escalado multi-GPU, precios y proveedores de GPU en la nube, texto a SQL, y frameworks de RAG y RAG agéntico.

Antes de AIMultiple, trabajó como evaluador en Yandex, donde evaluó la calidad de búsqueda y etiquetó grandes volúmenes de datos según directrices detalladas para respaldar la calidad del ranking y del model.

Interés de investigación

El trabajo de Ekrem se centra en el ciclo de vida de MLOps y LLMOps y en medir el rendimiento de los sistemas de IA. Compara models, frameworks e infraestructura en métricas como precisión, rendimiento, coste de API y escalabilidad, en toda la pila, desde models de embedding y bases de datos vectoriales hasta GPU e infraestructura en la nube. Su tesis de máster automatiza revisiones sistemáticas de literatura con un pipeline basado en RAG.

Educación

Ekrem tiene una licenciatura de la Universidad Hacettepe y está completando un máster en la Universidad de Başkent.

Últimos artículos de Ekrem

IA
Benchmark
4 de Ago

Benchmark de rerankers: comparación de los 8 mejores modelos

Comparamos 8 modelos de reranking en ~145k reseñas en inglés de Amazon para medir cuánto mejora la recuperación densa una etapa de reranking. Recuperamos los 100 candidatos principales con multilingual-e5-base, los rerankeamos con cada modelo y evaluamos los 10 mejores resultados frente a 300 consultas, cada una haciendo referencia a detalles concretos de su reseña…

Datos
Benchmark
30 de Jul

Web Scraping a Gran Escala: 7 Proveedores Comparados

Ejecutamos dos pruebas de rendimiento contra sitios web en vivo, desde 5 hasta 5.000 solicitudes concurrentes. La primera envió 260.000 solicitudes a través de cuatro desbloqueadores web en los 10.000 dominios principales de Tranco, además de una prueba de extracción de Markdown en 10.000 URLs. La segunda recuperó 65.000 páginas de productos y búsqueda de…

IA
Evaluación en Mundo Abierto
23 de Jul

Comparación de los 6 mejores servicios gratuitos de Cloud GPU

El mejor nivel gratis de GPU vale alrededor de $19 al mes en tarifas de alquiler, y ocho plataformas ofrecen una GPU real sin tarjeta de crédito. Seis de ellas limitan el uso gratis por mes, y hemos valorado esos precios según la tarifa bajo demanda más barata actual para cada GPU en nuestros datos…

IA
Benchmark
20 de Jul

Calculadora de dimensionamiento y selección de bases de datos vectoriales

La pregunta práctica detrás de una base de datos vectorial autogestionada para RAG es qué motor se ajusta a un servidor dado y cuál descarta la carga de trabajo. La calculadora a continuación responde ambas, a partir de nuestro benchmark de siete bases de datos vectoriales autogestionadas ejecutadas con recall emparejado sobre incrustaciones idénticas. Cinco…

IA
Benchmark
18 de Jul

Mejores herramientas, frameworks y bibliotecas de RAG

RAG mejora las respuestas de los LLM al basarlas en datos externos en lugar de solo en lo que el modelo memorizó durante el entrenamiento. Hemos evaluado los componentes con los que se construye un sistema RAG y recopilado los resultados en un solo lugar, con una guía práctica para elegir cada parte del stack.…

IA
Benchmark
18 de Jul

Comparativa de Bases de Datos Vectoriales: 7 Motores de Código Abierto para RAG

Comparamos siete bases de datos vectoriales autogestionadas de código abierto como capa de recuperación de un pipeline de RAG, ejecutándose cada una por separado sobre los mismos embeddings bge-m3 y consultas reales médicas y técnicas, de modo que el índice de la base de datos fue la única variable. La carga de trabajo abarcó MedRAG-50k,…

IA
Benchmark
16 de Jul

Precios, rendimiento y comparativa de proveedores de GPU en la nube

Los precios de lista de GPU en la nube para el mismo modelo pueden diferir varias veces de un proveedor a otro. Hemos seleccionado la tarifa más baja, el proveedor, el rango de mercado y la mediana para más de 40 configuraciones de GPU en los tres niveles de precios, además de un benchmark de…

IA
Análisis
12 de Jul

LLM Calculadora de VRAM para Autohospedaje

Autohospedar un LLM significa ejecutar la inferencia en hardware controlado por el operador en lugar de a través de una API de terceros, lo que cambia el costo, el control de datos y el perfil de privacidad. El que un modelo pueda ejecutarse depende de la memoria. La calculadora estima la VRAM o la memoria…

Software Empresarial
Benchmark
2 de Jul

Las mejores funciones serverless: Vercel vs Azure vs AWS

Las funciones serverless permiten a los desarrolladores ejecutar código sin tener que gestionar un servidor. Esto les permite centrarse en escribir y desplegar aplicaciones mientras el escalado de la infraestructura y el mantenimiento se gestionan automáticamente en segundo plano. En esta comparativa, evaluamos a 7 proveedores de servicios en la nube populares siguiendo nuestra metodología…

IA
Benchmark
2 de Jul

RAG Herramientas de evaluación: Weights & Biases vs Ragas vs DeepEval

Cuando un pipeline de RAG recupera el contexto incorrecto, el LLM genera con confianza la respuesta equivocada. Los evaluadores de relevancia contextual son la defensa principal. Evaluamos cinco herramientas en 1.460 preguntas y más de 14.600 contextos puntuados bajo condiciones idénticas: mismo modelo juez (GPT-4o), configuraciones predeterminadas y sin prompts personalizados. En condiciones estándar, WandB,…