Ekrem Sarı
Ekrem es investigador de IA y analista de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.
Experiencia profesional
En AIMultiple, Ekrem realiza benchmarks de sistemas de IA de extremo a extremo y construye los flujos de trabajo de datos y paneles utilizados para rastrear métricas de benchmark y producto. Sus benchmarks cubren models de embedding y reranker, bases de datos vectoriales y de grafos, motores de inference, cuantización, concurrencia de GPU y escalado multi-GPU, precios y proveedores de GPU en la nube, texto a SQL, y frameworks de RAG y RAG agéntico.
Antes de AIMultiple, trabajó como evaluador en Yandex, donde evaluó la calidad de búsqueda y etiquetó grandes volúmenes de datos según directrices detalladas para respaldar la calidad del ranking y del model.
Interés de investigación
El trabajo de Ekrem se centra en el ciclo de vida de MLOps y LLMOps y en medir el rendimiento de los sistemas de IA. Compara models, frameworks e infraestructura en métricas como precisión, rendimiento, coste de API y escalabilidad, en toda la pila, desde models de embedding y bases de datos vectoriales hasta GPU e infraestructura en la nube. Su tesis de máster automatiza revisiones sistemáticas de literatura con un pipeline basado en RAG.
Educación
Ekrem tiene una licenciatura de la Universidad Hacettepe y está completando un máster en la Universidad de Başkent.
Últimos artículos de Ekrem
Benchmark de rerankers: comparación de los 8 mejores modelos
Comparamos 8 modelos de reranking en ~145k reseñas en inglés de Amazon para medir cuánto mejora la recuperación densa una etapa de reranking. Recuperamos los 100 candidatos principales con multilingual-e5-base, los rerankeamos con cada modelo y evaluamos los 10 mejores resultados frente a 300 consultas, cada una haciendo referencia a detalles concretos de su reseña…
Web Scraping a Gran Escala: 7 Proveedores Comparados
Ejecutamos dos pruebas de rendimiento contra sitios web en vivo, desde 5 hasta 5.000 solicitudes concurrentes. La primera envió 260.000 solicitudes a través de cuatro desbloqueadores web en los 10.000 dominios principales de Tranco, además de una prueba de extracción de Markdown en 10.000 URLs. La segunda recuperó 65.000 páginas de productos y búsqueda de…
Comparación de los 6 mejores servicios gratuitos de Cloud GPU
El mejor nivel gratis de GPU vale alrededor de $19 al mes en tarifas de alquiler, y ocho plataformas ofrecen una GPU real sin tarjeta de crédito. Seis de ellas limitan el uso gratis por mes, y hemos valorado esos precios según la tarifa bajo demanda más barata actual para cada GPU en nuestros datos…
Calculadora de dimensionamiento y selección de bases de datos vectoriales
La pregunta práctica detrás de una base de datos vectorial autogestionada para RAG es qué motor se ajusta a un servidor dado y cuál descarta la carga de trabajo. La calculadora a continuación responde ambas, a partir de nuestro benchmark de siete bases de datos vectoriales autogestionadas ejecutadas con recall emparejado sobre incrustaciones idénticas. Cinco…
Mejores herramientas, frameworks y bibliotecas de RAG
RAG mejora las respuestas de los LLM al basarlas en datos externos en lugar de solo en lo que el modelo memorizó durante el entrenamiento. Hemos evaluado los componentes con los que se construye un sistema RAG y recopilado los resultados en un solo lugar, con una guía práctica para elegir cada parte del stack.…
Comparativa de Bases de Datos Vectoriales: 7 Motores de Código Abierto para RAG
Comparamos siete bases de datos vectoriales autogestionadas de código abierto como capa de recuperación de un pipeline de RAG, ejecutándose cada una por separado sobre los mismos embeddings bge-m3 y consultas reales médicas y técnicas, de modo que el índice de la base de datos fue la única variable. La carga de trabajo abarcó MedRAG-50k,…
Precios, rendimiento y comparativa de proveedores de GPU en la nube
Los precios de lista de GPU en la nube para el mismo modelo pueden diferir varias veces de un proveedor a otro. Hemos seleccionado la tarifa más baja, el proveedor, el rango de mercado y la mediana para más de 40 configuraciones de GPU en los tres niveles de precios, además de un benchmark de…
LLM Calculadora de VRAM para Autohospedaje
Autohospedar un LLM significa ejecutar la inferencia en hardware controlado por el operador en lugar de a través de una API de terceros, lo que cambia el costo, el control de datos y el perfil de privacidad. El que un modelo pueda ejecutarse depende de la memoria. La calculadora estima la VRAM o la memoria…
Las mejores funciones serverless: Vercel vs Azure vs AWS
Las funciones serverless permiten a los desarrolladores ejecutar código sin tener que gestionar un servidor. Esto les permite centrarse en escribir y desplegar aplicaciones mientras el escalado de la infraestructura y el mantenimiento se gestionan automáticamente en segundo plano. En esta comparativa, evaluamos a 7 proveedores de servicios en la nube populares siguiendo nuestra metodología…
RAG Herramientas de evaluación: Weights & Biases vs Ragas vs DeepEval
Cuando un pipeline de RAG recupera el contexto incorrecto, el LLM genera con confianza la respuesta equivocada. Los evaluadores de relevancia contextual son la defensa principal. Evaluamos cinco herramientas en 1.460 preguntas y más de 14.600 contextos puntuados bajo condiciones idénticas: mismo modelo juez (GPT-4o), configuraciones predeterminadas y sin prompts personalizados. En condiciones estándar, WandB,…
Boletín informativo de AIMultiple
Reciba un correo electrónico gratuito a la semana con las últimas noticias tecnológicas B2B y análisis de expertos para impulsar su empresa.