Servicios
Contáctanos
Ekrem Sarı

Ekrem Sarı

Investigador de IA
35 Artículos
Mantente al día sobre tecnología B2B.

Ekrem es investigador de IA y científico de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.

Experiencia profesional

En AIMultiple, Ekrem evalúa sistemas de IA de extremo a extremo y crea los flujos de trabajo de datos y los paneles que se usan para rastrear métricas de benchmark y de producto. Sus benchmarks cubren modelos de embedding y reranker, bases de datos vectoriales y de grafos, motores de inference, cuantización, concurrencia de GPU y escalado multi-GPU, precios y proveedores de GPU en la nube, text-to-SQL, y frameworks de RAG y RAG agéntico.

Antes de AIMultiple, trabajó como científico de datos en Yandex, donde consultó y analizó grandes datasets con SQL para evaluar la calidad de búsqueda y ranking según directrices detalladas.

Intereses de investigación

El trabajo de Ekrem se centra en medir cómo funcionan en la práctica los sistemas de LLM y de recuperación. Diseña el banco de pruebas, ejecuta las cargas de trabajo en hardware real y compara modelos, frameworks e infraestructura en precisión, rendimiento, latencia, costo y escalabilidad, en toda la pila, desde modelos de embedding y bases de datos vectoriales hasta motores de inference e infraestructura de GPU. Su tesis de maestría automatiza revisiones sistemáticas de literatura con un pipeline basado en RAG.

Educación

Ekrem tiene un MSc en Sistemas de Información Gerencial por la Universidad de Başkent, donde su tesis automatizó revisiones sistemáticas de literatura con un pipeline basado en RAG, y está cursando un segundo MSc en Ingeniería de Datos y del Conocimiento en la Universidad de Hacettepe.

Últimos artículos de Ekrem

IA
Benchmark
2 de Sep

Comparación de modelos fundacionales relacionales

Comparamos SAP-RPT-1-OSS contra el gradient boosting (LightGBM, CatBoost) en 17 conjuntos de datos tabulares que abarcan el espectro semántico-numérico, tablas pequeñas/de alta semántica, conjuntos de datos de negocio mixtos y grandes conjuntos de datos numéricos de baja semántica. Nuestro objetivo es medir dónde los priores semánticos preentrenados de un LLM relacional pueden ofrecer ventajas frente…

IA
Evaluación en Mundo Abierto
31 de Ago

Top 70+ proveedores de GPU en la nube

Los proveedores de GPU en la nube se dividen en tres niveles. Los hiperescaladores ejecutan plataformas de nube amplias con el alquiler de GPU como un producto entre muchos. Los neoclouds especializados se centran en la infraestructura de GPU e IA como su producto principal. Los mercados comunitarios agregan inventario de muchos operadores pequeños, a…

IA
Benchmark
31 de Ago

Precios, rendimiento y comparativa de proveedores de GPU en la nube

Los precios de lista de GPU en la nube para el mismo modelo pueden variar varias veces de un proveedor a otro. Hemos recopilado la tarifa más baja, el proveedor, el rango de mercado y la mediana para más de 40 configuraciones de GPU en los tres niveles de precios, además de una prueba comparativa…

IA
Benchmark
31 de Ago

RAG Herramientas de evaluación: Weights & Biases vs Ragas vs DeepEval

Cuando un pipeline de RAG recupera el contexto incorrecto, el LLM genera con confianza la respuesta incorrecta. Los evaluadores de relevancia del contexto son la principal defensa. Comparamos cinco herramientas en 1.460 preguntas y 14.600+ contextos evaluados bajo condiciones idénticas: el mismo modelo juez (GPT-4o), configuraciones predeterminadas y sin prompts personalizados. En condiciones estándar, WandB,…

IA
Benchmark
31 de Ago

Modelos de embedding: OpenAI vs Gemini vs Voyage

Evaluamos 15 modelos de embedding de texto en inglés y una línea base BM25 en más de 500 consultas curadas manualmente en tres dominios de recuperación: contratos legales (CUAD), soporte al cliente (IBM TechQA) y atención médica (MedRAG PubMed). Voyage-3.5 ocupa el primer puesto en general. Perplexity Embed V1 0.6b alcanza el nivel medio-alto al…

IA
Benchmark
31 de Ago

RAG Frameworks: LangChain frente a LangGraph frente a LlamaIndex

Comparamos 5 frameworks RAG: LangChain, LangGraph, LlamaIndex, Haystack y DSPy, construyendo el mismo flujo de trabajo RAG agéntico con componentes estandarizados: modelos idénticos (GPT-4.1-mini), embeddings (BGE-small), recuperador (Qdrant) y herramientas (búsqueda web de Tavily). Esto aísla la verdadera sobrecarga y eficiencia de tokens de cada framework. El benchmark consistió en 100 consultas, y cada framework…

Ciberseguridad
Benchmark
31 de Ago

Benchmark de software de copias de seguridad: Acronis vs NinjaOne vs Comet vs MSP360

Comparamos NinjaOne Backup, Acronis Cyber Protect Cloud Backup, Comet Backup y MSP360 Managed Backup en una infraestructura AWS idéntica. Cada proveedor ejecutó una copia de seguridad en modo archivo de la misma carga de trabajo de 625.946 archivos / 50 GB y una copia de seguridad completa de imagen del disco del sistema; luego restauró…

IA
Benchmark
31 de Ago

Benchmark de modelos de embedding de código abierto para RAG

NVIDIA Llama-Embed-Nemotron-8B lidera en precisión. En coste, Google EmbeddingGemma-300m funciona aproximadamente 4x más barato que Nemotron a costa de una pequeña pérdida de precisión. nDCG@3: Ganancia acumulada descontada normalizada con corte en 3. Con un documento relevante por consulta, es 1 / log2(rango + 1) cuando el documento dorado entra en el top 3, y…

IA
Benchmark
31 de Ago

Reranker Benchmark: Top 8 Models comparados

Evaluamos 8 models de reranker en ~145k reseñas en inglés de Amazon para medir cuánto mejora la recuperación densa una etapa de reranking. Recuperamos los 100 principales candidatos con multilingual-e5-base, los rerankeamos con cada model y evaluamos los 10 primeros resultados frente a 300 consultas, cada una referenciando detalles concretos de su reseña de origen.…

IA
Análisis
31 de Ago

LLM Calculadora de VRAM para alojamiento propio

Alojar por tu cuenta un LLM implica ejecutar la inferencia en hardware que controla el operador, en lugar de a través de una API de terceros, lo que cambia el coste, el control de los datos y el perfil de privacidad. El hecho de que un modelo pueda ejecutarse depende de la memoria. La calculadora…