Premium
Servicios
Premium
Ekrem Sarı

Ekrem Sarı

Investigador de IA
37 Artículos
Mantente al día sobre tecnología B2B.

Ekrem es investigador de IA y científico de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.

Experiencia profesional

En AIMultiple, Ekrem evalúa sistemas de IA de extremo a extremo y crea los flujos de trabajo de datos y los paneles que se usan para rastrear métricas de benchmark y de producto. Sus benchmarks cubren modelos de embedding y reranker, bases de datos vectoriales y de grafos, motores de inference, cuantización, concurrencia de GPU y escalado multi-GPU, precios y proveedores de GPU en la nube, text-to-SQL, y frameworks de RAG y RAG agéntico.

Antes de AIMultiple, trabajó como científico de datos en Yandex, donde consultó y analizó grandes datasets con SQL para evaluar la calidad de búsqueda y ranking según directrices detalladas.

Intereses de investigación

El trabajo de Ekrem se centra en medir cómo funcionan en la práctica los sistemas de LLM y de recuperación. Diseña el banco de pruebas, ejecuta las cargas de trabajo en hardware real y compara modelos, frameworks e infraestructura en precisión, rendimiento, latencia, costo y escalabilidad, en toda la pila, desde modelos de embedding y bases de datos vectoriales hasta motores de inference e infraestructura de GPU. Su tesis de maestría automatiza revisiones sistemáticas de literatura con un pipeline basado en RAG.

Educación

Ekrem tiene un MSc en Sistemas de Información Gerencial por la Universidad de Başkent, donde su tesis automatizó revisiones sistemáticas de literatura con un pipeline basado en RAG, y está cursando un segundo MSc en Ingeniería de Datos y del Conocimiento en la Universidad de Hacettepe.

Últimos artículos de Ekrem

IA
Benchmark
9 de sep

Benchmark de 40+ LLMs en finanzas: Claude Fable 5 y GPT-5.6 Sol

Evaluamos LLMs en 238 preguntas difíciles del benchmark FinanceReasoning (Tang et al.).1 Este subconjunto aborda las tareas de razonamiento financiero más desafiantes, evaluando razonamiento cuantitativo complejo de múltiples pasos que implica conceptos y fórmulas financieras. Nuestra evaluación empleó un diseño de prompt personalizado y criterios de puntuación de exactitud y consumo de tokens. Para una…

IA
Benchmark
4 de sep

Benchmark de bases de datos vectoriales: 7 motores de código abierto para RAG

Evaluamos siete bases de datos vectoriales de código abierto y autogestionadas como capa de recuperación de un pipeline de RAG, cada una ejecutada una a la vez sobre los mismos embeddings bge-m3 y consultas médicas y técnicas reales, de modo que el índice de la base de datos fuera la única variable. La carga de…

IA
Benchmark
31 de ago

Precios, rendimiento y comparativa de proveedores de GPU en la nube

Los precios de lista de GPU en la nube para el mismo modelo pueden variar varias veces de un proveedor a otro. Hemos recopilado la tarifa más baja, el proveedor, el rango de mercado y la mediana para más de 40 configuraciones de GPU en los tres niveles de precios, además de una prueba comparativa…

IA
Benchmark
31 de ago

RAG Herramientas de evaluación: Weights & Biases vs Ragas vs DeepEval

Cuando un pipeline de RAG recupera el contexto incorrecto, el LLM genera con confianza la respuesta incorrecta. Los evaluadores de relevancia del contexto son la principal defensa. Comparamos cinco herramientas en 1.460 preguntas y 14.600+ contextos evaluados bajo condiciones idénticas: el mismo modelo juez (GPT-4o), configuraciones predeterminadas y sin prompts personalizados. En condiciones estándar, WandB,…

IA
Benchmark
31 de ago

Modelos de embedding: OpenAI vs Gemini vs Voyage

Evaluamos 15 modelos de embedding de texto en inglés y una línea base BM25 en más de 500 consultas curadas manualmente en tres dominios de recuperación: contratos legales (CUAD), soporte al cliente (IBM TechQA) y atención médica (MedRAG PubMed). Voyage-3.5 ocupa el primer puesto en general. Perplexity Embed V1 0.6b alcanza el nivel medio-alto al…

IA
Benchmark
31 de ago

RAG Frameworks: LangChain frente a LangGraph frente a LlamaIndex

Comparamos 5 frameworks RAG: LangChain, LangGraph, LlamaIndex, Haystack y DSPy, construyendo el mismo flujo de trabajo RAG agéntico con componentes estandarizados: modelos idénticos (GPT-4.1-mini), embeddings (BGE-small), recuperador (Qdrant) y herramientas (búsqueda web de Tavily). Esto aísla la verdadera sobrecarga y eficiencia de tokens de cada framework. El benchmark consistió en 100 consultas, y cada framework…

IA
Benchmark
31 de ago

Benchmark de modelos de embedding de código abierto para RAG

NVIDIA Llama-Embed-Nemotron-8B lidera en precisión. En coste, Google EmbeddingGemma-300m funciona aproximadamente 4x más barato que Nemotron a costa de una pequeña pérdida de precisión. nDCG@3: Ganancia acumulada descontada normalizada con corte en 3. Con un documento relevante por consulta, es 1 / log2(rango + 1) cuando el documento dorado entra en el top 3, y…

IA
Benchmark
31 de ago

Mejores RAG herramientas, frameworks y bibliotecas

RAG mejora las respuestas de los LLM al fundamentarlas en datos externos en lugar de solo en lo que el modelo memorizó durante el entrenamiento. Evaluamos los componentes con los que se construye un sistema RAG y reunimos los resultados en un solo lugar, junto con una guía práctica para elegir cada parte del stack.…

Agentic AI
Benchmark
20 de ago

Búsqueda agéntica: Benchmark de 8 APIs de búsqueda para agentes

La búsqueda agéntica desempeña un papel crucial para cerrar la brecha entre los motores de búsqueda tradicionales y las capacidades de búsqueda con IA. Las APIs de búsqueda son la primera capa de una herramienta agéntica, donde el rendimiento limita la calidad de todo lo que viene después. Evaluamos comparativamente 8 APIs de búsqueda en…

IA
Benchmark
14 de ago

Modelos de embedding multimodal: Apple vs Meta vs OpenAI

Los modelos de embedding multimodal destacan en la identificación de objetos, pero tienen dificultades con las relaciones. Los modelos actuales luchan por distinguir “teléfono sobre un mapa” de “mapa sobre un teléfono”. Comparamos 7 modelos líderes en MS-COCO y Winoground para medir esta limitación específica. Para garantizar una comparación justa, evaluamos cada modelo en condiciones…