Ekrem Sarı
Ekrem es investigador de IA y analista de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.
Experiencia profesional
En AIMultiple, Ekrem realiza benchmarks de sistemas de IA de extremo a extremo y construye los flujos de trabajo de datos y paneles utilizados para rastrear métricas de benchmark y producto. Sus benchmarks cubren models de embedding y reranker, bases de datos vectoriales y de grafos, motores de inference, cuantización, concurrencia de GPU y escalado multi-GPU, precios y proveedores de GPU en la nube, texto a SQL, y frameworks de RAG y RAG agéntico.
Antes de AIMultiple, trabajó como evaluador en Yandex, donde evaluó la calidad de búsqueda y etiquetó grandes volúmenes de datos según directrices detalladas para respaldar la calidad del ranking y del model.
Interés de investigación
El trabajo de Ekrem se centra en el ciclo de vida de MLOps y LLMOps y en medir el rendimiento de los sistemas de IA. Compara models, frameworks e infraestructura en métricas como precisión, rendimiento, coste de API y escalabilidad, en toda la pila, desde models de embedding y bases de datos vectoriales hasta GPU e infraestructura en la nube. Su tesis de máster automatiza revisiones sistemáticas de literatura con un pipeline basado en RAG.
Educación
Ekrem tiene una licenciatura de la Universidad Hacettepe y está completando un máster en la Universidad de Başkent.
Últimos artículos de Ekrem
Benchmark de models de embedding de código abierto para RAG
NVIDIA Llama-Embed-Nemotron-8B lidera en precisión. En coste, Google EmbeddingGemma-300m se ejecuta aproximadamente 4x más barato que Nemotron a costa de una pequeña pérdida de precisión. nDCG@3: Ganancia acumulada descontada normalizada con corte en 3. Con un documento relevante por consulta, es 1 / log2(rango + 1) cuando el documento gold queda en las 3 primeras…
Modelos de embedding multimodal: Apple vs Meta vs OpenAI
Los modelos de embedding multimodal destacan en la identificación de objetos, pero tienen dificultades con las relaciones. Los modelos actuales luchan por distinguir “teléfono sobre un mapa” de “mapa sobre un teléfono”. Comparamos 7 modelos líderes en MS-COCO y Winoground para medir esta limitación específica. Para garantizar una comparación justa, evaluamos cada modelo en condiciones…
Benchmark de 40+ LLMs en Finanzas: Claude Fable 5 y GPT-5.6 Sol
Evaluamos LLMs en 238 preguntas difíciles del benchmark FinanceReasoning (Tang et al.).1 Este subconjunto se centra en las tareas de razonamiento financiero más desafiantes, evaluando el razonamiento cuantitativo complejo de varios pasos que involucra conceptos y fórmulas financieras. Nuestra evaluación empleó un diseño de prompt personalizado y criterios de puntuación de precisión y consumo de…
Modelos de embedding: OpenAI vs Gemini vs Voyage
Hicimos un benchmark de 15 modelos de embedding de texto en inglés y una línea base BM25 en más de 500 consultas curadas manualmente en tres dominios de recuperación: contratos legales (CUAD), soporte al cliente (IBM TechQA) y atención médica (MedRAG PubMed). Voyage-3.5 ocupa el primer lugar en general. Perplexity Embed V1 0.6b alcanza el…
Benchmark de software de archivado de correo electrónico
Aprovisionamos un tenant de Microsoft 365, lo poblamos con un corpus sintético de 10.000 correos y 1.700 adjuntos en 8 subtipos de tipo de archivo y luego comparamos NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving y MailPiler en el mismo tenant en 10 dimensiones que cubren ingesta, búsqueda, recuperación…
Scraper de comercio electrónico: 4 proveedores evaluados
Comparamos cuatro proveedores de datos web en 100 dominios de comercio electrónico, extrayendo 65.000 páginas de producto y de búsqueda cada uno, a entre 5 y 5.000 solicitudes simultáneas. Promediado entre los niveles de concurrencia, Bright Data alcanzó la mayor tasa de éxito (76 %) con una mediana de 16 segundos. Apify registró el tiempo de…
Benchmark de recuperación ante desastres: Acronis vs Comet vs MSP360
Comparamos Acronis Cyber Protect Cloud, Comet Backup y MSP360 Managed Backup en recuperación ante desastres. Cada proveedor creó una imagen de un servidor Windows Server 2022 en vivo y un servidor Ubuntu 24.04 en vivo que ejecutaban la misma carga de trabajo determinista: un servicio web, una base de datos de 10.000 filas y 50…
Comparativa de bases de datos de grafos: Neo4j vs FalkorDB vs Memgraph
Comparamos Neo4j, FalkorDB y Memgraph en un grafo sintético derivado de 120.000 reseñas de productos de Amazon (381K nodos, 804K aristas). Ejecutamos 12 plantillas de consultas con 1.000 mediciones cada una, probamos la ingesta con 6 tamaños de lote, mantuvimos carga concurrente durante 60 segundos con hasta 32 hilos, y medimos memoria, arranque en frío,…
Detección de bots: 9 proveedores anti-bot evaluados con benchmarks
Ejecutamos dos benchmarks contra sitios web reales, luego identificamos la empresa anti-bot que protege cada dominio y medimos con qué frecuencia los dominios de cada empresa devolvieron el contenido que solicitamos. Esto abarca más de 3.800 dominios etiquetados y más de 50.000 solicitudes. El primer benchmark recuperó páginas de producto y búsqueda en 100 dominios…
Principales 30+ Fabricantes de Chips de IA: NVIDIA y Sus Competidores
Basándonos en nuestra experiencia ejecutando el benchmark de GPU en la nube de AIMultiple con 10 modelos diferentes de GPU en 4 escenarios distintos, estas son las principales empresas de hardware de IA para cargas de trabajo de centros de datos. *El chip de IA seleccionado es la pieza, plataforma o proyecto anunciado que mejor…
Boletín informativo de AIMultiple
Reciba un correo electrónico gratuito a la semana con las últimas noticias tecnológicas B2B y análisis de expertos para impulsar su empresa.