Ekrem Sarı
Ekrem es investigador de IA en AIMultiple, donde se centra en la automatización inteligente, las GPU, los agentes de IA y las LLMOps para marcos RAG.
Experiencia profesional
Durante su etapa como evaluador en Yandex, evaluó los resultados de búsqueda utilizando marcos de trabajo propios y protocolos automatizados. Implementó pruebas de control de calidad mediante la anotación de datos, la puntuación de relevancia y el mapeo de la intención del usuario en más de 10 000 consultas mensuales, al tiempo que realizaba evaluaciones técnicas, incluyendo la monitorización del rendimiento y la detección de spam mediante bucles de retroalimentación de aprendizaje automático.Intereses de investigación
En AIMultiple, su investigación se centra en el ciclo de vida de MLOps y en el rendimiento y la evaluación comparativa de sistemas de IA de extremo a extremo. Colabora en una amplia gama de proyectos, incluyendo la optimización de la Generación Aumentada por Recuperación (RAG), la evaluación comparativa exhaustiva de Modelos de Lenguaje a Gran Escala (LLM) y el diseño de marcos de IA basados en agentes. Ekrem se especializa en el desarrollo de metodologías basadas en datos para medir y mejorar el rendimiento de la tecnología de IA en métricas operativas críticas como la precisión, la eficiencia, el coste de la API y la escalabilidad. Su análisis abarca toda la pila tecnológica, desde componentes fundamentales como los modelos de incrustación y las bases de datos vectoriales hasta la GPU de alto rendimiento y la infraestructura en la nube necesarias para implementar agentes de IA.Educación
Ekrem tiene una licenciatura de Hacettepe Üniversitesi y una maestría de Başkent Üniversitesi.Últimos artículos de Ekrem
RAG Herramientas de evaluación: Weights & Biases vs Ragas vs DeepEval
Cuando un pipeline de RAG recupera el contexto incorrecto, el LLM genera con confianza la respuesta equivocada. Los evaluadores de relevancia contextual son la defensa principal. Evaluamos cinco herramientas en 1,460 preguntas y más de 14,600 contextos puntuados bajo condiciones idénticas: mismo modelo juez (GPT-4o), configuraciones predeterminadas y sin prompts personalizados. En condiciones estándar, WandB,…
Navegadores Remotos: Infraestructura Web para Agentes de IA Comparados
Los agentes de IA dependen de navegadores remotos para automatizar tareas web sin ser bloqueados por medidas anti-scraping. El rendimiento de esta infraestructura de navegador es crítico para el éxito de un agente. Comparamos 8 proveedores en tasa de éxito, velocidad y características. Para esto, ejecutamos 160 tareas automatizadas, ejecutando 4 escenarios distintos 5 veces…
Prueba de referencia de base de datos de grafos: Neo4j vs FalkorDB vs Memgraph
Realizamos pruebas de referencia de Neo4j, FalkorDB y Memgraph en un grafo sintético derivado de 120,000 reseñas de productos de Amazon (381K nodos, 804K aristas). Ejecutamos 12 plantillas de consultas con 1,000 mediciones cada una, probamos la ingestión en 6 tamaños de lote, mantenemos carga concurrente durante 60 segundos con hasta 32 hilos, y medimos…
LLM Motores de Inferencia: vLLM vs LMDeploy vs SGLang
Evaluamos comparativamente 3 motores de inferencia de LLM líderes en hardware NVIDIA H100: vLLM, LMDeploy y SGLang. Cada motor procesó cargas de trabajo idénticas: 1,000 prompts de ShareGPT usando Llama 3.1 8B-Instruct para aislar el verdadero impacto en el rendimiento de sus decisiones arquitectónicas y estrategias de optimización. Medimos el rendimiento por lotes sin conexión…
Los 10 mejores Modelos de Embedding Multilingüe para RAG
Evaluamos 10 modelos de embedding multilingüe en ~606k reseñas de Amazon en 6 idiomas (Alemán, Inglés, Español, Francés, Japonés, Chino). Generamos 1,800 consultas (300 por idioma), cada una haciendo referencia a detalles concretos de su reseña fuente. Los modelos entrenados para búsqueda (separación consulta vs documento) superan a modelos más grandes entrenados para similitud de…
Múltiple GPU Benchmark: B200 vs H200 vs H100 vs MI300X
Durante más de dos décadas, optimizar el rendimiento de cálculo ha sido una piedra angular de mi trabajo. Realizamos pruebas de rendimiento de las B200, H200, H100 de NVIDIA y la MI300X de AMD para evaluar su escalabilidad en la inferencia de Modelos de Lenguaje Grande (LLM). Utilizando el framework vLLM con el modelo meta-llama/Llama-3.1-8B-Instruct,…
Modelos de Embedding: OpenAI vs Gemini vs Voyage
Evaluamos 15 modelos de embedding de texto en inglés y una línea base BM25 en más de 500 consultas curadas manualmente en tres dominios de recuperación: contratos legales (CUAD), soporte al cliente (IBM TechQA) y atención médica (MedRAG PubMed). Voyage-3.5 ocupa el primer lugar general. Perplexity Embed V1 0.6b alcanza el nivel medio-alto al precio…
RAG Frameworks: LangChain vs LangGraph vs LlamaIndex
Comparamos 5 RAG frameworks: LangChain, LangGraph, LlamaIndex, Haystack y DSPy, construyendo el mismo flujo de trabajo RAG agéntico con componentes estandarizados: modelos idénticos (GPT-4.1-mini), embeddings (BGE-small), recuperador (Qdrant) y herramientas (búsqueda web Tavily). Esto aísla la sobrecarga real y la eficiencia de tokens de cada framework. El benchmark consistió en 100 consultas, con cada framework…
Benchmark de Reranker: Comparación de los 8 Mejores Modelos
Evaluamos 8 modelos de reranking en ~145k reseñas de Amazon en inglés para medir cuánto mejora una etapa de reranking la recuperación densa. Recuperamos los 100 candidatos principales con multilingual-e5-base, los reordenamos con cada modelo y evaluamos los 10 mejores resultados frente a 300 consultas, cada una haciendo referencia a detalles concretos de su reseña…
Búsqueda agéntica: Comparativa de 8 APIs de búsqueda para agentes
La búsqueda agentic desempeña un papel crucial para cerrar la brecha entre los motores de búsqueda tradicionales y las capacidades de búsqueda de IA. Las APIs de búsqueda son la primera capa de una herramienta agentic, donde el rendimiento limita la calidad de todo lo que viene después. Hemos realizado una comparativa de 8 APIs…
Boletín informativo de AIMultiple
Reciba un correo electrónico gratuito a la semana con las últimas noticias tecnológicas B2B y análisis de expertos para impulsar su empresa.