Ekrem Sarı
Ekrem es investigador de IA y analista de datos en AIMultiple. Diseña y ejecuta evaluaciones comparativas prácticas para sistemas de IA y LLM.
Experiencia Profesional
En AIMultiple, Ekrem realiza evaluaciones comparativas de sistemas de IA de extremo a extremo y crea los flujos de trabajo de datos y paneles utilizados para realizar el seguimiento de las métricas de los productos y las evaluaciones comparativas. Sus evaluaciones comparativas cubren modelos de embedding y reranker, bases de datos vectoriales y de grafos, motores de inference, cuantificación, concurrencia de GPU y escalado multi-GPU, precios y proveedores de GPU en la nube, texto a SQL, y marcos de trabajo de RAG y RAG agéntico.
Antes de AIMultiple, trabajó como evaluador en Yandex, donde evaluaba la calidad de las búsquedas y etiquetaba grandes volúmenes de datos según pautas detalladas para respaldar la calidad del ranking y de los modelos.
Interés de Investigación
El trabajo de Ekrem se centra en el ciclo de vida de MLOps y LLMOps y en la medición del rendimiento de los sistemas de IA. Compara modelos, marcos de trabajo e infraestructura en métricas como la precisión, el rendimiento, el coste de las API y la escalabilidad, en toda la pila, desde los modelos de embedding y las bases de datos vectoriales hasta la infraestructura de GPU y la nube. Su tesis de maestría automatiza las revisiones sistemáticas de la literatura con un pipeline basado en RAG.
Formación
Ekrem tiene una licenciatura de la Universidad Hacettepe y está completando una maestría en la Universidad Başkent.
Últimos artículos de Ekrem
Mejores herramientas, frameworks y bibliotecas de RAG
RAG mejora las respuestas de los LLM al basarlas en datos externos en lugar de solo en lo que el modelo memorizó durante el entrenamiento. Hemos evaluado los componentes con los que se construye un sistema RAG y recopilado los resultados en un solo lugar, con una guía práctica para elegir cada parte del stack.…
Comparativa de Bases de Datos Vectoriales: 7 Motores de Código Abierto para RAG
Comparamos siete bases de datos vectoriales autogestionadas de código abierto como capa de recuperación de un pipeline de RAG, ejecutándose cada una por separado sobre los mismos embeddings bge-m3 y consultas reales médicas y técnicas, de modo que el índice de la base de datos fue la única variable. La carga de trabajo abarcó MedRAG-50k,…
Precios, rendimiento y comparativa de proveedores de GPU en la nube
Los precios de lista de GPU en la nube para el mismo modelo pueden diferir varias veces de un proveedor a otro. Hemos seleccionado la tarifa más baja, el proveedor, el rango de mercado y la mediana para más de 40 configuraciones de GPU en los tres niveles de precios, además de un benchmark de…
Índice de precios de alquiler de GPU en la nube
Las tarifas bajo demanda para las GPU de última generación en la nube (B200, B300, MI300X, RTX 5090) se duplicaron aproximadamente durante el último año, mientras que las tarjetas principales (H100, H200, A100) se mantuvieron en una banda ajustada. Recopilamos el índice de GPU mensualmente de 63 proveedores y 17 modelos de GPU, cubriendo los…
LLM Calculadora de VRAM para Autohospedaje
Autohospedar un LLM significa ejecutar la inferencia en hardware controlado por el operador en lugar de a través de una API de terceros, lo que cambia el costo, el control de datos y el perfil de privacidad. El que un modelo pueda ejecutarse depende de la memoria. La calculadora estima la VRAM o la memoria…
Benchmark de software de archivado de correo electrónico
Aprovisionamos un inquilino de Microsoft 365, lo poblamos con un corpus sintético de 10.000 correos y 1.700 archivos adjuntos en 8 subtipos de tipo de archivo, luego comparamos NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving y MailPiler en el mismo inquilino en 10 dimensiones que cubren: ingesta, búsqueda, recuperación…
Las mejores funciones serverless: Vercel vs Azure vs AWS
Las funciones serverless permiten a los desarrolladores ejecutar código sin tener que gestionar un servidor. Esto les permite centrarse en escribir y desplegar aplicaciones mientras el escalado de la infraestructura y el mantenimiento se gestionan automáticamente en segundo plano. En esta comparativa, evaluamos a 7 proveedores de servicios en la nube populares siguiendo nuestra metodología…
RAG Herramientas de evaluación: Weights & Biases vs Ragas vs DeepEval
Cuando un pipeline de RAG recupera el contexto incorrecto, el LLM genera con confianza la respuesta equivocada. Los evaluadores de relevancia contextual son la defensa principal. Evaluamos cinco herramientas en 1.460 preguntas y más de 14.600 contextos puntuados bajo condiciones idénticas: mismo modelo juez (GPT-4o), configuraciones predeterminadas y sin prompts personalizados. En condiciones estándar, WandB,…
Navegadores Remotos: Infraestructura Web para Agentes de IA Comparados
Los agentes de IA dependen de navegadores remotos para automatizar tareas web sin ser bloqueados por medidas anti-scraping. El rendimiento de esta infraestructura de navegador es crítico para el éxito de un agente. Comparamos 8 proveedores en tasa de éxito, velocidad y características. Para esto, ejecutamos 160 tareas automatizadas, ejecutando 4 escenarios distintos 5 veces…
Prueba de referencia de base de datos de grafos: Neo4j vs FalkorDB vs Memgraph
Realizamos pruebas de referencia de Neo4j, FalkorDB y Memgraph en un grafo sintético derivado de 120.000 reseñas de productos de Amazon (381K nodos, 804K aristas). Ejecutamos 12 plantillas de consultas con 1.000 mediciones cada una, probamos la ingestión en 6 tamaños de lote, mantenemos carga concurrente durante 60 segundos con hasta 32 hilos, y medimos…
Boletín informativo de AIMultiple
Reciba un correo electrónico gratuito a la semana con las últimas noticias tecnológicas B2B y análisis de expertos para impulsar su empresa.