Servicios
Contáctanos
Ekrem Sarı

Ekrem Sarı

Investigador de IA
32 Artículos
Mantente al día sobre tecnología B2B.

Ekrem es investigador de IA en AIMultiple, donde se centra en la automatización inteligente, las GPU, los agentes de IA y las LLMOps para marcos RAG.

Experiencia profesional

Durante su etapa como evaluador en Yandex, evaluó los resultados de búsqueda utilizando marcos de trabajo propios y protocolos automatizados. Implementó pruebas de control de calidad mediante la anotación de datos, la puntuación de relevancia y el mapeo de la intención del usuario en más de 10 000 consultas mensuales, al tiempo que realizaba evaluaciones técnicas, incluyendo la monitorización del rendimiento y la detección de spam mediante bucles de retroalimentación de aprendizaje automático.

Intereses de investigación

En AIMultiple, su investigación se centra en el ciclo de vida de MLOps y en el rendimiento y la evaluación comparativa de sistemas de IA de extremo a extremo. Colabora en una amplia gama de proyectos, incluyendo la optimización de la Generación Aumentada por Recuperación (RAG), la evaluación comparativa exhaustiva de Modelos de Lenguaje a Gran Escala (LLM) y el diseño de marcos de IA basados en agentes. Ekrem se especializa en el desarrollo de metodologías basadas en datos para medir y mejorar el rendimiento de la tecnología de IA en métricas operativas críticas como la precisión, la eficiencia, el coste de la API y la escalabilidad. Su análisis abarca toda la pila tecnológica, desde componentes fundamentales como los modelos de incrustación y las bases de datos vectoriales hasta la GPU de alto rendimiento y la infraestructura en la nube necesarias para implementar agentes de IA.

Educación

Ekrem tiene una licenciatura de Hacettepe Üniversitesi y una maestría de Başkent Üniversitesi.

Últimos artículos de Ekrem

IA
Benchmark
17 de Jul

Los 20+ Mejores Frameworks de RAG Agentic

El RAG agentic mejora el RAG tradicional al potenciar el rendimiento de los LLM y permitir una mayor especialización. Realizamos un benchmark para evaluar su rendimiento en el enrutamiento entre múltiples bases de datos y la generación de consultas. Explore los frameworks y librerías de RAG agentic, las diferencias clave con el RAG estándar, los…

IA
Benchmark
16 de Jul

Precios, rendimiento y comparativa de proveedores de GPU en la nube

Los precios de lista de GPU en la nube para el mismo modelo pueden diferir varias veces de un proveedor a otro. Hemos seleccionado la tarifa más baja, el proveedor, el rango de mercado y la mediana para más de 40 configuraciones de GPU en los tres niveles de precios, además de un benchmark de…

IA
Comparación de Funciones
16 de Jul

Índice de precios de alquiler de GPU en la nube

Las tarifas bajo demanda para las GPU de última generación en la nube (B200, B300, MI300X, RTX 5090) se duplicaron aproximadamente durante el último año, mientras que las tarjetas principales (H100, H200, A100) se mantuvieron en una banda ajustada. Recopilamos el índice de GPU mensualmente de 63 proveedores y 17 modelos de GPU, cubriendo los…

IA
Análisis
12 de Jul

LLM Calculadora de VRAM para Autohospedaje

Autohospedar un LLM significa ejecutar la inferencia en hardware controlado por el operador en lugar de a través de una API de terceros, lo que cambia el costo, el control de datos y el perfil de privacidad. El que un modelo pueda ejecutarse depende de la memoria. La calculadora estima la VRAM o la memoria…

IA
Benchmark
10 de Jul

Comparativa de 40+ LLMs en Finanzas: Claude Fable 5 & GPT-5.6 Sol

Evaluamos 40+ LLMs en finanzas en 238 preguntas difíciles del benchmark FinanceReasoning para identificar qué modelos destacan en tareas complejas de razonamiento financiero como análisis de estados financieros, pronósticos y cálculos de ratios. Evaluamos LLMs en 238 preguntas difíciles del benchmark FinanceReasoning (Tang et al.).1 Este subconjunto aborda las tareas de razonamiento financiero más desafiantes,…

IA
Benchmark
3 de Jul

Comparativa de modelos de embedding de código abierto para RAG

Evaluamos 14 modelos de embedding de código abierto, autohospedados en una sola H100, en más de 500 consultas de recuperación curadas manualmente que abarcan contratos legales, notas técnicas de soporte al cliente y resúmenes médicos. NVIDIA Llama-Embed-Nemotron-8B lidera en precisión. En cuanto a costo, el modelo EmbeddingGemma-300m de Google cuesta aproximadamente 4x menos que Nemotron…

IA
Benchmark
2 de Jul

Comparar Modelos Fundacionales Relacionales

Hemos realizado benchmarks de SAP-RPT-1-OSS frente al gradiente impulsado (LightGBM, CatBoost) en 17 conjuntos de datos tabulares que abarcan el espectro semántico-numérico, tablas pequeñas/de alta semántica, conjuntos de datos empresariales mixtos y grandes conjuntos de datos numéricos de baja semántica. Nuestro objetivo es medir dónde los priores semánticos preentrenados de un LLM relacional pueden proporcionar…

Software Empresarial
Benchmark
2 de Jul

Benchmark de software de archivado de correo electrónico

Aprovisionamos un inquilino de Microsoft 365, lo poblamos con un corpus sintético de 10,000 correos y 1,700 archivos adjuntos en 8 subtipos de tipo de archivo, luego comparamos NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving y MailPiler en el mismo inquilino en 10 dimensiones que cubren: ingesta, búsqueda, recuperación…

Software Empresarial
Benchmark
2 de Jul

Las mejores funciones serverless: Vercel vs Azure vs AWS

Las funciones serverless permiten a los desarrolladores ejecutar código sin tener que gestionar un servidor. Esto les permite centrarse en escribir y desplegar aplicaciones mientras el escalado de la infraestructura y el mantenimiento se gestionan automáticamente en segundo plano. En esta comparativa, evaluamos a 7 proveedores de servicios en la nube populares siguiendo nuestra metodología…

IA
Benchmark
2 de Jul

Modelos de incrustación multimodal: Apple vs Meta vs OpenAI

Los modelos de incrustación multimodal sobresalen en la identificación de objetos, pero tienen dificultades con las relaciones. Los modelos actuales luchan por distinguir «teléfono sobre un mapa» de «mapa sobre un teléfono». Evaluamos 7 modelos líderes en MS-COCO y Winoground para medir esta limitación específica. Para garantizar una comparación justa, evaluamos cada modelo en condiciones…