Ekrem Sarı
Ekrem é Pesquisador de IA e Analista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.
Experiência Profissional
Na AIMultiple, Ekrem faz benchmarks de sistemas de IA de ponta a ponta e constrói os fluxos de trabalho de dados e painéis usados para acompanhar métricas de benchmark e de produto. Seus benchmarks abrangem models de embedding e reranker, bancos de dados vetoriais e de grafos, mecanismos de inference, quantização, concorrência de GPU e escalonamento multi-GPU, preços e provedores de GPU em nuvem, text-to-SQL e frameworks de RAG e RAG agêntico.
Antes da AIMultiple, ele trabalhou como Avaliador na Yandex, onde avaliou a qualidade da pesquisa e rotulou grandes volumes de dados segundo diretrizes detalhadas para apoiar a qualidade de classificação e de model.
Interesse de Pesquisa
O trabalho de Ekrem se concentra no ciclo de vida de MLOps e LLMOps e na medição do desempenho de sistemas de IA. Ele compara models, frameworks e infraestrutura em métricas como acurácia, throughput, custo de API e escalabilidade, em toda a pilha, desde models de embedding e bancos de dados vetoriais até GPU e infraestrutura de nuvem. Sua dissertação de mestrado automatiza revisões sistemáticas da literatura com um pipeline baseado em RAG.
Educação
Ekrem possui bacharelado pela Hacettepe University e está concluindo um mestrado na Başkent University.
Últimos artigos de Ekrem
Agentic RAG Benchmark: Roteamento Multi-Banco de Dados entre 36 LLMs
Fizemos um benchmark de 36 grandes modelos de linguagem em roteamento entre bases de dados. Cada modelo recebe uma pergunta em linguagem natural e 11 bases de dados SQL descritas em parágrafo, e depois tem de decidir qual base contém a resposta antes de escrever qualquer SQL. As 11 bases de dados foram extraídas de…
Top 60+ Provedores de Cloud GPU
Os provedores de cloud GPU se dividem em três níveis. Os hyperscalers operam plataformas de nuvem amplas com aluguel de GPU como um produto entre muitos. Os neoclouds especializados focam em infraestrutura de GPU e IA como seu produto principal. Os marketplaces comunitários agregam inventário de muitos pequenos operadores, frequentemente no piso da faixa de…
Text-to-SQL: Comparação da Precisão de LLM
Executamos 36 grandes modelos de linguagem em 759 perguntas do BIRD-SQL, cada modelo escrevendo SQL contra um banco de dados que ele mesmo teve de identificar dentre 11 candidatos. Toda consulta analisável foi executada no banco de dados real e seu conjunto de resultados comparado com o da consulta de referência do BIRD. Consultas ausentes,…
RAG Frameworks: LangChain vs LangGraph vs LlamaIndex
Comparamos 5 RAG frameworks: LangChain, LangGraph, LlamaIndex, Haystack e DSPy, construindo o mesmo fluxo de trabalho RAG agêntico com componentes padronizados: modelos idênticos (GPT-4.1-mini), embeddings (BGE-small), recuperador (Qdrant) e ferramentas (pesquisa web Tavily). Isto isola a verdadeira sobrecarga e eficiência de tokens de cada framework. O benchmark consistiu em 100 consultas, com cada framework a…
Benchmark de software de backup: Acronis vs NinjaOne vs Comet vs MSP360
Realizámos um benchmark do NinjaOne Backup, do Acronis Cyber Protect Cloud Backup, do Comet Backup e do MSP360 Managed Backup em infraestrutura AWS idêntica. Cada fornecedor executou um backup em modo de ficheiro da mesma carga de trabalho de 625.946 ficheiros / 50 GB e um backup completo de imagem do disco do sistema, e…
Comparação de Modelos de Fundação Relacionais
Comparamos em benchmark o SAP-RPT-1-OSS contra gradient boosting (LightGBM, CatBoost) em 17 datasets tabulares abrangendo o espectro semântico-numérico, tabelas pequenas/de alta semântica, datasets empresariais mistos e grandes datasets numéricos de baixa semântica. O nosso objetivo é medir onde os priores semânticos pré-treinados de um LLM relacional podem oferecer vantagens sobre os modelos de árvore tradicionais…
Pesquisa Agêntica: Avaliação de 8 APIs de Pesquisa para Agentes
A pesquisa agêntica desempenha um papel crucial na ligação entre os motores de busca tradicionais e as capacidades de pesquisa de IA. As APIs de pesquisa são a primeira camada de uma ferramenta agêntica, onde o desempenho limita a qualidade de tudo o que vem a jusante. Avaliámos 8 APIs de pesquisa através de 100…
Benchmark de Software DLP
Realizamos o benchmark do Acronis DeviceLock DLP e do ManageEngine DLP Plus em VMs idênticas com Windows Server 2022 com 28 cenários: 23 testes de fuga de dados (incluindo 12 arquivos de evasão adversária), 3 testes de segurança do agente e 2 testes sob alto consumo de CPU e memória. Para os outros produtos DLP,…
Benchmark de Reranker: Top 8 Modelos Comparados
Fizemos benchmark de 8 modelos de reranker em ~145k avaliações da Amazon em inglês para medir o quanto uma etapa de re-ranqueamento melhora a recuperação densa. Recuperamos os top-100 candidatos com multilingual-e5-base, re-ranqueamos com cada modelo e avaliamos os top-10 resultados contra 300 consultas, cada uma referenciando detalhes concretos da avaliação original. O melhor reranker…
GPU Benchmark de Concorrência: H100 vs H200 vs B200 vs MI300X
Passei os últimos 20 anos focado na otimização de desempenho computacional em nível de sistema. Realizamos benchmark das mais recentes NVIDIA GPUs, incluindo as NVIDIA’s H100, H200 e B200, e a AMD’s MI300X, para análise de escalabilidade de concorrência. Utilizando o framework vLLM com o gpt-oss-20b modelo, testamos como essas GPUs lidam com requisições concorrentes,…
Boletim informativo AIMultiple
Receba um e-mail gratuito por semana com as últimas notícias de tecnologia B2B e insights de especialistas para impulsionar o seu negócio.