Ekrem Sarı
Ekrem é Pesquisador de IA e Cientista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.
Experiência Profissional
Na AIMultiple, Ekrem realiza benchmarks de sistemas de IA de ponta a ponta e constrói os fluxos de trabalho de dados e dashboards usados para acompanhar métricas de benchmark e de produto. Seus benchmarks abrangem models de embedding e reranker, bancos de dados vetoriais e de grafos, motores de inference, quantização, concorrência de GPU e escalonamento multi-GPU, preços e fornecedores de GPU na nuvem, text-to-SQL, e frameworks de RAG e RAG agêntico.
Antes da AIMultiple, ele trabalhou como Cientista de Dados na Yandex, onde consultou e analisou grandes datasets com SQL para avaliar a qualidade de busca e ranqueamento segundo diretrizes detalhadas.
Interesse de Pesquisa
O trabalho de Ekrem concentra-se em medir como os sistemas de LLM e de recuperação se comportam na prática. Ele projeta o ambiente de teste, executa as cargas de trabalho em hardware real e compara models, frameworks e infraestrutura em precisão, vazão, latência, custo e escalabilidade, em toda a stack, desde models de embedding e bancos de dados vetoriais até motores de inference e infraestrutura de GPU. Sua tese de mestrado automatiza revisões sistemáticas de literatura com uma pipeline baseada em RAG.
Educação
Ekrem possui um mestrado em Sistemas de Informação Gerenciais pela Başkent University, onde sua tese automatizou revisões sistemáticas de literatura com uma pipeline baseada em RAG, e está cursando um segundo mestrado em Engenharia de Dados e Conhecimento na Hacettepe University.
Últimos artigos de Ekrem
Benchmark de software de arquivamento de e-mail
Provisionamos um locatário do Microsoft 365, o preenchemos com um corpus sintético de 10.000 e-mails e 1.700 anexos em 8 subtipos de tipo de arquivo e, em seguida, comparamos o NinjaOne SaaS Archiver, o Barracuda Cloud Archiving Service, o Acronis Cyber Protect Cloud Email Archiving e o MailPiler no mesmo locatário em 10 dimensões que…
Benchmark de banco de dados de grafos: Neo4j vs FalkorDB vs Memgraph
Comparamos Neo4j, FalkorDB e Memgraph em um grafo sintético derivado de 120.000 avaliações de produtos da Amazon (381K nós, 804K arestas). Executamos 12 modelos de consulta com 1.000 medições cada, testamos a ingestão em 6 tamanhos de lote, sustentamos carga concorrente por 60 segundos em até 32 threads e medimos memória, partida a frio, carga…
Calculadora de Dimensionamento e Seleção de Banco de Dados Vetorial
A questão prática por trás de um banco de dados vetorial auto-hospedado para RAG é qual mecanismo se adapta a um determinado servidor e qual deles a carga de trabalho descarta. A calculadora abaixo responde a ambas, a partir do nosso benchmark de sete bancos de dados vetoriais auto-hospedados executados com recall correspondente em embeddings…
Principais Funções Sem Servidor: Vercel vs Azure vs AWS
Funções sem servidor permitem que os desenvolvedores executem código sem precisar gerenciar um servidor. Isso permite que eles se concentrem em escrever e implantar aplicativos enquanto o dimensionamento e a manutenção da infraestrutura são tratados automaticamente em segundo plano. Neste benchmark, avaliamos 7 provedores populares de serviços em nuvem seguindo nossa metodologia para testar o…
LLM Motores de Inferência: vLLM vs LMDeploy vs SGLang
Avaliamos o desempenho de 3 dos principais motores de inferência de LLM em NVIDIA H100: vLLM, LMDeploy e SGLang. Cada motor processou cargas de trabalho idênticas: 1.000 prompts do ShareGPT usando Llama 3.1 8B-Instruct para isolar o verdadeiro impacto de desempenho das suas escolhas arquiteturais e estratégias de otimização. Medimos a taxa de transferência em…
Os 10 melhores modelos de embedding multilíngues para RAG
Avaliamos 10 modelos de embedding multilíngues em aproximadamente 606k avaliações da Amazon em 6 idiomas (alemão, inglês, espanhol, francês, japonês, chinês). Geramos 1.800 consultas (300 por idioma), cada uma referenciando detalhes concretos da avaliação de origem. Modelos treinados para busca (separação entre consulta e documento) superam modelos maiores treinados para similaridade textual geral: e5_base (110M…
LLM Quantização: BF16 vs FP8 vs INT4
Realizamos o benchmark do Qwen3-32B em 4 níveis de precisão (BF16, FP8, GPTQ-Int8, GPTQ-Int4) em uma única NVIDIA H100 80GB GPU. Cada configuração foi avaliada em 2 benchmarks (~12,2 mil perguntas) cobrindo conhecimento e geração de código, além de mais de 2.000 execuções de inferência para medir a vazão. O Int4 é 2,7x mais rápido…
Boletim informativo AIMultiple
Receba um e-mail gratuito por semana com as últimas notícias de tecnologia B2B e insights de especialistas para impulsionar o seu negócio.