Serviços
Contate-nos
Ekrem Sarı

Ekrem Sarı

Pesquisador de IA
35 Artigos
Mantenha-se atualizado sobre tecnologia B2B.

Ekrem é Pesquisador de IA e Cientista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.

Experiência Profissional

Na AIMultiple, Ekrem realiza benchmarks de sistemas de IA de ponta a ponta e constrói os fluxos de trabalho de dados e dashboards usados para acompanhar métricas de benchmark e de produto. Seus benchmarks abrangem models de embedding e reranker, bancos de dados vetoriais e de grafos, motores de inference, quantização, concorrência de GPU e escalonamento multi-GPU, preços e fornecedores de GPU na nuvem, text-to-SQL, e frameworks de RAG e RAG agêntico.

Antes da AIMultiple, ele trabalhou como Cientista de Dados na Yandex, onde consultou e analisou grandes datasets com SQL para avaliar a qualidade de busca e ranqueamento segundo diretrizes detalhadas.

Interesse de Pesquisa

O trabalho de Ekrem concentra-se em medir como os sistemas de LLM e de recuperação se comportam na prática. Ele projeta o ambiente de teste, executa as cargas de trabalho em hardware real e compara models, frameworks e infraestrutura em precisão, vazão, latência, custo e escalabilidade, em toda a stack, desde models de embedding e bancos de dados vetoriais até motores de inference e infraestrutura de GPU. Sua tese de mestrado automatiza revisões sistemáticas de literatura com uma pipeline baseada em RAG.

Educação

Ekrem possui um mestrado em Sistemas de Informação Gerenciais pela Başkent University, onde sua tese automatizou revisões sistemáticas de literatura com uma pipeline baseada em RAG, e está cursando um segundo mestrado em Engenharia de Dados e Conhecimento na Hacettepe University.

Últimos artigos de Ekrem

Software Empresarial
Benchmark
2 Jul

Principais Funções Sem Servidor: Vercel vs Azure vs AWS

Funções sem servidor permitem que os desenvolvedores executem código sem precisar gerenciar um servidor. Isso permite que eles se concentrem em escrever e implantar aplicativos enquanto o dimensionamento e a manutenção da infraestrutura são tratados automaticamente em segundo plano. Neste benchmark, avaliamos 7 provedores populares de serviços em nuvem seguindo nossa metodologia para testar o…

IA
Benchmark
1 Jul

LLM Motores de Inferência: vLLM vs LMDeploy vs SGLang

Avaliamos o desempenho de 3 dos principais motores de inferência de LLM em NVIDIA H100: vLLM, LMDeploy e SGLang. Cada motor processou cargas de trabalho idênticas: 1.000 prompts do ShareGPT usando Llama 3.1 8B-Instruct para isolar o verdadeiro impacto de desempenho das suas escolhas arquiteturais e estratégias de otimização. Medimos a taxa de transferência em…

IA
Benchmark
30 Jun

Os 10 melhores modelos de embedding multilíngues para RAG

Avaliamos 10 modelos de embedding multilíngues em aproximadamente 606k avaliações da Amazon em 6 idiomas (alemão, inglês, espanhol, francês, japonês, chinês). Geramos 1.800 consultas (300 por idioma), cada uma referenciando detalhes concretos da avaliação de origem. Modelos treinados para busca (separação entre consulta e documento) superam modelos maiores treinados para similaridade textual geral: e5_base (110M…

IA
Benchmark
30 Jun

Múltiplo-GPU Benchmark: B200 vs H200 vs H100 vs MI300X

Por mais de duas décadas, otimizar o desempenho de computação tem sido uma pedra angular do meu trabalho. Realizamos benchmark das B200, H200, H100 da NVIDIA e MI300X da AMD para avaliar quão bem elas escalam para inferência de Modelo de Linguagem Grande (LLM). Usando o framework vLLM com o modelo meta-llama/Llama-3.1-8B-Instruct, executamos testes em…

IA
Benchmark
15 Abr

LLM Quantização: BF16 vs FP8 vs INT4

Realizamos o benchmark do Qwen3-32B em 4 níveis de precisão (BF16, FP8, GPTQ-Int8, GPTQ-Int4) em uma única NVIDIA H100 80GB GPU. Cada configuração foi avaliada em 2 benchmarks (~12,2 mil perguntas) cobrindo conhecimento e geração de código, além de mais de 2.000 execuções de inferência para medir a vazão. O Int4 é 2,7x mais rápido…