Serviços
Contate-nos
Ekrem Sarı

Ekrem Sarı

Pesquisador de IA
35 Artigos
Mantenha-se atualizado sobre tecnologia B2B.

Ekrem é Pesquisador de IA e Analista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.

Experiência Profissional

Na AIMultiple, Ekrem faz benchmarks de sistemas de IA de ponta a ponta e constrói os fluxos de trabalho de dados e painéis usados para acompanhar métricas de benchmark e de produto. Seus benchmarks abrangem models de embedding e reranker, bancos de dados vetoriais e de grafos, mecanismos de inference, quantização, concorrência de GPU e escalonamento multi-GPU, preços e provedores de GPU em nuvem, text-to-SQL e frameworks de RAG e RAG agêntico.

Antes da AIMultiple, ele trabalhou como Avaliador na Yandex, onde avaliou a qualidade da pesquisa e rotulou grandes volumes de dados segundo diretrizes detalhadas para apoiar a qualidade de classificação e de model.

Interesse de Pesquisa

O trabalho de Ekrem se concentra no ciclo de vida de MLOps e LLMOps e na medição do desempenho de sistemas de IA. Ele compara models, frameworks e infraestrutura em métricas como acurácia, throughput, custo de API e escalabilidade, em toda a pilha, desde models de embedding e bancos de dados vetoriais até GPU e infraestrutura de nuvem. Sua dissertação de mestrado automatiza revisões sistemáticas da literatura com um pipeline baseado em RAG.

Educação

Ekrem possui bacharelado pela Hacettepe University e está concluindo um mestrado na Başkent University.

Últimos artigos de Ekrem

Dados
Benchmark
2 Jul

Navegadores Remotos: Infraestrutura Web para Agentes de IA Comparada

Os agentes de IA dependem de navegadores remotos para automatizar tarefas web sem serem bloqueados por medidas anti-scraping. O desempenho desta infraestrutura de navegador é fundamental para o sucesso de um agente. Avaliámos 8 fornecedores quanto à taxa de sucesso, velocidade e funcionalidades. Para isso, executámos 160 tarefas automatizadas, executando 4 cenários distintos 5 vezes…

IA
Benchmark
1 Jul

LLM Motores de Inferência: vLLM vs LMDeploy vs SGLang

Avaliamos o desempenho de 3 dos principais motores de inferência de LLM em NVIDIA H100: vLLM, LMDeploy e SGLang. Cada motor processou cargas de trabalho idênticas: 1.000 prompts do ShareGPT usando Llama 3.1 8B-Instruct para isolar o verdadeiro impacto de desempenho das suas escolhas arquiteturais e estratégias de otimização. Medimos a taxa de transferência em…

IA
Benchmark
30 Jun

Os 10 melhores modelos de embedding multilíngues para RAG

Avaliamos 10 modelos de embedding multilíngues em aproximadamente 606k avaliações da Amazon em 6 idiomas (alemão, inglês, espanhol, francês, japonês, chinês). Geramos 1.800 consultas (300 por idioma), cada uma referenciando detalhes concretos da avaliação de origem. Modelos treinados para busca (separação entre consulta e documento) superam modelos maiores treinados para similaridade textual geral: e5_base (110M…

IA
Benchmark
30 Jun

Múltiplo-GPU Benchmark: B200 vs H200 vs H100 vs MI300X

Por mais de duas décadas, otimizar o desempenho de computação tem sido uma pedra angular do meu trabalho. Realizamos benchmark das B200, H200, H100 da NVIDIA e MI300X da AMD para avaliar quão bem elas escalam para inferência de Modelo de Linguagem Grande (LLM). Usando o framework vLLM com o modelo meta-llama/Llama-3.1-8B-Instruct, executamos testes em…

IA
Benchmark
15 Abr

LLM Quantização: BF16 vs FP8 vs INT4

Realizamos o benchmark do Qwen3-32B em 4 níveis de precisão (BF16, FP8, GPTQ-Int8, GPTQ-Int4) em uma única NVIDIA H100 80GB GPU. Cada configuração foi avaliada em 2 benchmarks (~12,2 mil perguntas) cobrindo conhecimento e geração de código, além de mais de 2.000 execuções de inferência para medir a vazão. O Int4 é 2,7x mais rápido…