Ekrem Sarı
Ekrem é Pesquisador de IA e Cientista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.
Experiência Profissional
Na AIMultiple, Ekrem realiza benchmarks de sistemas de IA de ponta a ponta e constrói os fluxos de trabalho de dados e dashboards usados para acompanhar métricas de benchmark e de produto. Seus benchmarks abrangem models de embedding e reranker, bancos de dados vetoriais e de grafos, motores de inference, quantização, concorrência de GPU e escalonamento multi-GPU, preços e fornecedores de GPU na nuvem, text-to-SQL, e frameworks de RAG e RAG agêntico.
Antes da AIMultiple, ele trabalhou como Cientista de Dados na Yandex, onde consultou e analisou grandes datasets com SQL para avaliar a qualidade de busca e ranqueamento segundo diretrizes detalhadas.
Interesse de Pesquisa
O trabalho de Ekrem concentra-se em medir como os sistemas de LLM e de recuperação se comportam na prática. Ele projeta o ambiente de teste, executa as cargas de trabalho em hardware real e compara models, frameworks e infraestrutura em precisão, vazão, latência, custo e escalabilidade, em toda a stack, desde models de embedding e bancos de dados vetoriais até motores de inference e infraestrutura de GPU. Sua tese de mestrado automatiza revisões sistemáticas de literatura com uma pipeline baseada em RAG.
Educação
Ekrem possui um mestrado em Sistemas de Informação Gerenciais pela Başkent University, onde sua tese automatizou revisões sistemáticas de literatura com uma pipeline baseada em RAG, e está cursando um segundo mestrado em Engenharia de Dados e Conhecimento na Hacettepe University.
Últimos artigos de Ekrem
Modelos de Embedding Multimodal: Apple vs Meta vs OpenAI
Modelos de embedding multimodal se destacam na identificação de objetos, mas têm dificuldade com relações. Os modelos atuais têm dificuldade para distinguir “telefone em cima de um mapa” de “mapa em cima de um telefone”. Fizemos benchmark de 7 modelos líderes nos conjuntos MS-COCO e Winoground para medir essa limitação específica. Para garantir uma comparação…
Benchmark de 40+ LLMs em Finanças: Claude Fable 5 & GPT-5.6 Sol
Avaliamos LLMs em 238 questões difíceis do benchmark FinanceReasoning (Tang et al.).1 Este subconjunto tem como alvo as tarefas de raciocínio financeiro mais desafiadoras, avaliando raciocínio quantitativo complexo e em várias etapas envolvendo conceitos e fórmulas financeiras. Nossa avaliação empregou um design de prompt personalizado e critérios de pontuação de precisão e consumo de tokens.…
Benchmark de software de arquivamento de e-mail
Provisionamos um locatário do Microsoft 365, o preenchemos com um corpus sintético de 10.000 e-mails e 1.700 anexos em 8 subtipos de tipo de arquivo e, em seguida, comparamos o NinjaOne SaaS Archiver, o Barracuda Cloud Archiving Service, o Acronis Cyber Protect Cloud Email Archiving e o MailPiler no mesmo locatário em 10 dimensões que…
Benchmark de recuperação de desastres: Acronis vs Comet vs MSP360
Fizemos benchmark de Acronis Cyber Protect Cloud, Comet Backup e MSP360 Managed Backup em recuperação de desastres. Cada fornecedor criou uma imagem de um Windows Server 2022 ativo e de um servidor Ubuntu 24.04 ativo executando a mesma carga de trabalho determinística, um serviço web, um banco de dados de 10.000 linhas e 50 arquivos,…
Benchmark de banco de dados de grafos: Neo4j vs FalkorDB vs Memgraph
Comparamos Neo4j, FalkorDB e Memgraph em um grafo sintético derivado de 120.000 avaliações de produtos da Amazon (381K nós, 804K arestas). Executamos 12 modelos de consulta com 1.000 medições cada, testamos a ingestão em 6 tamanhos de lote, sustentamos carga concorrente por 60 segundos em até 32 threads e medimos memória, partida a frio, carga…
Agentic RAG Benchmark: Roteamento Multi-Banco de Dados entre 36 LLMs
Fizemos um benchmark de 36 grandes modelos de linguagem em roteamento entre bases de dados. Cada modelo recebe uma pergunta em linguagem natural e 11 bases de dados SQL descritas em parágrafo, e depois tem de decidir qual base contém a resposta antes de escrever qualquer SQL. As 11 bases de dados foram extraídas de…
Benchmark de Software DLP
Realizamos o benchmark do Acronis DeviceLock DLP e do ManageEngine DLP Plus em VMs idênticas com Windows Server 2022 com 28 cenários: 23 testes de fuga de dados (incluindo 12 arquivos de evasão adversária), 3 testes de segurança do agente e 2 testes sob alto consumo de CPU e memória. Para os outros produtos DLP,…
Web Scraping em Grande Escala: 7 Provedores Comparados
Realizámos dois benchmarks em websites reais, de 5 a 5.000 pedidos simultâneos. O primeiro enviou 260.000 pedidos através de quatro desbloqueadores web pelos 10.000 domínios do topo do Tranco, mais um teste de extração de markdown em 10.000 URLs. O segundo recolheu 65.000 páginas de produto e pesquisa de cada um dos cinco fornecedores de…
Comparação dos 6 Melhores Serviços Gratuitos de Cloud GPU
O melhor tier gratuito de GPU vale cerca de $19 por mês em taxas de aluguel, e oito plataformas oferecem uma GPU real sem cartão de crédito. Seis delas limitam o uso gratuito por mês, e nós precificamos essas com base na taxa sob demanda atual mais barata para cada GPU em nossos dados de…
Calculadora de Dimensionamento e Seleção de Banco de Dados Vetorial
A questão prática por trás de um banco de dados vetorial auto-hospedado para RAG é qual mecanismo se adapta a um determinado servidor e qual deles a carga de trabalho descarta. A calculadora abaixo responde a ambas, a partir do nosso benchmark de sete bancos de dados vetoriais auto-hospedados executados com recall correspondente em embeddings…
Boletim informativo AIMultiple
Receba um e-mail gratuito por semana com as últimas notícias de tecnologia B2B e insights de especialistas para impulsionar o seu negócio.