Premium
Serviços
Premium
Ekrem Sarı

Ekrem Sarı

Pesquisador de IA
37 Artigos
Mantenha-se atualizado sobre tecnologia B2B.

Ekrem é Pesquisador de IA e Cientista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.

Experiência Profissional

Na AIMultiple, Ekrem realiza benchmarks de sistemas de IA de ponta a ponta e constrói os fluxos de trabalho de dados e dashboards usados para acompanhar métricas de benchmark e de produto. Seus benchmarks abrangem models de embedding e reranker, bancos de dados vetoriais e de grafos, motores de inference, quantização, concorrência de GPU e escalonamento multi-GPU, preços e fornecedores de GPU na nuvem, text-to-SQL, e frameworks de RAG e RAG agêntico.

Antes da AIMultiple, ele trabalhou como Cientista de Dados na Yandex, onde consultou e analisou grandes datasets com SQL para avaliar a qualidade de busca e ranqueamento segundo diretrizes detalhadas.

Interesse de Pesquisa

O trabalho de Ekrem concentra-se em medir como os sistemas de LLM e de recuperação se comportam na prática. Ele projeta o ambiente de teste, executa as cargas de trabalho em hardware real e compara models, frameworks e infraestrutura em precisão, vazão, latência, custo e escalabilidade, em toda a stack, desde models de embedding e bancos de dados vetoriais até motores de inference e infraestrutura de GPU. Sua tese de mestrado automatiza revisões sistemáticas de literatura com uma pipeline baseada em RAG.

Educação

Ekrem possui um mestrado em Sistemas de Informação Gerenciais pela Başkent University, onde sua tese automatizou revisões sistemáticas de literatura com uma pipeline baseada em RAG, e está cursando um segundo mestrado em Engenharia de Dados e Conhecimento na Hacettepe University.

Últimos artigos de Ekrem

IA
Benchmark
24 set

Benchmark de 40+ LLMs em Finanças: Claude Fable 5 & GPT-5.6 Sol

Avaliamos LLMs em 238 perguntas difíceis do benchmark FinanceReasoning (Tang et al.).1 Este subconjunto tem como alvo as tarefas de raciocínio financeiro mais desafiadoras, avaliando raciocínio quantitativo complexo e de múltiplas etapas envolvendo conceitos e fórmulas financeiras. Nossa avaliação empregou um design de prompt personalizado e critérios de pontuação de precisão e consumo de tokens.…

IA
Benchmark
23 set

Benchmark de RAG agêntico: roteamento entre 11 bancos de dados SQL

A precisão de roteamento é a porcentagem de perguntas pontuadas nas quais o modelo nomeia explicitamente o banco de dados correto em sua resposta final. O resultado principal usa as 184 perguntas marcadas como difíceis tanto por nosso teste de similaridade quanto por um júri de três LLMs. Declarações explícitas ausentes não recebem crédito. O…

Cibersegurança
Benchmark
22 set

Benchmark de software de backup: Acronis vs NinjaOne vs Comet vs MSP360

Benchmarkamos o NinjaOne Backup, o Acronis Cyber Protect Cloud Backup, o Comet Backup e o MSP360 Managed Backup em infraestrutura AWS idêntica. Cada fornecedor executou um backup em modo de arquivo da mesma carga de trabalho de 625.946 arquivos / 50 GB e um backup de imagem completo do disco do sistema e, em seguida,…

IA
Benchmark
22 set

Text-to-SQL: Comparação da precisão de LLM

Executamos 36 grandes modelos de linguagem em 759 perguntas do BIRD-SQL, cada modelo escrevendo SQL contra um banco de dados que precisava identificar por si mesmo entre 11 candidatos. Toda consulta analisável foi executada no banco de dados real e seu conjunto de resultados comparado com o conjunto de resultados da consulta gold do BIRD.…

IA
Comparação de Recursos
22 set

Índice de Preços de Aluguel de GPU em Nuvem

Acompanhamos os preços publicados de aluguel de GPU em nuvem para 17 modelos em 75 provedores, cobrindo tarifas sob demanda, spot e reservadas. O grupo de último lançamento registra o maior aumento de preço entre os três grupos. Sua mediana sob demanda subiu de $2,12 por GPU-hora em outubro de 2024 para $4,72 em setembro…

IA
Benchmark
22 set

Benchmark de Reranker: Comparação dos 8 Principais Modelos

Avaliamos 8 modelos de reranker em ~145k avaliações da Amazon em inglês para medir o quanto uma etapa de reranking melhora a recuperação densa. Recuperamos os top-100 candidatos com multilingual-e5-base, reordenamos com cada modelo e avaliamos os top-10 resultados em relação a 300 consultas, cada uma referenciando detalhes concretos da avaliação de origem. O melhor…

IA
Comparação de Recursos
21 set

Principais 30+ fabricantes de chips de IA: NVIDIA e seus concorrentes

Com base em nossa experiência rodando o AIMultiple e seu benchmark de GPU em nuvem, comparamos fabricantes de chips por produto, disponibilidade e arquitetura, cobrindo GPUs de data center, chips móveis, aceleradores de borda e fundições. Cada linha nomeia um produto representativo, seu tipo e sua disponibilidade. A disponibilidade distingue hardware oferecido para venda, serviços…

Cibersegurança
Benchmark
21 set

Detecção de bot: 9 fornecedores anti-bot avaliados em benchmark

Executamos dois benchmarks contra sites ativos, identificamos a empresa anti-bot à frente de cada domínio e medimos com que frequência os domínios de cada empresa retornaram o conteúdo solicitado. Isso cobre mais de 3.800 domínios rotulados e mais de 50.000 solicitações. O primeiro benchmark buscou páginas de produto e de busca em 100 domínios de…

Dados
Benchmark
21 set

Navegadores Remotos: Infraestrutura Web para Agentes de IA Comparada

Os agentes de IA dependem de navegadores remotos para automatizar tarefas web sem serem bloqueados por medidas anti-scraping. O desempenho dessa infraestrutura de navegador é fundamental para o sucesso de um agente. Avaliamos 8 provedores quanto à taxa de sucesso, velocidade e recursos. Para isso, executamos 160 tarefas automatizadas, executando 4 cenários distintos 5 vezes…

Dados
Benchmark
21 set

Web Scraping em Grande Escala: 7 Provedores Comparados

Realizámos dois benchmarks em websites reais, de 5 a 5.000 pedidos simultâneos. O primeiro enviou 260.000 pedidos através de quatro desbloqueadores web pelos 10.000 domínios do topo do Tranco, mais um teste de extração de markdown em 10.000 URLs. O segundo recolheu 65.000 páginas de produto e pesquisa de cada um dos cinco fornecedores de…