Serviços
Contate-nos
Ekrem Sarı

Ekrem Sarı

Pesquisador de IA
35 Artigos
Mantenha-se atualizado sobre tecnologia B2B.

Ekrem é Pesquisador de IA e Analista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.

Experiência Profissional

Na AIMultiple, Ekrem faz benchmarks de sistemas de IA de ponta a ponta e constrói os fluxos de trabalho de dados e painéis usados para acompanhar métricas de benchmark e de produto. Seus benchmarks abrangem models de embedding e reranker, bancos de dados vetoriais e de grafos, mecanismos de inference, quantização, concorrência de GPU e escalonamento multi-GPU, preços e provedores de GPU em nuvem, text-to-SQL e frameworks de RAG e RAG agêntico.

Antes da AIMultiple, ele trabalhou como Avaliador na Yandex, onde avaliou a qualidade da pesquisa e rotulou grandes volumes de dados segundo diretrizes detalhadas para apoiar a qualidade de classificação e de model.

Interesse de Pesquisa

O trabalho de Ekrem se concentra no ciclo de vida de MLOps e LLMOps e na medição do desempenho de sistemas de IA. Ele compara models, frameworks e infraestrutura em métricas como acurácia, throughput, custo de API e escalabilidade, em toda a pilha, desde models de embedding e bancos de dados vetoriais até GPU e infraestrutura de nuvem. Sua dissertação de mestrado automatiza revisões sistemáticas da literatura com um pipeline baseado em RAG.

Educação

Ekrem possui bacharelado pela Hacettepe University e está concluindo um mestrado na Başkent University.

Últimos artigos de Ekrem

IA
Benchmark
11 Ago

Agentic RAG Benchmark: Roteamento Multi-Banco de Dados entre 36 LLMs

Fizemos um benchmark de 36 grandes modelos de linguagem em roteamento entre bases de dados. Cada modelo recebe uma pergunta em linguagem natural e 11 bases de dados SQL descritas em parágrafo, e depois tem de decidir qual base contém a resposta antes de escrever qualquer SQL. As 11 bases de dados foram extraídas de…

IA
Avaliação em Mundo Aberto
11 Ago

Top 60+ Provedores de Cloud GPU

Os provedores de cloud GPU se dividem em três níveis. Os hyperscalers operam plataformas de nuvem amplas com aluguel de GPU como um produto entre muitos. Os neoclouds especializados focam em infraestrutura de GPU e IA como seu produto principal. Os marketplaces comunitários agregam inventário de muitos pequenos operadores, frequentemente no piso da faixa de…

IA
Benchmark
9 Ago

Text-to-SQL: Comparação da Precisão de LLM

Executamos 36 grandes modelos de linguagem em 759 perguntas do BIRD-SQL, cada modelo escrevendo SQL contra um banco de dados que ele mesmo teve de identificar dentre 11 candidatos. Toda consulta analisável foi executada no banco de dados real e seu conjunto de resultados comparado com o da consulta de referência do BIRD. Consultas ausentes,…

IA
Benchmark
4 Ago

RAG Frameworks: LangChain vs LangGraph vs LlamaIndex

Comparamos 5 RAG frameworks: LangChain, LangGraph, LlamaIndex, Haystack e DSPy, construindo o mesmo fluxo de trabalho RAG agêntico com componentes padronizados: modelos idênticos (GPT-4.1-mini), embeddings (BGE-small), recuperador (Qdrant) e ferramentas (pesquisa web Tavily). Isto isola a verdadeira sobrecarga e eficiência de tokens de cada framework. O benchmark consistiu em 100 consultas, com cada framework a…

Cibersegurança
Benchmark
4 Ago

Benchmark de software de backup: Acronis vs NinjaOne vs Comet vs MSP360

Realizámos um benchmark do NinjaOne Backup, do Acronis Cyber Protect Cloud Backup, do Comet Backup e do MSP360 Managed Backup em infraestrutura AWS idêntica. Cada fornecedor executou um backup em modo de ficheiro da mesma carga de trabalho de 625.946 ficheiros / 50 GB e um backup completo de imagem do disco do sistema, e…

IA
Benchmark
4 Ago

Comparação de Modelos de Fundação Relacionais

Comparamos em benchmark o SAP-RPT-1-OSS contra gradient boosting (LightGBM, CatBoost) em 17 datasets tabulares abrangendo o espectro semântico-numérico, tabelas pequenas/de alta semântica, datasets empresariais mistos e grandes datasets numéricos de baixa semântica. O nosso objetivo é medir onde os priores semânticos pré-treinados de um LLM relacional podem oferecer vantagens sobre os modelos de árvore tradicionais…

IA Agêntica
Benchmark
4 Ago

Pesquisa Agêntica: Avaliação de 8 APIs de Pesquisa para Agentes

A pesquisa agêntica desempenha um papel crucial na ligação entre os motores de busca tradicionais e as capacidades de pesquisa de IA. As APIs de pesquisa são a primeira camada de uma ferramenta agêntica, onde o desempenho limita a qualidade de tudo o que vem a jusante. Avaliámos 8 APIs de pesquisa através de 100…

Cibersegurança
Benchmark
4 Ago

Benchmark de Software DLP

Realizamos o benchmark do Acronis DeviceLock DLP e do ManageEngine DLP Plus em VMs idênticas com Windows Server 2022 com 28 cenários: 23 testes de fuga de dados (incluindo 12 arquivos de evasão adversária), 3 testes de segurança do agente e 2 testes sob alto consumo de CPU e memória. Para os outros produtos DLP,…

IA
Benchmark
4 Ago

Benchmark de Reranker: Top 8 Modelos Comparados

Fizemos benchmark de 8 modelos de reranker em ~145k avaliações da Amazon em inglês para medir o quanto uma etapa de re-ranqueamento melhora a recuperação densa. Recuperamos os top-100 candidatos com multilingual-e5-base, re-ranqueamos com cada modelo e avaliamos os top-10 resultados contra 300 consultas, cada uma referenciando detalhes concretos da avaliação original. O melhor reranker…

IA
Benchmark
2 Ago

GPU Benchmark de Concorrência: H100 vs H200 vs B200 vs MI300X

Passei os últimos 20 anos focado na otimização de desempenho computacional em nível de sistema. Realizamos benchmark das mais recentes NVIDIA GPUs, incluindo as NVIDIA’s H100, H200 e B200, e a AMD’s MI300X, para análise de escalabilidade de concorrência. Utilizando o framework vLLM com o gpt-oss-20b modelo, testamos como essas GPUs lidam com requisições concorrentes,…