Serviços
Contate-nos
Ekrem Sarı

Ekrem Sarı

Pesquisador de IA
35 Artigos
Mantenha-se atualizado sobre tecnologia B2B.

Ekrem é Pesquisador de IA e Cientista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.

Experiência Profissional

Na AIMultiple, Ekrem realiza benchmarks de sistemas de IA de ponta a ponta e constrói os fluxos de trabalho de dados e dashboards usados para acompanhar métricas de benchmark e de produto. Seus benchmarks abrangem models de embedding e reranker, bancos de dados vetoriais e de grafos, motores de inference, quantização, concorrência de GPU e escalonamento multi-GPU, preços e fornecedores de GPU na nuvem, text-to-SQL, e frameworks de RAG e RAG agêntico.

Antes da AIMultiple, ele trabalhou como Cientista de Dados na Yandex, onde consultou e analisou grandes datasets com SQL para avaliar a qualidade de busca e ranqueamento segundo diretrizes detalhadas.

Interesse de Pesquisa

O trabalho de Ekrem concentra-se em medir como os sistemas de LLM e de recuperação se comportam na prática. Ele projeta o ambiente de teste, executa as cargas de trabalho em hardware real e compara models, frameworks e infraestrutura em precisão, vazão, latência, custo e escalabilidade, em toda a stack, desde models de embedding e bancos de dados vetoriais até motores de inference e infraestrutura de GPU. Sua tese de mestrado automatiza revisões sistemáticas de literatura com uma pipeline baseada em RAG.

Educação

Ekrem possui um mestrado em Sistemas de Informação Gerenciais pela Başkent University, onde sua tese automatizou revisões sistemáticas de literatura com uma pipeline baseada em RAG, e está cursando um segundo mestrado em Engenharia de Dados e Conhecimento na Hacettepe University.

Últimos artigos de Ekrem

IA
Benchmark
4 Set

Benchmark de bancos de dados vetoriais: 7 mecanismos de código aberto para RAG

Avaliamos sete bancos de dados vetoriais de código aberto e auto-hospedados como a camada de recuperação de um pipeline de RAG, cada um executado isoladamente com os mesmos embeddings bge-m3 e consultas médicas e técnicas reais, de modo que o índice do banco de dados fosse a única variável. A carga de trabalho abrangeu os…

IA
Benchmark
2 Set

Comparação de Modelos de Fundação Relacionais

Comparamos em benchmark o SAP-RPT-1-OSS contra gradient boosting (LightGBM, CatBoost) em 17 datasets tabulares abrangendo o espectro semântico-numérico, tabelas pequenas/de alta semântica, datasets empresariais mistos e grandes datasets numéricos de baixa semântica. O nosso objetivo é medir onde os priores semânticos pré-treinados de um LLM relacional podem oferecer vantagens sobre os modelos de árvore tradicionais…

IA
Avaliação em Mundo Aberto
31 Ago

Top 70+ provedores de GPU em nuvem

Os provedores de GPU em nuvem se dividem em três níveis. Os hiperescaladores operam plataformas de nuvem amplas com aluguel de GPU como um produto entre muitos. Os neoclouds especializados concentram-se em infraestrutura de GPU e IA como seu produto principal. Os marketplaces comunitários agregam inventário de muitos operadores pequenos, frequentemente no piso da variação…

IA
Benchmark
31 Ago

Preços de GPU em nuvem, desempenho e comparação de provedores

Os preços de tabela de GPU em nuvem para o mesmo modelo podem variar várias vezes de um provedor para outro. Selecionamos a menor tarifa, o provedor, a faixa de mercado e a mediana para 40+ configurações de GPU em todos os três níveis de preços, além de um benchmark de throughput por dólar em…

IA
Benchmark
31 Ago

RAG Ferramentas de avaliação: Weights & Biases vs Ragas vs DeepEval

Quando um pipeline de RAG recupera o contexto errado, o LLM gera com confiança a resposta errada. Os avaliadores de relevância de contexto são a principal defesa. Avaliamos cinco ferramentas em 1.460 perguntas e 14.600+ contextos pontuados sob condições idênticas: mesmo modelo juiz (GPT-4o), configurações padrão e nenhum prompt personalizado. Sob condições padrão, WandB, TruLens…

IA
Benchmark
31 Ago

Modelos de Embedding: OpenAI vs Gemini vs Voyage

Fizemos benchmark de 15 modelos de embedding de texto em inglês e de um baseline BM25 em mais de 500 consultas curadas manualmente em três domínios de recuperação: contratos jurídicos (CUAD), suporte ao cliente (IBM TechQA) e saúde (MedRAG PubMed). Voyage-3.5 fica em primeiro lugar geral. Perplexity Embed V1 0.6b alcança o nível intermediário superior…

IA
Benchmark
31 Ago

RAG Frameworks: LangChain vs LangGraph vs LlamaIndex

Avaliamos 5 RAG frameworks: LangChain, LangGraph, LlamaIndex, Haystack e DSPy, construindo o mesmo fluxo de trabalho agêntico RAG com componentes padronizados: modelos idênticos (GPT-4.1-mini), embeddings (BGE-small), retriever (Qdrant) e ferramentas (busca na web Tavily). Isso isola a sobrecarga real e a eficiência de tokens de cada framework. O benchmark consistiu em 100 consultas, com cada…

Cibersegurança
Benchmark
31 Ago

Benchmark de software de backup: Acronis vs NinjaOne vs Comet vs MSP360

Comparamos o NinjaOne Backup, o Acronis Cyber Protect Cloud Backup, o Comet Backup e o MSP360 Managed Backup em uma infraestrutura AWS idêntica. Cada fornecedor executou um backup em modo de arquivo da mesma carga de trabalho de 625.946 arquivos / 50 GB e um backup de imagem completo do disco do sistema e, em…

IA
Benchmark
31 Ago

Benchmark de Modelos de Embedding de Código Aberto para RAG

NVIDIA Llama-Embed-Nemotron-8B lidera em precisão. Em custo, o EmbeddingGemma-300m do Google tem custo cerca de 4x menor que o Nemotron, com uma pequena perda de precisão. nDCG@3: Ganho cumulativo descontado normalizado no ponto de corte 3. Com um documento relevante por consulta, é 1 / log2(posição + 1) quando o documento gold aparece entre os…

IA
Benchmark
31 Ago

Benchmark de Reranker: Comparação dos 8 Principais Modelos

Avaliamos 8 modelos de reranker em ~145k avaliações da Amazon em inglês para medir o quanto uma etapa de reranking melhora a recuperação densa. Recuperamos os top-100 candidatos com multilingual-e5-base, reordenamos com cada modelo e avaliamos os top-10 resultados em relação a 300 consultas, cada uma referenciando detalhes concretos da avaliação de origem. O melhor…