Ekrem Sarı
Ekrem é Pesquisador de IA e Cientista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.
Experiência Profissional
Na AIMultiple, Ekrem realiza benchmarks de sistemas de IA de ponta a ponta e constrói os fluxos de trabalho de dados e dashboards usados para acompanhar métricas de benchmark e de produto. Seus benchmarks abrangem models de embedding e reranker, bancos de dados vetoriais e de grafos, motores de inference, quantização, concorrência de GPU e escalonamento multi-GPU, preços e fornecedores de GPU na nuvem, text-to-SQL, e frameworks de RAG e RAG agêntico.
Antes da AIMultiple, ele trabalhou como Cientista de Dados na Yandex, onde consultou e analisou grandes datasets com SQL para avaliar a qualidade de busca e ranqueamento segundo diretrizes detalhadas.
Interesse de Pesquisa
O trabalho de Ekrem concentra-se em medir como os sistemas de LLM e de recuperação se comportam na prática. Ele projeta o ambiente de teste, executa as cargas de trabalho em hardware real e compara models, frameworks e infraestrutura em precisão, vazão, latência, custo e escalabilidade, em toda a stack, desde models de embedding e bancos de dados vetoriais até motores de inference e infraestrutura de GPU. Sua tese de mestrado automatiza revisões sistemáticas de literatura com uma pipeline baseada em RAG.
Educação
Ekrem possui um mestrado em Sistemas de Informação Gerenciais pela Başkent University, onde sua tese automatizou revisões sistemáticas de literatura com uma pipeline baseada em RAG, e está cursando um segundo mestrado em Engenharia de Dados e Conhecimento na Hacettepe University.
Últimos artigos de Ekrem
Benchmark de recuperação de desastres: Acronis vs Comet vs MSP360
Comparamos o Acronis Cyber Protect Cloud, o Comet Backup e o MSP360 Managed Backup em recuperação de desastres. Cada fornecedor criou uma imagem de um Windows Server 2022 ativo e de um servidor Ubuntu 24.04 ativo executando a mesma carga de trabalho determinística, um serviço web, um banco de dados de 10.000 linhas e 50…
Benchmark de bancos de dados vetoriais: 7 mecanismos de código aberto para RAG
Avaliamos sete bancos de dados vetoriais de código aberto e auto-hospedados como a camada de recuperação de um pipeline de RAG, cada um executado isoladamente com os mesmos embeddings bge-m3 e consultas médicas e técnicas reais, de modo que o índice do banco de dados fosse a única variável. A carga de trabalho abrangeu os…
Preços de GPU em nuvem, desempenho e comparação de provedores
Os preços de tabela de GPU em nuvem para o mesmo modelo podem variar várias vezes de um provedor para outro. Selecionamos a menor tarifa, o provedor, a faixa de mercado e a mediana para 40+ configurações de GPU em todos os três níveis de preços, além de um benchmark de throughput por dólar em…
RAG Ferramentas de avaliação: Weights & Biases vs Ragas vs DeepEval
Quando um pipeline de RAG recupera o contexto errado, o LLM gera com confiança a resposta errada. Os avaliadores de relevância de contexto são a principal defesa. Avaliamos cinco ferramentas em 1.460 perguntas e 14.600+ contextos pontuados sob condições idênticas: mesmo modelo juiz (GPT-4o), configurações padrão e nenhum prompt personalizado. Sob condições padrão, WandB, TruLens…
Modelos de Embedding: OpenAI vs Gemini vs Voyage
Fizemos benchmark de 15 modelos de embedding de texto em inglês e de um baseline BM25 em mais de 500 consultas curadas manualmente em três domínios de recuperação: contratos jurídicos (CUAD), suporte ao cliente (IBM TechQA) e saúde (MedRAG PubMed). Voyage-3.5 fica em primeiro lugar geral. Perplexity Embed V1 0.6b alcança o nível intermediário superior…
RAG Frameworks: LangChain vs LangGraph vs LlamaIndex
Avaliamos 5 RAG frameworks: LangChain, LangGraph, LlamaIndex, Haystack e DSPy, construindo o mesmo fluxo de trabalho agêntico RAG com componentes padronizados: modelos idênticos (GPT-4.1-mini), embeddings (BGE-small), retriever (Qdrant) e ferramentas (busca na web Tavily). Isso isola a sobrecarga real e a eficiência de tokens de cada framework. O benchmark consistiu em 100 consultas, com cada…
Benchmark de Modelos de Embedding de Código Aberto para RAG
NVIDIA Llama-Embed-Nemotron-8B lidera em precisão. Em custo, o EmbeddingGemma-300m do Google tem custo cerca de 4x menor que o Nemotron, com uma pequena perda de precisão. nDCG@3: Ganho cumulativo descontado normalizado no ponto de corte 3. Com um documento relevante por consulta, é 1 / log2(posição + 1) quando o documento gold aparece entre os…
Melhores RAG Ferramentas, Frameworks e Bibliotecas
RAG melhora as respostas de LLM ao fundamentá-las em dados externos em vez de apenas no que o modelo memorizou no treinamento. Fizemos benchmark dos componentes dos quais um sistema RAG é construído e reunimos os resultados em um só lugar, com um guia prático para escolher cada parte da stack. Veja nossos resultados de…
Busca agêntica: Benchmark de 8 APIs de busca para agentes
A busca agêntica desempenha um papel crucial na redução da lacuna entre os mecanismos de busca tradicionais e os recursos de busca com IA. As APIs de busca são a primeira camada de uma ferramenta agêntica, e o desempenho limita a qualidade de tudo o que vem a jusante. Avaliamos 8 APIs de busca em…
Modelos de Embedding Multimodal: Apple vs Meta vs OpenAI
Modelos de embedding multimodal se destacam na identificação de objetos, mas têm dificuldade com relações. Os modelos atuais têm dificuldade para distinguir “telefone em cima de um mapa” de “mapa em cima de um telefone”. Fizemos benchmark de 7 modelos líderes nos conjuntos MS-COCO e Winoground para medir essa limitação específica. Para garantir uma comparação…
Boletim informativo AIMultiple
Receba um e-mail gratuito por semana com as últimas notícias de tecnologia B2B e insights de especialistas para impulsionar o seu negócio.