Ekrem Sarı
Ekrem é Pesquisador de IA e Cientista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.
Experiência Profissional
Na AIMultiple, Ekrem realiza benchmarks de sistemas de IA de ponta a ponta e constrói os fluxos de trabalho de dados e dashboards usados para acompanhar métricas de benchmark e de produto. Seus benchmarks abrangem models de embedding e reranker, bancos de dados vetoriais e de grafos, motores de inference, quantização, concorrência de GPU e escalonamento multi-GPU, preços e fornecedores de GPU na nuvem, text-to-SQL, e frameworks de RAG e RAG agêntico.
Antes da AIMultiple, ele trabalhou como Cientista de Dados na Yandex, onde consultou e analisou grandes datasets com SQL para avaliar a qualidade de busca e ranqueamento segundo diretrizes detalhadas.
Interesse de Pesquisa
O trabalho de Ekrem concentra-se em medir como os sistemas de LLM e de recuperação se comportam na prática. Ele projeta o ambiente de teste, executa as cargas de trabalho em hardware real e compara models, frameworks e infraestrutura em precisão, vazão, latência, custo e escalabilidade, em toda a stack, desde models de embedding e bancos de dados vetoriais até motores de inference e infraestrutura de GPU. Sua tese de mestrado automatiza revisões sistemáticas de literatura com uma pipeline baseada em RAG.
Educação
Ekrem possui um mestrado em Sistemas de Informação Gerenciais pela Başkent University, onde sua tese automatizou revisões sistemáticas de literatura com uma pipeline baseada em RAG, e está cursando um segundo mestrado em Engenharia de Dados e Conhecimento na Hacettepe University.
Últimos artigos de Ekrem
Benchmark de bancos de dados vetoriais: 7 mecanismos de código aberto para RAG
Avaliamos sete bancos de dados vetoriais de código aberto e auto-hospedados como a camada de recuperação de um pipeline de RAG, cada um executado isoladamente com os mesmos embeddings bge-m3 e consultas médicas e técnicas reais, de modo que o índice do banco de dados fosse a única variável. A carga de trabalho abrangeu os…
Comparação de Modelos de Fundação Relacionais
Comparamos em benchmark o SAP-RPT-1-OSS contra gradient boosting (LightGBM, CatBoost) em 17 datasets tabulares abrangendo o espectro semântico-numérico, tabelas pequenas/de alta semântica, datasets empresariais mistos e grandes datasets numéricos de baixa semântica. O nosso objetivo é medir onde os priores semânticos pré-treinados de um LLM relacional podem oferecer vantagens sobre os modelos de árvore tradicionais…
Top 70+ provedores de GPU em nuvem
Os provedores de GPU em nuvem se dividem em três níveis. Os hiperescaladores operam plataformas de nuvem amplas com aluguel de GPU como um produto entre muitos. Os neoclouds especializados concentram-se em infraestrutura de GPU e IA como seu produto principal. Os marketplaces comunitários agregam inventário de muitos operadores pequenos, frequentemente no piso da variação…
Preços de GPU em nuvem, desempenho e comparação de provedores
Os preços de tabela de GPU em nuvem para o mesmo modelo podem variar várias vezes de um provedor para outro. Selecionamos a menor tarifa, o provedor, a faixa de mercado e a mediana para 40+ configurações de GPU em todos os três níveis de preços, além de um benchmark de throughput por dólar em…
RAG Ferramentas de avaliação: Weights & Biases vs Ragas vs DeepEval
Quando um pipeline de RAG recupera o contexto errado, o LLM gera com confiança a resposta errada. Os avaliadores de relevância de contexto são a principal defesa. Avaliamos cinco ferramentas em 1.460 perguntas e 14.600+ contextos pontuados sob condições idênticas: mesmo modelo juiz (GPT-4o), configurações padrão e nenhum prompt personalizado. Sob condições padrão, WandB, TruLens…
Modelos de Embedding: OpenAI vs Gemini vs Voyage
Fizemos benchmark de 15 modelos de embedding de texto em inglês e de um baseline BM25 em mais de 500 consultas curadas manualmente em três domínios de recuperação: contratos jurídicos (CUAD), suporte ao cliente (IBM TechQA) e saúde (MedRAG PubMed). Voyage-3.5 fica em primeiro lugar geral. Perplexity Embed V1 0.6b alcança o nível intermediário superior…
RAG Frameworks: LangChain vs LangGraph vs LlamaIndex
Avaliamos 5 RAG frameworks: LangChain, LangGraph, LlamaIndex, Haystack e DSPy, construindo o mesmo fluxo de trabalho agêntico RAG com componentes padronizados: modelos idênticos (GPT-4.1-mini), embeddings (BGE-small), retriever (Qdrant) e ferramentas (busca na web Tavily). Isso isola a sobrecarga real e a eficiência de tokens de cada framework. O benchmark consistiu em 100 consultas, com cada…
Benchmark de software de backup: Acronis vs NinjaOne vs Comet vs MSP360
Comparamos o NinjaOne Backup, o Acronis Cyber Protect Cloud Backup, o Comet Backup e o MSP360 Managed Backup em uma infraestrutura AWS idêntica. Cada fornecedor executou um backup em modo de arquivo da mesma carga de trabalho de 625.946 arquivos / 50 GB e um backup de imagem completo do disco do sistema e, em…
Benchmark de Modelos de Embedding de Código Aberto para RAG
NVIDIA Llama-Embed-Nemotron-8B lidera em precisão. Em custo, o EmbeddingGemma-300m do Google tem custo cerca de 4x menor que o Nemotron, com uma pequena perda de precisão. nDCG@3: Ganho cumulativo descontado normalizado no ponto de corte 3. Com um documento relevante por consulta, é 1 / log2(posição + 1) quando o documento gold aparece entre os…
Benchmark de Reranker: Comparação dos 8 Principais Modelos
Avaliamos 8 modelos de reranker em ~145k avaliações da Amazon em inglês para medir o quanto uma etapa de reranking melhora a recuperação densa. Recuperamos os top-100 candidatos com multilingual-e5-base, reordenamos com cada modelo e avaliamos os top-10 resultados em relação a 300 consultas, cada uma referenciando detalhes concretos da avaliação de origem. O melhor…
Boletim informativo AIMultiple
Receba um e-mail gratuito por semana com as últimas notícias de tecnologia B2B e insights de especialistas para impulsionar o seu negócio.