Serviços
Contate-nos
Ekrem Sarı

Ekrem Sarı

Pesquisador de IA
35 Artigos
Mantenha-se atualizado sobre tecnologia B2B.

Ekrem é Pesquisador de IA e Analista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.

Experiência Profissional

Na AIMultiple, Ekrem faz benchmarks de sistemas de IA de ponta a ponta e constrói os fluxos de trabalho de dados e painéis usados para acompanhar métricas de benchmark e de produto. Seus benchmarks abrangem models de embedding e reranker, bancos de dados vetoriais e de grafos, mecanismos de inference, quantização, concorrência de GPU e escalonamento multi-GPU, preços e provedores de GPU em nuvem, text-to-SQL e frameworks de RAG e RAG agêntico.

Antes da AIMultiple, ele trabalhou como Avaliador na Yandex, onde avaliou a qualidade da pesquisa e rotulou grandes volumes de dados segundo diretrizes detalhadas para apoiar a qualidade de classificação e de model.

Interesse de Pesquisa

O trabalho de Ekrem se concentra no ciclo de vida de MLOps e LLMOps e na medição do desempenho de sistemas de IA. Ele compara models, frameworks e infraestrutura em métricas como acurácia, throughput, custo de API e escalabilidade, em toda a pilha, desde models de embedding e bancos de dados vetoriais até GPU e infraestrutura de nuvem. Sua dissertação de mestrado automatiza revisões sistemáticas da literatura com um pipeline baseado em RAG.

Educação

Ekrem possui bacharelado pela Hacettepe University e está concluindo um mestrado na Başkent University.

Últimos artigos de Ekrem

IA
Benchmark
14 Ago

Benchmark de Modelos de Embedding de Código Aberto para RAG

NVIDIA Llama-Embed-Nemotron-8B lidera em precisão. Em custo, o EmbeddingGemma-300m do Google roda cerca de 4x mais barato que o Nemotron ao custo de uma pequena perda de precisão. nDCG@3: Ganho cumulativo descontado normalizado no corte 3. Com um documento relevante por consulta, é 1 / log2(posição + 1) quando o documento ouro fica no top…

IA
Benchmark
14 Ago

Modelos de Embedding Multimodal: Apple vs Meta vs OpenAI

Modelos de embedding multimodal se destacam na identificação de objetos, mas têm dificuldade com relações. Os modelos atuais têm dificuldade para distinguir “telefone em cima de um mapa” de “mapa em cima de um telefone”. Fizemos benchmark de 7 modelos líderes nos conjuntos MS-COCO e Winoground para medir essa limitação específica. Para garantir uma comparação…

IA
Benchmark
14 Ago

Benchmark de 40+ LLMs em Finanças: Claude Fable 5 & GPT-5.6 Sol

Avaliamos LLMs em 238 questões difíceis do benchmark FinanceReasoning (Tang et al.).1 Este subconjunto tem como alvo as tarefas de raciocínio financeiro mais desafiadoras, avaliando raciocínio quantitativo complexo e em várias etapas envolvendo conceitos e fórmulas financeiras. Nossa avaliação empregou um design de prompt personalizado e critérios de pontuação de precisão e consumo de tokens.…

IA
Benchmark
14 Ago

Modelos de Embedding: OpenAI vs Gemini vs Voyage

Comparamos 15 modelos de embedding de texto em inglês e uma linha de base BM25 em mais de 500 consultas curadas manualmente em três domínios de recuperação: contratos legais (CUAD), suporte ao cliente (IBM TechQA) e saúde (MedRAG PubMed). Voyage-3.5 fica em primeiro lugar no geral. Perplexity Embed V1 0.6b alcança o nível médio-superior ao…

Software Empresarial
Benchmark
14 Ago

Benchmark de software de arquivamento de e-mail

Provisionamos um locatário do Microsoft 365, o preenchemos com um corpus sintético de 10.000 e-mails e 1.700 anexos em 8 subtipos de tipo de arquivo e, em seguida, comparamos o NinjaOne SaaS Archiver, o Barracuda Cloud Archiving Service, o Acronis Cyber Protect Cloud Email Archiving e o MailPiler no mesmo locatário em 10 dimensões que…

Dados
Benchmark
14 Ago

Scraper de E-Commerce: 4 Provedores Avaliados

Comparamos quatro provedores de dados da web em 100 domínios de e-commerce, coletando 65.000 páginas de produto e de busca, cada um com 5 a 5.000 requisições simultâneas. Na média entre os níveis de concorrência, Bright Data atingiu a maior taxa de sucesso (76%) com uma mediana de 16 segundos. Apify registrou o maior tempo…

Cibersegurança
Avaliação em Mundo Aberto
14 Ago

Benchmark de recuperação de desastres: Acronis vs Comet vs MSP360

Fizemos benchmark de Acronis Cyber Protect Cloud, Comet Backup e MSP360 Managed Backup em recuperação de desastres. Cada fornecedor criou uma imagem de um Windows Server 2022 ativo e de um servidor Ubuntu 24.04 ativo executando a mesma carga de trabalho determinística, um serviço web, um banco de dados de 10.000 linhas e 50 arquivos,…

Dados
Benchmark
14 Ago

Benchmark de banco de dados de grafos: Neo4j vs FalkorDB vs Memgraph

Comparamos Neo4j, FalkorDB e Memgraph em um grafo sintético derivado de 120.000 avaliações de produtos da Amazon (381K nós, 804K arestas). Executamos 12 modelos de consulta com 1.000 medições cada, testamos a ingestão em 6 tamanhos de lote, sustentamos carga concorrente por 60 segundos em até 32 threads e medimos memória, partida a frio, carga…

Cibersegurança
Benchmark
12 Ago

Detecção de bot: 9 fornecedores anti-bot avaliados em benchmark

Executamos dois benchmarks contra sites ativos, identificamos a empresa anti-bot à frente de cada domínio e medimos com que frequência os domínios de cada empresa retornaram o conteúdo solicitado. Isso cobre mais de 3.800 domínios rotulados e mais de 50.000 solicitações. O primeiro benchmark buscou páginas de produto e de busca em 100 domínios de…

IA
Comparação de Recursos
11 Ago

Principais 30+ Fabricantes de Chips de IA: NVIDIA e Seus Concorrentes

Com base em nossa experiência executando o benchmark de GPU na nuvem do AIMultiple com 10 modelos de GPU diferentes em 4 cenários diferentes, estas são as principais empresas de hardware de IA para cargas de trabalho de data center. *O chip de IA selecionado é a peça, plataforma ou projeto anunciado que melhor representa…