Ekrem Sarı
Ekrem é pesquisador de IA na AIMultiple, com foco em automação inteligente, GPUs, agentes de IA e LLMOps para frameworks RAG.
Experiência profissional
Durante sua atuação como Avaliador na Yandex, ele avaliou resultados de busca utilizando frameworks proprietários e protocolos automatizados. Implementou testes de controle de qualidade por meio de anotação de dados, pontuação de relevância e mapeamento da intenção do usuário em mais de 10.000 consultas mensais, além de conduzir avaliações técnicas, incluindo monitoramento de desempenho e detecção de spam utilizando ciclos de feedback de aprendizado de máquina.Interesse de pesquisa
Na AIMultiple, sua pesquisa se concentra no ciclo de vida de MLOps e no desempenho e benchmarking de sistemas de IA de ponta a ponta. Ele contribui para uma ampla gama de projetos, incluindo otimização de Geração Aumentada por Recuperação (RAG), benchmarking extensivo de Modelos de Linguagem Amplos (LLM) e o design de frameworks de IA para agentes. Ekrem se especializa no desenvolvimento de metodologias orientadas a dados para medir e aprimorar o desempenho da tecnologia de IA em métricas operacionais críticas, como precisão, eficiência, custo de API e escalabilidade. Sua análise abrange toda a pilha de tecnologia, desde componentes fundamentais, como modelos de incorporação e bancos de dados vetoriais, até a infraestrutura de nuvem e GPU de alto desempenho necessária para a implantação de agentes de IA.Educação
Ekrem é bacharel pela Hacettepe Üniversitesi e mestre pela Başkent Üniversitesi.Últimos artigos de Ekrem
Top 20+ Frameworks de RAG Agentic
O RAG agentic aprimora o RAG tradicional, aumentando o desempenho do LLM e permitindo maior especialização. Realizamos um benchmark para avaliar seu desempenho no roteamento entre vários bancos de dados e na geração de consultas. Explore frameworks e bibliotecas de RAG agentic, principais diferenças em relação ao RAG padrão, benefícios e desafios para desbloquear todo…
Cloud GPU Preços, Desempenho e Comparação de Fornecedores
Os preços de tabela de Cloud GPU para o mesmo modelo podem diferir várias vezes de um fornecedor para outro. Selecionámos o preço mais baixo, fornecedor, intervalo de mercado e mediana para mais de 40 configurações de GPU nos três níveis de preços, mais um benchmark de débito por dólar em 10 modelos. Veja a…
Índice de Preços de Locação de GPU na Nuvem
As tarifas sob demanda para as GPUs de última geração em nuvem (B200, B300, MI300X, RTX 5090) aproximadamente dobraram no último ano, enquanto as placas convencionais (H100, H200, A100) mantiveram uma faixa estreita. Compilamos o índice de GPU mensalmente de 63 provedores e 17 modelos de GPU, abrangendo os níveis sob demanda, spot e reservado…
LLM Calculadora de VRAM para Auto-hospedagem
Auto-hospedar um LLM significa executar a inferência em hardware controlado pelo operador, em vez de via uma API de terceiros, o que altera o custo, o controlo dos dados e o perfil de privacidade. O facto de um modelo conseguir sequer correr depende da memória. A calculadora estima a VRAM ou a memória unificada de…
Benchmark de 40+ LLMs em Finanças: Claude Fable 5 & GPT-5.6 Sol
Avaliamos 40+ LLMs em finanças em 238 perguntas difíceis do benchmark FinanceReasoning para identificar quais modelos se destacam em tarefas complexas de raciocínio financeiro, como análise de demonstrações, previsões e cálculos de índices. Avaliamos LLMs em 238 perguntas difíceis do benchmark FinanceReasoning (Tang et al.).1 Este subconjunto tem como alvo as tarefas de raciocínio financeiro…
Benchmark de Modelos de Embedding de Código Aberto para RAG
Avaliamos 14 modelos de embedding de código aberto, auto-hospedados em uma única H100, em mais de 500 consultas de recuperação curadas manualmente, abrangendo contratos legais, notas técnicas de suporte ao cliente e resumos médicos. NVIDIA Llama-Embed-Nemotron-8B lidera em precisão. Em custo, o EmbeddingGemma-300m do Google é aproximadamente 4x mais barato que o Nemotron, ao custo…
Compare Modelos de Fundação Relacionais
Fizemos benchmark do SAP-RPT-1-OSS contra boosting de gradiente (LightGBM, CatBoost) em 17 conjuntos de dados tabulares abrangendo o espectro semântico-numeral, tabelas de baixa/alta semântica, conjuntos de dados mistos de negócios e grandes conjuntos de dados numéricos de baixa semântica. Nosso objetivo é medir onde os priores semânticos pré-treinados de um LLM relacional podem fornecer vantagens…
Benchmark de Software de Arquivamento de E-mail
Provisionamos um tenant Microsoft 365, preenchemos-no com um corpus sintético de 10.000 e-mails e 1.700 anexos em 8 subtipos de tipos de arquivo, depois avaliamos o NinjaOne SaaS Archiver, Barracuda Cloud Archiving Service, Acronis Cyber Protect Cloud Email Archiving e MailPiler no mesmo tenant em 10 dimensões que abrangem ingestão, pesquisa, recuperação de anexos, exportação,…
Principais Funções Sem Servidor: Vercel vs Azure vs AWS
Funções sem servidor permitem que os desenvolvedores executem código sem precisar gerenciar um servidor. Isso permite que eles se concentrem em escrever e implantar aplicativos enquanto o dimensionamento e a manutenção da infraestrutura são tratados automaticamente em segundo plano. Neste benchmark, avaliamos 7 provedores populares de serviços em nuvem seguindo nossa metodologia para testar o…
Modelos de Incorporação Multimodal: Apple vs Meta vs OpenAI
Modelos de incorporação multimodal se destacam na identificação de objetos, mas lutam com relacionamentos. Os modelos atuais têm dificuldade em distinguir “telefone em um mapa” de “mapa em um telefone”. Avaliamos 7 modelos líderes em MS-COCO e Winoground para medir essa limitação específica. Para garantir uma comparação justa, avaliamos cada modelo sob condições idênticas usando…
Boletim informativo AIMultiple
Receba um e-mail gratuito por semana com as últimas notícias de tecnologia B2B e insights de especialistas para impulsionar o seu negócio.