Berk Kalelioğlu
Interesses de pesquisa
Berk concentra-se em aprendizado de máquina, ferramentas de IA agêntica e grandes e pequenos language models (LLMs e SLMs).Ele faz parte da equipe de benchmark da AIMultiple, realizando avaliações e fornecendo percepções para ajudar os leitores a entender tecnologias emergentes e suas aplicações no mundo real.
Experiência profissional
Ele começou sua carreira como Líder de Projeto Técnico na ODTU IVME-R, onde liderou um projeto para construir geradores físicos quânticos e de números pseudoaleatórios.Após sua passagem pela IVME-R, ele cofundou uma empresa de desenvolvimento de jogos e lançou um jogo na Steam.
Mais tarde, mudou sua carreira para a área de IA e ingressou na AIMultiple como Pesquisador.
Educação
Berk é bacharel em Matemática pela Ankara University.Últimos artigos de Berk
MCP Gateway Benchmark: Latência e Segurança de 6 Gateways
Um gateway MCP fica entre um agente de IA e as ferramentas que ele chama, e os fornecedores o posicionam como a camada de segurança para esse tráfego. Avaliamos seis gateways MCP em relação a um backend instrumentado em uma única máquina, medindo latência adicionada, autorização por ferramenta, proteção de conteúdo e completude de auditoria.…
AIM-Decision: Jev versus Kev versus LLMs
Modelos de decisão, também chamados de modelos System One,1 escolhem a próxima ação do agente em uma única passagem em vez de gerar texto token por token. Para ver se eles podem tornar a automação de navegador mais barata do que LLMs, executamos três modelos de decisão e dois LLMs, Gemini 3.8 Flash e GPT-6…
Agentes Sempre Ativos: Dots vs Grok Bot vs Muse
Agentes sempre ativos continuam trabalhando depois que você fecha o aplicativo. Cada um roda em um computador que mantém seus arquivos e memória, inicia tarefas em uma programação ou quando algo acontece e envia mensagens quando precisa de uma decisão. Comparamos cinco deles: OpenAI Dots, Grok Bot, Meta Muse, Hermes Agent e OpenClaw. *Nous Research…
AIM Benchmark Web Agêntico
Agentes dependem de interfaces web para concluir tarefas na web. Para medir como a escolha da interface afeta a conclusão de tarefas, construímos o AIM Benchmark Web Agêntico e tentamos 3.500 tarefas (100 tarefas concluídas por meio de 7 interfaces web em 5 execuções). Uma interface Bright Data liderou todas as execuções. A CLI Bright…
TI Agêntica: Podem os Agentes de IA Conceber um Benchmark
Testámos 16 models na conceção de um benchmark em text-to-SQL e chamada de ferramentas. Cada model criou um benchmark por tópico, num total de 32 submissões. Nenhuma submissão passou em todos os critérios da rubrica. Os agentes conseguiram criar e executar testes, mas nenhum demonstrou simultaneamente um teste de resposta em branco e um teste…
AIM Enterprise: Benchmark Empresarial Agêntico
As empresas usam LLMs todos os dias para suas tarefas regulares. Para encontrar os LLMs com melhor custo-benefício, projetamos o AIM Enterprise, um benchmark empresarial agêntico, no qual usamos 69 tarefas empresariais reais em estratégia, marketing, RH, vendas e operações. Dois modelos juízes pontuaram cada arquivo que passou nas verificações. Em 32,7% das pontuações individuais,…
Pesquisa aprofundada de IA: Codex vs Claude vs Grok vs Exa
Uma ferramenta de pesquisa aprofundada responde a uma pergunta com um relatório escrito em vez de uma página de links. Executamos cinco maneiras de produzir um relatório sobre os mesmos 20 briefings de pesquisa de negócios e pontuamos cada relatório de acordo com regras definidas antes das execuções para encontrar a melhor ferramenta para pesquisa…
Melhores provedores com tarifa fixa de LLM API
Provedores de LLM com tarifa fixa vendem uso ilimitado do modelo por um preço mensal fixo em vez de cobrar por token. Esse modelo se espalhou porque sessões de codificação agentiva podem usar dezenas de milhões de tokens, então uma conta por token é difícil de prever. Muito poucos provedores oferecem uma tarifa fixa verdadeira;…
Benchmark de VC com IA: 16 agentes de IA na identificação de clientes
A identificação de clientes faz parte da due diligence comercial. Testamos 16 modelos em pesquisas de listas de clientes para três sites de pesquisa e avaliação, um deles o AIMultiple, pontuando suas submissões em relação às chaves de resposta que compilamos e às páginas citadas. Não definimos esforço de raciocínio para nenhum modelo. Cada um…
Alternativas ao OpenClaw: Hermes vs ZeroClaw vs Grok Bot
Agentes de IA autônomos, como o OpenClaw e o agente Hermes, automatizam tarefas de várias etapas que normalmente exigiriam entrada humana constante. Embora o OpenClaw tenha se tornado o agente autônomo sempre ativo mais amplamente adotado, muitos usuários estão buscando alternativas devido ao seu processo de implantação desafiador e aos requisitos de configuração complexos. Fornecemos…
Boletim informativo AIMultiple
Receba um e-mail gratuito por semana com as últimas notícias de tecnologia B2B e insights de especialistas para impulsionar o seu negócio.