Berk Kalelioğlu
Interesses de pesquisa
Berk concentra-se em aprendizado de máquina, ferramentas de IA de agentes e modelos de linguagem grandes e pequenos (LLMs e SLMs).Ele faz parte da equipe de benchmark da AIMultiple, conduzindo avaliações e fornecendo percepções para ajudar os leitores a entender tecnologias emergentes e suas aplicações no mundo real.
Experiência profissional
Ele começou sua carreira como Líder de Projetos de Tecnologia na ODTU IVME-R, onde liderou um projeto para construir geradores físicos quânticos e de números pseudoaleatórios.Após seu período na IVME-R, ele cofundou uma empresa de desenvolvimento de jogos e lançou um jogo na Steam.
Mais tarde, ele redirecionou sua carreira para a IA e ingressou na AIMultiple como Pesquisador.
Educação
Berk possui bacharelado em Matemática pela Ankara University.Últimos artigos de Berk
AIM Enterprise: Benchmark Empresarial Agêntico
As empresas usam LLMs todos os dias em suas tarefas regulares. Para encontrar os LLMs mais econômicos, projetamos o AIM Enterprise, um benchmark empresarial agêntico, onde usamos 69 tarefas empresariais reais em estratégia, marketing, RH, vendas e operações. Dois modelos juízes pontuaram todos os arquivos e frequentemente discordaram. Em cerca de um terço das pontuações…
MCP Gateway Benchmark: Latência e Segurança de 6 Gateways
Um gateway MCP fica entre um agente de IA e as ferramentas que ele chama, e os fornecedores o posicionam como a camada de segurança para esse tráfego. Avaliamos seis gateways MCP em relação a um backend instrumentado em uma única máquina, medindo latência adicionada, autorização por ferramenta, proteção de conteúdo e completude de auditoria.…
Benchmark de Classificação de Séries Temporais: Foundation Models vs Métodos Clássicos
Avaliamos 13 métodos de classificação de séries temporais, de foundation models de séries temporais pré-treinados a uma baseline de 22 features de 2019, em 33 datasets UCR/UEA sob um único protocolo congelado. São 14.638 células registradas de método-dataset-reamostragem, 11.874 delas pontuadas. O gráfico compara 12 métodos nos 15 datasets univariados que todos completaram, cada dataset…
A-CODE-CLI Bench: Benchmark de CLI agêntica
As ferramentas CLI agênticas são ferramentas de codificação de IA que podem criar e excluir arquivos, executar comandos, planejar e executar a codificação de todo o projeto. Avaliamos as principais ferramentas em 10 cenários reais de desenvolvimento web, realizando ~600 verificações atômicas de validação por agente e mais de ~5.000 execuções de teste automatizadas no…
Teste de Referência VPS: Hetzner vs Digital Ocean
Testamos 6 provedores de Servidor Virtual Privado (VPS) executando ~1.200 testes automatizados por servidor em CPU, memória, I/O de disco e velocidade de rede usando sysbench, fio e speedtest-cli. Também documentamos a experiência completa de cadastro ao SSH para cada provedor. Utilizamos planos de 4 vCPU (Compartilhada) / 8 GB de cada provedor, sem adicionar…
A-CODE-LLM Bench: Benchmark de Codificação Agêntica
Avaliamos os melhores Grandes Modelos de Linguagem (LLMs) em 10 tarefas de desenvolvimento de software usando uma ferramenta CLI agentiva. Executamos ~3.500 etapas de validação automatizadas por modelo, tanto na camada API quanto na de UI. Cada alias foi executado 3 vezes em 10 tarefas (30 amostras por alias, 400 células por iteração em 40…
Benchmark AIM de Marketing Agêntico
Estamos a apresentar o Benchmark AIM de Marketing Agêntico, que mede o desempenho dos agentes em três fluxos de trabalho de marketing: análise de lacunas competitivas, preparação de listas de alvos ABM e um deck de vendas personalizado. Também realizámos uma auditoria de reputação do site separada, na qual os agentes examinaram o conteúdo em…
Moltbook: Mídia Social Orientada por Agentes
O rápido crescimento do OpenClaw desencadeou um experimento social incomum: Moltbook, uma plataforma social semelhante ao Reddit onde agentes interagem entre si. Lançado em 28 de janeiro de 2026, e começou a ganhar atenção em um curto período. Atingiu 1.5m+ agentes na primeira semana. Para mais plataformas para agentes de IA, leia Por dentro do…
Agentic IT: Can LLMs Design a Benchmark
We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…
Melhores provedores com tarifa fixa de LLM API
Provedores de LLM com tarifa fixa vendem uso ilimitado do modelo por um preço mensal fixo em vez de cobrar por token. Esse modelo se espalhou porque sessões de codificação agentiva podem usar dezenas de milhões de tokens, então uma conta por token é difícil de prever. Muito poucos provedores oferecem uma tarifa fixa verdadeira;…
Boletim informativo AIMultiple
Receba um e-mail gratuito por semana com as últimas notícias de tecnologia B2B e insights de especialistas para impulsionar o seu negócio.