Berk Kalelioğlu
Interesses de pesquisa
Berk concentra-se em aprendizado de máquina, ferramentas de IA agêntica e grandes e pequenos language models (LLMs e SLMs).Ele faz parte da equipe de benchmark da AIMultiple, realizando avaliações e fornecendo percepções para ajudar os leitores a entender tecnologias emergentes e suas aplicações no mundo real.
Experiência profissional
Ele começou sua carreira como Líder de Projeto Técnico na ODTU IVME-R, onde liderou um projeto para construir geradores físicos quânticos e de números pseudoaleatórios.Após sua passagem pela IVME-R, ele cofundou uma empresa de desenvolvimento de jogos e lançou um jogo na Steam.
Mais tarde, mudou sua carreira para a área de IA e ingressou na AIMultiple como Pesquisador.
Educação
Berk é bacharel em Matemática pela Ankara University.Últimos artigos de Berk
Agentic IT: os agentes de IA podem projetar um benchmark
Testamos 16 models no design de benchmark em text-to-SQL e chamada de ferramentas. Nenhuma de suas 32 submissões passou em todos os critérios. Os agentes puderam criar e executar testes, mas nenhum demonstrou tanto um teste de resposta em branco quanto um teste de resposta correta de seu próprio avaliador. O text-to-SQL transforma uma pergunta…
Pesquisa Aprofundada de IA: Claude vs ChatGPT vs Grok
A pesquisa aprofundada de IA oferece aos utilizadores uma gama mais ampla de resultados de pesquisa do que os motores de busca de IA. Para ver o desempenho de diferentes ferramentas de pesquisa aprofundada de IA, introduzimos três novos benchmarks: Bench DR-50 (Deep Research 50), que avalia ferramentas em 50 perguntas abrangendo seis tipos de…
Melhores provedores com tarifa fixa de LLM API
Provedores de LLM com tarifa fixa vendem uso ilimitado do modelo por um preço mensal fixo em vez de cobrar por token. Esse modelo se espalhou porque sessões de codificação agentiva podem usar dezenas de milhões de tokens, então uma conta por token é difícil de prever. Muito poucos provedores oferecem uma tarifa fixa verdadeira;…
Benchmark de VC com IA: 16 agentes de IA na identificação de clientes
A identificação de clientes faz parte da due diligence comercial. Testamos 16 modelos em pesquisas de listas de clientes para três sites de pesquisa e avaliação, um deles o AIMultiple, pontuando suas submissões em relação às chaves de resposta que compilamos e às páginas citadas. Não definimos esforço de raciocínio para nenhum modelo. Cada um…
AIM Enterprise: Benchmark Empresarial Agêntico
As empresas usam LLMs todos os dias em suas tarefas regulares. Para encontrar os LLMs com melhor custo-benefício, projetamos o AIM Enterprise, um benchmark empresarial agêntico, onde usamos 69 tarefas empresariais reais em estratégia, marketing, RH, vendas e operações. Dois modelos juízes pontuaram todos os arquivos que passaram nas verificações. Em 32,7% das pontuações individuais,…
Alternativas ao OpenClaw: Hermes vs ZeroClaw vs Grok Bot
Agentes de IA autônomos, como o OpenClaw e o agente Hermes, automatizam tarefas de várias etapas que normalmente exigiriam entrada humana constante. Embora o OpenClaw tenha se tornado o agente autônomo sempre ativo mais amplamente adotado, muitos usuários estão buscando alternativas devido ao seu processo de implantação desafiador e aos requisitos de configuração complexos. Fornecemos…
Agentes de Uso de Computador: Benchmark & Arquitetura
Os agentes de uso de computador operam desktops e aplicativos web reais. Seus designs, limites e compensações muitas vezes não são claros. Nós detalhamos como os sistemas líderes funcionam, como aprendem e como suas arquiteturas diferem. Também referenciamos um benchmark focado de ancoragem de IU em 100 capturas de tela de desktop, em 4 tipos…
MCP Gateway Benchmark: Latência e Segurança de 6 Gateways
Um gateway MCP fica entre um agente de IA e as ferramentas que ele chama, e os fornecedores o posicionam como a camada de segurança para esse tráfego. Avaliamos seis gateways MCP em relação a um backend instrumentado em uma única máquina, medindo latência adicionada, autorização por ferramenta, proteção de conteúdo e completude de auditoria.…
Benchmark de Classificação de Séries Temporais: Foundation Models vs Métodos Clássicos
Avaliamos 13 métodos de classificação de séries temporais, de foundation models de séries temporais pré-treinados a uma baseline de 22 features de 2019, em 33 datasets UCR/UEA sob um único protocolo congelado. São 14.638 células registradas de método-dataset-reamostragem, 11.874 delas pontuadas. O gráfico compara 12 métodos nos 15 datasets univariados que todos completaram, cada dataset…
A-CODE-CLI Bench: Benchmark de CLI agêntica
As ferramentas CLI agênticas são ferramentas de codificação de IA que podem criar e excluir arquivos, executar comandos, planejar e executar a codificação de todo o projeto. Avaliamos as principais ferramentas em 10 cenários reais de desenvolvimento web, realizando ~600 verificações atômicas de validação por agente e mais de ~5.000 execuções de teste automatizadas no…
Boletim informativo AIMultiple
Receba um e-mail gratuito por semana com as últimas notícias de tecnologia B2B e insights de especialistas para impulsionar o seu negócio.