Agentes de IA
Agentes de IA são sistemas de software que usam raciocínio, planejamento e ferramentas para auxiliar ou automatizar tarefas complexas. Comparamos os principais agentes de código aberto e comerciais.
Large Action Models: Hype ou Realidade?
Após o lançamento do Rabbit, um dispositivo de IA que pode usar aplicativos móveis, o termo large action models (LAMs) está ganhando popularidade. Esses modelos vão além da conversa, transformando LLMs em "agentes" que podem conectar o mundo isolado e orientado por aplicativos sem exigir que os usuários cliquem em aplicativos ou integrem APIs. A…
A-CODE-CLI Bench: Benchmark de CLI agêntica
As ferramentas CLI agênticas são ferramentas de codificação de IA que podem criar e excluir arquivos, executar comandos, planejar e executar a codificação de todo o projeto. Avaliamos as principais ferramentas em 10 cenários reais de desenvolvimento web, realizando ~600 verificações atômicas de validação por agente e mais de ~5.000 execuções de teste automatizadas no…
Agentes de IA móveis testados em 65 tarefas do mundo real
Passámos 3 dias a avaliar quatro agentes de IA (DroidRun, Mobile-Agent, AutoDroid e AppAgent) em 65 tarefas do mundo real usando um emulador Android com aplicações como gestão de calendário, criação de contactos, captura de fotografias, gravação de áudio e ficheiros operações. Veja os resultados do benchmark, incluindo a comparação de desempenho no mundo real,…
Agentes de IA da SAP: estudos de caso do Joule Studio
A SAP prevê que os agentes de IA podem suportar até 80% das tarefas de negócio mais usadas na SAP. 1 Avaliamos o portfólio de agentes de IA da SAP, estudos de caso relacionados e a infraestrutura de suporte e identificamos três mudanças que moldam a estratégia de agentes de IA da SAP: A tabela…
Melhores 50+ agentes de IA de código aberto listados
Todos têm criado agentes de IA, então, após testes práticos com agentes de codificação de IA, construtores de agentes de IA e benchmarks de uso de ferramentas para avaliar suas capacidades no mundo real, reunimos uma lista curada dos melhores 50+ agentes de IA de código aberto. Clique nos cabeçalhos das categorias para ir diretamente…
Busca agêntica: Benchmark de 8 APIs de busca para agentes
A busca agêntica desempenha um papel crucial na redução da lacuna entre os mecanismos de busca tradicionais e os recursos de busca com IA. As APIs de busca são a primeira camada de uma ferramenta agêntica, e o desempenho limita a qualidade de tudo o que vem a jusante. Avaliamos 8 APIs de busca em…
A-CODE-LLM Bench: Benchmark de Codificação Agêntica
Avaliamos os melhores Grandes Modelos de Linguagem (LLMs) em 10 tarefas de desenvolvimento de software usando uma ferramenta CLI agentiva. Executamos ~3.500 etapas de validação automatizadas por modelo, tanto na camada API quanto na de UI. Cada alias foi executado 3 vezes em 10 tarefas (30 amostras por alias, 400 células por iteração em 40…
Top 30+ Empresas de IA Agêntica
Embora os agentes de IA estejam sendo exagerados e algumas empresas rebatizem seus chatbots como ferramentas agênticas, ainda há poucos agentes em produção. Anteriormente, comparamos vários agentes de IA capazes em várias tarefas do mundo real. Listamos: Essas empresas se concentram principalmente em pesquisa e desenvolvimento de IA agêntica, oferecendo iniciativas como diretrizes éticas de…
Principais Arreios de Agente: Claude Code vs Codex
Os arreios de agente servem como tempo de execução de produção para agentes de IA, com escolhas de design que criam variação de desempenho entre modelos subjacentes idênticos. Avaliamos 17 arreios de agente em 10 tarefas de codificação. Para isolar o arco em vez do modelo, executámos cada CLI agêntica num único modelo de base,…
Benchmark de Finanças com IA Agêntica: FinRobot vs FinRL vs FinGPT
79% dos executivos relatam que suas empresas começaram a adotar agentes de IA, mas apenas 34% os estão usando atualmente em contabilidade e finanças.1 Realizamos um benchmark em 3 ferramentas de IA agêntica para finanças adaptadas para fluxos de trabalho financeiros. Os resultados sugerem que Este artigo apresenta os resultados do benchmark junto com casos…