Modelos de IA
Os modelos de IA fazem previsões com base em seus dados de treinamento. Eles podem funcionar em qualquer domínio, como números, texto ou multimídia.
Text-to-SQL: Comparação da precisão de LLM
Executamos 36 grandes modelos de linguagem em 759 perguntas do BIRD-SQL, cada modelo escrevendo SQL contra um banco de dados que precisava identificar por si mesmo entre 11 candidatos. Toda consulta analisável foi executada no banco de dados real e seu conjunto de resultados comparado com o conjunto de resultados da consulta gold do BIRD.…
LLM Participação de Mercado: Compare Uso e Adoção
Analisamos a participação de mercado de LLM combinando dados baseados em uso e estimativas de visitas web para mostrar como a demanda por large language models está distribuída entre laboratórios de IA e aplicações de IA. Leia a metodologia para ver como medimos e calculamos esses resultados. Os Estados Unidos dominaram as visitas web ao…
AIM-Decision: Jev versus Kev versus LLMs
Modelos de decisão, também chamados de modelos System One,1 escolhem a próxima ação do agente em uma única passagem em vez de gerar texto token por token. Para ver se eles podem tornar a automação de navegador mais barata do que LLMs, executamos três modelos de decisão e dois LLMs, Gemini 3.8 Flash e GPT-6…
Comparar Modelos de IA Multimodais em Raciocínio Visual
Avaliámos 15 modelos de IA multimodais líderes em raciocínio visual utilizando 200 perguntas baseadas em imagens. A avaliação consistiu em duas pistas: 100 perguntas de compreensão de gráficos testando a interpretação de visualizações de dados, e 100 perguntas de lógica visual avaliando o reconhecimento de padrões e o raciocínio espacial. Cada pergunta foi executada 5…
Modelos Multimodais Grandes (LMMs) vs LLMs
Avaliamos o desempenho de Modelos Multimodais Grandes (LMMs) em tarefas de raciocínio financeiro usando um dataset cuidadosamente selecionado. Ao analisar um subconjunto de amostras financeiras de alta qualidade, avaliamos as capacidades dos modelos no processamento e raciocínio com dados multimodais no domínio financeiro. A seção de metodologia fornece percepções detalhadas sobre o dataset e o…
LLM Calculadora de VRAM para Auto-Hospedagem
Auto-hospedar um LLM significa executar a inferência em hardware que o operador controla, em vez de via uma API de terceiros, o que altera o custo, o controle de dados e o perfil de privacidade. O fato de um modelo executar ou não depende da memória. A calculadora estima a VRAM ou memória unificada que…
TI Agêntica: Podem os Agentes de IA Conceber um Benchmark
Testámos 16 models na conceção de um benchmark em text-to-SQL e chamada de ferramentas. Cada model criou um benchmark por tópico, num total de 32 submissões. Nenhuma submissão passou em todos os critérios da rubrica. Os agentes conseguiram criar e executar testes, mas nenhum demonstrou simultaneamente um teste de resposta em branco e um teste…
AIM Enterprise: Benchmark Empresarial Agêntico
As empresas usam LLMs todos os dias para suas tarefas regulares. Para encontrar os LLMs com melhor custo-benefício, projetamos o AIM Enterprise, um benchmark empresarial agêntico, no qual usamos 69 tarefas empresariais reais em estratégia, marketing, RH, vendas e operações. Dois modelos juízes pontuaram cada arquivo que passou nas verificações. Em 32,7% das pontuações individuais,…
O Futuro dos Large Language Models
Veja o futuro dos large language models explorando abordagens promissoras, como autotreinamento, verificação de fatos e especialização esparsa, que poderiam resolver as limitações do LLM. Comparação da taxa de sucesso dos LLM’s Claude Sonnet 4.6 liderou o benchmark com uma pontuação geral de 0.748, com as variantes base e thinking empatadas até a terceira casa…
World Foundation Models: 10 Casos de Uso
Treinar robôs e veículos autônomos (AVs) no mundo físico pode ser caro, demorado e arriscado. Os World Foundation Models oferecem uma alternativa escalável ao permitir simulações realistas de ambientes do mundo real. Esses models aceleram o desenvolvimento e a implantação em robótica, AVs e outros domínios, reduzindo a dependência de testes físicos. Descubra como os…