Premium
Serviços
Premium

Modelos de IA

Os modelos de IA fazem previsões com base em seus dados de treinamento. Eles podem funcionar em qualquer domínio, como números, texto ou multimídia.

Explorar: categoria

Benchmark de 40+ LLMs em Finanças: Claude Fable 5 & GPT-5.6 Sol

LLM
Benchmark
28 set

Avaliamos LLMs em 238 perguntas difíceis do benchmark FinanceReasoning (Tang et al.).1 Este subconjunto tem como alvo as tarefas de raciocínio financeiro mais desafiadoras, avaliando raciocínio quantitativo complexo e de múltiplas etapas envolvendo conceitos e fórmulas financeiras. Nossa avaliação empregou um design de prompt personalizado e critérios de pontuação de precisão e consumo de tokens.…

Leia mais
LLM
Benchmark
25 set

Text-to-SQL: Comparação da precisão de LLM

Executamos 36 grandes modelos de linguagem em 759 perguntas do BIRD-SQL, cada modelo escrevendo SQL contra um banco de dados que precisava identificar por si mesmo entre 11 candidatos. Toda consulta analisável foi executada no banco de dados real e seu conjunto de resultados comparado com o conjunto de resultados da consulta gold do BIRD.…

LLM
Análise
25 set

LLM Participação de Mercado: Compare Uso e Adoção

Analisamos a participação de mercado de LLM combinando dados baseados em uso e estimativas de visitas web para mostrar como a demanda por large language models está distribuída entre laboratórios de IA e aplicações de IA. Leia a metodologia para ver como medimos e calculamos esses resultados. Os Estados Unidos dominaram as visitas web ao…

Modelos de IA
Benchmark
24 set

AIM-Decision: Jev versus Kev versus LLMs

Modelos de decisão, também chamados de modelos System One,1 escolhem a próxima ação do agente em uma única passagem em vez de gerar texto token por token. Para ver se eles podem tornar a automação de navegador mais barata do que LLMs, executamos três modelos de decisão e dois LLMs, Gemini 3.8 Flash e GPT-6…

LLM
Benchmark
21 set

Comparar Modelos de IA Multimodais em Raciocínio Visual

Avaliámos 15 modelos de IA multimodais líderes em raciocínio visual utilizando 200 perguntas baseadas em imagens. A avaliação consistiu em duas pistas: 100 perguntas de compreensão de gráficos testando a interpretação de visualizações de dados, e 100 perguntas de lógica visual avaliando o reconhecimento de padrões e o raciocínio espacial. Cada pergunta foi executada 5…

LLM
Análise
21 set

Modelos Multimodais Grandes (LMMs) vs LLMs

Avaliamos o desempenho de Modelos Multimodais Grandes (LMMs) em tarefas de raciocínio financeiro usando um dataset cuidadosamente selecionado. Ao analisar um subconjunto de amostras financeiras de alta qualidade, avaliamos as capacidades dos modelos no processamento e raciocínio com dados multimodais no domínio financeiro. A seção de metodologia fornece percepções detalhadas sobre o dataset e o…

LLM
Análise
21 set

LLM Calculadora de VRAM para Auto-Hospedagem

Auto-hospedar um LLM significa executar a inferência em hardware que o operador controla, em vez de via uma API de terceiros, o que altera o custo, o controle de dados e o perfil de privacidade. O fato de um modelo executar ou não depende da memória. A calculadora estima a VRAM ou memória unificada que…

LLM
Benchmark
18 set

TI Agêntica: Podem os Agentes de IA Conceber um Benchmark

Testámos 16 models na conceção de um benchmark em text-to-SQL e chamada de ferramentas. Cada model criou um benchmark por tópico, num total de 32 submissões. Nenhuma submissão passou em todos os critérios da rubrica. Os agentes conseguiram criar e executar testes, mas nenhum demonstrou simultaneamente um teste de resposta em branco e um teste…

LLM
Benchmark
17 set

AIM Enterprise: Benchmark Empresarial Agêntico

As empresas usam LLMs todos os dias para suas tarefas regulares. Para encontrar os LLMs com melhor custo-benefício, projetamos o AIM Enterprise, um benchmark empresarial agêntico, no qual usamos 69 tarefas empresariais reais em estratégia, marketing, RH, vendas e operações. Dois modelos juízes pontuaram cada arquivo que passou nas verificações. Em 32,7% das pontuações individuais,…

LLM
Análise
17 set

O Futuro dos Large Language Models

Veja o futuro dos large language models explorando abordagens promissoras, como autotreinamento, verificação de fatos e especialização esparsa, que poderiam resolver as limitações do LLM. Comparação da taxa de sucesso dos LLM’s Claude Sonnet 4.6 liderou o benchmark com uma pontuação geral de 0.748, com as variantes base e thinking empatadas até a terceira casa…

Modelos de IA
Análise
15 set

World Foundation Models: 10 Casos de Uso

Treinar robôs e veículos autônomos (AVs) no mundo físico pode ser caro, demorado e arriscado. Os World Foundation Models oferecem uma alternativa escalável ao permitir simulações realistas de ambientes do mundo real. Esses models aceleram o desenvolvimento e a implantação em robótica, AVs e outros domínios, reduzindo a dependência de testes físicos. Descubra como os…