Inteligência Artificial
Explore insights práticos, pesquisas e benchmarks sobre inteligência artificial, incluindo IA generativa, grandes modelos de linguagem, RAG (Random Access Group), frameworks de governança, práticas de MLOps (Multiple Logging Operations) e hardware de IA. Compreenda as principais ferramentas, estratégias de implementação e casos de uso corporativos que estão moldando o cenário da IA.
Explore Inteligência Artificial
Orquestração de LLM: 22 Frameworks e Gateways
Otimizar a orquestração de LLM é essencial para melhorar o desempenho mantendo o uso de recursos sob controle. Para avaliar como diferentes abordagens de orquestração se comportam na prática, realizamos benchmarks: Descubra ferramentas selecionadas de orquestração de LLM, incluindo frameworks para desenvolvedores e gateways empresariais: A orquestração de LLM envolve gerenciar e integrar vários Large…
Cloud GPU Rental Price Index
As tarifas sob demanda para as GPUs de nuvem de geração mais recente (B200, B300, MI300X, RTX 5090) praticamente dobraram no último ano, enquanto as placas mainstream (H100, H200, A100) mantiveram uma faixa estreita. Compilamos o índice de GPU mensalmente a partir de 69 provedores e 17 modelos de GPU, cobrindo os níveis sob demanda,…
Benchmark de Reconhecimento de Escrita à Mão com 14 LLMs & OCRs
As ferramentas de OCR alcançam mais de 99% de precisão em texto digitado em imagens de alta qualidade. No entanto, a escrita à mão continua desafiadora devido a variações de estilo, espaçamento e irregularidades. Apresentamos um benchmark de reconhecimento de escrita cursiva com 100 amostras manuscritas por nossa equipe para evitar sobreajuste. Neste benchmark, GPT-5,…
AIM Enterprise: Benchmark Empresarial Agêntico
As empresas usam LLMs todos os dias em suas tarefas regulares. Para encontrar os LLMs mais econômicos, projetamos o AIM Enterprise, um benchmark empresarial agêntico, onde usamos 69 tarefas empresariais reais em estratégia, marketing, RH, vendas e operações. Dois modelos juízes pontuaram todos os arquivos e frequentemente discordaram. Em cerca de um terço das pontuações…
Text-to-SQL: Comparação da precisão de LLM
Executamos 36 grandes modelos de linguagem em 759 perguntas do BIRD-SQL, cada modelo escrevendo SQL contra um banco de dados que precisava identificar por si mesmo entre 11 candidatos. Toda consulta analisável foi executada no banco de dados real e seu conjunto de resultados comparado com o conjunto de resultados da consulta gold do BIRD.…
GPU Benchmark de Concorrência: H100 vs H200 vs B200 vs MI300X
Passei os últimos 20 anos focando na otimização de desempenho computacional em nível de sistema. Avaliamos as mais recentes NVIDIA GPUs, incluindo as NVIDIA H100, H200 e B200, e a AMD MI300X, para análise de escalabilidade de concorrência. Usando o framework vLLM com o gpt-oss-20b model, testamos como essas GPUs lidam com solicitações simultâneas, de…
Benchmark de Classificação de Séries Temporais: Foundation Models vs Métodos Clássicos
Avaliamos 13 métodos de classificação de séries temporais, de foundation models de séries temporais pré-treinados a uma baseline de 22 features de 2019, em 33 datasets UCR/UEA sob um único protocolo congelado. São 14.638 células registradas de método-dataset-reamostragem, 11.874 delas pontuadas. O gráfico compara 12 métodos nos 15 datasets univariados que todos completaram, cada dataset…
Benchmark de Codificação de IA: Claude Code vs Cursor
Na codificação com IA, o mercado se fragmentou em duas categorias: ferramentas de CLI agêntica e editores de código de IA incorporados em IDEs. Cada uma afirma automatizar o desenvolvimento. Poucas comparações mostram como elas diferem sob cargas de trabalho idênticas. Avaliamos cada agente em 10 tarefas de desenvolvimento web full-stack, realizando ~600 verificações de…
LLM Parameters: GPT-5 High, Medium, Low and Minimal
Alguns LLMs, como a família GPT-5 da OpenAI, vêm em diferentes versões (por exemplo, GPT-5, GPT-5-mini e GPT-5-nano) e com várias configurações de parâmetros, incluindo alta, média, baixa e mínima. Abaixo, exploramos as diferenças entre essas versões de modelo reunindo seu desempenho em benchmarks e os custos para executá-los. Usamos a família GPT-5 em nossa…
HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Contexto Longo
HALC-Bench (LLM Alucinação em Benchmark de Recuperação de Contexto Longo) mede a resistência de um modelo de linguagem grande a fabricar evidência para uma métrica que não existe no documento alvo, usando 3 palheiros colocados no início, meio e fim da janela de contexto do modelo, com 204 questões. claude-fable-5 respondeu corretamente a todas as…