La ricerca approfondita IA offre agli utenti una gamma più ampia di risultati di ricerca rispetto ai motori di ricerca IA. Per valutare le prestazioni di diversi strumenti di ricerca approfondita IA, introduciamo tre nuovi benchmark:
DR-50 (Deep Research 50) Bench, che valuta gli strumenti su 50 domande distribuite su sei tipologie, DR-2T (Deep Research 2 Task) Bench, che valuta gli strumenti attraverso due compiti di ricerca reali incentrati sulla qualità della generazione di report, la copertura delle fonti e la presentazione strutturata dei dati, e Agent vs Deep Research Models, che dimostra che gli agenti sono più economici dei modelli di deep research pur fornendo livelli di accuratezza comparabili.
Benchmark Agenti vs. Modelli di Deep Research
Agenti IA come Claude Code e OpenAI Codex possono cercare sul web, recuperare pagine specifiche ed estrarre dati tramite chiamate mirate a strumenti. Abbiamo verificato se questo approccio agentico eguaglia le prestazioni dei modelli di deep research costruiti ad hoc in compiti di ricerca fattuale. Sei strumenti sono stati valutati su 5 compiti con 33 punti di verifica di verità fondamentale, che spaziano tra eventi aziendali, fusioni e acquisizioni, documentazione software e ricerca IA. Vedi la nostra metodologia.
Parallel Ultra e Claude Code sono arrivati primi a pari merito con un'accuratezza del 97%. Codex segue al 93,9%. Perplexity Sonar ha ottenuto l'87,9%. I modelli di deep research di OpenAI (o3 e o4-mini) hanno ottenuto tra il 75,8% e l'81,8%, pur eseguendo da 27 a 125 ricerche web per compito e costando da 2 a 6 volte di più rispetto a Sonar.
I migliori performer condividono uno schema: navigano verso le fonti primarie e le leggono attentamente. Codex è andato al modulo 8-K della SEC per il Compito 2 e alla dichiarazione di delega della SEC per il Compito 3. Claude Code ha recuperato direttamente le pagine della documentazione di Unity nel Compito 1. Parallel ha trovato la cifra specifica del pagamento di Zaslav ($886,8M) che altri tre strumenti hanno mancato. o3 e o4-mini hanno cercato in modo ampio ma hanno estratto informazioni meno precise dalle pagine trovate.
Claude Code e Codex occupano l'angolo in alto a destra: alta accuratezza a basso costo (rispettivamente $1,54 e $1,30). Parallel raggiunge la stessa accuratezza per $2,10. o3 costa $10,92 per un'accuratezza del 75,8%. Nella scheda della latenza, Claude Code è il più veloce con una media di 1,7 minuti per compito. Parallel è il più lento con 16,7 minuti ma eguaglia la massima accuratezza. Sonar si colloca in una solida posizione intermedia con 2,3 minuti e l'87,9%.
Sonar produce in media 5.253 parole per compito. Gli agenti producono da 398 a 483. Sonar ha scritto 4.509 parole sulla struttura EntityId di Unity, ma è riuscito a nominare solo uno dei suoi cinque metodi pubblici. Codex ha scritto 248 parole e li ha nominati tutti e cinque. Parallel ha scritto 1.037 parole e le ha azzeccate. Più parole e più citazioni non hanno predetto una maggiore accuratezza.
Approfondimento: migrazione da Unity 2022.3 a Unity 6 (Compito 5)
Il Compito 5 è il più complesso del benchmark. Ha chiesto a ogni strumento di creare una guida alla transizione da Unity 2022.3 LTS a Unity 6.3 LTS. Il prompt ha specificato i numeri di versione esatti: 2022.3.62f3, 2022.3.74f1 e 6000.3.12f1. Una risposta corretta richiede la lettura della pagina dei requisiti di sistema di Unity 6.3, della pagina del ciclo di vita del supporto e di quattro guide all'aggiornamento separate (6.0, 6.1, 6.2, 6.3).
Tre strumenti su sei hanno restituito i requisiti di sistema per Unity 6.0 invece che per Unity 6.3.
o3, o4-mini e Claude Code hanno tutti fatto riferimento alla pagina della documentazione di Unity 6.0 invece che alla pagina 6.3, nonostante il prompt specificasse “Unity 6.3” e il numero di build “6000.3.12f1”.
Un team che seguisse la guida di o3 punterebbe ad Android API 23 (Android 6.0). Unity 6.3 richiede API 25 (Android 7.1). La build fallirebbe o verrebbe distribuita puntando a una piattaforma non supportata. La guida stessa sembra professionale: tabelle pulite, struttura sensata, tono corretto. I numeri sono sbagliati.
Codex e Parallel hanno entrambi azzeccato ogni numero. Codex è andato direttamente alla pagina dei requisiti di sistema della 6.3 e l'ha confrontata riga per riga con quella della 2022.3. Ha persino identificato che il minimo iOS è passato da 12 a 13 all'interno della linea 2022.3 alla build 2022.3.72f1, prima di saltare a 15 nella 6.3. Parallel ha prodotto una guida completa con numeri corretti e 35 fonti citate.
Come ogni strumento ha affrontato il compito:
Claude Code ha generato 4 sotto-agenti paralleli, ognuno dei quali ha gestito una parte diversa della domanda: date di supporto, percorso di aggiornamento, modifiche sostanziali e requisiti di sistema. Veloce (3 minuti e 59 secondi), ma il sotto-agente per i requisiti di sistema ha recuperato la pagina sbagliata della documentazione.
Codex ha eseguito 90 ricerche web sequenziali in 6 minuti e 17 secondi. Ha recuperato la guida all'aggiornamento della 6.3, la pagina dei requisiti di sistema della 6.3 e la pagina dei requisiti di sistema della 2022.3 singolarmente. Più lento ma metodico. Ogni numero era corretto.
o3 ha impiegato 8 minuti e ha eseguito 32 ricerche web. Ha prodotto 2.132 parole di consigli generici sulla migrazione, ma ha estratto le tempistiche di supporto e i requisiti di sistema dalla documentazione della 6.0. Non ha menzionato alcuna modifica sostanziale specifica della 6.3 (rimozione della modalità di compatibilità URP, deprecazione di Netcode 1.x, deprecazione di Relay/Lobby).
Nessuno strumento ha letto tutte e quattro le guide all'aggiornamento (6.0, 6.1, 6.2, 6.3) in sequenza. La documentazione di Unity afferma che gli sviluppatori dovrebbero seguirle in ordine perché ciascuna contiene modifiche sostanziali uniche. Ogni strumento ha trovato la pagina più evidente e ha estratto da quella. Questa è una limitazione strutturale per qualsiasi compito di ricerca che richieda di lavorare attraverso una serie di documenti correlati piuttosto che trovare una singola risposta.
Risultati del Benchmark DR-50
Confronto accuratezza e latenza
Abbiamo testato gli strumenti di ricerca approfondita IA su 50 domande con 6 tipologie distinte. Vedi la nostra metodologia del benchmark
Perplexity Sonar Deep Research mostra la massima accuratezza al 34% con una latenza moderata. Parallel Ultra e o4 mini deep research dimostrano livelli di accuratezza simili intorno al 22-24%, sebbene Parallel Ultra richieda significativamente più tempo. o3-deep-research mostra l'accuratezza più bassa con una latenza elevata.
Costo e latenza sul singolo compito riuscito
Abbiamo misurato costo e latenza su una singola domanda in cui tutti gli strumenti hanno avuto successo. o4 mini deep research e Perplexity Ultra occupano la regione efficiente con costi bassi e tempi di completamento più rapidi. o3 deep research opera a costi più alti con maggiore latenza. Parallel mostra la latenza più lunga nonostante un costo moderato.
Citazioni
La quantità di citazioni varia indipendentemente da costo e latenza. o4 mini deep research fornisce significativamente più citazioni mantenendo l'efficienza, suggerendo approcci diversi alla raccolta e al riferimento delle informazioni. Le citazioni minime in o3 deep research, nonostante il costo elevato, indicano che il numero di citazioni non è legato al consumo di risorse.
Risultati del Benchmark DR-2T
Abbiamo anche condotto un secondo benchmark tra i primi 7 strumenti di ricerca approfondita IA con due compiti e li abbiamo valutati su cinque dimensioni.
Li abbiamo valutati in base all'accuratezza e al numero di fonti. Consulta la metodologia per vedere come abbiamo valutato queste soluzioni.
Gemini è leader nell'accuratezza dei dati forniti:
Claude è il leader in base al numero di fonti indicizzate:
Compito 1:
Abbiamo chiesto loro di creare tabelle sui software aziendali di gestione delle password secondo il nostro prompt. Vedi il prompt completo.
Quasi tutti gli strumenti hanno fornito tabelle dettagliate contenenti le informazioni richieste, sebbene i loro approcci alla presentazione dei dati siano variati in modo significativo.
Per la generazione di report completi:
- Gemini e Claude sono emersi come le soluzioni leader, fornendo report analitici estesi con approfondimenti sintetizzati e analisi contestuali.
- Al contrario, Bright Data Deep Lookup* si è concentrato principalmente sull'estrazione di dati, fornendo tabelle strutturate con contenuti narrativi limitati.
I ricercatori dovrebbero selezionare gli strumenti in base alle loro specifiche esigenze di ricerca. Chi necessita di analisi complete e soluzioni orientate ai report troverà Gemini e Claude più adatti, poiché questi strumenti sono più focalizzati sulla sintesi delle informazioni in report dettagliati.
Al contrario, i ricercatori che privilegiano la raccolta di dati grezzi e richiedono ricerche web su larga scala trarranno maggior beneficio da Bright Data, che fornisce un'ampia copertura di dati web con livelli di affidabilità e spiegazioni dettagliate sulla pertinenza e affidabilità delle fonti.
Questo approccio incentrato sui dati rende Bright Data prezioso per revisioni sistematiche che richiedono una verifica ad alto volume delle fonti.
Kimi impiega una metodologia distintiva per la generazione di report, producendo un report interattivo che incorpora riepiloghi esecutivi, sezioni mirate “ideale per” e raccomandazioni strategiche.
Il report presenta visualizzazioni di dati integrate e attribuzione delle fonti, risultando in un risultato completo adatto all'implementazione immediata senza ulteriori modifiche.
Nota: Perplexity ha fornito un report dettagliato ma non è riuscito a creare una tabella con le informazioni raccolte. Poiché il nostro prompt richiedeva esplicitamente output in formato tabella, ha ricevuto zero punti per quel compito.
*Aggiorneremo Bright Data Deep Lookup quando il prodotto uscirà dalla fase beta.
Compito 2:
L'obiettivo di questo compito è valutare la loro velocità e copertura nella ricerca. Abbiamo richiesto un report dettagliato sull'adozione della RPA per determinare il numero di pagine indicizzate e il tempo necessario per generare un report.
Naturalmente, il numero di fonti non deve necessariamente correlarsi con la qualità della ricerca. Tuttavia, poiché questi strumenti sono progettati per accelerare la ricerca, l'abbiamo considerata una metrica importante.
Va anche notato che i tempi di ricerca variano significativamente tra questi strumenti. Grok Deep Search è circa 10 volte più veloce di ChatGPT Deep Research e ricerca circa 3 volte più pagine web.
Claude Deep Search è anche molto reattivo, avendo esaminato 261 fonti in oltre 6 minuti. Tuttavia, Gemini potrebbe non essere la scelta ideale per chi cerca una soluzione rapida e reattiva, poiché ha esaminato 62 fonti in oltre 15 minuti.
Sviluppi negli strumenti di ricerca approfondita IA
Kimi K2.5
Kimi K2.5 può elaborare testo, immagini e video, generare codice pronto per la produzione ed eseguire flussi di lavoro complessi utilizzando un'architettura a sciame di agenti.
Agent Swarm è il meccanismo di Kimi K2.5 per gestire compiti complessi trasformando un singolo modello in un team coordinato di agenti IA. Invece di eseguire un compito in modo sequenziale, Kimi crea più sotto-agenti specializzati, ognuno assegnato a un ruolo specifico come ricerca, analisi, codifica, verifica o strutturazione dei contenuti. Questi agenti operano in parallelo, utilizzano strumenti in modo indipendente e condividono risultati intermedi, il che riduce significativamente il tempo di esecuzione per flussi di lavoro a lungo orizzonte.
Lo sciame scompone un obiettivo di alto livello in sotto-compiti, li assegna agli agenti, monitora i progressi e integra gli output in un risultato finale coerente. Questo approccio è particolarmente utile per la ricerca approfondita, la creazione di documenti su larga scala, l'elaborazione batch e la risoluzione di problemi multi-step, in cui diverse parti del lavoro possono procedere simultaneamente.
Kimi K2.5 Deep Research
Kimi K2.5 Deep Research supporta la ricerca end-to-end e la generazione di report per domande complesse. Raccoglie informazioni da più fonti, analizza gli argomenti da molteplici prospettive e sintetizza i risultati in report visivi.
La ricerca approfondita è progettata principalmente per l'analisi degli investimenti, la ricerca di settore, il lavoro accademico e la pianificazione strategica, dove è richiesta un'analisi orientata alle decisioni.
Figura 1: Una ricerca esemplificativa di Kimi K2.5 Deep Research sulle metriche ESG e sui rendimenti degli investimenti.
Claude per le scienze della vita
Claude for Life Sciences è progettato per supportare il lavoro scientifico lungo il ciclo di vita dello sviluppo di farmaci e dispositivi per organizzazioni biotecnologiche, farmaceutiche e di ricerca. Aggiornamenti recenti ne ampliano l'ambito oltre la ricerca preclinica fino alle operazioni di sperimentazione clinica e ai flussi di lavoro normativi, aggiungendo nuovi connettori di dati e competenze agentiche su misura per casi d'uso reali nelle scienze della vita.
Caratteristiche e capacità principali:
- Connettori scientifici ampliati: Accesso a piattaforme come Medidata, ClinicalTrials.gov, bioRxiv/medRxiv, Open Targets, ChEMBL, ToolUniverse e Owkin, oltre alle integrazioni esistenti con Benchling, PubMed, 10x Genomics, BioRender, Synapse.org e Wiley.
- Intelligenza per la sperimentazione clinica: Uso sicuro dei dati storici di arruolamento negli studi e delle performance dei siti per supportare l'analisi di fattibilità, la pianificazione del reclutamento dei pazienti e il monitoraggio degli studi.
- Supporto alla scoperta precoce: Strumenti per assistere nell'identificazione dei target, nell'analisi dei composti e nella verifica delle ipotesi utilizzando database scientifici curati e strumenti computazionali.
- Flussi di lavoro bioinformatici: Competenze agentiche e pacchetti di strumenti che supportano pipeline di elaborazione e analisi dei dati, inclusi scVI-tools e implementazioni Nextflow.
- Bozza e pianificazione di protocolli: Una competenza per la bozza di protocolli di sperimentazione clinica che incorpora percorsi normativi, contesto competitivo, raccomandazioni sugli endpoint e linee guida FDA pertinenti.
- Preparazione normativa: Assistenza nell'identificare lacune nei documenti normativi, redigere risposte ai quesiti delle agenzie e navigare tra le linee guida applicabili.1
Integrazione di Gemini Deep Research con Gmail, Docs, Drive e Chat
Google ha introdotto un aggiornamento significativo a Gemini Deep Research, ampliando la sua capacità di accedere ai dati dall'ecosistema Google. Lo strumento può ora connettersi a Gmail, Google Drive (inclusi Docs, Slides, Sheets e PDF) e Google Chat, consentendo agli utenti di includere fonti private e condivise direttamente nel loro processo di ricerca.
Con questo aggiornamento, gli utenti possono:
- Creare report completi combinando dati provenienti da email, documenti e chat con informazioni web.
- Condurre un'analisi competitiva che integri piani di progetto, fogli di calcolo comparativi e discussioni di team.
- Avviare un piano di ricerca multi-step per un nuovo prodotto analizzando i materiali di brainstorming iniziali e i thread di comunicazione correlati.
Questa funzionalità consente a Gemini Deep Research di supportare sia revisioni della letteratura accademica che ricerche di mercato. Combinando più fonti di dati, gli utenti possono generare analisi più dettagliate e scoprire informazioni chiave in modo più efficiente.2
Gemini in Chrome: navigazione automatica
Google sta aggiornando Gemini in Chrome su macOS, Windows e Chromebook Plus con Gemini 3, aggiungendo un pannello laterale, un supporto più integrato per le app Google e funzionalità agentiche come la navigazione automatica:
- Navigazione e azioni multi-step agentiche: La nuova funzione di navigazione automatica di Chrome utilizza Gemini 3 per agire come un agente web in grado di svolgere autonomamente compiti complessi e multi-step, come ricercare opzioni di viaggio, compilare moduli, confrontare prodotti e navigare tra siti web interpretando le istruzioni e interagendo con le pagine per conto dell'utente.
- Disponibilità: La navigazione automatica è attualmente in fase di rollout in anteprima per gli abbonati Google IA Pro e IA Ultra negli Stati Uniti e richiede Chrome su piattaforme come Windows, macOS o Chromebook Plus.
- Copertura delle app connesse: Gemini aggiornato in Chrome supporta le integrazioni con le app connesse con servizi come Gmail, Calendar, YouTube, Maps, Google Shopping e Voli.
- Per le azioni che comportano passaggi sensibili o ad alto rischio, come completare un acquisto o pubblicare sui social media, il sistema si mette in pausa e richiede una conferma esplicita dell'utente prima di procedere.3
Microsoft introduce Deep Research in Azure IA Foundry Agent Service
Microsoft ha lanciato l'anteprima pubblica di Deep Research all'interno di Azure IA Foundry Agent Service, offrendo la tecnologia di ricerca agentica di OpenAI attraverso la piattaforma aziendale di Azure. Il servizio consente l'automazione di compiti di ricerca complessi, l'integrazione tra sistemi aziendali e la creazione di output di ricerca trasparenti e verificabili.4
Le caratteristiche principali sono:
- Ricerca multi-step automatizzata: Utilizza il modello o3-deep-research per pianificare, analizzare e sintetizzare dati dal web e dai sistemi aziendali.
- Fondatezza web con Bing Search: Garantisce che le informazioni siano basate su fonti verificate e attuali.
- Output trasparenti: Ogni report include fonti citate, passaggi di ragionamento e chiarimenti.
- Integrazione con gli strumenti di Azure: Funziona con Logic Apps, Azure Functions e altri connettori per reportistica e automazione del flusso di lavoro.
- Flessibilità programmatica: Disponibile via API e SDK, consentendo agli sviluppatori di incorporare strumenti di ricerca approfondita IA in app e flussi di lavoro.
Come funziona
- Chiarire l'intento di ricerca: Il sistema utilizza GPT-4o e GPT-4.1 per definire la domanda di ricerca.
- Raccolta dei dati: Bing Search raccoglie dati web affidabili per il grounding.
- Analisi dei risultati: Il modello di deep research esegue ragionamento e sintesi per produrre report completi con approfondimenti chiave.
- Garantire la conformità: Ogni risultato è tracciabile e verificabile per l'uso aziendale.
Vantaggi degli strumenti di ricerca approfondita IA
Maggiore efficienza e produttività
- Revisioni della letteratura: Gli strumenti di ricerca IA agiscono come un assistente alla ricerca, eseguendo una ricerca approfondita della letteratura su vasti database di articoli scientifici. Identificano gli articoli pertinenti e possono sintetizzare le informazioni per generare riassunti concisi, riducendo significativamente il tempo e lo sforzo necessari per una revisione manuale della letteratura.
- Raccolta e analisi dei dati: Un assistente di ricerca IA può automatizzare la raccolta di dati estraendoli da grandi database e pagine web. Questi strumenti possiedono capacità di ricerca approfondita che consentono loro di elaborare e analizzare enormi set di dati molto più velocemente rispetto ai metodi tradizionali. Possono individuare schemi e tendenze che potrebbero sfuggire a una revisione manuale, fondamentale per compiti di ricerca complessi come l'analisi di mercato o la creazione di un report di ricerca approfondita.
- Automazione dei compiti ripetitivi: L'IA può gestire compiti ripetitivi come l'inserimento dati e la formattazione delle citazioni bibliografiche. Automatizzando questi processi che richiedono tempo, i ricercatori possono concentrarsi sugli aspetti più creativi e complessi del proprio lavoro.
Approfondimenti e scoperte più profonde
- Identificare le lacune di ricerca: Analizzando la letteratura accademica esistente, gli strumenti IA possono aiutare i ricercatori a individuare le lacune nelle conoscenze attuali. Questo è un passo fondamentale per formulare una nuova domanda di ricerca o sviluppare un piano di ricerca multi-step. Questi strumenti forniscono approfondimenti di facile lettura in un formato strutturato e ordinato.
- Sintesi delle informazioni: Gli assistenti di ricerca IA possono sintetizzare informazioni da più fonti, generando un report completo ed evidenziando i risultati principali. Ciò offre ai ricercatori una panoramica ampia senza dover leggere ogni singolo articolo per intero, risparmiando tempo pur fornendo approfondimenti completi.
- Ad esempio, lo strumento di ricerca approfondita di Claude ha generato un report dettagliato. Il report può essere pubblicato come Artifact, accessibile online e visibile sui motori di ricerca.
- Esplorare le connessioni: Gli strumenti che visualizzano le reti di citazioni possono aiutare i ricercatori a vedere come diversi articoli scientifici sono interconnessi. Questo può portare a scoperte e a una comprensione più completa di un campo di ricerca.
Ad esempio, Grok ha indicizzato più di 100 pagine diverse nel nostro secondo compito. Normalmente, un essere umano impiega ore per leggere e raccogliere informazioni da tutte queste pagine, ma a Grok sono bastati circa 2 minuti.
Pertanto, questi strumenti possono accelerare il processo di ricerca. Tuttavia, gli utenti dovrebbero sempre ricordare che questi strumenti possono avere allucinazioni e generare informazioni errate, quindi bisogna essere cauti nell'usare informazioni prese direttamente da un LLM.
Sfide e limiti degli strumenti di ricerca approfondita IA
Accuratezza e affidabilità
La maggior parte delle persone è diffidente verso l'accuratezza delle informazioni generate dagli LLM e le verifica personalmente perché sa che gli LLM possono avere allucinazioni. Il problema della ricerca approfondita è che, poiché conduce ricerche più complete rispetto a una chat standard e fornisce fonti, gli utenti potrebbero erroneamente credere che fornisca sempre informazioni accurate. Gli LLM (anche con la ricerca approfondita) tendono ancora ad avere allucinazioni, e questo può portare a gravi incomprensioni.
- Mancanza di contesto e sfumature: Un assistente di ricerca IA può avere difficoltà a cogliere il contesto completo di un compito di ricerca, potenzialmente riassumendo le informazioni senza comprenderne il significato più profondo. Ciò può portare a conclusioni incomplete o errate.
- Informazioni obsolete: I dati di addestramento per alcuni modelli IA potrebbero non essere aggiornati, facendo sì che perdano gli sviluppi più recenti negli articoli scientifici o altra letteratura accademica.
- Credibilità delle fonti: Gli strumenti IA spesso faticano a distinguere tra fonti autorevoli e inaffidabili, trattando tutte le informazioni dal web aperto come ugualmente valide. Il giudizio umano è essenziale per verificare la credibilità delle fonti per un report di ricerca approfondita.
Distorsioni e preoccupazioni etiche
- Distorsione algoritmica: Se i set di dati utilizzati per addestrare i modelli IA contengono pregiudizi sociali, l'IA li imparerà e li perpetuerà. Ciò può portare a output distorti contro specifici gruppi demografici, compromettendo l'integrità della ricerca approfondita.
- Privacy dei dati: L'uso di strumenti IA comporta l'elaborazione di grandi quantità di dati, il che solleva notevoli preoccupazioni in materia di privacy e sicurezza. I dati proprietari o confidenziali inseriti da un ricercatore potrebbero essere utilizzati per addestrare modelli futuri, con il rischio di fuga di dati.
- Proprietà e copyright: Quando uno strumento IA sintetizza informazioni da più fonti, sorgono domande sulla proprietà intellettuale e la corretta attribuzione. Spesso è difficile determinare la proprietà dell'output finale e garantire che tutte le citazioni delle fonti siano corrette.
Competenza umana ed eccessivo affidamento
- L'illusione della competenza: Gli strumenti IA possono produrre un report lucido e strutturato, creando la falsa impressione di un'analisi esperta e completa. Lo strumento è un assistente alla ricerca, non un sostituto del giudizio, della competenza e dell'attenzione critica che un ricercatore umano apporta ai compiti di ricerca complessi. Ciò è particolarmente rilevante per i decisori che affrontano decisioni ad alto rischio.
- Erosione del pensiero critico: Un eccessivo affidamento sugli strumenti di ricerca IA può diminuire le capacità di pensiero critico e analitico del ricercatore. Fornire tutte le risposte può ridurre il coinvolgimento dell'utente nei processi di ricerca complessi, essenziali per articoli accademici di alta qualità.
- Curva di apprendimento ripida: Nonostante il design intuitivo, molti strumenti di ricerca presentano una leggera curva di apprendimento, in particolare per le loro funzionalità avanzate. I ricercatori potrebbero dover investire tempo per sfruttare appieno le capacità di ricerca approfondita dello strumento.
Gary Marcus ha anche avvertito che potrebbe causare un declino della qualità degli articoli scientifici.5
Metodologia
Nel nostro benchmark DR-50, abbiamo valutato gli strumenti di ricerca IA utilizzando 50 domande su sei diverse tipologie di domande:
1. Ricerca fattuale semplice
Domande a singolo passaggio che richiedono il recupero diretto di dati da una singola fonte.
Esempio: “Qual è il prezzo di input per 1M token per il modello llama-3-70b di DeepInfra?”
2. Analisi comparativa
Valutazione tra più fonti che richiede la raccolta di dati da diversi fornitori per confrontare prodotti o servizi.
Esempio: “Quale fornitore offre llama-3.2-1b al prezzo combinato più conveniente?”
3. Ragionamento multi-step
Catene di ragionamento sequenziale che richiedono più passaggi dipendenti per il recupero delle informazioni.
Esempio: “Qual è il prezzo di input per 1 milione di token su OpenRouter per il modello che si è classificato 1° nel benchmark AIMultiple Finance Reasoning?”
4. Basato su calcoli
Operazioni matematiche eseguite su dati numerici recuperati.
Esempio: “Qual è la differenza di prezzo combinato tra i due modelli più economici di Mistral IA?”
5. Estrazione strutturata JSON
La raccolta dati richiede una formattazione rigorosa in JSON con più valori strutturati.
Esempio: “Quali sono architettura, memoria e larghezza di banda di NVIDIA H200 SXM? Formato: {“architettura”: “…”, “memoria”: “…”, “larghezza di banda”: “…”}”
6. Elenco categoriale
Enumerazione completa di tutti gli elementi all'interno di una categoria specifica.
Esempio: “Fornisci tutti i server MCP nella categoria blockchain.”
Metriche di valutazione
Accuratezza
Abbiamo confrontato ogni risposta con risposte di verità fondamentale predefinite utilizzando GPT-4o-mini come giudice automatizzato tramite OpenRouter. Il punteggio finale di accuratezza rappresenta la percentuale di risposte corrette su tutte le 50 domande.
Conteggio dei token
Abbiamo utilizzato la libreria tiktoken per misurare i token lato client e abbiamo convalidato queste misurazioni con i conteggi dei token riportati dalle API dei fornitori e dalle UI, ove disponibili.
Latenza
Abbiamo misurato la latenza come tempo di clock dall'avvio della richiesta alla ricezione della risposta completa, riportato in secondi. Abbiamo convalidato queste misurazioni con le metriche di latenza riportate dalle API dei fornitori e dalle UI, ove disponibili.
Costo
Abbiamo monitorato i costi manualmente tramite il pannello di fatturazione di ciascun fornitore.
Citazioni
Abbiamo estratto automaticamente le citazioni dai metadati di risposta di ogni API e contato gli URL unici citati per risposta.
Configurazione tecnica
Abbiamo eseguito il benchmark in sequenza, con ogni API che completava tutte le 50 domande prima che l'API successiva iniziasse. Abbiamo implementato un ritardo di 5 secondi tra le domande consecutive per evitare limiti di velocità e non abbiamo imposto alcun timeout, consentendo alle richieste di attendere indefinitamente il completamento.
Per il benchmark DR-2T basato su compiti diversi, ogni dato nel prompt ha ottenuto 1 punto. Se l'output non era in formato tabella, l'abbiamo valutato 0.
Prompt del Compito 1
Ricerca e valuta le prime 5 soluzioni aziendali di gestione delle password in base ai seguenti criteri per identificare la soluzione più efficace per l'implementazione aziendale.
Criteri
1. Funzionalità di sicurezza
- Standard di crittografia utilizzato
- Implementazione dell'architettura a conoscenza zero
- Opzioni MFA supportate
- Certificazioni di sicurezza di terze parti
- Funzionalità di monitoraggio dello stato delle password
2. Distribuzione e integrazione
- Opzioni di distribuzione
- Capacità di integrazione con i servizi di directory
- Disponibilità e funzionalità delle API
- Integrazione SSO
3. Esperienza utente
- Compatibilità con le estensioni del browser
- Disponibilità e valutazione dell'app mobile
- Capacità di accesso offline
- Funzionalità di condivisione delle password
4. Amministrazione
- Opzioni di applicazione dei criteri password
- Automazione del provisioning/deprovisioning utenti
- Funzionalità di reportistica e conformità
- Protocolli di accesso di emergenza
5. Costo e scalabilità
- Confronta i prezzi utilizzando scenari aziendali standardizzati (100 utenti, 500 utenti, oltre 1000 utenti)
Formato di consegna
- Tabella dettagliata per ogni criterio
- Tabella di confronto dei costi con scenari standardizzati
Prompt del Compito 2
Nel nostro secondo compito, abbiamo mirato a scoprire l'ampiezza della ricerca condotta. Per fare ciò, abbiamo confrontato il numero di riferimenti citati. Confrontare gli articoli non è un metodo oggettivo in questo caso, poiché stabilire una verità fondamentale definitiva non è fattibile.
Tuttavia, il numero di riferimenti può darci un'idea della loro capacità di fornire informazioni, poiché la forza di questi strumenti è la loro capacità di indicizzare centinaia di pagine web in pochi minuti.
Metodologia del Benchmark Agenti vs Deep Research
Abbiamo creato 5 compiti di ricerca in diversi domini. Ogni compito pone domande dirette con risposte fattuali e verificabili. Ogni punto di verifica ha un punteggio binario: corretto o errato.
Ogni domanda riguarda informazioni pubblicate dopo la data limite dei dati di addestramento dei modelli. Il benchmark è stato eseguito nella prima settimana di aprile 2026.
La verità fondamentale è stata costruita da fonti primarie: documentazione ufficiale di Unity 6.4, modulo 8-K della SEC di Atlassian, comunicati stampa di Paramount, articolo arxiv di ARC-AGI-3 e guide all'aggiornamento di Unity. A ogni strumento sono stati forniti prompt identici. Tutti i prompt terminavano con “Cita tutte le fonti che hai utilizzato con gli URL”.
Punteggio: corrispondenza automatica di modelli per numeri, date e nomi. Giudice LLM (GPT-4o) per i punti di verifica sulla qualità delle spiegazioni. Un revisore umano ha convalidato tutti i risultati.
I modelli di deep research sono stati chiamati tramite le OpenRouter API (o3, o4-mini, Sonar) e l'API di Parallel. Gli agenti sono stati eseguiti tramite le loro interfacce CLI con la ricerca web abilitata, senza strumenti MCP.
In Claude Code, abbiamo usato Opus 4.6, e in Codex, abbiamo usato GPT 5.4. Entrambi con sforzo medio, e il calcolo dei costi è basato sull'uso dei token per entrambi gli agenti.
FAQ
Gli strumenti di ricerca potenziati dall'IA trasformano il modo in cui gli scienziati conducono la ricerca, rendendola più veloce ed efficiente. Gli strumenti di ricerca approfondita, in particolare, hanno il potenziale per impattare significativamente la comunità scientifica. Possono aiutare ad accelerare il processo, ma gli utenti dovrebbero fare attenzione agli errori prima di pubblicare tali informazioni.
Rapporti di settore e studi hanno dimostrato che gli strumenti IA possono essere molto efficaci in determinate aree, come l'analisi dei dati e le revisioni della letteratura. Questi strumenti utilizzano modelli IA capaci di sintetizzare informazioni da più fonti, fornendo risultati e approfondimenti chiave.
Questi modelli utilizzano modelli di ragionamento e IA generativa per sintetizzare le informazioni e fornire approfondimenti. Possono anche rispondere a domande complesse e fornire risposte dettagliate. Gli utenti pro possono sfruttare gli strumenti IA per ottenere un vantaggio competitivo nella loro ricerca.
Come Deep Research, nuovi modelli e tecnologie, come gli strumenti IA Python e i sottoinsiemi solo testuali, stanno emergendo, e l'integrazione di tutti questi strumenti aumenterà la portata e l'affidabilità della ricerca approfondita.
Gli strumenti IA possono assistere in vari aspetti delle revisioni della letteratura, tra cui l'identificazione di articoli pertinenti, la sintesi dei risultati principali e l'organizzazione dei temi di ricerca. Questi strumenti possono elaborare rapidamente grandi volumi di letteratura accademica e aiutare i ricercatori a identificare lacune o schemi tra gli studi. Tuttavia, l'IA non può sostituire completamente il giudizio umano nella valutazione della qualità delle fonti, nella sintesi di argomentazioni complesse o nella fornitura di analisi critiche. I ricercatori devono comunque rivedere, verificare e interpretare i contenuti generati dall'IA per garantire l'accuratezza e mantenere il rigore accademico nelle loro revisioni della letteratura.
Gli strumenti IA possono assistere nell'analisi dei dati e nel lavoro statistico pulendo i set di dati, eseguendo test statistici, creando visualizzazioni e individuando schemi in grandi set di dati. Questi strumenti possono suggerire metodi statistici appropriati in base al tipo di dati e alle domande di ricerca. Tuttavia, i ricercatori devono comprendere il contesto dei loro dati e convalidare i risultati, poiché l'IA potrebbe non cogliere sfumature specifiche del dominio o fare ipotesi inappropriate.
La maggior parte dei moderni strumenti di ricerca IA utilizza interfacce in linguaggio naturale che non richiedono competenze di programmazione. Tuttavia, una conoscenza di base dei dati e la comprensione dei concetti fondamentali della ricerca aiutano gli utenti a formulare domande migliori e a interpretare i risultati in modo più efficace. Le applicazioni avanzate possono trarre beneficio da conoscenze tecniche per analisi personalizzate o flussi di lavoro specializzati.
I ricercatori dovrebbero confrontare i risultati dell'IA con le fonti originali e la letteratura peer-reviewed. Le citazioni e i riferimenti forniti dall'IA richiedono verifica, poiché potrebbero essere inaccurati o inventati. I risultati principali dovrebbero essere confermati utilizzando più fonti, con particolare cautela per gli sviluppi recenti o gli argomenti di nicchia. Le analisi statistiche traggono beneficio dalla convalida tramite più strumenti e, quando possibile, esperti del settore dovrebbero rivedere gli output complessi.
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Ricerca approfondita IA: Claude vs ChatGPT vs Grok}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/ai-deep-research}},
note = {AIMultiple. Consultato il 22 Giugno 2026}
}
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.