Abbiamo testato 30+ web agent open source in quattro categorie: agenti autonomi, controller per uso computer, web scraper e framework per sviluppatori.
Abbiamo eseguito benchmark identici utilizzando la suite di test WebVoyager, che copre 643 compiti su 15 siti web reali, per misurare quali strumenti completano effettivamente compiti web multi-step e quali falliscono quando i siti utilizzano menu a discesa dinamici o layout ricchi di JavaScript.
Web Agent Open Source: Stelle GitHub
Benchmark WebVoyager: Metodologia
Agenti testati
Abbiamo incluso agenti che soddisfacevano tutti e tre i criteri: codice sorgente apertamente disponibile, un punteggio riportato sul benchmark WebVoyager dalla valutazione pubblicata dall'agente stesso e manutenzione attiva (ultimo commit entro 6 mesi dalla data della nostra revisione).
- Browser-Use: ponte LLM-browser, basato su DOM con integrazione LangChain
- Skyvern 2.0: basato su visione, architettura pianificatore-attore-validatore, distribuzione cloud
- Agent-E: solo DOM, nessun modello di visione, dataset completo di 643 compiti
- WebVoyager: baseline multimodale originale, GPT-4V + DOM ibrido
Gli agenti elencati nell'articolo più ampio ma senza punteggi WebVoyager pubblicati (Auto-GPT, AgenticSeek, OpenManus, LaVague e altri) sono stati valutati qualitativamente su architettura, modello di distribuzione e capacità dichiarate. Non sono inclusi nel confronto quantitativo.
Condizioni di test
Ogni team ha eseguito la propria valutazione; non abbiamo rieseguito i test indipendentemente. Le differenze di punteggio riflettono in parte condizioni di test diverse:
Browser-Use ha testato 586 dei 643 compiti, rimuovendo 55 con risposte obsolete (prodotti Apple dismessi, date di voli scadute, ricette eliminate). I test sono stati eseguiti su macchine locali con indirizzi IP sicuri. L'integrazione LangChain e prompt di sistema riscritti sono stati applicati prima del test.
Skyvern 2.0 ha testato 635 dei 643 compiti, rimuovendo 8 con risposte non valide e aggiornando le date 2023/2024 nei compiti di viaggio al 2025. I test sono stati eseguiti su Skyvern Cloud utilizzando browser cloud asincroni — non macchine locali. Le condizioni cloud espongono gli agenti al rilevamento bot e alle sfide CAPTCHA che i test locali evitano. Le registrazioni complete dei test sono disponibili su eval.skyvern.com.
Agent-E ha testato il dataset completo di 643 compiti senza modifiche. Ha utilizzato solo il parsing DOM, nessun modello di visione. La baseline di confronto era l'agente WebVoyager originale, non GPT-4o.
WebVoyager (originale) ha testato il dataset completo utilizzando screenshot GPT-4V più DOM. Serve come baseline multimodale che Agent-E ha superato utilizzando solo testo.
Punteggio
Il completamento del compito è binario: l'agente completa l'intero compito multi-step oppure no. Non viene assegnato credito parziale. Un compito è contrassegnato come completato solo quando l'output finale atteso (un prezzo, una conferma di prenotazione, un risultato di ricerca) corrisponde alla verità di base.
Il tasso di superamento è riportato come: tasks completed / tasks attempted × 100
Quando i team hanno rimosso compiti dal dataset, il denominatore riflette il loro insieme ridotto, non l'originale 643.
Cosa significano questi punteggi nella pratica
I compiti del benchmark WebVoyager vengono eseguiti su siti web reali in condizioni cooperative, senza protezione bot aggressiva, senza Cloudflare, senza DataDome. Browser-Use e Agent-E sono stati eseguiti su macchine locali con IP equivalenti a quelli residenziali. Skyvern ha deliberatamente utilizzato infrastruttura cloud per approssimare la realtà produttiva. I tassi di successo nel mondo reale su siti di produzione protetti saranno inferiori ai punteggi del benchmark per tutti gli agenti.
Il benchmark non misura velocità, costo per compito o resilienza alle misure anti-bot. Un punteggio WebVoyager del 89.1% non significa che l'agente completerà l'89% dei compiti su un sito di produzione con protezione Cloudflare.
Limitazioni
Denominatori non confrontabili: Browser-Use ha testato 586 compiti, Skyvern ha testato 635, Agent-E ha testato 643. Un punteggio più alto su un insieme più piccolo non è direttamente confrontabile con un punteggio più basso sull'insieme completo.
Risultati auto-riportati: Tutti i punteggi provengono dalla valutazione pubblicata da ciascun team. Non abbiamo eseguito un re-test controllato con condizioni identiche per tutti gli agenti.
Deriva del benchmark: L'insieme di compiti WebVoyager è stato pubblicato nel 2023. Diversi compiti fanno riferimento a prodotti, prezzi e date che non esistono più. I team li hanno gestiti in modo diverso; alcuni li hanno rimossi, mentre altri hanno aggiornato le date, introducendo incoerenza.
Divario locale vs. cloud: Browser-Use e Agent-E hanno testato localmente (IP sicuri, nessun rilevamento bot). Skyvern ha testato nel cloud (esposizione reale alla protezione bot). Il confronto diretto dei punteggi sottostima il divario produttivo per gli agenti testati localmente.
Nessun dato su costo o latenza: Il benchmark misura solo il completamento del compito. Il costo per compito e il tempo medio di completamento non sono catturati nei punteggi WebVoyager, sebbene contino significativamente per le decisioni di distribuzione in produzione.
Istantanea statica: I punteggi riflettono le versioni degli agenti e gli stati dei siti web al momento del test. Entrambi cambiano frequentemente; una riprogettazione del sito o un aggiornamento dell'agente può spostare i risultati in modo sostanziale.
Aggiornamenti Importanti Recenti
Crisi di Sicurezza: Distribuzione Malware OpenClaw
Oltre 400 "skill" dannose sono state caricate su ClawHub (il marketplace di OpenClaw) tra fine gennaio e inizio febbraio, distribuendo malware per il furto di credenziali. IBM, Anthropic e Palo Alto Networks hanno emesso avvisi. I ricercatori di sicurezza ora raccomandano di utilizzare solo ambienti isolati e fonti verificate.
Crescita Virale di OpenClaw
OpenClaw (precedentemente Moltbot/Clawdbot) ha raggiunto 147.000 stelle GitHub, il progetto IA open source in più rapida crescita. Funziona localmente, si integra con piattaforme di messaggistica e utilizza il Model Context Protocol per oltre 100 servizi. Cloudflare ha rilasciato il middleware Moltworker per supportare la sua infrastruttura.1
Moltbook: Social Network per Agenti IA
Social network solo IA lanciato a fine gennaio, ha raggiunto 1,5 milioni di agenti in pochi giorni. Gli agenti pubblicano e interagiscono autonomamente mentre gli umani osservano.2
Standardizzazione del Model Context Protocol
MCP è diventato il protocollo dominante per l'integrazione agente-strumento, con più di 100 server disponibili. La gestione e la governance sono ora critiche per le distribuzioni aziendali.
Modelli NVIDIA Nemotron 3
NVIDIA ha rilasciato la famiglia Nemotron 3 (Nano, Super, Ultra) ottimizzata per l'IA agentica, offrendo un throughput 4x superiore. Include NeMo Gym e Agentic Safety Dataset su GitHub e Hugging Face.3
Agenti Web Autonomi e Copiloti
Strumenti che navigano siti web e completano compiti multi-step con una guida minima.
Agenti Autonomi Generici
OpenClaw (precedentemente Moltbot/Clawdbot): Eseguilo sulla tua macchina locale per automatizzare compiti su app di messaggistica, calendari ed email. Digli "pianifica una riunione con il team per martedì prossimo e invia inviti del calendario" e gestisce l'intero flusso di lavoro. Utilizza il Model Context Protocol per connettersi con oltre 100 servizi senza chiamate API cloud.
Chi lo utilizza: Early adopter disposti a gestire i rischi di sicurezza per l'automazione locale. Utenti che desiderano interfacce conversazionali per flussi di lavoro desktop.
Limitazioni:
- Gravi vulnerabilità di sicurezza nell'ecosistema delle skill (400+ pacchetti dannosi in una settimana)
- Ancora in rapido sviluppo con frequenti modifiche sostanziali
- Documentazione incoerente a causa di molteplici cicli di rebranding
- Elevato consumo di risorse (richiede notevole potenza di calcolo locale)
AgenticSeek: Sostituisci i servizi commerciali basati su cloud con un'alternativa locale che non invia dati di navigazione a server esterni. Installalo sulla tua macchina, descrivi ciò di cui hai bisogno ("estrai tutti i prezzi dei prodotti da questa pagina") e gestisce i clic e la raccolta dati. Basato su Python, eseguito interamente in self-hosting.
Chi lo utilizza: Utenti attenti alla privacy che non condivideranno i dati di navigazione. Organizzazioni con requisiti di residenza dei dati.
Limitazioni:
- Limitato alla concorrenza su singola macchina (5-10 istanze browser)
- Nessuna rotazione proxy integrata o funzionalità anti-rilevamento
- Richiede configurazione e manutenzione dell'ambiente Python
- Più lento delle soluzioni cloud per compiti su larga scala
Auto-GPT: Gestisce la navigazione web insieme a operazioni su file ed esecuzione di codice. Distribuisci tramite l'interfaccia browser o la riga di comando. Quando assegni un compito come "ricerca i prezzi dei concorrenti e salvali in un foglio di calcolo", determina quali siti web visitare, quali dati recuperare e come organizzare l'output.
Chi lo utilizza: Sviluppatori che creano flussi di lavoro di automazione personalizzati. Utenti a proprio agio con strumenti a riga di comando.
Limitazioni:
- Privo di funzionalità specifiche per il web come rotazione proxy e gestione dei cookie
- Nessun evitamento del rilevamento bot integrato (i siti con Cloudflare lo bloccheranno)
- Elevato consumo di risorse (avvia più istanze browser)
- Richiede ingegneria dei prompt manuale per compiti complessi
AgentGPT: Configura gli agenti direttamente nel tuo browser senza scrivere codice. Sviluppa agenti specializzati come "ResearchGPT" o "DataGPT" che scompongono gli obiettivi in passaggi. La piattaforma gestisce l'orchestrazione. Descrivi ciò che vuoi realizzare. Auto-ospitabile se non vuoi usare la loro versione hosted.
Chi lo utilizza: Utenti non tecnici che necessitano di automazione semplice. Team che desiderano configurazioni di agenti condivise.
Limitazioni:
- Personalizzazione limitata rispetto alle soluzioni codificate
- Colli di bottiglia delle prestazioni su compiti multi-step complessi
- La versione hosted invia dati ai loro server (self-hosting necessario per la privacy)
- Nessuna funzionalità avanzata come browser fingerprinting o gestione CAPTCHA
SuperAGI: Framework per costruire agenti autonomi personalizzati con template per flussi di lavoro comuni. Estendilo con la tua logica. Gestisce l'automazione del browser come un componente di flussi di lavoro più ampi. Distribuisci localmente o su infrastruttura cloud.
Chi lo utilizza: Team di sviluppo che costruiscono sistemi di agenti per la produzione. Organizzazioni che necessitano di framework di automazione personalizzabili.
Limitazioni:
- Curva di apprendimento ripida (richiede comprensione dell'architettura degli agenti)
- Libreria di template ancora limitata (richiede sviluppo personalizzato per la maggior parte dei casi d'uso)
- Lacune nella documentazione per funzionalità avanzate
- Lo sviluppo attivo comporta modifiche sostanziali tra le versioni
Nanobrowser: Approccio estensione Chrome: installala, poi controlla gli agenti dalla barra degli strumenti del browser. Buono per compiti rapidi come "estrai tutte le email da questa pagina" o "compila questo modulo con i dati del mio foglio di calcolo".
Chi lo utilizza: Utenti occasionali che necessitano di automazione browser occasionale. Utenti che non configureranno server o ambienti Python.
Limitazioni:
- Non può scalare oltre poche schede (nessuna elaborazione concorrente)
- Nessuna integrazione con pipeline di automazione backend
- Limitato al browser Chrome
- I permessi dell'estensione sollevano preoccupazioni di sicurezza
OpenManus: Alternativa open source ai servizi commerciali di automazione browser. Esegue compiti browser che richiedono ore o giorni, come monitorare siti per variazioni di prezzo o attendere che i prodotti tornino disponibili. Distribuisci localmente con Python e Docker, mantienilo in esecuzione in background.
Aggiornamento recente: DeepWisdom (società madre di OpenManus) ha ufficialmente rinominato la sua tecnologia agente principale in Atoms a metà gennaio. Il nuovo framework Atoms sposta l'attenzione dagli strumenti per hobbisti sviluppatori al deployment di agenti di livello commerciale con moduli integrati per pagamenti e autenticazione.4
Chi lo utilizza: Utenti che eseguono compiti di monitoraggio di lunga durata. Sviluppatori che costruiscono sistemi di notifica automatizzati.
Limitazioni:
- Richiede configurazione Docker e Python
- Nessun supporto proxy integrato (i siti rileveranno richieste ripetute dallo stesso IP)
- Perdite di memoria su compiti di lunga durata (richiede riavvii periodici)
- Il rebranding in Atoms potrebbe causare confusione nella documentazione
Agenti per Uso Computer
Automazione desktop che controlla i browser come parte di flussi di lavoro informatici più ampi.
OpenInterpreter: Agente basato su terminale che esegue script Python, JavaScript e shell in base a ciò che digiti. Chiedigli di "fare scraping di questo sito e analizzare i dati in pandas" e genera il codice di scraping, lo esegue e poi esegue l'analisi. L'automazione del browser si integra con l'accesso al file system e l'elaborazione dei dati.
Chi lo utilizza: Sviluppatori a proprio agio con interfacce a terminale. Data scientist che combinano web scraping con flussi di lavoro di analisi.
Quando ha senso: Hai bisogno di automazione che copra la navigazione web e il calcolo locale. Vuoi ispezionare e modificare il codice generato prima dell'esecuzione. I tuoi flussi di lavoro coinvolgono la trasformazione dei dati dopo la raccolta.
Limitazioni:
- Interfaccia solo terminale (nessuna GUI)
- Rischio di sicurezza (esegue codice arbitrario sulla tua macchina)
- Nessun sandboxing predefinito (può accedere a qualsiasi file o risorsa di sistema)
- Curva di apprendimento per non programmatori
UI-TARS: Framework di ricerca accademica che cattura screenshot del tuo desktop, li analizza con modelli di visione, quindi genera comandi per controllare gli elementi GUI. Costruito per testare nuovi approcci all'automazione desktop, non per uso in produzione.
Chi lo utilizza: Ricercatori accademici che esplorano l'automazione basata su visione. Laboratori che testano sistemi di controllo multimodali.
Quando ha senso: Stai conducendo ricerca sull'automazione basata su visione. Hai bisogno di sperimentare con approcci di analisi degli screenshot. Stai scrivendo articoli accademici sull'automazione GUI.
Limitazioni:
- Non pronto per la produzione (prototipo di ricerca)
- Alta latenza (l'elaborazione del modello di visione richiede 2-3 secondi per azione)
- Costoso (GPT-4V addebita per token immagine)
- Nessun ripristino degli errori o logica di retry
AutoBrowser MCP: Server MCP che consente a Claude di controllare i browser Chrome attraverso il Model Context Protocol, fornendo capacità di interazione browser basate su visione. Claude vede lo schermo del tuo browser, decide cosa cliccare ed esegue l'azione. Funziona come estensione Chrome più un server locale.
Chi lo utilizza: Utenti Claude che desiderano il controllo del browser. Sviluppatori che costruiscono sistemi di automazione basati su MCP.
Quando ha senso: Stai già usando Claude e vuoi aggiungere l'automazione del browser. Preferisci il controllo conversazionale rispetto alle API programmatiche. L'interazione basata su visione è necessaria per layout complessi.
Limitazioni:
- Richiede accesso all'API Claude (non disponibile in tutte le regioni)
- I costi del modello di visione aumentano rapidamente
- La latenza è superiore rispetto agli approcci basati su DOM
- Limitato al browser Chrome
Open Operator: La risposta del team Browser-Use all'Operator di OpenAI. Fornisce ai modelli linguistici accesso diretto a Chrome tramite una vista DOM semplificata. Eseguilo in modalità completamente autonoma o abilita la modalità di approvazione, in cui confermi ogni azione prima dell'esecuzione. Installa tramite Python o estensione browser.
Aggiornamento recente: Browser-Use ha annunciato l'integrazione strategica con Parallel IA a fine gennaio, abilitando ricerche web multi-thread. L'aggiornamento consente agli agenti di eseguire fino a 20 passaggi browser al minuto, eguagliando o superando le prestazioni umane su compiti di ricerca complessi.5
Chi lo utilizza: Team che già utilizzano il framework Browser-Use. Organizzazioni che desiderano flussi di lavoro di approvazione per le azioni degli agenti.
Quando ha senso: Hai bisogno di navigazione autonoma con supervisione umana. I tuoi flussi di lavoro richiedono velocità (esecuzione multi-thread). Stai costruendo sull'ecosistema Browser-Use.
Limitazioni:
- Richiede l'installazione del framework Browser-Use
- La modalità di approvazione rallenta significativamente l'automazione
- Funzionalità anti-rilevamento limitate (i siti con protezione bot lo bloccheranno)
- Solo Python (nessun supporto JavaScript/TypeScript)
Cowork (Anthropic): Strumento desktop di Anthropic che dà a Claude accesso diretto ai file system e agli ambienti browser all'interno di un'applicazione unificata. Espande l'API Computer Use in un prodotto rivolto al consumatore. Disponibile per il download; non più limitato all'anteprima di ricerca. Proprietario, incluso qui per confronto con alternative open source.
Agenti di Navigazione Web
Si concentrano specificamente su flussi di lavoro multi-step su siti web.
Agent-E: Legge l'HTML della pagina per trovare elementi cliccabili e percorsi di navigazione. Utilizza la "Distillazione DOM" per ridurre le pagine agli elementi interattivi essenziali, più la "Raccolta di Skill" per ricordare i pattern di successo. Ha ottenuto il 73.1% sul benchmark WebVoyager usando solo testo, nessun modello di visione.
Chi lo utilizza: Organizzazioni che danno priorità al costo rispetto all'accuratezza. Sviluppatori che costruiscono sistemi di automazione basati su DOM.
Quando ha senso: Hai bisogno di automazione veloce ed economica su siti web statici. I tuoi siti target non utilizzano moduli dinamici pesanti in JavaScript. Puoi tollerare un tasso di successo del 73% in cambio di costi inferiori.
Limitazioni:
- Nessun ripristino degli errori integrato quando la struttura DOM cambia inaspettatamente
- Difficoltà con moduli dinamici dove i menu a discesa rivelano nuove opzioni in base alle selezioni
- Le prestazioni calano significativamente su siti pesanti in JavaScript
- Scarsi risultati sui siti di prenotazione
AutoWebGLM: Semplifica l'HTML prima di passarlo ai modelli linguistici. Le pagine complesse vengono ridotte agli elementi di navigazione principali e ai campi dei moduli. Utilizza l'apprendimento per rinforzo per migliorare le decisioni di navigazione nel tempo. Eseguito in self-hosting tramite Python.
Chi lo utilizza: Team di ricerca che esplorano l'automazione web basata su RL. Organizzazioni con risorse di calcolo per l'addestramento dei modelli.
Quando ha senso: Puoi investire nell'addestramento di modelli personalizzati per i tuoi siti web specifici. I tuoi flussi di lavoro sono sufficientemente ripetitivi da beneficiare dell'ottimizzazione RL. Disponi di infrastruttura Python ML.
Limitazioni:
- Documentazione e supporto della comunità limitati
- Richiede una fase di addestramento prima del deployment (non plug-and-play)
- Necessita di esempi significativi per apprendere policy efficaci
- Si rompe quando i siti web riprogettano i layout
Agenti di Navigazione Basati su Visione
Combinano screenshot con analisi del testo per interpretare il layout visivo della pagina.
Estensione Autogen WebSurfer: Collegati al framework AutoGen di Microsoft per aggiungere la navigazione web. Richiede l'installazione di Playwright. Il framework ti consente di creare team di agenti, un agente cerca mentre un altro elabora i risultati e un terzo interagisce con te.
Chi lo utilizza: Team che già utilizzano il framework AutoGen. Utenti dell'ecosistema Microsoft.
Quando ha senso: Stai costruendo sistemi multi-agente all'interno di AutoGen. Hai bisogno di collaborazione orchestrata tra agenti. Desideri il supporto e la documentazione di Microsoft.
Limitazioni reali:
- Esempi e progetti della comunità limitati
- Richiede l'adozione dell'intero framework AutoGen (non può essere usato standalone)
- L'overhead del framework non vale la pena per compiti di automazione semplici
- Curva di apprendimento ripida per l'orchestrazione multi-agente
Skyvern: Sistema a tre fasi: il pianificatore scompone i compiti in passaggi, l'attore li esegue, il validatore conferma il successo. Cattura screenshot per identificare visivamente pulsanti e moduli. Questo approccio affronta i siti pesanti in JavaScript in cui il DOM cambia dopo il caricamento della pagina. Ha ottenuto l'85.85% su WebVoyager. Distribuisci in self-hosting o usa il loro cloud gestito.
WebVoyager: L'agente benchmark originale dal paper del 2024 che ha introdotto la suite di test WebVoyager. Utilizza screenshot GPT-4V insieme al parsing DOM in un approccio ibrido. Ha ottenuto il 57.1% sul dataset completo di 643 compiti, la baseline rispetto alla quale gli agenti successivi si misurano. Non attivamente mantenuto come strumento di produzione; il suo valore è come riferimento di ricerca e punto di origine del benchmark.
Chi lo utilizza: Organizzazioni che necessitano di alta accuratezza su app web moderne. Team disposti a pagare i costi dei modelli di visione per risultati migliori.
Quando ha senso: I tuoi siti target utilizzano JavaScript pesante e layout dinamici. Hai bisogno di un'accuratezza superiore all'85%. Puoi permetterti costi 10-20x superiori rispetto al parsing DOM. I tuoi flussi di lavoro giustificano l'infrastruttura cloud.
Limitazioni:
- La versione self-hosted richiede notevole potenza di calcolo per i modelli di visione
- Costoso (GPT-4V addebita per token immagine; ogni visualizzazione di pagina costa 10-20x più del parsing DOM)
- Più lento degli approcci DOM (2-3 secondi per pagina per l'elaborazione visiva)
- Il deployment cloud ti espone al rilevamento bot
LiteWebAgent: Modello di linguaggio visivo con memoria e pianificazione che controlla Chrome attraverso il DevTools Protocol. Mantiene il contesto attraverso i caricamenti di pagina, ricordando ciò che ha visto nelle pagine precedenti quando prende decisioni di navigazione. Framework Python, deployment self-hosted.
Chi lo utilizza: Sviluppatori che costruiscono agenti personalizzati basati su visione. Team che necessitano di memoria cross-page.
Quando ha senso: I tuoi flussi di lavoro richiedono di ricordare informazioni su più pagine. Hai bisogno di capacità di visione ma desideri più controllo rispetto a Skyvern. Puoi mantenere infrastruttura Python ML.
Limitazioni:
- Richiede notevole potenza di calcolo per i modelli di visione
- L'architettura di memoria aumenta la complessità e le modalità di fallimento
- Test limitati su siti web di produzione con rilevamento bot
- Comunità piccola (meno esempi e integrazioni rispetto alle alternative)
Strumenti di abilitazione per agenti
Framework che consentono agli LLM o agli utenti di inviare comandi ai browser senza pianificazione autonoma dei compiti.
Dal Linguaggio Naturale all'Azione Web
LaVague: tu dici "Clicca il pulsante verde". LaVague lo trova e lo clicca. Gestisce l'identificazione degli elementi attraverso diversi layout di pagina. Buono per compiti ripetitivi dove sai esattamente cosa vuoi ma non vuoi scrivere selettori. Basato su Python, eseguito in self-hosting.
ZeroStep: Trasforma le istruzioni conversazionali in codice di test Playwright. Descrivi l'azione in linguaggio semplice e genera i comandi Playwright. Accelera la scrittura dei test se stai già usando Playwright. Strumento CLI Node.js.
Ponti LLM-Browser
Collegano i modelli linguistici direttamente ai controlli del browser.
Browser-Use: Prende il DOM disordinato e lo ristruttura per gli LLM. Elimina gli elementi irrilevanti, etichetta i componenti interattivi e fornisce interfacce di controllo. Questo è ciò che ha permesso a Browser-Use di raggiungere l'89.1% su WebVoyager. Disponibile come libreria Python o API, distribuisci in self-hosting o usa il loro cloud.
Browserless: Istanze Chrome remote che controlli via REST o WebSocket. Avvia centinaia di browser nel cloud senza gestire infrastruttura. Ogni browser funziona headless, quindi nessun overhead GUI. Usa la loro API hosted o Docker per il self-hosting.
ZeroStep (Playwright IA): Livello IA sopra Playwright. Scrivi prompt invece di selettori. Combina l'affidabilità di Playwright con la flessibilità degli LLM per identificare gli elementi. Richiede l'installazione di Node.js e Playwright.
Toolkit di Automazione Web e Scraping
Strumenti specifici per compito, dove avvii ogni lavoro individualmente.
Estensioni di Automazione Browser
PulsarRPA: Estensione Chrome per l'estrazione dati. Puntala su una tabella o un elenco, mostrale cosa estrarre e gestisce il resto. Include backend per la pianificazione e l'archiviazione dei risultati.
Chi lo utilizza: Utenti non tecnici che necessitano di estrazione dati regolare. Analisti aziendali che inseriscono dati in fogli di calcolo.
Quando ha senso: Estrai dati dagli stessi siti ripetutamente. Non vuoi scrivere codice. Hai bisogno di pianificazione e archiviazione dei risultati. I tuoi siti target non bloccano le estensioni del browser.
Limitazioni:
- Solo Chrome (nessun Firefox o Safari)
- Si rompe quando i siti target cambiano layout
- Nessun supporto proxy (i siti rilevano richieste ripetute dallo stesso IP)
- Limitato all'estrazione di dati tabulari
VimGPT: Progetto sperimentale dove GPT-4 Vision controlla il tuo browser attraverso scorciatoie da tastiera Vimium. Il modello vede screenshot e genera comandi da tastiera.
Chi lo utilizza: Ricercatori che esplorano il controllo visione + tastiera. Appassionati di Vim curiosi dell'automazione IA.
Quando ha senso: Stai conducendo ricerca sull'automazione guidata da tastiera. Cerchi di comprendere le capacità dei modelli di visione. Non stai distribuendo automazione di produzione.
Limitazioni:
- Solo sperimentale (non pratico per lavoro reale)
- Richiede l'estensione Vimium più backend Python
- Alta latenza (elaborazione visiva + generazione comandi)
- Costoso (GPT-4V costa per screenshot)
Scraper e Crawler IA
Crawl4AI: Un crawler che utilizza gli LLM per decidere cosa è importante in una pagina. Invece di prendere tutto, identifica il contenuto rilevante in base al tuo obiettivo. Basato su Python, si integra con librerie di scraping standard.
Crescita recente: Ha raggiunto il #1 nelle tendenze GitHub e superato le 58.000 stelle. Ottimizzato per l'integrazione con LLM con output markdown e filtraggio dei contenuti BM25. Scelta popolare per pipeline RAG che richiedono deployment local-first.6
Chi lo utilizza: Sviluppatori che costruiscono sistemi RAG. Team che necessitano di supporto LLM locale senza costi API.
Quando ha senso: Stai costruendo applicazioni LLM che necessitano di dati web. Desideri output formattato in markdown. Hai bisogno di un deployment locale senza dipendenze API cloud. Il tuo caso d'uso coinvolge filtraggio dei contenuti e ranking di rilevanza.
Limitazioni:
- Richiede LLM in esecuzione localmente o via API (non standalone)
- Più lento degli scraper tradizionali (elaborazione LLM per pagina)
- Potrebbe perdere contenuti importanti se l'LLM giudica in modo errato
- Utilizzo di risorse superiore rispetto agli scraper basati su regole
FireCrawl: Converte i siti web in Markdown pulito o JSON. Gestisce navigazione, rendering JavaScript ed estrazione dei contenuti. Output strutturato per l'inserimento nelle finestre di contesto degli LLM. Libreria Node.js o CLI.
Chi lo utilizza: Sviluppatori di applicazioni LLM. Team che costruiscono sistemi IA che elaborano contenuti web.
Quando ha senso: Hai bisogno di estrazione di testo pulito per l'elaborazione LLM. I tuoi siti target utilizzano rendering JavaScript. Desideri output strutturato (Markdown/JSON). Stai costruendo applicazioni Node.js.
Limitazioni:
- Solo Node.js (nessun binding Python)
- Conversione Markdown opinabile (potrebbe perdere formattazione necessaria)
- Personalizzazione limitata delle regole di estrazione
- Nessun rate limiting o anti-rilevamento integrato
GPT-crawler: Esegue il crawling di siti e produce dati di addestramento per GPT personalizzati. Puntalo su documentazione o una base di conoscenza, estrae i contenuti e li formatta per il fine-tuning. Strumento CLI Python.
Chi lo utilizza: Team che costruiscono modelli GPT personalizzati. Organizzazioni che creano assistenti IA specifici per dominio.
Quando ha senso: Stai facendo fine-tuning di modelli linguistici. Hai bisogno di dati di addestramento strutturati da fonti web. I tuoi contenuti sono documentazione o basi di conoscenza. Puoi eseguire strumenti CLI Python.
Limitazioni:
- Formato di output specifico per il fine-tuning GPT (non generico)
- Nessun aggiornamento incrementale (ri-esegue il crawling dell'intero sito per gli aggiornamenti)
- Gestione limitata di autenticazione o paywall
- Presuppone una struttura dei contenuti statica
ScrapeGraphAI: Costruisce grafi di conoscenza dai contenuti sottoposti a crawling. Buono per siti di documentazione dove hai bisogno di comprendere le relazioni tra i concetti. Produce riepiloghi strutturati o grafi di fatti. Deployment Python.
Chi lo utilizza: Team di gestione della conoscenza. Ricercatori che costruiscono mappe concettuali da contenuti web.
Quando ha senso: Hai bisogno di estrazione di relazioni, non solo di contenuti. I tuoi siti target sono documentazione o contenuti educativi. Stai costruendo basi di conoscenza o mappe concettuali. Disponi di infrastruttura Python.
Limitazioni:
- Configurazione complessa (richiede database a grafo e modelli NLP)
- Più lento dei semplici scraper (estrazione entità + mappatura relazioni)
- La qualità dipende dalla struttura del contenuto sorgente
- Limitato al testo (non gestisce bene tabelle o immagini)
AutoScraper: Scraper con apprendimento per esempio. Mostragli una pagina con i dati che desideri, individua il pattern e lo applica a pagine simili. Libreria Python leggera per compiti di estrazione semplici.
Chi lo utilizza: Sviluppatori che necessitano di estrazione rapida senza scrivere selettori XPath o CSS. Team che prototipano flussi di lavoro di scraping.
Quando ha senso: Le tue pagine target seguono pattern coerenti. Non vuoi scrivere selettori manualmente. Hai bisogno di prototipi rapidi. I tuoi siti non cambiano frequentemente i layout.
Limitazioni:
- Si rompe quando i layout delle pagine cambiano
- Limitato a strutture di pagina simili (non può generalizzare a siti diversi)
- Nessun supporto per il rendering JavaScript
- Semplice corrispondenza di pattern (nessun ragionamento IA sul contenuto)
LLM Scraper: Invia una pagina a un LLM e chiedi "Estrai tutti i prezzi dei prodotti" o "Trova le informazioni di contatto". Il modello interpreta il tuo intento e recupera i dati rilevanti. Flessibile ma più costoso degli scraper basati su regole. Basato su Python.
Chi lo utilizza: Team che necessitano di estrazione flessibile senza scrivere regole. Sviluppatori che costruiscono compiti di estrazione una tantum.
Quando ha senso: Le strutture delle pagine variano troppo per l'estrazione basata su regole. Hai bisogno di comprensione semantica ("trova il nome dell'autore"). Il costo non è la tua preoccupazione principale. Desideri uno sviluppo rapido senza ingegneria dei selettori.
Limitazioni:
- Costoso (costi API LLM per pagina)
- Più lento degli scraper basati su regole (latenza API)
- Potrebbe estrarre dati errati se il prompt non è chiaro
- Nessuna garanzia di estrazione coerente dei campi tra le pagine
Strumenti di Ricerca IA
BingGPT: Interfaccia di chat che combina la ricerca Bing con le risposte GPT. Fai domande, ottieni risposte con fonti. Applicazione desktop, non basata su browser.
BraveGPT: Estensione browser IA che aggiunge risposte GPT ai risultati di ricerca di Brave. Vedi sia i risultati di ricerca tradizionali che un riepilogo IA fianco a fianco. Si sovrappone direttamente sulle pagine di ricerca.
Framework di Controllo Web per Sviluppatori
Librerie di basso livello per il controllo programmatico del browser.
Framework di Testing
Playwright: Automazione cross-browser di Microsoft. Supporta Chromium, Firefox, WebKit. Attese integrate, intercettazione di rete ed emulazione mobile. Disponibile in JavaScript, Python, .NET e Java. Standard del settore per il testing web moderno.
Selenium: Il framework originale di automazione browser. Funziona su tutti i principali browser. Ecosistema più ampio ma architettura più datata. Binding per Python, Java, C#, Ruby e altri. Standard del protocollo WebDriver.
taiko: Framework ThoughtWorks con sintassi leggibile. Buono per test funzionali dove la leggibilità del test è importante. Solo Node.js.
Librerie di Automazione
Puppeteer: Libreria di Google per controllare Chrome/Chromium. API di alto livello per screenshot, generazione PDF e scraping. L'ecosistema Node.js funziona con TypeScript. Scelta standard per l'automazione Chrome headless.
Browser-Use: Elencato prima come ponte LLM, ma funziona anche come libreria di automazione per sviluppatori. Converte il DOM in un formato strutturato, gestisce navigazione e interazione. Libreria Python con opzione API.
Cosa Rende Diversi Questi Web Agent
Browser-Use ha ottenuto l'89.1% nei test WebVoyager, mentre Agent-E ha raggiunto il 73.1% sul dataset completo. Browser-Use utilizza la pianificazione autonoma dei compiti con integrazione LangChain. Agent-E analizza la struttura DOM direttamente senza modelli di visione, il che è più veloce ma incontra difficoltà quando i siti web utilizzano menu a discesa dinamici o rivelano nuove opzioni in base alle scelte dell'utente.
Livelli di Autonomia
Agenti completamente autonomi come Browser-Use, Skyvern e Agent-E accettano obiettivi di alto livello ("trova il volo più economico per Parigi") e pianificano i propri passaggi di navigazione. Si adattano a elementi imprevisti come banner dei cookie o captcha. Tuttavia, ogni decisione richiede una chiamata LLM, aumentando sia il costo che il tempo di risposta.
Strumenti di guida passo-passo come LaVague e ZeroStep eseguono comandi specifici ("clicca il pulsante di ricerca", "inserisci testo nel campo 2"). Esecuzione più veloce poiché saltano l'overhead di pianificazione. Ma se un sito riprogetta il suo layout, devi aggiornare manualmente le istruzioni.
Framework di codifica manuale come Playwright e Selenium richiedono codice esplicito per ogni clic, compilazione di moduli e navigazione. I test funzionano in modo identico ogni volta fino a quando il sito cambia un ID elemento o un nome di classe. Poi i selettori si rompono e riscrivi il codice.
Come Interpretano le Pagine
Elaborazione basata su visione: Skyvern 2.0, WebVoyager e VimGPT catturano screenshot e li inviano a modelli di visione come GPT-4V. Identificano pulsanti e moduli guardando la pagina renderizzata.
Skyvern 2.0 utilizza effettivamente un ciclo pianificatore-attore-validatore. Il pianificatore scompone compiti complessi in obiettivi più piccoli, l'attore li esegue e il validatore conferma se ogni obiettivo ha avuto successo. Questo approccio a tre fasi ha aiutato Skyvern a passare dal 45% (versione a prompt singolo) al 68.7% (con pianificatore) all'85.85% (con validatore che verifica se le azioni hanno effettivamente funzionato).
L'elaborazione visiva funziona su siti pesanti in JavaScript dove il DOM viene ricostruito dopo il caricamento della pagina. Ma GPT-4V addebita per token immagine, rendendo ogni visualizzazione di pagina 10-20x più costosa della lettura dell'HTML. I modelli di visione aggiungono anche 2-3 secondi per pagina rispetto al parsing DOM.
Parsing DOM: Browser-Use e Agent-E leggono l'HTML della pagina direttamente. Scansionano il codice per elementi cliccabili, campi di input e link di navigazione.
Agent-E utilizza la "Distillazione DOM" per ridurre le pagine complesse agli elementi essenziali, più la "Raccolta di Skill" per ricordare e riutilizzare pattern di interazione di successo. Ha battuto l'agente multimodale WebVoyager (che utilizza la visione) su siti come Huggingface, Apple e Amazon usando solo testo. Ma la pianificazione di Agent-E perde la sincronizzazione quando i siti web rivelano dinamicamente nuove opzioni – come i menu a discesa che cambiano in base alle tue selezioni.
Il parsing DOM costa meno e funziona più velocemente. L'accuratezza dell'89.1% di Browser-Use deriva in parte dall'integrazione LangChain e dai prompt aggiornati, non solo dall'evitare le chiamate di visione. Ma gli approcci DOM incontrano difficoltà quando i siti utilizzano shadow DOM, nomi di classe offuscati o pesante manipolazione JavaScript.
Approccio combinato: LiteWebAgent e AutoWebGLM analizzano il DOM per la struttura, poi usano la visione per verificare ciò che gli utenti vedono effettivamente. Più accurato del solo DOM, più economico della pura visione, ma esegui due sistemi per pagina.
Specializzazione
Auto-GPT e AgenticSeek gestiscono la navigazione web insieme a operazioni su file ed esecuzione di codice. Mancano di funzionalità specifiche per il web come rotazione proxy e gestione dei cookie, limitando l'efficacia su siti con rilevamento bot.
Agent-E e WebVoyager si occupano solo di navigazione web. Agent-E ha raggiunto il 73.1% complessivo sul dataset completo WebVoyager di 643 compiti, superando il 57.1% dell'agente multimodale WebVoyager. Forti prestazioni su siti come Wolfram (95.7%), Google Search (90.7%) e Google Maps (87.8%). Debole su siti dinamici: solo 27.3% su Booking.com e 35.7% su Google Flights dove menu a discesa e campi dei moduli cambiano in base alle selezioni dell'utente.
Crawl4AI e FireCrawl estraggono dati e convertono le pagine in Markdown o JSON. Non compilano moduli né cliccano attraverso flussi di lavoro. Usali quando hai bisogno di contenuti in formato strutturato, non quando devi completare compiti multi-step.
Playwright e Selenium automatizzano il testing del browser. Producono risultati identici tra un'esecuzione e l'altra, essenziali per i test di regressione. Ma questo determinismo significa che non possono adattarsi. Quando un sito cambia, la tua suite di test si rompe.
Opzioni di Deployment
Esecuzione locale: AgenticSeek, Nanobrowser e OpenInterpreter funzionano sulla tua macchina. I tuoi dati di navigazione rimangono locali ed eviti i costi API. Ma una workstation tipica gestisce 5-10 istanze browser concorrenti prima che CPU/RAM raggiungano il massimo.
API cloud: Browserless fornisce istanze Chrome remote via REST o WebSocket. Puoi avviare centinaia di sessioni parallele con rotazione proxy automatica. Ogni richiesta aggiunge 100-300ms di latenza rispetto ai browser locali e il tuo traffico passa attraverso i loro server a meno che tu non faccia self-hosting con Docker.
Deployment flessibile: Skyvern funziona localmente durante lo sviluppo, poi si distribuisce nel cloud per la produzione. Il loro benchmark è stato effettivamente eseguito su Skyvern Cloud (non su macchine locali) per testare condizioni reali con browser cloud asincroni e indirizzi IP realistici. La maggior parte dei benchmark viene eseguita su IP locali sicuri con buone impronte digitali del browser, il che non corrisponde alla realtà produttiva.
Pattern di Integrazione
WebSurfer di AutoGen richiede l'adozione dell'intero framework multi-agente di Microsoft. Ottieni orchestrazione degli agenti e gestione della memoria integrate, ma non puoi integrarlo facilmente con sistemi esistenti.
Browser-Use e Playwright funzionano come librerie standalone. Inseriscili in qualsiasi progetto Python o Node.js. Ma dovrai costruire il tuo coordinamento degli agenti, gestione degli errori e archiviazione dei risultati.
Nanobrowser e BraveGPT si installano come estensioni Chrome. Nessuna configurazione del server richiesta, aggiungi al browser e inizia. Non possono scalare oltre poche schede concorrenti e non si integrano con pipeline di automazione backend.
Considerazioni per la Produzione
Skyvern e Browserless includono supporto proxy residenziale, movimenti del mouse randomizzati e rotazione delle impronte digitali del browser. Queste funzionalità prevengono i ban IP e gli attivatori CAPTCHA sui siti protetti.
WebVoyager e AutoWebGLM si concentrano sugli algoritmi di navigazione. Agent-E ha raggiunto il 73.1% usando solo parsing DOM testuale, superando l'approccio multimodale di WebVoyager al 57.1%. Ma i siti di produzione con Cloudflare o DataDome bloccheranno gli agenti senza un adeguato anti-rilevamento.
Contesto benchmark importante: Browser-Use e Agent-E hanno eseguito i test localmente con indirizzi IP sicuri. Skyvern ha specificamente eseguito i propri test in infrastruttura cloud per corrispondere alle condizioni reali di produzione, dove si affrontano rilevamento bot, browser fingerprinting e sfide CAPTCHA. I test benchmark stessi vengono eseguiti su siti cooperativi senza protezione bot aggressiva, quindi i tassi di successo nel mondo reale saranno inferiori a quanto suggerito da questi numeri.
Fonti dei benchmark
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{I migliori 30+ Web Agent Open Source}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/open-source-web-agents}},
note = {AIMultiple. Consultato il 25 Giugno 2026}
}
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.