Dienstleistungen
Kontaktieren

Agentisches Web

Benchmarks für KI-Infrastruktur im Web, einschließlich Remote-Browser für Agenten und KI-Browser für Menschen.

Agentische Suche: Benchmark von 8 Such-APIs für Agenten

Agentisches Web
Benchmark
4. Aug

Agentische Suche spielt eine entscheidende Rolle dabei, die Kluft zwischen traditionellen Suchmaschinen und KI-Suchfähigkeiten zu überbrücken. Such-APIs sind die erste Schicht eines agentischen Werkzeugs, wobei die Leistungsfähigkeit die Qualität aller nachgelagerten Prozesse begrenzt. Wir haben 8 Such-APIs anhand von 100 echten KI/LLM-Abfragen einem Benchmark unterzogen und 4.000 abgerufene Ergebnisse mit einem LLM-Richter bewertet, der jedes…

Mehr lesen
Agentisches Web
Open-World-Bewertung
24. Jul

Beste 30+ Open-Source-Web-Agenten

Wir haben 30+ Open-Source-Web-Agenten in vier Kategorien getestet: autonome Agenten, Computer-Nutzungs-Controller, Web Scraper und Entwickler-Frameworks. Wir haben identische Benchmarks mit der WebVoyager-Testsuite durchgeführt, die 643 Aufgaben auf 15 echten Websites abdeckt, um zu messen, welche Tools tatsächlich mehrstufige Web-Aufgaben abschließen und welche scheitern, wenn Websites dynamische Dropdowns oder JavaScript-lastige Layouts verwenden. Siehe Benchmark-Quellen. Wir haben…

Agentisches Web
Benchmark
9. Jul

Top 4 KI-Suchmaschinen im Vergleich

Die Suche mit LLMs ist zu einer bedeutenden Alternative zur Google-Suche geworden. Wir haben die folgenden KI-Suchmaschinen getestet, um herauszufinden, welche die korrektesten Ergebnisse liefert: Deepseek ist der Spitzenreiter dieses Benchmarks, indem es 57 % der Daten in unserem Ground-Truth-Datensatz korrekt lieferte. Sie können auch unseren KI-Deep-Research-Benchmark lesen, wenn Sie eine Lösung für fortgeschrittenere Rechercheaufgaben suchen.…

Agentisches Web
Benchmark
2. Jul

Remote-Browser: Web-Infrastruktur für KI-Agenten im Vergleich

KI-Agenten sind auf Remote-Browser angewiesen, um Webaufgaben zu automatisieren, ohne von Anti-Scraping-Maßnahmen blockiert zu werden. Die Leistung dieser Browser-Infrastruktur ist entscheidend für den Erfolg eines Agenten. Wir haben 8 Anbieter hinsichtlich Erfolgsquote, Geschwindigkeit und Funktionen bewertet. Dazu haben wir 160 automatisierte Aufgaben ausgeführt und 4 verschiedene Szenarien 5 Mal für jeden Dienst durchgetestet, um ihre…

Agentisches Web
Benchmark
22. Jun

KI Deep Research: Claude vs ChatGPT vs Grok

KI-Deep-Research bietet Nutzern eine breitere Palette an Suchergebnissen als KI-Suchmaschinen. Um die Leistung verschiedener KI-Deep-Research-Tools zu vergleichen, führen wir drei neue Benchmarks ein: DR-50 (Deep Research 50) Bench, der die Tools anhand von 50 Fragen aus sechs Fragetypen bewertet, DR-2T (Deep Research 2 Tasks) Bench, der die Tools durch zwei praxisnahe Forschungsaufgaben mit Fokus auf…