Premium
Dienstleistungen
Premium

KI VC Benchmark: 16 KI-Agenten zur Kundenidentifikation

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
aktualisiert am 10. Sept. 2026

Die Kundenidentifikation ist Teil der kommerziellen Due Diligence. Wir haben 16 Models bei der Kundenlisten-Recherche für drei Forschungs- und Bewertungsseiten getestet, eine davon AIMultiple, und ihre Einreichungen anhand von Antwortschlüsseln, die wir erstellt haben, und der von ihnen zitierten Seiten bewertet.

Benchmark-Ergebnisse zur Kundenidentifikation

Diagramm wird geladen

Wir haben bei keinem Model einen Reasoning-Aufwand festgelegt. Jedes lief mit dem Standard seines Agentenprogramms, und das Scoring-Model wurde bei Temperatur 0 aufgerufen.

  • Fable 5.1 erzielt 90.2, den höchsten Durchschnitt der 16 Models. Opus 5 folgt mit 89.1 und GLM 5.3 mit 81.0.
  • GLM 5.3 erzielte bei allen drei Zielen Werte zwischen 79.6 und 83.3. Claude Sonnet 5 erzielte bei einem 90.8 und bei einem anderen 0.0, und Gemini 3.8 Flash erzielte 87.0 und 9.2. Durchschnittswerte von 48.0 und 60.7 beschreiben die Läufe keines der beiden Models.

Schwierigkeitsgrad der Ziele

Die Medianwerte liegen bei 64.3 beim ersten Ziel, bei 59.2 beim zweiten und bei 87.0 beim dritten. Zehn der 16 Models erreichen beim dritten mindestens 84; dessen Antwortschlüssel enthält 18 Kunden, daher ist ein richtiger Kunde 5.6 der 100 Abdeckungspunkte wert, die Hälfte der Punktzahl ausmachen.

Die Punktzahl jedes Models ist der Mittelwert aus allen drei Zielen. Ein einfaches Ziel nach Ansicht der Ergebnisse fallenzulassen, würde den Vergleich verzerren. Die nächste Runde braucht schwierigere Zielunternehmen.

Kosten- und Punktevergleich

  • Fable 5.1 erreicht durchschnittlich 90.2 bei $4,38 pro Aufgabe. Opus 5 erreicht durchschnittlich 89.1 bei $8,51, die höchsten Kosten der 15 Models mit Dollarbeträgen. GLM 5.3 erreicht durchschnittlich 81.0 bei $1.40.
  • Grok 4.6 erreicht durchschnittlich 80.5 bei $0,42 pro Aufgabe, ein Zwanzigstel dessen, was Opus 5 für 8.6 Punkte weniger kostet.
  • GPT 6 Astra erreicht durchschnittlich 74.2. Seine drei Abonnement-Aufgaben verbrauchten 279.253 Tokens, und Codex CLI erfasst keine Dollarkosten, daher lässt die Kostenübersicht es aus.

Warum testet die Kundenlisten-Arbeit KI-Agenten?

Eine Kundenliste erfordert einen Namen und einen Beleg für die Geschäftsbeziehung. Eine plausible Liste kann dennoch Seiten zitieren, die nur Produkte vergleichen.

Öffentliche Quellen können eine einzelne Kundenbeziehung bestätigen. Dieser Benchmark testet nicht, ob eine Liste vollständig ist.

Ein tatsächlicher Kunde kann im Antwortschlüssel fehlen. Eine Einreichung erhält dafür Punkte, wenn die zitierte Seite die Beziehung belegt, und verliert Abdeckungspunkte für ein nicht belegtes zusätzliches Unternehmen.

Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

Methodik

Model-Abdeckung

Das Punktediagramm verwendet die 16 Models, die für diese Benchmark-Kampagne ausgewählt wurden. Fünf abgelöste Models bleiben in den historischen Daten und werden nicht dargestellt. Die Punktzahlen reichen von 0 bis 100, und die Balkenbeschriftungen runden auf ganze Punkte.

Der Agentic IT-Benchmark verwendet eine andere Skala, daher sind seine Punktzahlen nicht vergleichbar.

Aufgaben und Einreichungen

Das erste Ziel ist AIMultiple, der Herausgeber dieses Benchmarks, und sein Antwortschlüssel wurde von einem AIMultiple-Analysten erstellt. Das zweite Ziel ist eine Software-Bewertungsseite und das dritte ein Analysten-Forschungsunternehmen.

Die drei Antwortschlüssel enthalten 45, 65 und 18 Kunden und wurden den getesteten Models vorenthalten. Der Lauf umfasst 48 Model-Unternehmens-Zuordnungen und 47 nicht leere Kundenlisten; Inkling Small erzeugte beim zweiten Unternehmen keine Kundendatensätze und erzielte dort null Punkte.

Jede Punktzahl verwendet eine Einreichung pro Unternehmen. Die Einreichungen erstrecken sich von Juli bis September, und einige ersetzen frühere Versuche.

Eine Neugewichtung der drei Ziele über alle 27 geordneten Ziehungen mit Zurücklegen legt die mittleren 95 % der Mittelwerte von Fable 5.1 auf 86.0-94.8 und die von Opus 5 auf 82.4-96.1, sodass das Intervall von Fable 5.1 innerhalb des Intervalls von Opus 5 liegt. Wir haben nur diese drei Ziele neu gewichtet und haben die Variation von Lauf zu Lauf nicht gemessen.

Kosten und Ausführung

Die Kosten pro Aufgabe sind der Mittelwert über drei Läufe eines Models, einschließlich des Laufs, der keine Kundendatensätze erzeugte. Eine Aufgabe entspricht einem Zielunternehmen. Die Dollarkosten decken 15 der 16 Models ab, und die Daten zur verstrichenen Zeit decken 13 ab.

Die Dollarbeträge werden nicht alle auf dieselbe Weise gemessen. Läufe auf opencode tragen die OpenRouter-Gebühr für diese Sitzung. Läufe auf Claude Code und Grok Build authentifizieren sich über ein Abonnement, daher sind ihre Beträge Listenpreise, die auf die vom Programm gemeldeten Tokens angewendet werden. Codex CLI erfasst keine Dollarkosten.

Jedes Model erhielt einen eingefrorenen Prompt, der das Unternehmen nannte und eine CSV mit Firmennamen, LinkedIn-URLs, Beleg-URLs und Belegdaten anforderte. Grok Build nutzte die native Websuche; die anderen Agentenprogramme erreichten das Web über Bright Data, eines der Web-Scraping-Tools, die wir vergleichen.

Ein Agentenprogramm gibt dem Model eine Shell und Webzugriff, daher spiegelt eine Punktzahl sowohl das Model als auch das Programm wider, in dem es lief. Die Listenpreise der Anbieter finden sich in unserem LLM-Preisvergleich.

Bewertung und Belege

Die Kundenabdeckung macht 50 % der Punktzahl aus, die LinkedIn-Genauigkeit 17 %, die Belegqualität 17 % und die Aktualität der Belege 16 %.

Die Bewertung lief am 10. September 2026. Sie akzeptiert Belege mit Datum vom 10. September 2025 bis zum 12. September 2026, also die 12 Monate vor der Bewertung plus zwei Tage. Eine zitierte URL, die 404 oder 410 zurückgibt, begrenzt diese Einreichung auf 40, und in diesem Durchgang erreichte keine Einreichung die Obergrenze.

Der Code prüft Formatierung, Namen, Duplikate, Daten und URL-Status. Claude Sonnet 5 liest einen Auszug jeder zitierten Seite und beurteilt, ob er die Beziehung bestätigt. Claude Sonnet 5 ist außerdem eines der 16 bewerteten Models, und Anthropic-Models belegen die ersten beiden Plätze. Wir haben nicht getestet, ob ein Anthropic-Bewerter Anthropic-Models bevorzugt.

Der Prompt des Bewerters gibt an, ob das Unternehmen im Antwortschlüssel enthalten ist, daher ist das Urteil des Bewerters nicht unabhängig vom Schlüssel. Wir haben den Scorer erneut ausgeführt, nachdem wir ein Unternehmen aus einem Schlüssel entfernt hatten, und bei derselben Seite und demselben Auszug änderte sich sein Urteil von Kunde zu Erwähnung.

Das Benchmark-Team hat bei 58 Datensätzen anstelle des Urteils des Bewerters eine Entscheidung festgehalten, 30 gegen das Model und 28 dafür. Vierundfünfzig stammen aus einer Überprüfung des gespeicherten Seitentexts vom 9. September 2026, und vier sind redaktionelle Entscheidungen, die am 10. September festgehalten wurden.

Die Auswertung akzeptiert 140 Datensätze außerhalb der Antwortschlüssel, 125 davon beim zweiten Ziel. Belegte Datensätze erhalten dieselben Punkte wie Einträge im Schlüssel.

Weiterführende Literatur

Verpassen Sie nicht unsere Benchmarks und datengestützten Erkenntnisse. Die Schaltfläche öffnet Google; die Auswahl von AIMultiple bestätigt, dass Sie AIMultiple häufiger in den Google-Suchergebnissen sehen möchten.
GoogleAls bevorzugte Quelle hinzufügen

FAQs

Dieser Test hat einzelne Kundenbeziehungen anhand öffentlicher Belege verifiziert. Er hat nicht bewertet, ob eine Liste vollständig ist.

Ein Vergleich allein tut dies nicht. Eine Seite muss außerdem eine Geschäftsbeziehung belegen, etwa einen namentlich genannten Kunden oder einen Abonnenten der Dienste des Research-Unternehmens.

Die Abdeckungswerte stammen aus dem Antwortschlüssel. Der Bewerter prüft die Seite, die ein Model zitiert hat, sodass eine Einreichung Punkte für belegte Kunden außerhalb des Schlüssels erhält.

Der Test deckt die Kundenlisten-Recherche ab. Er bewertet nicht die Investitionsauswahl, die Bewertung oder die Qualität der Entscheidungen eines Fonds.

Zitieren Sie diesen Benchmark

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Ezgi Arslan, PhD. and Berk Kalelioğlu (2026) - "KI VC Benchmark: 16 KI-Agenten zur Kundenidentifikation". Online veröffentlicht auf AIMultiple.com. Abgerufen am 10. September 2026, von: https://aimultiple.com/ai-vc [Online-Ressource]

PhD., E. A., & Kalelioğlu, B. (2026, 10. September). KI VC Benchmark: 16 KI-Agenten zur Kundenidentifikation. AIMultiple. https://aimultiple.com/ai-vc

@misc{phd2026,
  author = {PhD., Ezgi Arslan, and Kalelioğlu, Berk},
  title  = {{KI VC Benchmark: 16 KI-Agenten zur Kundenidentifikation}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/ai-vc}},
  note   = {AIMultiple. Abgerufen am 10. September 2026}
}
Alle Daten herunterladen

Ergebnisse und Zeitstempel von 13 Datenpunkten. Laden Sie die Zusammenfassungsdaten aus den Diagrammen und Tabellen dieses Artikels als ZIP-Datei herunter, die eine CSV-Datei und eine README enthält.

Zuletzt aktualisiert: 23. September 2026
Herunterladen

Möchten Sie die granularen Daten dahinter? Premium beitreten

Änderungsprotokoll

1 Aktualisierungen
  1. Ersetzte den Deal-Sourcing- und Wettbewerbsvergleichs-Benchmark durch einen Client-Identifikations-Benchmark mit 14 Agenten.

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Industrieanalystin
Ezgi hat einen Doktortitel in Betriebswirtschaftslehre mit Spezialisierung auf Finanzen und ist als Industrieanalystin bei AIMultiple tätig. Sie treibt Forschung und Erkenntnisse an der Schnittstelle von Technologie und Wirtschaft voran, mit Fachkenntnissen in den Bereichen Nachhaltigkeit, Umfrage- und Sentimentanalyse, KI-Agenten-Anwendungen im Finanzwesen, Answer-Engine-Optimierung, Firewall-Management und Beschaffungstechnologien.
Vollständiges Profil anzeigen
Technisch geprüft von
Berk Kalelioğlu
Berk Kalelioğlu
KI-Forscher
Berk ist KI-Forscher im Benchmark-Team von AIMultiple und konzentriert sich auf agentische KI, maschinelles Lernen sowie große und kleine Sprachmodelle (LLMs und SLMs).
Vollständiges Profil anzeigen

Seien Sie der Erste, der kommentiert

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450