Wir stellen den AIM Agentenbasierter Marketing-Benchmark vor, der die Agentenleistung bei der Wettbewerbslückenanalyse und der Erstellung von ABM-Ziellisten misst.
Wir haben die Leistung von 11 Modellen getestet und die End-to-End-Ausführungsleistung gemessen:
Ergebnisse des Agentenbasierten Marketing-Benchmarks
Die Aufgabenbewertungen sind auf eine Skala von 0–100 normalisiert.
- Für die Wettbewerbsanalyse entspricht die Punktzahl: 100 × MAX(0, gefundene überprüfte Lücken − falsche Lücken) / 10
- Für die Vorbereitung der Kontenliste entspricht die Punktzahl dem Prozentsatz der von dem Modell erzielten 71 verfügbaren Bewertungspunkte.
Die Gesamtwertung ist das arithmetische Mittel der beiden Aufgabenbewertungen, wobei jede Aufgabe trotz unterschiedlicher Bewertungsumfänge gleich gewichtet wird. Ungültige oder fehlende Einreichungen werden in der Gesamtberechnung als Null gezählt, obwohl die Tabelle sie getrennt von gültigen Einreichungen ausweist, die zufällig null Punkte erzielen.
Lesen Sie die Methodik für weitere Informationen zur Aufgabenbewertung.
Fable 5 belegte in beiden Aufgaben den ersten Platz
Fable 5 erzielte die höchste Gesamtwertung mit 75.15, mit 70 in der Wettbewerbsanalyse und 80.3 in der Kontenlistenerstellung. Der Vorsprung ergab sich aus dem stärksten gültigen Ergebnis in beiden Workflows und der Vermeidung der Null, die auf eine ungültige oder fehlende Einreichung folgt.
Die aggregierten Punktzahlen zeigen nicht, welche zugrunde liegende Fähigkeit diesen Vorteil geschaffen hat. Formatkonformität, Quellenauswahl, Suchabdeckung und wiederholte Regelanwendung könnten alle dazu beitragen; eine Trennung würde einen Vergleich der Dateien jedes Modells auf Kriterienebene erfordern.
GLM 5.2 belegte den zweiten Platz mit 68.05 und wurde ebenfalls in beiden Aufgaben Zweiter. Fable 5 führte mit 10 Punkten in der Wettbewerbsanalyse und mit 4.2 Punkten in der Kontenlistenerstellung.
Die Wettbewerbsanalyse lieferte niedrigere Punktzahlen
Wenn die ungültige Einreichung als Null eingeschlossen wird, beträgt der Durchschnittswert der Wettbewerbsanalyse 40.9. Fable 5 führte mit 70, während die gültigen Punktzahlen von 30 bis 70 reichten.
Diese Werte müssen zusammen mit der Bewertungsformel interpretiert werden. Da die Aufgabe zehn erwartete Lücken verwendet, ändert jedes zusätzliche Netto-erkannte korrekte Ergebnis die Punktzahl um zehn Punkte. Ein Modell, das sechs gültige Lücken und keine falschen findet, erzielt 60; ein Modell, das sieben gültige Lücken findet und eine falsche Behauptung hinzufügt, erhält das gleiche Ergebnis.
Die Bewertung beschreibt diese Aufgabe auch als schwachen Diskriminator unter den Spitzenmodellen. Ihr Hauptwert liegt darin, schwächere Systeme zu trennen, die mehrere Lücken übersehen, falsche Abwesenheitsbehauptungen hinzufügen oder das erforderliche Ausgabeformat nicht einhalten. Kleine Punktzahlunterschiede an der Spitze sollten daher weniger Gewicht erhalten als größere Ausfälle oder ungültige Einreichungen.
Die Kontenlistenerstellung bot eine feinere Punktzahlauflösung
Die Kontenlistenaufgabe verwendet eine 71-Punkte-Bewertung, die detailliertere Ergebnisse liefert. Die gültigen Punktzahlen reichten von 32.4 bis 80.3, und Fable 5 sowie GLM 5.2 übertrafen 70.
Sol, Terra, Sonnet 5 und Opus 4.8 bildeten eine knappe Mittelgruppe mit Punktzahlen zwischen 66.2 und 69. Gemini 3.1 Pro lieferte die niedrigste gültige Einreichung mit 32.4. Kimi K3 erzielte kein bewertetes Ergebnis, während MiniMax M3 eine zwingende strukturelle Bedingung nicht erfüllte.
Der Durchschnitt betrug 51.5, nachdem ungültige und fehlende Durchläufe als Null gewertet wurden. Da der Workflow eine Abdeckungskarte und 100 qualifizierte Konten erforderte, spiegelte die Punktzahl die Leistung über Hunderte von Einzelbehauptungen und Klassifikationen wider und nicht nur eine kurze Liste von Ergebnissen.
Leistung variierte je nach Workflow
Kimi K3 erzielte 60 in der Wettbewerbsanalyse und lieferte keine gültige Kontenliste. Sonnet 5 zeigte das umgekehrte Muster: Seine Wettbewerbsanalyse-Ausgabe war ungültig, während seine Kontenlisteneinreichung 67.6 erreichte.
Diese Fälle zeigen, warum die Aufgabenebenen-Ergebnisse wichtig sind. Die Wettbewerbsanalyse betont den semantischen Vergleich und die Abwesenheitsprüfung; die Kontenlistenerstellung stellt höhere Anforderungen an fortlaufende Recherche, Entitätsauflösung, Quellenverwaltung und Dateikonstruktion.
Für Marketing-Teams ist die praktische Implikation klar: Wählen Sie Modelle basierend auf dem zu automatisierenden Workflow aus und testen Sie dann gegen das erforderliche Ausgabeformat und den Evidenzstandard.
Die im Benchmark verwendeten realen Aufgaben
Diese agentischen Marketing-Aufgaben umfassen Strategie- und Inhaltsabdeckung, Wachstum und Vertriebsrecherche. Jede erfordert Webrecherche, Quellenvalidierung, regelbasierte Qualifikation und strukturierte Ausgabe.
Aufgabe 1: Wettbewerbslückenanalyse
Das Modell fungiert als Strategieanalyst, der AIMultiple mit anderen Forschungs- und Benchmarking-Plattformen vergleicht.
Der Agent überprüft beide Websites und identifiziert Angebote, die andere Plattform bereitstellt, die AIMultiple jedoch nicht hat. Gültige Kategorien sind arena, benchmark, evaluation_format, content, methodology, dataset und other.
Die Aufgabe erlaubt bis zu zehn Lücken. Jede CSV-Zeile enthält die Lücke, ihre Kategorie, eine Erklärung, eine Live-Seite, die belegt, dass das konkurrierende Angebot existiert, die überprüften AIMultiple-Seiten und einen Prioritätswert.
Wenn AIMultiple ein verwandtes Angebot bereitstellt, muss das Modell es benennen und den verbleibenden Unterschied erklären. Eine breite Kategorieüberschneidung allein begründet keine Gleichwertigkeit.
Wie wir die Aufgabe bewertet haben
Der versteckte Antwortschlüssel enthält zehn verifizierte Lücken und eine Reihe bekannter falscher Abwesenheitsbehauptungen. Jede unterstützte Lücke erhöht A_found um eins, während jede falsche Lücke B_wrong um eins erhöht. Die Punktzahl ist: MAX(0, A_found − B_wrong) / 10
Eine erfundene, nicht erreichbare oder nicht unterstützte URL entfernt die Anerkennung für die zugehörige Lücke und fügt einen Präzisionsabzug hinzu. Diese Konstruktion macht spekulative Listenerweiterungen kostspielig, da das Hinzufügen einer plausiblen Behauptung die Endpunktzahl senken kann.
Die Ausgabe muss auch strukturelle Anforderungen auf Durchlaufebene erfüllen. Die CSV benötigt den korrekten Dateinamen und die korrekten Spalten, zwischen 1 und 10 Zeilen, akzeptierte Kategoriewerte, gültige Domänen, atomare Zellen und eine absteigende Prioritätsreihenfolge. Ein Fehler in einer dieser Anforderungen macht die Einreichung ungültig.
Aufgabe 2: Best-Fit-Kontenlistenerstellung
Das Modell agiert als Growth Marketer, der eine Account-Based-Marketing-Liste für AIMultiple vorbereitet.
Die Arbeit beginnt mit einer Abdeckungskarte der Live-Seiten von AIMultiple. Der Agent erfasst Kategorieseiten, Benchmarks und Anbietervergleichsseiten sowie Anbieter, die in Artikelinhalten und Sponsorenangaben erwähnt werden.
Anschließend erstellt er eine priorisierte Liste von 100 Konten. Jedes Unternehmen muss ein B2B-Technologieanbieter mit einem jährlichen Umsatz zwischen $100 Millionen und $1 Milliarde sein, mit Hauptsitz in den USA, Europa oder Israel, und in einer von AIMultiple abgedeckten Kategorie tätig sein. Das Unternehmen benötigt außerdem ein aktuelles Wachstumsmarketing-Signal und mindestens eine AIMultiple-Seite, auf der es eine echte kommerzielle Chance darstellt.
Die Kontendatei erfasst die Domain des Unternehmens, die LinkedIn-Seite, den Hauptsitz, die Kategorie, den Umsatz und die Quelle, die Mitarbeiterzahl, das Gründungsjahr, den Finanzierungs- oder Eigentumsstatus, relevante AIMultiple-Seiten, das Marketing-Signal und den Fit-Score.
Muttergesellschaften und Tochtergesellschaften dürfen nicht beide für dieselbe Anbieterchance erscheinen. Die Regeln schließen außerdem Dienstleistungsunternehmen, Verbraucherunternehmen, Analysten- oder Bewertungsunternehmen sowie Kandidaten aus, die Umsatz- oder Hauptsitzanforderungen nicht erfüllen.
Wie wir die Aufgabe bewertet haben
Die Bewertungsrubrik umfasst 71 Punkte in sieben Abschnitten. Der Abschnitt zur Abdeckungskarte prüft, ob das Modell mindestens 30 Live-AIMultiple-Seiten überprüft und jeden erforderlichen Seitentyp enthalten hat. Die Prüfer stichprobenartig überprüfen Zeilen, um zu bestätigen, dass genannte Anbieter und Sponsorenangaben mit den Live-Seiten übereinstimmen.
Der Abschnitt zur Kontendatei erfordert genau 100 unterschiedliche Domains, die angegebenen Spalten, akzeptierte Klassifikationen, absteigende Fit-Scores und vollständige Evidenzfelder. Eine feste Stichprobe von 20 Konten wird dann für Detailprüfungen zu Umsatz, LinkedIn-Identität, tatsächlichem Hauptsitz, Kategoriefit, Wachstumsmarketing-Nachweis und B2B-Anbieterstatus verwendet.
Weitere Abschnitte prüfen, ob vorgeschlagene Seiten echte Möglichkeiten darstellen, bestrafen disqualifizierte oder frei erfundene Konten, belohnen die Aufnahme verifizierter Unternehmen mit hohem Fit und prüfen, ob Modelle bekannte Beinahe-Fehler vermeiden.
Eine fehlende Kontendatei, falsche Spalten oder eine Zeilenanzahl ungleich 100 macht den Durchlauf ungültig.
Methodik des Agentenbasierten Marketing-Benchmarks
Wir haben beide Benchmarks aus Workflows entwickelt, die von unseren Strategie- und Wachstumsteams verwendet werden.
Die Wettbewerbsanalyse-Aufgabe unterstützt Entscheidungen über Produktabdeckung, Inhaltsprioritäten und Positionierung. Die Kontenlisten-Aufgabe unterstützt Account-Based Marketing und Vertriebsrecherche.
Für jeden Workflow haben wir eine Aufgabendatei erstellt, die definiert:
- die Rolle des Modells
- verfügbare Werkzeuge
- Evidenzanforderungen
- Qualifikationsregeln
- erforderliche Ausgaben
- Zeitlimit
Wir haben die Aufgaben um unsere eigenen Seiten und kommerziellen Workflows herum gestaltet, und unsere Daten sind Teil des Antwortschlüssels. Dies erleichtert die Überprüfung der Evidenz, schränkt jedoch auch die Übertragbarkeit der Ergebnisse auf andere Unternehmen und Marketingumgebungen ein.
Aufgabenanweisungen und Bewertungsrubriken
Für die Wettbewerbsanalyse konnten die Modelle über das Bright Data MCP das Live-Web durchsuchen. Wir haben die Codeausführung deaktiviert und ein 90-Minuten-Limit gesetzt.
Für die Kontenlistenerstellung verwendeten die Modelle denselben Webzugriff, wobei die Codeausführung aktiviert war. Wir erlaubten bis zu 240 Minuten, da die Aufgabe zwei Ausgabedateien und 100 qualifizierte Konten erforderte.
Wir gaben jedem Modell die Aufgabenanweisungen und das Ausgabeschema, hielten jedoch die Bewertungsrubrik verborgen.
Modelle mussten aktuelle Quellen verwenden
Beide Aufgaben hängen von Informationen ab, die sich im Laufe der Zeit ändern, darunter Website-Angebote, Benchmark-Inventare, Produktseiten, Unternehmensumsätze, Hauptsitze, Eigentumsverhältnisse, Sponsorenangaben und Marketingaktivitäten.
Wir zählten eine URL, wenn sie auflösbar war und die zugehörige Behauptung unterstützte. Eine Unternehmenshomepage konnte keine bestimmte Umsatzzahl belegen, und eine generische Marketing-Datenbank konnte nicht beweisen, dass eine Plattform ein bestimmtes Benchmark-Format anbot. Wir haben die Antwortschlüssel zuletzt am 7. Juli 2026 überprüft.
Ausgaben wurden für den operativen Einsatz konzipiert
Beide Aufgaben erfordern CSV-Dateien mit festen Spalten und atomaren Zellen. Dieses Format ermöglicht es uns, automatisch auf fehlende Felder, Duplikate, ungültige Kategorien, nicht unterstützte Domains, falsche Zeilenanzahlen, fehlerhafte Werte und Sortierfehler zu prüfen.
Es spiegelt auch wider, wie Marketingteams diese Ausgaben verwenden. Kontenlisten und Wettbewerbsanalysen gelangen häufig in Tabellenkalkulationen, CRM-Workflows, interne Datenbanken oder Automatisierungswerkzeuge. Eine strukturell ungültige Datei kann den nächsten Schritt blockieren, selbst wenn Teile der Recherche korrekt sind.
Wir berichten Einzeldurchlauf-Punktzahlen ohne Varianz
Die Ergebnisse enthalten eine gemeldete Punktzahl pro Modell. Wir berichten derzeit keine wiederholten Durchläufe, Seeds, Konfidenzintervalle oder Fehlerbalken.
Leser sollten daher kleine Punktzahlunterschiede mit Vorsicht behandeln. In der Wettbewerbsanalyse ändert ein zusätzliches Netto-erkanntes korrektes Ergebnis die Punktzahl um zehn Punkte. In der Kontenlistenerstellung können einige wenige Stichprobenzeilen darüber entscheiden, ob ein gesamtes schwellenwertbasiertes Kriterium erfüllt wird.
Wir kombinierten deterministische Prüfungen mit einem LLM-Richter
Deterministische Skripte erledigten alles, was Software direkt klären kann: Dateiexistenz, CSV-Parsing, Spaltenreihenfolge, Zeilenanzahlen, akzeptierte Werte, URL-Domänen, Duplikate und Sortierung. Die Skripte holten auch jede zitierte URL ab, folgten Weiterleitungen und übergaben den Inhalt der aufgelösten Seite an den Richter.
Ein LLM-Richter bewertete die semantischen Kriterien: ob zwei Angebote gleichwertig sind, ob eine Abwesenheitsbehauptung zutrifft, ob ein Unternehmen in eine Kategorie passt, ob eine abgerufene Seite die damit verknüpfte Behauptung stützt und ob eine vorgeschlagene Seite eine echte Möglichkeit darstellt.
Der Richter bewertete eine Zeile oder eine Lücke nach der anderen anhand der Bestanden/Nicht-Bestanden-Regeln der Rubrik, und Skripte fassten diese Urteile zu den Schwellenwertkriterien zusammen (z. B. ≥18 von 20 Stichprobenzeilen). Es wurde nie eine allgemeine Qualitätseinstufung vergeben. Unsere eigenen Analysten haben den Antwortschlüssel erstellt und eingefroren: die Goldkonten, die Fallstricke und die Transkriptionen der Sponsorenangaben am 7. Juli 2026; der Richter wandte diesen Schlüssel an, anstatt eine eigene Meinung darüber zu bilden, was zählen sollte.
Dies ermöglichte uns, zwei lange, evidenzreiche Dateien zu bewerten, birgt jedoch ein Risiko: Ein Richter kann eine Quelle, die er zu großzügig liest, akzeptieren, was genau der Fehlermodus ist, den die Rubrik bei den Modellen bestraft. Diese Ergebnisse basieren auf einem einzigen Bewertungsdurchgang, ohne Mehrfach-Richter-Übereinstimmungsprüfung und ohne Kalibrierung an einer von Menschen bewerteten Stichprobe.
FAQs
Agentisches Marketing beinhaltet den Einsatz von KI-gestützten Agenten, um mehrstufige Marketingaufgaben mit minimalem menschlichem Eingriff zu planen und abzuschließen. Diese Agenten nutzen Kundendaten, Geschäftsregeln, Echtzeitkontext und natürlichsprachliche Anweisungen, um Entscheidungen in Marketing-Workflows zu treffen.
Herkömmliche Marketingautomatisierung führt vordefinierte Regeln aus, etwa das Versenden einer E-Mail nach dem Absenden eines Formulars oder das Verschieben eines Leads zwischen Zielgruppensegmenten. Agentische Systeme können ein Geschäftsziel interpretieren, die erforderlichen Werkzeuge auswählen, Kampagnen einrichten, die Kampagnenleistung überwachen und Maßnahmen zur Leistungsoptimierung anpassen.
Eine agentische Marketingplattform kann Aufgaben unterstützen wie:
– Analyse des Kundenverhaltens und Identifizierung von Zielgruppensegmenten;
– Anpassung von Customer Journeys auf Basis neuer Signale;
– Verteilung von Werbeausgaben über Marketingkampagnen;
– Erstellung von Inhalten innerhalb von Markenrichtlinien;
– Koordination kreativer Workflows und Bewahrung der kreativen Ausrichtung;
– Erzeugung KI-gestützter Erkenntnisse zur Journey-Optimierung;
– Verschiebung von Daten zwischen nicht verbundenen Tools in einer Marketing-Cloud;
– Zuweisung spezifischer Aufgaben an mehrere Agenten.
Die Wettbewerbslückenanalyse erfordert Beweise von beiden Seiten für jede Erkenntnis. Das Modell muss bestätigen, dass die konkurrierende Plattform ein bestimmtes Angebot bereitstellt. Es muss dann die relevanten Seiten von AIMultiple prüfen und feststellen, ob ein Äquivalent existiert.
Der zweite Schritt erfordert eine breitere Website-Erkundung. Relevante Evidenz kann auf einer Benchmark-Seite, einer Kategorieseite, einem Artikel, einer Tool-Seite oder einem Sitemap-Eintrag erscheinen.
Die semantische Ähnlichkeit stellt eine weitere Herausforderung dar. Zwei Angebote können denselben breiten Markt adressieren, aber unterschiedliche Bewertungsformate oder Methodologien verwenden. Der Agent muss entscheiden, ob der Unterschied eine sinnvolle Lücke darstellt.
Die Rubrik bestraft auch spekulative Erkenntnisse. Ein breites Suchverhalten kann die Ausbeute verbessern und die Anzahl falscher Abwesenheitsbehauptungen erhöhen. Konservatives Verhalten kann die Präzision schützen und erwartete Lücken übersehen.
Die beiden Aufgaben testen unterschiedliche Kombinationen von Fähigkeiten. Die Wettbewerbsanalyse erfordert vergleichende Recherche, semantisches Urteilsvermögen und sorgfältige Überprüfung von Abwesenheit.
Die Kontenlistenerstellung erfordert fortlaufende Webrecherche, wiederholte Qualifikation, Entitätsauflösung, Quellenverwaltung und exakte Ausgabekontrolle.
Ein Modell kann bei einer kurzen Vergleichsaufgabe gut abschneiden, aber daran scheitern, eine große, strukturierte Datei zu vervollständigen. Ein anderes Modell kann wiederholte Kontorecherche bewältigen und an einer strukturellen Hürde in der Wettbewerbsanalyse scheitern.
Die Modellauswahl für agentisches Marketing sollte daher die spezifischen Marketing-Workflows berücksichtigen, die ein Team automatisieren möchte.
Diese Forschung zitieren
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{ermut2026,
author = {Ermut, Sıla and Kalelioğlu, Berk},
title = {{AIM Agentenbasierter Marketing-Benchmark}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/agentic-marketing}},
note = {AIMultiple. Abgerufen am 17. Juli 2026}
}
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.