Wir stellen den AIM Agentic Marketing Benchmark vor, der die Leistung von Agenten bei drei Marketing-Workflows misst: Wettbewerbsanalyse, ABM-Ziellisten-Erstellung und ein personalisiertes Sales-Deck.
Wir führten außerdem ein separates Website-Reputations-Audit durch, bei dem Agenten die englischsprachigen Inhalte von AIMultiple untersuchten und überprüfbare Probleme hinsichtlich Faktenrichtigkeit, Zitaten, Konsistenz, Aktualität, Funktionalität, Grammatik und Formatierung meldeten, die das Vertrauen der Leser untergraben könnten.
Ergebnisse des Agentic Marketing Benchmarks
Die Aufgabenbewertungen werden auf einer Skala von 0 bis 100 normalisiert.
- Für die Wettbewerbsanalyse entspricht die Punktzahl: 100 × MAX(0, gefundene verifizierte Lücken − falsche Lücken) / 10
- Bei der Account-Listen-Erstellung ist die Punktzahl der Prozentsatz der 71 verfügbaren Bewertungspunkte, den das Modell erreicht hat.
- Bei der Sales-Deck-Aufgabe ist die Punktzahl die Summe von 5 Abschnitten zu je 20 Punkten.
- Die Gesamtpunktzahl ist das arithmetische Mittel aus den Punktzahlen für Wettbewerbsanalyse, Account-Liste und Sales-Deck. Das Website-Reputations-Audit fließt nicht in diese Gesamtpunktzahl ein. Das Audit wird anhand eigener Achsen statt mit einer einzigen Punktzahl bewertet.
Im Gegensatz zu den drei normalisierten Aufgaben hat das Audit keine feste Maximalpunktzahl. Daher haben wir die Ergebnisse in eine separate Bewertung aufgenommen und nicht mit dem Gesamtbenchmark kombiniert.
Lesen Sie die Methodik für weitere Informationen zur Aufgabenbewertung.
Die im Benchmark verwendeten realen Aufgaben
Diese agentischen Marketing-Workflows decken Strategie- und Inhaltsabdeckung, Wachstum, Vertriebsrecherche, personalisierte Inhaltserstellung und Website-Qualitätssicherung ab. Jeder erfordert Live-Recherche, Quellenvalidierung, regelbasierte Beurteilung und eine Ausgabe, die in einen operativen Workflow integriert werden kann.
Aufgabe 1: Wettbewerbsanalyse
Das Modell arbeitet als Strategieanalyst bei AIMultiple und vergleicht es mit einer konkurrierenden KI-Benchmarking-Plattform. Der Durchlauf erlaubt 90 Minuten Laufzeit und Live-Webzugriff über das Bright Data MCP, wobei die Codeausführung deaktiviert ist.
Die Ausgabe ist eine einzelne Datei mit bis zu 10 Zeilen, geordnet nach Priorität. Jede Zeile benennt ein Angebot, das der Wettbewerber veröffentlicht, AIMultiple jedoch nicht, erklärt den Unterschied in ein oder zwei Sätzen, zitiert die aufgerufene Wettbewerberseite und listet die AIMultiple-Seiten auf, die es vor der Behauptung des Fehlens untersucht hat.
Die Behauptung des Fehlens ist die schwierigere Hälfte jedes Befundes. Ein Feature auf der Seite des Wettbewerbers zu identifizieren, erfordert eine einzige Seite. Festzustellen, dass AIMultiple es nicht bietet, erfordert die Überprüfung der Kategorieseiten, Benchmarks, Artikel und der Sitemap.
Wenn AIMultiple ein angrenzendes Angebot veröffentlicht, muss das Modell diese Seite benennen und angeben, was die Version des Wettbewerbers anders macht. Die Abdeckung desselben breiten Themas stellt kein gleichwertiges Angebot dar.
Wie wir die Aufgabe bewertet haben
Die Bewertung erfolgt anhand eines manuell erstellten Lösungsschlüssels: zehn auf beiden Seiten verifizierte Lücken zusammen mit den Fehlensbehauptungen, die Live-Seiten von AIMultiple widerlegen.
Jede verifizierte Lücke bringt einen Punkt, jede falsche Fehlensbehauptung zieht einen ab. Eine falsche Behauptung umfasst jede Zeile, deren URL erfunden, nicht erreichbar ist oder die zugehörige Behauptung nicht stützt.
Der Schlüssel enthält zehn Lücken, aber ein Modell kann eine echte finden, die nicht darin enthalten ist. Ein Prüfer liest diese Befunde manuell und vergibt den Punkt, wenn die zitierte Seite das Angebot zeigt, keine Live-Seite von AIMultiple der Behauptung widerspricht und das Angebot tatsächlich bei AIMultiple fehlt.
Zwei Regeln begrenzen diese zusätzlichen Punkte:
- Ein Befund, der eine der bestehenden zehn mit anderen Worten wiederholt, bringt nichts zusätzlich. Er wird stattdessen unter der aufgeführten Lücke angerechnet.
- Ein Befund, der die Überprüfung nicht besteht, kostet einen Punkt. Wenn AIMultiple das Angebot veröffentlicht oder der Wettbewerber es nicht hat, erhält die Zeile null Punkte, dieselbe Strafe wie für jede andere falsche Behauptung.
Dies verhindert, dass der Schlüssel einen Befund bestraft, den die Analysten nicht erfasst haben, während spekulativen Behauptungen die Anerkennung verweigert wird.
Als letzten Teil der Bewertung führt der Prüfer Link-Checks durch. Link-Checks folgen Weiterleitungen und bewerten das endgültige Ziel, sodass ein 301 allein keine Zeile scheitern lässt. Ein falscher Dateiname, fehlende oder neu angeordnete Spalten, eine Zeilenanzahl außerhalb von eins bis zehn, eine Priorität außerhalb von 1 bis 10, eine Beleg-URL mit der falschen Domain oder falsch sortierte Zeilen machen den Durchlauf jeweils ungültig, und ein ungültiger Durchlauf erhält keine numerische Punktzahl.
Aufgabe 2: Erstellung einer Best-Fit-Account-Liste
Das Modell agiert als Growth Marketer, der eine Account-basierte Marketingliste für AIMultiple erstellt.
Die Arbeit beginnt mit einer Coverage Map der Live-Seiten von AIMultiple. Der Agent erfasst Kategorieseiten, Benchmarks und Herstellervergleichsseiten sowie Hersteller, die in Artikeltexten und in Sponsor-Offenlegungen erwähnt werden.
Anschließend erstellt er eine priorisierte Liste von 100 Accounts. Jedes Unternehmen muss ein B2B-Technologieanbieter mit einem jährlichen Umsatz zwischen $100 Millionen und $1 Milliarde sein, seinen Hauptsitz in den USA, Europa oder Israel haben und in einer von AIMultiple abgedeckten Kategorie tätig sein. Das Unternehmen benötigt außerdem ein aktuelles Growth-Marketing-Signal und mindestens eine AIMultiple-Seite, auf der es eine echte kommerzielle Chance darstellt.
Die Account-Datei enthält die Domain des Unternehmens, die LinkedIn-Seite, den Hauptsitz, die Kategorie, den Umsatz und die Quelle, die Mitarbeiterzahl, das Gründungsjahr, den Finanzierungs- oder Eigentümerstatus, relevante AIMultiple-Seiten, das Marketing-Signal und den Fit-Score.
Muttergesellschaften und Tochtergesellschaften können nicht beide für dieselbe Herstellerchance erscheinen. Die Regeln schließen zudem Dienstleister, Verbraucherunternehmen, Analysten- oder Bewertungsunternehmen sowie Kandidaten aus, die Umsatz- oder Hauptsitzanforderungen nicht erfüllen.
Wie wir die Aufgabe bewertet haben
Die Bewertungsmatrix enthält 71 Punkte in sieben Abschnitten. Der Coverage-Map-Abschnitt prüft, ob das Modell mindestens 30 Live-Seiten von AIMultiple überprüft und jeden erforderlichen Seitentyp einbezogen hat. Die Prüfer ziehen Stichproben, um zu bestätigen, dass die genannten Hersteller und Sponsor-Offenlegungen mit den Live-Seiten übereinstimmen.
Der Account-Datei-Abschnitt verlangt genau 100 verschiedene Domains, die angegebenen Spalten, akzeptierte Klassifizierungen, absteigende Fit-Scores und vollständige Belegfelder. Eine feste Stichprobe von 20 Accounts wird dann für detaillierte Prüfungen verwendet, die Umsatz, LinkedIn-Identität, tatsächlichen Hauptsitz, Kategorie-Fit, Growth-Marketing-Nachweis und B2B-Herstellerstatus abdecken.
Weitere Abschnitte prüfen, ob vorgeschlagene Seiten echte Chancen sind, bestrafen disqualifizierte oder erfundene Accounts, belohnen die Aufnahme verifizierter Unternehmen mit hohem Fit und prüfen, ob Modelle bekannte Beinahe-Treffer vermeiden.
Eine fehlende Account-Datei, falsche Spalten oder eine Zeilenanzahl, die nicht 100 beträgt, machen den Durchlauf ungültig.
Aufgabe 3: Personalisiertes Sales-Deck
Hinweis: Wir haben Kimi K3 und Gemini 3.5 Flash ausgeschlossen, weil beide Zugriff auf ein Verzeichnis außerhalb ihres Arbeitsordners anforderten; das Testgerüst lehnte die Anfrage automatisch ab, und beide Durchläufe endeten dort. Keiner produzierte ein Deck, und keiner scheiterte an der Aufgabe, da nichts, was sie produzierten, bewertet wurde. Eine Null würde ein Infrastrukturproblem in der Bilanz des Modells vermerken, daher sind beide als nicht ausgeführt markiert und vom Durchschnitt ausgeschlossen.
Das Modell fungiert als Pre-Sales-Analyst bei AIMultiple und erstellt ein Pitch-Deck für eine leitende Führungskraft im Produktmarketing. Der Durchlauf umfasst 90 Minuten, Live-Webzugriff über das Bright Data MCP, Codeausführung und einen Ordner mit Marken-Assets, der die Logos und Schriftarten enthält.
Der Großteil der Recherche fließt in die Führungskraft und nicht in das Unternehmen. Diese Führungskraft leitet das Marketing für eine einzelne Produktlinie und hat öffentlich erklärt, was bei der Beurteilung von Hardware zählt: wie viele Tokens ein Dollar kauft, ob eine unabhängige dritte Partei die Zahlen geprüft hat und ob der Test einer echten Arbeitslast oder einer Demo ähnelte.
Ein weiteres wiederkehrendes Argument ist, dass ein Rack eine gerechtere Vergleichseinheit als ein Chip ist. Da diese Argumente öffentlich sind und in Interviews, Konferenzvorträgen und Beiträgen gefunden werden können, besteht die Aufgabe darin, sie zu lesen und dann die AIMultiple-Benchmarks zu finden, die sie beantworten. Ein Deck kann korrekte Angaben zu AIMultiple machen und dennoch die Person völlig verfehlen, und genau diese Version wird schlecht bewertet.
Hier sind einige Ausgaben von Fable 5, Gemini 3-1 pro-preview und GPT 5.6 Sol:
Wie wir die Aufgabe bewertet haben
Das Deck wird nach fünf Aspekten bewertet, die jeweils 20 Punkte wert sind: ob es der visuellen Identität von AIMultiple folgt, ob es die richtigen Benchmarks zitiert, ob es nützliche nächste Schritte vorschlägt, ob es erklärt, was AIMultiple dem Empfänger wert ist, und ob die Folien klar sind. Jeder der fünf Aspekte zerfällt in kleine Prüfungen mit festen Antworten.
Die visuelle Identität ist der einzige Teil, den ein Modell ohne jede Recherche korrekt erledigen kann. Die Logodateien, der Hex-Wert der Akzentfarbe, die Textfarben, die Schriftart und die Schreibweise des Firmennamens sind alle entweder richtig oder falsch. Ein in Calibri gesetztes Deck verliert beispielsweise die Punkte.
Der zweite Teil bewertet, worauf das Deck heute verweist. AIMultiple veröffentlicht viele Artikel über Hardware, und einige davon testen die Art von Chips, die diese Person verkauft. Daher erhalten die Punkte diejenigen Decks, die Rechenzentrums-GPU-Studien zitieren, und nicht diejenigen, die erstbesten Hardware-Seiten nehmen.
Der dritte Abschnitt betrifft die Arbeit, die AIMultiple als Nächstes leisten könnte. Ein Vorschlag zählt hier, wenn er die Studie und die Zahl nennt, die sie produzieren würde. Zum Beispiel bringt die erneute Durchführung eines bestehenden Vergleichs mit den diesjährigen Chips oder die Aufnahme der Hardware des Unternehmens in einen Benchmark, der sie derzeit ausschließt, einen Punkt. Der Vorschlag, dass die beiden Firmen gemeinsam die Inference-Leistung betrachten, nennt dagegen weder eine Studie noch eine Messung und bringt daher keine Punkte.
Der vierte Teil betrifft den Wert von AIMultiple für den Empfänger. Punkte werden für drei Aussagen vergeben, dass:
- AIMultiple unabhängig ist
- seine Leserschaft eine genannte Größe hat, die durch eine benannte Quelle belegt ist
- diese Leserschaft einem bestimmten Zweck für das Geschäft des Empfängers dient, etwa das Erreichen von Käufern in der Shortlist-Phase
Ein Deck, das auflistet, was AIMultiple veröffentlicht, ohne eine Verbindung zu den eigenen Produkten des Empfängers herzustellen, erhält keine Punkte.
Der fünfte Teil beurteilt, ob das Deck lesbar ist. Zwei Prüfungen wiegen schwerer als die übrigen: Überschriften müssen eine Kernaussage enthalten, statt die Folie nur zu beschriften, und Zahlen müssen ihre Herkunft angeben, wobei die Zahlen des Unternehmens von den eigenen Messungen von AIMultiple getrennt bleiben müssen. Der Rest ist mechanisch, etwa die Folienanzahl, Textüberlauf, Diagrammbeschriftungen und Füllmaterial.
Vier der fünf Teile enthalten zudem Strafen. Ein erfundener Benchmark, eine erfundene Zahl, ein toter Link oder die Darstellung einer eigenen Marketingbehauptung des Unternehmens als AIMultiple-Messung kosten Punkte. Das Versprechen günstiger Ergebnisse, einer bevorzugten Platzierung oder einer Überprüfung vor der Veröffentlichung kostet ebenfalls Punkte, da AIMultiple nichts davon anbietet. Das Deck muss überzeugen, ohne Beweise zu erfinden und ohne etwas anzubieten, das Unternehmen nicht verkauft.
Aufgabe 4: Website-Reputations-Audit
Das Modell agiert als Prüfer für Website-Qualität und -Reputation für AIMultiple. Der Durchlauf erlaubt 120 Minuten, Live-Webzugriff über das Bright Data MCP und Codeausführung.
Der Agent beginnt damit, die Beitrags-Sitemap von AIMultiple abzurufen und URLs mit deutschen, spanischen, französischen, italienischen, portugiesischen oder türkischen Sprachpräfixen auszuschließen. Er muss mindestens 100 verbleibende englischsprachige URLs untersuchen.
Für jede Seite sucht der Agent nach Problemen, die der Glaubwürdigkeit von AIMultiple schaden könnten. Dazu können inkonsistente Informationen über Seiten hinweg, defekte Links, veraltete Behauptungen, Faktenfehler, schlechte Grammatik oder Formatierung, fehlende Zitate, irreführende Behauptungen, funktionale Defekte und generischer KI-generierter Fülltext gehören.
Die Ausgabe ist eine Datei Results.csv mit höchstens 50 Zeilen. Jede Zeile muss ein eindeutiges, dedupliziertes Problem beschreiben und alle URLs zusammenfassen, an denen dieses Problem auftritt.
Jede Zeile enthält:
- die Problem-ID;
- Priorität;
- Schweregrad;
- Anzahl betroffener URLs;
- betroffene URLs;
- exakter zitierter Beleg;
- eine Erläuterung des Reputationsproblems;
- und einen empfohlenen Fix.
Die Datei muss von der höchsten zur niedrigsten Priorität geordnet sein.
Wie wir die Aufgabe bewertet haben
Die Priorität wird berechnet als: Priorität = Schweregrad × Anzahl betroffener URLs
Der Schweregrad verwendet vier Stufen:
- 4: Faktenfehler, funktionale Defekte oder andere Probleme, die erheblichen Reputationsschaden verursachen können.
- 3: Seitenübergreifende Inkonsistenzen, veraltete Informationen, fehlende Quellen, defekte Links oder KI-typischer Fülltext.
- 2: Schwerwiegende Grammatik- oder Formatierungsprobleme.
- 1: Geringfügige Grammatik-, Formatierungs- oder Stilprobleme, die Lesbarkeit nicht beeinträchtigen.
Eine Zeile zählt, wenn jede zutreffende Prüfung bestanden wird. Deterministische Skripte laufen zuerst. Sie prüfen die Struktur der Datei und die interne Konsistenz jeder Zeile und gleichen jeden Beleg einer Zeile mit der Seite ab, der er zugeschrieben wird.
Ein Panel aus Modellen von drei Anbietern überprüft dann die Zeilen, die Skripte bestehen ließen. Das Panel arbeitet mit einer datierten Kopie jeder Seite anstatt mit der Live-Seite, sodass ein Defekt, den die Seite inzwischen behoben hat, nicht dem Modell angelastet wird, das ihn gefunden hat.
Schließlich wird die gesamte Einreichung auf doppelte Befunde und zu vage Probleme geprüft. Zum Beispiel ist „Zitierprobleme“ zu allgemein für eine Zeile, während „defekte Zitat-Links“ ein hinreichend spezifisches Problem darstellt.
Das Audit gibt an, wie viele Zeilen eines Modells die Verifikation überstanden haben, sowie den Anteil der eingereichten Zeilen, die überstanden haben. Ein Modell, das eine ungültige Datei oder keine gültigen Datenzeilen einreicht, wird als leere Lieferung gewertet. Sehen Sie unten, wie jedes Modell abgeschnitten hat:
Methodik des Agentic Marketing Benchmarks
Wir haben den ursprünglichen Benchmark aus drei Workflows aufgebaut, die von unseren Strategie-, Wachstums- und Vertriebsteams verwendet werden. Anschließend haben wir ein Website-Reputations-Audit hinzugefügt, das die Qualitätssicherung von Inhalten und die redaktionelle Governance repräsentiert.
Die Wettbewerbsanalyse-Aufgabe unterstützt Entscheidungen über Produktabdeckung, Inhaltsprioritäten und Positionierung. Die Account-Listen-Aufgabe unterstützt Account-basiertes Marketing und Vertriebsrecherche. Das Sales-Deck unterstützt die Pre-Sales-Ansprache: Auswahl eines potenziellen Kunden, Bestimmung, welche veröffentlichten Benchmarks relevant sind, und Erstellung des Dokuments.
Das Website-Reputations-Audit unterstützt die Instandhaltung von Inhalten und das Vertrauen. Es identifiziert defekte Nachweise, veraltete Informationen, seitenübergreifende Inkonsistenzen, Faktenprobleme, Funktionsfehler und redaktionelle Mängel.
Für jeden Workflow haben wir eine Aufgabendatei erstellt, die Folgendes definiert:
- die Rolle des Modells
- verfügbare Werkzeuge
- Anforderungen an die Nachweise
- Qualifikationsregeln
- erforderliche Ausgaben
- Zeitlimit
Wir haben die Aufgaben rund um unsere eigenen Seiten und kommerziellen Workflows gestaltet, und unsere Daten sind Teil des Lösungsschlüssels. Dies erleichtert die Überprüfung der Nachweise, schränkt jedoch gleichzeitig ein, wie allgemein die Ergebnisse auf andere Unternehmen und Marketingumgebungen übertragbar sind.
Aufgabenanweisungen und Bewertungsrastern
Für die Wettbewerbsanalyse konnten die Modelle über das Bright Data MCP das Live-Web durchsuchen. Wir deaktivierten die Codeausführung und setzten ein Zeitlimit von 90 Minuten.
Für die Account-Listen-Erstellung nutzten die Modelle denselben Webzugriff mit aktivierter Codeausführung. Wir erlaubten bis zu 240 Minuten, da die Aufgabe zwei Ausgabedateien und 100 qualifizierte Accounts erforderte.
Für die Sales-Deck-Erstellung aktivierten wir denselben Webzugriff mit Codeausführung. Die Dauer betrug 90 Minuten, mit einem Ordner mit Marken-Assets im Arbeitsverzeichnis.
Für das Website-Reputations-Audit nutzten die Modelle den Live-Webzugriff über das Bright Data MCP mit aktivierter Codeausführung. Wir erlaubten bis zu 120 Minuten, da die Aufgabe das Crawlen und Analysieren von mindestens 100 Seiten erforderte. Die geforderte Ausgabe war eine einzige CSV-Datei mit höchstens 50 deduplizierten Problemgruppen.
Wir gaben jedem Modell die Aufgabenanweisungen und das Ausgabeschema, hielten jedoch die Bewertungsmatrix verborgen.
Modelle mussten aktuelle Quellen verwenden
Alle vier Workflows hängen von Informationen ab, die sich ändern können. Dazu gehören Website-Angebote, Benchmark-Inventare, Produktseiten, Unternehmensumsätze, Hauptsitze, Eigentumsverhältnisse, Sponsor-Offenlegungen, Marketingaktivitäten, öffentliche Stellungnahmen, Artikelinhalte, Zitate und Linkziele.
Wir werteten eine URL, wenn sie auflösbar war und die mit ihr verbundene Behauptung stützte. Eine Unternehmens-Homepage kann keine bestimmte Umsatzzahl belegen, und eine Seite, die eine ähnliche Formulierung enthält, kann einen Audit-Befund nur dann stützen, wenn das eingereichte Zitat und der beschriebene Defekt vorhanden sind.
Die Lösungsschlüssel für die Wettbewerbsanalyse und die Account-Listen-Aufgabe wurden zuletzt am 7. Juli 2026 verifiziert. Die Bewertungsmatrix für das Sales-Deck wurde am 25. Juli 2026 verifiziert, und die Decks wurden am folgenden Tag bewertet.
Das Website-Reputations-Audit verwendete keine feste Liste erwarteter Probleme. Jeder eingereichte Befund wurde zum Zeitpunkt der Bewertung mit den Live-Seiten von AIMultiple abgeglichen. Dies ist notwendig, da die Website kontinuierlich aktualisiert wird und ein Problem, das während eines Durchlaufs bestand, später behoben sein kann.
Ausgaben wurden für den operativen Einsatz konzipiert
Die Aufgaben zur Wettbewerbsanalyse, Account-Liste und Website-Reputation erfordern CSV-Dateien mit festen Spalten und atomaren Zellen. Dies ermöglicht es uns, automatisch auf fehlende Felder, Duplikate, nicht unterstützte Domains, falsche Zeilenanzahlen, fehlerhafte Werte, Rechenfehler und Sortierungsprobleme zu prüfen.
Die Sales-Deck-Aufgabe erfordert eine 16:9 PowerPoint-Datei, die sich ohne Reparaturaufforderung öffnen lässt.
Wettbewerbsanalysen und Account-Listen können in Tabellenkalkulationen, CRM-Workflows und Automatisierungstools überführt werden. Die Ausgabe des Reputations-Audits kann in einen redaktionellen oder technischen Issue-Tracker überführt werden. Das Deck kann nach Prüfung an einen Interessenten gesendet werden.
Eine strukturell ungültige Datei blockiert den nächsten operativen Schritt, selbst wenn ein Teil der darin enthaltenen Recherche nützlich ist. Aus diesem Grund sind Dateilieferung und Schema-Konformität Teil des Benchmarks und nicht nur administrative Anforderungen außerhalb davon.
Wir berichten Einzeldurchlauf-Ergebnisse ohne Varianz
Die Ergebnisse enthalten eine gemeldete Punktzahl pro Modell. Derzeit berichten wir keine wiederholten Durchläufe, Seeds, Konfidenzintervalle oder Fehlerbalken.
Leser sollten kleine Punktzahlunterschiede daher mit Vorsicht behandeln. In der Wettbewerbsanalyse ändert eine einzige zusätzliche korrekte Nettolücke die Punktzahl um zehn Punkte. Bei der Account-Listen-Erstellung können wenige Stichprobenzeilen darüber entscheiden, ob ein gesamtes schwellwertbasiertes Kriterium besteht oder nicht.
Wir kombinierten deterministische Prüfungen mit einem LLM-Bewerter
Deterministische Skripte erledigten alles, was Software direkt klären kann: Dateiexistenz, CSV-Parsing, Spaltenreihenfolge, Zeilenanzahl, akzeptierte Werte, URL-Domains, Duplikate, Sortierung und beim Deck die Archivintegrität, Foliendimensionen und Schriftdeklarationen. Die Skripte riefen auch jede zitierte URL ab, folgten Weiterleitungen und übergaben den aufgelösten Seiteninhalt an den Bewerter.
Ein LLM-Bewerter bewertete die semantischen Kriterien zeilenweise, Lücke für Lücke oder Kriterium für Kriterium anhand von Bestanden/Nicht-bestanden-Regeln und vergab niemals ein allgemeines Qualitätsurteil. Unsere Analysten erstellten die Lösungsschlüssel, und der Bewerter wendete sie an.
Die Wettbewerbsanalyse fügt einen menschlichen Schritt hinzu. Ein Modell kann eine echte Lücke melden, die der Schlüssel nicht auflistet; diese Befunde gehen an einen Analysten, der sie nach Prüfung beider Seiten anrechnet.
Zitieren Sie diesen Benchmark
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{ermut2026,
author = {Ermut, Sıla and Kalelioğlu, Berk},
title = {{AIM Agentic Marketing Benchmark}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/agentic-marketing}},
note = {AIMultiple. Abgerufen am 5. August 2026}
}Ergebnisse und Zeitstempel von 11 Datenpunkten. Laden Sie die in diesem Artikel verwendeten Daten als ZIP-Datei herunter, die eine CSV-Datei enthält.
Zuvor arbeitete sie als Personalvermittlerin in Projektmanagement- und Beratungsunternehmen. Sıla hat einen Master of Science in Sozialpsychologie und einen Bachelor of Arts in Internationalen Beziehungen.
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.