Premium
Dienstleistungen
Premium

AIM Enterprise: Agentischer Unternehmens-Benchmark

Berk Kalelioğlu
Berk Kalelioğlu
aktualisiert am 17. Sept. 2026

Unternehmen nutzen LLMs jeden Tag für ihre regulären Aufgaben. Um die kosteneffizientesten LLMs zu finden, haben wir AIM Enterprise entwickelt, einen agentischen Unternehmens-Benchmark, bei dem wir 69 reale Unternehmensaufgaben aus Strategie, Marketing, HR, Vertrieb und Betrieb verwendet haben.

Benchmark-Ergebnisse

Diagramm wird geladen
  • Opus 5 erzielte bei 39 Aufgaben eine höhere Punktzahl und Astra bei 30. Die Top vier liegen zusammen mit Claude Fable 5.1 und Grok 4.6 innerhalb von 2.9 Punkten.
  • Astra führte bei 23 Aufgaben, Opus 5 bei 22 und Fable 5.1 bei 16.
  • Claude Fable 5.1 schlug Claude Fable 5 bei 63 von 69 Aufgaben und erzielte im Durchschnitt 7.2 Punkte mehr. GPT 6 Astra erzielte durchschnittlich 8.8 Punkte mehr als GPT 5.6 Sol und schlug ihn bei 61.
  • Claude Sonnet 5 kostet $1,23 pro Aufgabe. Gemini 3.8 Flash erzielte 1.5 Punkte mehr bei $0,61, und Grok 4.6 erzielte 13 Punkte mehr bei $1.09.

Kosten und Punktzahl

  • GPT 6 Astra und Claude Opus 5 kosten etwa gleich viel, $1,76 und $1,73 pro Aufgabe, und liegen 1.6 Punkte auseinander.
  • GPT 5.6 Luna erzielte 45.2 Punkte bei $0,016 pro Aufgabe, 18.7 Punkte unter Claude Opus 5 bei unter einem Prozent von dessen Kosten.
  • GPT 5.6 Sol erzielt 53.5 Punkte bei $0,167 pro Aufgabe. Grok 4.6 erzielt 7.5 Punkte mehr und kostet 6.5-mal so viel.
  • Claude Fable 5.1 ist das teuerste Model in der Grafik mit $3,19 pro Aufgabe und liegt 1.8 Punkte unter Claude Opus 5, das $1,73 kostet.
  • Über die 16 Models im Chart korrelieren Kosten pro Aufgabe und Punktzahl mit 0.68. Mediane Zeit pro Aufgabe und Punktzahl korrelieren mit 0.04. Das schnellste Model, Inkling Small mit 66 Sekunden pro Aufgabe, liegt auf dem letzten Platz.

Uneinigkeit der Juroren

Zwei Bewerter-Models bewerteten jede Datei, die Prüfungen bestand. Bei 32,7 % der Einzelbewertungen wichen die beiden um mehr als ein Viertel der Skala voneinander ab, und niemand hat diese Zeilen überprüft.

Beide Bewerter setzten dieselben vier Setups in die Top vier und dieselben zwei auf die letzten Plätze; 12 der 17 Setups werden bei jedem Bewerter unterschiedlich eingestuft.

Jeder Bewerter setzte das Model des eigenen Unternehmens auf Platz eins. GPT 5.6 Sol stufte GPT 6 Astra auf Platz eins und Claude Opus 5 auf Platz zwei ein; Opus 5 stufte sich selbst auf Platz eins und Astra auf Platz vier ein. Die veröffentlichte Reihenfolge kombiniert beide Ranglisten.

AIM Marketing Benchmark

Dieselbe Methode läuft für Marketingarbeit: Angebote zu finden, die ein Wettbewerber veröffentlicht und AIMultiple nicht, eine passgenaue Account-Liste zu erstellen und ein personalisiertes Vertriebsdeck zu produzieren. Jede Aufgabe wird mit 0 bis 100 bewertet, und die Gesamtpunktzahl ist der Mittelwert der drei. Ein Website-Reputationsaudit läuft parallel und wird auf eigenen Achsen berichtet, da es keine feste Höchstpunktzahl hat.

Vollständige Ergebnisse: der agentische Marketing-Benchmark.

Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

AIM IT Benchmark

Zwölf Models führten jeweils eine Benchmark-Design-Aufgabe zweimal aus, erfanden einen Benchmark, bauten ihn auf und ließen vier Models darin laufen. Keiner der 24 Versuche bestand jedes Kriterium, und sechs der Prüfungen der Rubrik wurden von keinem von ihnen bestanden. Claude Opus 5 führte bei Text-zu-SQL mit 78.2 und Kimi K3 bei Tool-Aufrufen mit 74.3.

Vollständige Ergebnisse: können LLMs einen Benchmark entwerfen.

AIM VC Benchmark

Dreizehn abgebildete Models wurden gebeten, die Kunden eines Unternehmens mit datierten Belegen zu benennen, und zwar für drei Zielunternehmen. Claude Opus 5 erreichte 89.1 von 100 und Claude Fable 5 85.0, und diese beiden waren die einzigen, die bei allen drei Zielen in der Bewertung über 76 blieben. Die meisten anderen erzielten beim Ziel, dessen Kunden eher in Podcast-Werbung als auf indexierten Seiten erscheinen, die niedrigste Punktzahl.

Vollständige Ergebnisse: der Kundenlisten-Benchmark.

Verpassen Sie nicht unsere Benchmarks und datengestützten Erkenntnisse. Die Schaltfläche öffnet Google; die Auswahl von AIMultiple bestätigt, dass Sie AIMultiple häufiger in den Google-Suchergebnissen sehen möchten.
GoogleAls bevorzugte Quelle hinzufügen

Agentische Unternehmensplattformen

Unternehmen können LLMs auch über Business-Software nutzen. Die folgenden Plattformen verbinden Models von Anbietern wie OpenAI, Anthropic und Google mit CRM-Datensätzen, Workflows und vorgefertigten Agenten.

Creatio

Creatio ist eine CRM- und Workflow-Plattform mit vorgefertigten KI-Agenten.

Agenten nach Abteilung: Die verfügbaren Agenten hängen von den installierten Apps eines Unternehmens ab. Beispiele:

  • Vertriebsagent: reichert Account-Daten an, füllt Opportunity-Felder nach Zoom-Meetings aus und bereitet neue Meetings vor.
  • Wissensagent: entwirft Knowledge-Base-Artikel aus gelösten Fällen.
  • Segmentierungsagent: wandelt Zielgruppenbeschreibungen in einfacher Sprache in Marketing-Segmente um.

Ein separates Model pro Agent, einschließlich selbst gehosteter: Jeder Agent oder Sub-Agent kann sein eigenes Model verwenden. Unterstützte Optionen sind OpenAI, Azure OpenAI und LiteLLM-unterstützte Anbieter, einschließlich Models auf der eigenen Infrastruktur des Unternehmens. Agent-Szenarien erfordern mindestens ein Kontextfenster von 40.000 Tokens und Funktionsaufrufe.

Salesforce Agentforce

Agentforce ist die Agenten-Schicht des CRM von Salesforce.

Models: Agenten verwenden von Salesforce aktivierte Models von Partnern, darunter Anthropic, Google und OpenAI. Unternehmen können außerdem ihr eigenes LLM-Konto verbinden, und das Standard-Model eines Agenten kann geändert werden.

Einstein Trust Layer: Model-Aufrufe durchlaufen eine Schicht, die laut Salesforce Toxizitätserkennung, Null-Datenspeicherungs-Vereinbarungen und Prompt-Injection-Abwehr umfasst.

Übergabe an eine Person: „Transfer zu einem menschlichen Agenten“ ist eine der Aktionen, die ein Agent wählen kann. Dadurch kann ein Gespräch an eine Person übergeben werden, wenn ein Prozess keine Fehler tolerieren kann.

Microsoft Copilot Studio

Copilot Studio ist das Tool von Microsoft zum Erstellen von Agenten für Microsoft 365 und Power Platform.

Models: OpenAI-Models sind die Standardeinstellung. Ersteller können außerdem externe Models von Anthropic, xAI oder Mistral hinzufügen.

Produktionskennzeichnungen: Microsoft kennzeichnet einige Models als experimentell oder Vorschau und rät davon ab, sie in Produktion zu verwenden. Veröffentlichte Agenten, die diese Models nutzen, werden weiterhin zu Standardtarifen abgerechnet.

Fallback: Wenn ein Admin Anthropic-Models deaktiviert, wechseln darauf aufgebaute Agenten automatisch zum Standard-OpenAI-Model.

Methodik

Die 69 Aufgaben wurden vom Gründer von AIMultiple anhand realer Unternehmensentscheidungen geschrieben und den IDs des APQC Process Classification Framework zugeordnet.1

Sie decken Strategie (16 Aufgaben), Marketing (15), HR (7), Vertrieb (6), Betrieb (5), IT und Finanzen (jeweils 4) sowie sieben kleinere Bereiche ab. Jede Aufgabe benennt die gewünschte Datei: eine results.csv mit fester Spaltenliste, typischerweise 10 Zeilen und 8 Spalten, mit einer expliziten Regel für jedes ganzzahlige Feld.

Wie die Models liefen

Sechzehn Models liefen in 17 Setups, wobei ein Setup ein Model unter einem Agentenprogramm ist. Acht liefen auf opencode 1.15.13 über OpenRouter. Die anderen neun verwendeten Claude Code, Codex oder Grok Build, die eigenen Agentenprogramme ihrer Anbieter. Alle wurden über Abonnements abgerechnet.

Fable 5.1 lief auf Claude Code 2.1.258, während die anderen drei Claude-Setups auf 2.1.220 liefen; Astra lief auf Codex 0.153.4, während die drei GPT 5.6-Setups auf 0.146.0 liefen. Gemini 3.8 Flash lief auf demselben opencode-Build wie die übrigen.

Jedes Setup erhielt denselben eingefrorenen Prompt, Live-Webzugriff über eine Scraping-API und ein Zeitlimit von einer Stunde. Prompts wurden nie pro Model angepasst, und die Bewertungsrubriken erreichten nie die Maschine, die Aufgaben ausführte.

Niemand wählte eine Reasoning-Stufe. Jedes Setup lief mit dem Standard seines Agentenprogramms, und die Standards sind nicht eine einzige Stufe:

Claude Code verwendet standardmäßig die Stufe hoch für jedes Model, das es ausführte. Codex sendet den Katalogstandard jedes Models. Das ist niedrig für GPT 5.6 Sol und mittel für Luna, Terra und GPT 6 Astra. Grok Build führte Grok 4.6 mit hoch aus. opencode überlässt die Stufe dem Anbieter, daher liefen seine acht Setups mit dem jeweiligen OpenRouter-Standard jedes Models.

Ein höherer Reasoning-Standard ging nicht mit einer höheren Punktzahl einher. Im Chart mit 16 Models liegen die drei Models, deren Standard über hoch liegt, auf den Rängen 9th, 11th und 14th: GLM 5.3 mit max, Qwen 3.8 Max mit xhoch und Kimi K3 mit max. Claude Sonnet 5 lief sowohl unter einer Anbieter-CLI als auch unter opencode und erzielte 47.9 und 47.5.

Alle Kostenangaben hier werden aus der aufgezeichneten Token-Nutzung zu den am 27. August 2026 eingefrorenen Listenpreisen von OpenRouter neu berechnet. Reasoning-Tokens werden als Output-Tokens bepreist, so wie OpenRouter sie abrechnet. GPT 6 Astra und Gemini 3.8 Flash kamen später hinzu und verwenden die am 5. September 2026 gelesenen OpenRouter-Tarife; Claude Fable 5.1 verwendet die veröffentlichten Tarife von Anthropic vom selben Datum, da OpenRouter es nicht listet.

Die Claude-Code-Kosten wenden außerdem drei veröffentlichte Anthropic-Regeln an, die eine pauschale Preisliste nicht enthält. Der einstündige Prompt-Cache kostet das Doppelte des Input-Tarifs, während ein fünfminütiger Cache das 1.25-fache des Input-Tarifs kostet. Die Websuche kostet $10 pro tausend Anfragen. Der Haiku-4.5-Subagent, den Claude Code neben dem Haupt-Model ausführt, ist enthalten.

Die eigenen Kostenangaben der Agentenprogramme sind nicht vergleichbar. Jeder Lauf erfolgte über ein Abonnement, daher gibt es für kein Setup eine Rechnung pro Lauf. Wenn ein Programm Kosten meldet, bepreist es seine eigenen Tokens anhand seiner eigenen Liste. opencode verwendet eine gebündelte Preisliste. Grok Build verwendet eine xAI-Liste zu etwa einem Drittel des öffentlichen Tarifs. Codex meldet nichts. Claude Code bepreiste Sonnet 5 mit $3 und $15 pro Million Tokens, dem Tarif von Claude Sonnet 4.6, während Sonnet 5 $2 und $10 kostet.

Die Läufe erzeugten 1.140 Dateien aus 1.173 Setup-Aufgaben-Paaren. Eine fehlende Datei erhält null Punkte und wird nicht erneut ausgeführt, es sei denn, der Lauf erreichte das Ein-Stunden-Limit oder endete mit einem Fehler des Model-Anbieters; jede Ausnahme erlaubt einen erneuten Versuch.

Fünf Läufe blieben stecken, und vier lieferten beim erneuten Versuch. Achtzehn Läufe endeten mit einem Anbieterfehler, einem 502 oder 504 von der API oder einer beschädigten Antwort. Einer hatte seine Datei bereits geschrieben; die anderen 17 wurden erneut ausgeführt, und 16 lieferten. Ein Lauf traf sowohl das Zeitlimit als auch einen Anbieterfehler.

Acht Qwen-3.8-Max-Läufe endeten, als opencodes Loop-Schutz das Model daran hinderte, denselben Tool-Aufruf ein drittes Mal zu wiederholen. Kein anderes Setup löste den Schutz aus. Diese Läufe wurden nicht erneut ausgeführt, und vier davon erzeugten keine Datei. Jede Datei wurde einmal bewertet, sodass kein Ergebnis daraus entstand, den besseren von zwei Versuchen auszuwählen.

Wie die Prüfungen und Bewerter arbeiten

Deterministische Prüfungen laufen zuerst, und kein Bewerter sieht eine Datei, die sie nicht besteht: Spaltenmenge und Zeilenzahl, RFC-4180-Parsing,2

Ganzzahlformatierung, keine leeren Zellen, keine doppelten Zeilen und Sortierreihenfolge, wo die Aufgabe eine verlangt.

Eine Datei, die nicht besteht, erhält null Punkte, statt verworfen zu werden. MiniMax M3 scheiterte bei 8 der 64 gelieferten Dateien, sechs davon, weil sich die CSV nicht parsen ließ, und GPT 5.6 Luna und GPT 5.6 Terra scheiterten bei jeweils einer. Entfernt man jede Aufgabe, bei der irgendein Setup null Punkte erzielte, bleiben 38 Aufgaben und derselbe Spitzenreiter übrig.

Die 1.130 Dateien, die bestanden, gingen an zwei Bewerter: GPT 5.6 Sol über die Codex-CLI und Claude Opus 5 über die Claude-Code-CLI, beide mit hohem Reasoning-Aufwand und Live-Webzugriff.

Jede Spalte der Datei geht an einen eigenen Subagenten, der die Antworten dieser Spalte von jedem Model und sonst nichts sieht, unter anonymen Zeilen-IDs, die für jeden Bewerter separat gemischt werden. Der Bewerter ordnet diese Antworten im Vergleich zueinander an und kann keine zwei als gleich einstufen. Die beiden Ranglisten werden dann kombiniert, indem die Position jeder Antwort bei jedem Bewerter addiert wird. Das ergab 93.490 Bewertungen.

Gemessen mit sichtbaren Model-Namen stufte Sol GPT-Antworten 8.4 Perzentilpunkte über dem Niveau ein, auf dem Opus sie einstufte, und Opus stufte Anthropic-Antworten 4.9 Perzentilpunkte über dem Niveau ein, auf dem Sol sie einstufte. Im anonymisierten Lauf hinter dieser Bestenliste stufte Sol GPT 6 Astra auf Platz eins und Opus Claude Opus 5 auf Platz eins ein.

Wie die Bewertung funktioniert

Die Punktzahl eines Models ist die Summe seiner Spaltendurchschnitte, so umskaliert, dass die höchstmögliche Gesamtpunktzahl 100 beträgt. Diese Obergrenze hängt davon ab, wie viele Models die Prüfungen bestanden haben, weshalb diese Punktzahlen nur innerhalb dieses Benchmarks und nirgendwo sonst vergleichbar sind.

Um zu testen, wie stark die Rangliste von der Aufgabenauswahl abhängt, haben wir die Bestenliste 4.000 Mal neu bewertet, jedes Mal mit einer zufälligen Neuauswahl der 69 Aufgaben. Das misst nur die Aufgabenempfindlichkeit. Es misst nicht, wie stark eine erneute Ausführung derselben Aufgabe eine Punktzahl verschieben würde, da keine Aufgabe zweimal bewertet wurde.

Das schwerste Viertel sind 17 Aufgaben, die mit der niedrigsten durchschnittlichen Punktzahl über alle 17 Setups. Fünf Aufgaben teilen sich die letzten vier Plätze, und Opus 5 hat unter allen fünf möglichen Auswahlen den höchsten Durchschnitt. Diese Regel wurde festgelegt, bevor die Platzierung eines Models bei diesen Aufgaben berechnet wurde.

Zehn der 16 Models erscheinen auch in den Benchmarks oben. Ihre Punktzahlen sind nicht über Benchmarks hinweg vergleichbar, da jeder seine eigene Skala festlegt.

Jedes Setup hier wird anhand seiner Position relativ zu den Models bewertet, gegen die es lief. Das Entfernen eines Setups verändert daher jede andere Punktzahl. Aus demselben Grund sind diese Punktzahlen nicht mit dem vorherigen Lauf dieses Benchmarks vergleichbar, der ein anderes Feld bewertet hat. Nur die Reihenfolge der Setups kann über Läufe hinweg verglichen werden.

Gemini 3.7 Flash lief auf diesem Feld und wurde entfernt, als Gemini 3.8 Flash abgeschlossen wurde, gemäß der Regel, dass ein Model ausscheidet, sobald sein Nachfolger gelaufen ist. Dieselbe Regel zog Grok 4.5 und GLM 5.2 zurück.

FAQs

Nicht nach dieser Evidenz. Die Skala ist relativ, daher bedeutet selbst die höchste Punktzahl von 63.9 nur, dass die Antworten eines Models über den anderen lagen, und die Zeilen, in denen die beiden bewertenden Models erheblich voneinander abweichen, sind nicht überprüft. Anbieter, die diese Art von Agenten bauen, sind in unserer Aufschlüsselung der Enterprise-KI-Unternehmen aufgeführt, und AIMultiple automatisiert Prozesse wie diese.

Sieben von ihnen erzielen zwischen 45.2 und 49.4, näher beieinander, als 69 Aufgaben trennen können. Die Top vier liegen ebenfalls innerhalb von 2.9 Punkten zueinander. Der Benchmark trennt starke Models von schwachen; das Resampling der Aufgaben ordnet beide Gruppen neu.

Ein Model lief in diesem Lauf unter beiden Programmen und erzielte 47.9 unter Claude Code und 47.5 unter opencode. Ein einziger Vergleich ergibt keine allgemeine Antwort. Die Diagramme zeigen das Claude-Code-Ergebnis. Das opencode-Setup las 4.5-mal so viel zwischengespeicherten Kontext und produzierte 1.2-mal so viele Output-Tokens, einschließlich Reasoning. Es kostete $1,59 pro Aufgabe, verglichen mit $1,23 für Claude Code, dessen Wert bereits einen Subagenten enthält, den opencode nicht ausführt.

Zitieren Sie diesen Benchmark

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Berk Kalelioğlu (2026) - "AIM Enterprise: Agentischer Unternehmens-Benchmark". Online veröffentlicht auf AIMultiple.com. Abgerufen am 17. September 2026, von: https://aimultiple.com/agentic-enterprise [Online-Ressource]

Kalelioğlu, B. (2026, 17. September). AIM Enterprise: Agentischer Unternehmens-Benchmark. AIMultiple. https://aimultiple.com/agentic-enterprise

@misc{kalelioglu2026,
  author = {Kalelioğlu, Berk},
  title  = {{AIM Enterprise: Agentischer Unternehmens-Benchmark}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/agentic-enterprise}},
  note   = {AIMultiple. Abgerufen am 17. September 2026}
}
Alle Daten herunterladen

Ergebnisse und Zeitstempel von 33 Datenpunkten. Laden Sie die Zusammenfassungsdaten aus den Diagrammen und Tabellen dieses Artikels als ZIP-Datei herunter, die 2 CSV-Dateien und eine README enthält.

Zuletzt aktualisiert: 23. September 2026
Herunterladen

Möchten Sie die granularen Daten dahinter? Premium beitreten

Änderungsprotokoll

1 Aktualisierungen
  1. Der Methodik-Abschnitt wurde um eine Tabelle zum Reasoning-Aufwand nach Modell und Agentenprogramm ergänzt.

Berk Kalelioğlu
Berk Kalelioğlu
KI-Forscher
Berk ist KI-Forscher im Benchmark-Team von AIMultiple und konzentriert sich auf agentische KI, maschinelles Lernen sowie große und kleine Sprachmodelle (LLMs und SLMs).
Vollständiges Profil anzeigen

Seien Sie der Erste, der kommentiert

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450