Unternehmen nutzen LLMs täglich für ihre regulären Aufgaben. Um die kosteneffizientesten LLMs zu finden, haben wir AIM Enterprise entwickelt, einen agentischen Enterprise-Benchmark, bei dem wir 69 Unternehmensaufgaben in verschiedenen Kategorien verwendet haben.
Ergebnisse des Enterprise-Aufgaben-Benchmarks
Jedes Modell lieferte eine Datei pro Aufgabe. Die Punktzahlen sind relativ: Die Juroren ordnen jede Antwort im Vergleich zu den anderen Antworten für dieselbe Aufgabe ein, daher liegt die Durchschnittspunktzahl konstruktionsbedingt bei 50. Ein Wert von 55 bedeutet, dass die Antworten eines Modells über den meisten anderen lagen, nicht dass 55 % seiner Arbeit korrekt waren.
Zwei Modelle lagen klar vorn. Claude Opus 5 erreichte 66.4 und GPT 5.6 Sol 62.4, mehr als 7 Punkte über dem drittplatzierten Setup. Ihr Vorsprung hängt nicht davon ab, welche Aufgaben wir ausgewählt haben: Wir haben die Rangliste 4.000-mal bei zufälligen Neuauswahlen der 69 Aufgaben neu bewertet, und diese beiden lagen jedes Mal auf Platz eins und zwei.
Die nächsten neun Modelle erreichten zwischen 51.4 und 55.3. Neunundsechzig Aufgaben können so knappe Punktzahlen nicht trennen, daher ändert sich ihre Reihenfolge je nachdem, welche Aufgaben gewertet werden. Kimi K3 ist in dieser Gruppe die Ausnahme und landete in 94 % der Neubewertungen über Claude Sonnet 5.
Opus 5 gewann auch die schwierigsten Aufgaben. Wir nahmen die 17 Aufgaben mit der niedrigsten Durchschnittspunktzahl über alle 16 Setups hinweg, festgelegt nach dieser Regel, bevor die Platzierung eines Modells auf diesen Aufgaben berechnet wurde, und Opus 5 übertraf alle 15 anderen Setups in dieser Teilmenge.
Opus 5 hat keine schwachen Aufgaben. Seine beste Punktzahl, 80.6, ist die höchste, die jemand erzielt hat, und seine schlechteste, 52.9, übertrifft immer noch eine durchschnittliche Antwort. Es erreichte über 60 bei 62 der 69 Aufgaben und wurde bei 43 davon Erster. GPT 5.6 Sol gewann 13 Aufgaben, und kein anderes Modell gewann mehr als vier.
Die beiden bewertenden Modelle waren sich uneinig, welches der führenden Modelle zuerst kommen sollte. Jedes setzte das Modell seines eigenen Unternehmens an die Spitze, daher kombiniert die veröffentlichte Reihenfolge beide Ranglisten.
Kosten und Punktzahl
Die Kosten umfassen die 11 Setups, die pro Lauf abgerechnet werden. Fünf Setups, einschließlich beider führender Modelle, liefen über Abonnements, die keine Kosten pro Lauf erfassen.
Das bestbewertete kostenpflichtige Setup ist auch das günstigste. GPT 5.6 Luna erreichte 55.3 bei $0.032 pro Aufgabe, knapp unter DeepSeek V4 Flash bei $0.033. Claude Sonnet 5 erreichte 53.2 bei $1.46, was das 46-fache der Kosten und 2.1 Punkte weniger ist.
Mehr zu bezahlen bringt hier wenig. Über die 11 kostenpflichtigen Setups hinweg beträgt die Korrelation zwischen Kosten pro Aufgabe und Punktzahl 0.48. Kimi K3 bei $0.92 und Qwen 3.8 Max bei $0.74 lagen im gleichen Bereich wie Luna bei $0.03.
Ein schneller Lauf ist ein Warnsignal, aber ein langsamer beweist nichts. Über alle 16 Setups hinweg beträgt die Korrelation zwischen Zeit pro Aufgabe und Punktzahl 0.55, und die vier schnellsten waren vier der fünf niedrigsten Punktzahlen. Inkling Small erledigte eine Aufgabe in 49 Sekunden und wurde Vorletzter. Unter den neun Modellen, die sich in der Mitte ballen und zwischen 127 und 569 Sekunden benötigten, sinkt diese Korrelation auf −0.06.
Die Kosten sind das, was das Harness zu seiner gebündelten Preisliste berechnet hat, kein Angebot. Die Listenpreise der Anbieter finden Sie in unserem LLM-Preisvergleich. Fehlgeschlagene Versuche zählen zur Gesamtsumme eines Modells, aber nicht zu seinem Pro-Aufgabe-Wert, und die beiden weichen am stärksten bei Grok 4.5 voneinander ab: $26.14 ausgegeben gegenüber $22.84 für gelieferte Läufe.
Meinungsverschiedenheiten der Juroren
Zwei Modelle bewerteten jede Datei und waren oft unterschiedlicher Meinung. Bei etwa einem Drittel der Einzelbewertungen lagen die beiden mehr als ein Viertel der Skala auseinander, und niemand hat diese Zeilen überprüft.
Sie waren sich über die Enden einig, aber nicht über die Mitte. Beide setzten Opus 5 und GPT 5.6 Sol über alle anderen, aber 11 der 16 Setups landen je nachdem, welchem Bewertungsmodell man folgt, auf einer anderen Position.
Jede Aufgabe wurde einmal ausgeführt und einmal bewertet. Ein Modell, das keine Datei erzeugte, wurde erneut ausgeführt, aber keine Datei wurde jemals zweimal bewertet, daher stammt kein Ergebnis aus der Auswahl des besseren von zwei Versuchen.
Eine siebzigste Aufgabe, ein Playbook zur Bearbeitung von Anfragen, ist in allen Abbildungen hier ausgelassen. Ihre Eingabedatei fehlte zur Laufzeit und nur ein Setup hat jemals eine Datei dafür erzeugt.
AIM Marketing-Benchmark
Dieselbe Methode wird auf Marketingarbeiten angewendet: das Finden von Angeboten, die ein Wettbewerber veröffentlicht und AIMultiple nicht, die Erstellung einer optimal passenden Kontoliste und die Erstellung eines personalisierten Vertriebsdecks. Jede Aufgabe wird mit 0 bis 100 bewertet, und die Gesamtpunktzahl ist der Mittelwert der drei. Eine Website-Reputationsprüfung läuft parallel dazu und wird auf eigenen Achsen berichtet, da sie keine feste Höchstpunktzahl hat.
Vollständige Ergebnisse: der agentische Marketing-Benchmark.
AIM-IT-Benchmark
Zwölf Modelle wurden angewiesen, einen Benchmark zu erfinden, ihn aufzubauen und vier Modelle jeweils zweimal durchlaufen zu lassen. Keiner der 24 Versuche erfüllte jedes Kriterium, und sechs der Prüfungen des Bewertungsrasters wurden von keinem von ihnen bestanden. Claude Opus 5 führte bei Text-zu-SQL mit 78.2 und Kimi K3 bei Tool-Aufrufen mit 74.3.
Vollständige Ergebnisse: können LLMs einen Benchmark entwerfen.
AIM-VC-Benchmark
Dreizehn Modelle wurden gebeten, die Kunden eines Unternehmens mit datierten Belegen über drei Zielunternehmen hinweg zu benennen. Claude Opus 5 erreichte 89.1 von 100 und Claude Fable 5 85.0, und diese beiden waren die einzigen, die bei allen drei Zielunternehmen über 76 blieben. Die meisten anderen brachen bei dem Zielunternehmen ein, dessen Kunden eher in Podcast-Sponsoransagen als auf indexierten Seiten genannt werden.
Vollständige Ergebnisse: der Kundenlisten-Benchmark.
Methodik
Die 69 Aufgaben wurden vom Gründer von AIMultiple anhand realer Unternehmensentscheidungen verfasst und den IDs des APQC Process Classification Framework zugeordnet.
1Sie decken Strategie (16 Aufgaben), Marketing (15), HR (7), Vertrieb (6), Betrieb (5), IT und Finanzen (je 4) sowie sieben kleinere Bereiche ab. Jede Aufgabe benennt ihr Ergebnis: eine results.csv mit einer festen Spaltenliste, typischerweise 10 Zeilen und 8 Spalten, mit einer expliziten Regel für jedes ganzzahlige Feld.
Wie die Modelle ausgeführt wurden
Dreizehn Modelle liefen in 16 Setups, wobei ein Setup ein Modell unter einem Agentenprogramm ist. Elf liefen auf opencode 1.15.13 über OpenRouter. Die übrigen liefen auf den Agentenprogrammen, die ihre eigenen Anbieter ausliefern, Claude Code und Codex, die über Abonnements abgerechnet werden.
Jedes Setup erhielt denselben eingefrorenen Prompt, Live-Webzugriff über eine Scraping-API und ein Zwei-Stunden-Limit. Die Prompts wurden nie pro Modell angepasst, und die Bewertungsraster gelangten nie auf die Maschine, die Aufgaben ausführte.
Das erzeugte 1.104 Dateien, eine pro Modell und Aufgabe. Sechs opencode-Setups verfehlten 25 Zellen im ersten Durchgang, weil die Dateisuche des Agenten Pfade beschritt, die eigene Sandbox dann nicht öffnen wollte, was den Lauf blockierte. Das erneute Ausführen dieser 25 in einem isolierten Verzeichnis stellte alle wieder her, daher wird die Lieferung sowohl als Erstdurchgangs- als auch als Endrate angegeben. Zählt man jeden Neustart, benötigten 83 der 759 Zellen mit Nutzungsdatensätzen mehr als einen Versuch.
Wie die Prüfungen und Juroren funktionieren
Deterministische Prüfungen laufen zuerst, und kein Juror sieht eine Datei, die sie nicht besteht: Spaltensatz und Zeilenanzahl, RFC 4180-Parsing,
2Ganzzahlformatierung, keine leeren Zellen, keine doppelten Zeilen und Sortierreihenfolge, wo die Aufgabe eine verlangt.
Eine Datei, die durchfällt, erhält null Punkte, statt verworfen zu werden, denn eine Datei, die niemand parsen kann, ist ein Ergebnis. DeepSeek V4 Flash fiel bei 6 seiner 69 Dateien durch, Inkling Small bei 2, MiniMax M3 und GPT 5.6 Terra jeweils bei einer. Das Entfernen jeder Aufgabe, bei der ein Setup durchfiel, lässt die beiden Spitzenreiter und die Gesamtstruktur unverändert.
Die 1.094 Dateien, die bestanden, gingen an zwei Juroren: GPT 5.6 Sol über die Codex-CLI und Claude Opus 5 über die Claude Code-CLI, beide mit hohem Reasoning-Aufwand und Live-Webzugriff.
Jede Spalte des Ergebnisses geht an ihren eigenen Subagenten, der die Antworten dieser Spalte von jedem Modell und sonst nichts sieht, unter anonymen Zeilen-IDs, die für jeden Juror separat gemischt werden. Der Juror ordnet diese Antworten zueinander und kann keine zwei als gleich einstufen. Die beiden Ranglisten werden dann kombiniert, indem die Position jeder Antwort unter jedem Juror addiert wird. Das erzeugte 90.530 Punktzahlen.
Die Anonymisierung ist nicht kosmetisch. Gemessen mit sichtbaren Modellnamen stufte Sol GPT-Antworten 8.4 Perzentile höher ein als Opus, und Opus stufte Anthropic-Antworten 4.9 Perzentile höher ein als Sol. Sie entfernt den Effekt nicht: Die Läufe hinter dieser Rangliste waren anonymisiert, und jeder Juror setzte dennoch das Setup seines eigenen Unternehmens an die erste Stelle.
Wie die Punktevergabe funktioniert
Die Punktzahl eines Modells ist die Summe seiner Spaltendurchschnitte, neu skaliert, sodass die höchstmögliche Gesamtpunktzahl 100 beträgt. Diese Obergrenze hängt davon ab, wie viele Modelle die Prüfungen bestanden haben, weshalb diese Punktzahlen nur innerhalb dieses Benchmarks vergleichbar sind und nirgendwo sonst.
Um zu testen, wie stark die Rangliste von der Aufgabenauswahl abhängt, haben wir die Rangliste 4.000-mal neu bewertet, jedes Mal mit einer zufälligen Neuauswahl der 69 Aufgaben. Das misst nur die Aufgabenempfindlichkeit. Es misst nicht, wie stark eine erneute Ausführung derselben Aufgabe eine Punktzahl verändern würde, denn keine Aufgabe wurde zweimal bewertet.
Das schwierigste Viertel sind die 17 Aufgaben mit der niedrigsten Durchschnittspunktzahl über alle 16 Setups hinweg. Diese Regel wurde festgelegt, bevor die Platzierung eines Modells bei diesen Aufgaben berechnet wurde.
Zwölf der 13 Modelle hier laufen auch in den anderen Benchmarks oben, daher überträgt sich ihre Reihenfolge über die Serie. Die Zahlen tun dies nicht, da jeder Benchmark seine eigene Skala festlegt.
Dieser Benchmark lässt sich nicht so kürzen wie die anderen. Jede Punktzahl ist eine Position relativ zu den Modellen, gegen die sie angetreten ist, daher würde das Entfernen eines Setups alle übrigen neu bewerten, statt einen Balken zu entfernen. Qwen 3.8 Max läuft nur in diesem Benchmark und bleibt aus diesem Grund im Diagramm.
FAQs
Nicht nach dieser Evidenz. Die Skala ist relativ, daher besagt selbst die Höchstpunktzahl von 66.4 nur, dass die Antworten eines Modells über den anderen lagen, und die Zeilen, in denen die beiden Bewertungsmodelle erheblich voneinander abweichen, sind nicht überprüft. Anbieter, die diese Art von Agenten entwickeln, sind in unserer Aufschlüsselung Enterprise-KI-Unternehmen aufgeführt, und AIMultiple automatisiert Prozesse wie diese.
Weil neun von ihnen wirklich nahe beieinander liegen und 69 Aufgaben Unterschiede unter etwa 1.5 Punkten nicht trennen können. Der Benchmark unterscheidet starke Modelle von schwachen, nicht ein Mittelfeldmodell vom nächsten.
Nicht für die Ausgabequalität, in den drei Fällen, die wir testen konnten. Drei Modelle liefen jeweils unter zwei Agentenprogrammen, und kein Paar unterschied sich um mehr als 0.83 Punkte. Der Unterschied zeigte sich stattdessen im Betrieb: Nur die opencode-Setups verloren Zellen durch einen Sandbox-Konflikt, und nur die über Abonnements abgerechneten Programme hinterließen keinen Nutzungsdatensatz.
Diese Forschung zitieren
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{AIM Enterprise: Agentischer Enterprise-Benchmark}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/agentic-enterprise}},
note = {AIMultiple. Abgerufen am 14. August 2026}
}
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.