Premium
Dienstleistungen
Premium

Agentic IT: Können KI-Agenten einen Benchmark entwerfen

Berk Kalelioğlu
Berk Kalelioğlu
aktualisiert am 18. Sept. 2026

Wir haben 16 Models anhand eines Benchmark-Entwurfs in Text-zu-SQL und Tool-Calling getestet. Jedes Model erstellte einen Benchmark pro Thema, insgesamt 32 Einreichungen. Keine Einreichung erfüllte jedes Rubrik-Kriterium. Die Agenten konnten Tests erstellen und ausführen, aber keiner führte sowohl einen Leerantwort-Test als auch einen Richtigantwort-Test des eigenen Scorers vor.

Benchmark-Design-Ergebnisse

Diagramm wird geladen

Text-zu-SQL wandelt eine Frage in natürlicher Sprache in eine Datenbankabfrage um. Tool-Calling wählt eine Funktion aus und füllt deren Argumente aus.

Wir haben jede Einreichung anhand einer Rubrik bewertet, die Agenten nicht sehen konnten. Die Text-zu-SQL-Rubrik hat 78 Punkte, und die Tool-Calling-Rubrik hat 74. Die Punktzahlen zeigen den Prozentsatz der anwendbaren Rubrik-Punkte. Die Balkenbeschriftungen sind auf ganze Zahlen gerundet.

  • Text-zu-SQL: Claude Opus 5 und Grok 4.6 liegen gleichauf bei 78,2 %. Wenn wir die Rubrik-Kriterien neu ziehen, liegt die mittlere 95 % ihrer Rangplätze zwischen 1st und 5th.
  • Tool-Calling: GPT 5.6 Sol führt mit 74,3 %. Die mittleren 95 % seiner neu gezogenen Rangplätze fallen zwischen 1st und 4th. Die Rangspannen stammen aus dem Neu-Ziehen der Rubrik-Kriterien.

Über die 16 Models hinweg korrelieren die beiden Themenwerte mit 0.42 (Pearson). Der Durchschnittswert kombiniert zwei Rubriken mit unterschiedlichen Kriterien, daher handelt es sich nicht um einen direkten Vergleich.

Fehlende Qualitätsprüfungen

Keine Einreichung bestand diese vier Prüfungen:

  • Leerantwort-Test: Leere Antworten durchlaufen den Scorer. Ein funktionierender Scorer sollte nahezu null Punkte vergeben.
  • Richtigantwort-Test: Die Referenzantworten durchlaufen die vollständigen Extraktions- und Bewertungsschritte. Ein funktionierender Scorer sollte die volle Punktzahl vergeben.
  • Test ohne Referenz: Die Fälle werden ohne das Datenbankschema oder die Tool-Definitionen wiederholt.
  • Schwierigkeitsziel: Das stärkste Model sollte zwischen 40 % und 60 % punkten. Es lag über 60 % in 30 von 32 Einreichungen.

Zwanzig Einreichungen verfehlten außerdem den geforderten Abstand von mindestens 20 Punkten zwischen den stärksten und den schwächsten Models.

  • Kalibrierung: Zwei Einreichungen bestanden die Kalibrierungsprüfung: GLM 5.3 in Text-zu-SQL und Claude Opus 5 im Tool-Calling. Um zu bestehen, musste eine Einreichung ihre Überarbeitungen beibehalten und sie erläutern, nachdem sie das Schwierigkeitsziel verfehlt hatte.
  • Vorhersagen: Sechs von 32 Einreichungen bestanden die Vorhersageprüfung. Für das Bestehen mussten die besten und schlechtesten Models benannt und mindestens zwei ihrer vier Punktzahlen innerhalb der vorhergesagten Intervalle platziert werden. Jeder Agent sagte außerdem das Punkteintervall und den Rang eines fünften, zurückgehaltenen Models voraus. Zwei Einreichungen lagen bei beidem richtig: Gemini 3.8 Flash und Grok 4.6, beide in Text-zu-SQL.
  • Unbelegte Behauptungen: Zweiundzwanzig von 32 Berichten fielen bei der Prüfung des Richtergremiums auf Behauptungen ohne unterstützende Belege durch.

Kosten und Zeit

Kostenaufzeichnungen erfassen 16 Models, und Zeitaufzeichnungen erfassen 15. Die Grafik verwendet die 15 mit beiden Aufzeichnungen und lässt Grok 4.6 aus, weil dessen Dauer nicht aufgezeichnet wurde.

Die Kosten umfassen die Inferenz des erstellenden Agenten pro Thema, einschließlich aufgezeichneter Wiederholungen. Sie schließen API-Aufrufe aus, die von den generierten Benchmark-Programmen ausgeführt werden, und unterschätzen daher die Gesamtkosten für das Erstellen und Ausführen eines Benchmarks.

Die Läufe verwenden unterschiedliche Agentenprogramme und enthalten Ersatzversuche. Die Daten können nicht zeigen, ob höhere Ausgaben oder längere Läufe zu höheren Punktzahlen führen.

Die durch das Neu-Ziehen von Rubrik-Kriterien gewonnenen Punkteintervalle sind im Durchschnitt 32.7 Punkte breit. Sie schließen die Variation aus, die wiederholte Erstellungsläufe hinzufügen würden.

Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

Was die Models richtig gemacht haben

Jede Ergebniszeile in den 32 Haupteinreichungen verlinkt auf eine gespeicherte Model-Antwort. Das erneute Ausführen des Scorers jeder Einreichung mit diesen gespeicherten Antworten reproduzierte die Ergebnistabelle. Die Bewertung ist wiederholbar, aber die Reproduktion authentifiziert die gespeicherten Antworten nicht.

Wir haben separat gesampelte Antwortdateien gelöscht und beschädigt. Alle 32 Scorer änderten ihre Ausgabe und unterschieden eine gelöschte Antwort von einer beschädigten. Der Test prüft nicht jede Bewertungsregel.

Zweiundzwanzig von 32 Berichten fielen bei der Prüfung des Gremiums auf unbelegte Behauptungen durch.

Was die Ergebnisse für Agentic IT bedeuten

Im IT-Betrieb liest ein KI-Agent den Zustand eines Systems und handelt daraufhin, etwa indem er einen Patch installiert oder einen Dienst neu startet. Eine separate Prüfung muss anschließend bestätigen, dass die Aktion funktioniert hat. Die Scorer-Kontrolltests in diesem Benchmark spielen dieselbe Rolle für die Bewertung: Sie bestätigen, dass der Scorer funktioniert, bevor seine Ergebnisse verwendet werden. Keine der 32 Haupteinreichungen bestand diese Tests.

Dieser Benchmark deckt Text-zu-SQL und Tool-Calling ab. Er ist kein Test für Patching, Ticket-Triage oder andere IT-Aufgaben.

Wir testen IT-Management-Tools separat, auf Live-Systemen. Ausgewählte Ergebnisse:

Verpassen Sie nicht unsere Benchmarks und datengestützten Erkenntnisse. Die Schaltfläche öffnet Google; die Auswahl von AIMultiple bestätigt, dass Sie AIMultiple häufiger in den Google-Suchergebnissen sehen möchten.
GoogleAls bevorzugte Quelle hinzufügen

Agentic-IT-Plattformen

Die 16 Models in diesem Benchmark sind LLMs. Die folgenden Plattformen sind es nicht. Sie liegen über solchen Models und ergänzen IT-Daten, Workflows und Kontrollen.

Ein agentisches System entscheidet seinen nächsten Schritt anhand des beobachteten Zustands, während regelbasierte Automatisierung im Voraus festgelegten Schritten folgt. IT-Produkte kombinieren beides, daher ist bei jedem Eintrag unten vermerkt, welcher Teil welcher ist.

Creatio

Creatio führt KI-Agenten innerhalb einer CRM- und Workflow-Plattform aus, sodass ein Agent mit den eigenen Datensätzen des Unternehmens arbeitet und nicht mit einem Chat-Protokoll.

Models: OpenAI, Azure OpenAI oder jeder durch die LiteLLM-Bibliothek unterstützte Anbieter, einschließlich Models auf den eigenen Servern des Unternehmens. Jeder Agent kann einen anderen verwenden.

Teams erstellen ihre eigenen Agenten: Ein Agent wird in der Oberfläche definiert, nicht im Code: seine Anweisungen, dann was er nicht tun darf, auf welche Daten er nicht zugreifen kann, welche Skills er aufrufen kann und welche Aktionen er an einem Datensatz ausführen darf.

Coding-Agenten erstellen die Apps: Claude Code, Codex und GitHub Copilot verbinden sich über ein Plugin, Agenten-Skills und MCP tools mit der Plattform und können Daten-Models, Seiten, Geschäftsregeln und Testdaten erstellen.

ServiceNow

ServiceNow ist eine IT-Service-Management-Plattform (ITSM).

Models: Die Agenten-Orchestrierung kann auf Azure OpenAI, Claude auf AWS, Google Gemini oder Now LLM, ServiceNows eigenem Model, ausgeführt werden.

Bestätigung vor der Aktion: ITSM-Agenten können manuell über das Now-Assist-Panel gestartet werden oder automatisch ausgeführt werden, wenn ein Datensatz erstellt oder aktualisiert wird. Admins entscheiden, welche Aktionen von einer Person bestätigt werden müssen.

NinjaOne

NinjaOne ist eine Endpoint-Management-Plattform, die Monitoring, Patching, Backup und Fernzugriff abdeckt.

Models: NinjaOne dokumentiert keine Model-Wahl für seine KI-Funktionen. Sie laufen als Teil der Plattform, anders als bei den obigen Optionen, bei denen ein Admin den Anbieter auswählt.

Patch-Risiko anhand von Community-Berichten bewertet: Patch Intelligence KI überprüft Anbieter-Telemetrie und öffentliche Berichte anderer Administratoren über Windows-Updates, kennzeichnet dann Updates, die andernorts Systeme beschädigt haben, und fasst den Kontext zusammen. Die anderen Plattformen in diesem Abschnitt lesen die eigenen Datensätze eines Unternehmens; diese Funktion liest, was bei anderen Unternehmen passiert ist.

CVE-Erkennung ohne Scan: Das Schwachstellen-Modul identifiziert CVEs anhand von Software-Telemetrie, die in der Cloud von NinjaOne analysiert wird, sodass kein Scan auf dem Endpoint ausgeführt wird und die Ergebnisse zur Behebung an das Patching-Modul weitergeleitet werden.

Methodik

Die Aufgabe

Für jedes Thema erhielt jedes Model denselben festen Prompt. Der Prompt forderte den Agenten auf:

  • ein Geschäftsthema auszuwählen,
  • mindestens 24 Testfälle in vier Kategorien zu schreiben,
  • einen Runner zu schreiben (das Programm, das Fälle an Models sendet) und einen Scorer (das Programm, das Antworten bewertet),
  • vier benannte Models zweimal bei jedem Fall auszuführen.

Ein fünftes Model wurde zurückgehalten. Der Agent sagte zuerst dessen Ergebnisse voraus und testete es anschließend.

Der Prompt forderte jeden Agenten auf, zu entscheiden, welche Qualitätsstandards ein Benchmark vor der Veröffentlichung benötigt, und nachzuweisen, dass er sie erfüllt. Der Prompt nannte weder das numerische Schwierigkeitsziel noch einen Scorer-Test.

Agenten und Einreichungen

Die Einreichungen liefen zwischen Juli und September 2026. Die meisten verwendeten opencode, ein Agentenprogramm, das dem Model eine Shell und ein Dateisystem bereitstellt.

Die vorherige Version umfasste 14 Models und 28 Einreichungen. Unsere historischen Daten enthalten außerdem sieben ältere Models, die nicht mehr im Kader sind.

Wir haben außerdem fünf Pilot-Setups für GPT 5.5 ausgeführt, was zu 10 zusätzlichen Einreichungen führte. Ihre Prompts unterscheiden sich von der Hauptaufgabe, daher schließen die Diagramme sie aus. Insgesamt umfasst dieses Update 42 Einreichungen und bewertet 40. Zwei Pilot-Einreichungen erreichten die Mindestgröße des Datasets nicht, daher hat das Richtergremium sie nicht bewertet.

Bewertung

Der Code prüft die eingereichten Dateien, baut Datenbanken neu auf, führt Scorer erneut aus und gleicht Ergebniszeilen mit Antwortdateien ab. Ein Model-Gremium bewertet die Kriterien, die Interpretation erfordern. Eingereichter Code läuft in einer isolierten Kopie ohne Netzwerkzugriff.

Wir schließen eine Live-Neuausführung der gesampelten Model-Aufrufe für jede Einreichung aus, weil die Runner unterschiedliche Schnittstellen haben und einige keine nutzbaren Anbieterkonfigurationen besitzen. Ohne dieses Kriterium umfassen die Rubriken insgesamt 78 Punkte für Text-zu-SQL und 74 für Tool-Calling.

Alle 32 Einreichungen in den Diagrammen bestehen die erforderlichen Datei- und Dataset-Größenprüfungen. Die Aufgaben-Prompts wurden für dieses Update nicht bearbeitet, und die Ergebnisse verwenden eine beibehaltene Einreichung pro Model und Thema.

Scorer-Kontrolltests

Der Test ohne Referenz prüft, ob Models ohne die Informationen antworten können, die sie eigentlich benötigen. Wenn sie dennoch gut abschneiden, könnten die Fragen die Antwort verraten oder die Models könnten die Daten während des Trainings gesehen haben. Eine hohe Punktzahl allein ist kein Beleg für eine der beiden Möglichkeiten.

Ein Pilot-Prompt nannte alle drei Scorer-Tests, und dieser Pilot führte sie in beiden Themen aus. Das erneute Ausführen der gespeicherten Testdateien ohne Netzwerkzugriff reproduzierte die aufgezeichneten Zahlen.

Die Prompts für die 32 Haupteinreichungen überließen diese Tests dem Agenten, und keine dieser Einreichungen bestand einen der drei. Ein einziger Prompt in der Studie nannte die Tests, daher bleibt ihre Wirkung über die Models hinweg ungetestet.

Das Richtergremium

GPT 5.6 Sol und Claude Opus 5 bewerten jedes an das Gremium gesendete Kriterium. Wenn sie uneinig sind, gibt Grok 4.6 die entscheidende Stimme ab.

Die Richter laufen mit Temperatur 0 (der am wenigsten zufälligen Einstellung), mit hohem Reasoning-Aufwand und einem Limit von 32.000 Token. Wenn ein Richter unvollständiges oder ungültiges JSON zurückgibt, wird kein Urteil erfasst und der Aufruf wird erneut versucht.

Über 672 Kriterien, einschließlich der Piloten, waren sich die beiden Hauptrichter bei 195 uneinig. Sol bestand bei 54,8 %, und Opus bei 82,6 %. Grok bestand 133 der strittigen Kriterien.

Die Anbieter der Richter haben ebenfalls Einreichungen in diesem Benchmark bewertet: vier von OpenAI, vier von Anthropic und eine von xAI. Die Richter-Prompts lassen Autorennamen aus und entfernen Dateipfade, die ein Model identifizieren könnten. Der Schreibstil kann den Autor dennoch verraten.

Bei Einreichungen von anderen Anbietern als OpenAI und Anthropic erzielt Sol 13.9 Punkte weniger als Opus. Bei OpenAI-Einreichungen betrug der Abstand 9.1 Punkte, also 4.8 Punkte weniger. Bei von Anthropic verfassten Einreichungen ist Opus’ Vorsprung vor Sol 0.1 Punkte kleiner als bei Arbeiten anderer Anbieter. Die Pilot-Prompts unterscheiden sich, sodass die Prüfung keine Bevorzugung nachweist. Grok bewertet nur Streitfälle, einschließlich Streitfällen über seine eigenen Einreichungen, und seine Stimmen liegen außerhalb dieser Prüfung.

Intervalle

Die Punkteintervalle und die mittleren 95 % der Rangpositionen verwenden 4.000 gepaarte Ziehungen von Rubrik-Kriterien mit Zurücklegen. Jede Einreichung wird anhand derselben gezogenen Kriterien neu bewertet wie die anderen in ihrem Thema. Die Intervalle beschreiben die Abhängigkeit von der Rubrik und schließen Aufgaben-Sampling und Lauf-zu-Lauf-Unsicherheit aus. Die Korrelationen sind Pearson-Korrelationen.

Zitieren Sie diesen Benchmark

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Berk Kalelioğlu and Şevval Alper (2026) - "Agentic IT: Können KI-Agenten einen Benchmark entwerfen". Online veröffentlicht auf AIMultiple.com. Abgerufen am 18. September 2026, von: https://aimultiple.com/agentic-it [Online-Ressource]

Kalelioğlu, B., & Alper, Ş. (2026, 18. September). Agentic IT: Können KI-Agenten einen Benchmark entwerfen. AIMultiple. https://aimultiple.com/agentic-it

@misc{kalelioglu2026,
  author = {Kalelioğlu, Berk and Alper, Şevval},
  title  = {{Agentic IT: Können KI-Agenten einen Benchmark entwerfen}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/agentic-it}},
  note   = {AIMultiple. Abgerufen am 18. September 2026}
}
Alle Daten herunterladen

Ergebnisse und Zeitstempel von 21 Datenpunkten. Laden Sie die Zusammenfassungsdaten aus den Diagrammen und Tabellen dieses Artikels als ZIP-Datei herunter, die 2 CSV-Dateien und eine README enthält.

Zuletzt aktualisiert: 20. September 2026
Herunterladen

Möchten Sie die granularen Daten dahinter? Premium beitreten

Berk Kalelioğlu
Berk Kalelioğlu
KI-Forscher
Berk ist KI-Forscher im Benchmark-Team von AIMultiple und konzentriert sich auf agentische KI, maschinelles Lernen sowie große und kleine Sprachmodelle (LLMs und SLMs).
Vollständiges Profil anzeigen
Technisch geprüft von
Şevval Alper
Şevval Alper
KI-Forscherin
Şevval ist KI-Forscherin bei AIMultiple. Sie hat bereits Forschungserfahrung in der Erzeugung von Pseudozufallszahlen mithilfe chaotischer Systeme.
Şevval konzentriert sich auf KI-Programmierwerkzeuge, KI-Agenten und Quantentechnologien.
Vollständiges Profil anzeigen

Seien Sie der Erste, der kommentiert

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450