Premium
Dienstleistungen
Premium

KI-Modelle

KI-Modelle machen Vorhersagen auf Basis ihrer Trainingsdaten. Sie können in jedem Bereich eingesetzt werden, beispielsweise in Zahlen, Texten oder Multimedia-Inhalten.

Erkunden Sie KI-Modelle

DecisionBench: Jev vs. Kev vs. LLMs

KI-Modelle
Benchmark
24. Sep

Entscheidungsmodelle, auch System-One-Modelle genannt,1 wählen die nächste Aktion eines Agenten in einem einzigen Durchgang, statt Text Token für Token zu erzeugen. Um zu sehen, ob sie Browser-Automatisierung günstiger machen können als LLMs, haben wir drei Entscheidungsmodelle und zwei LLMs, Gemini 3.8 Flash und GPT-6 Astra, an denselben 50 Browser-Aufgaben getestet, insgesamt 250 Versuche. Kev-9B erledigte…

Mehr lesen
LLM
Benchmark
24. Sep

Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol

Wir haben LLMs anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Teilmenge zielt auf die anspruchsvollsten Aufgaben zum finanziellen Denken ab und bewertet komplexe, mehrstufige quantitative Schlussfolgerungen mit Finanzkonzepten und -formeln. Unsere Evaluierung verwendete ein eigenes Prompt-Design und Bewertungskriterien für Genauigkeit und Token-Verbrauch. Eine detaillierte Erklärung, wie diese Metriken berechnet…

LLM
Benchmark
22. Sep

Text-zu-SQL: Vergleich der LLM-Genauigkeit

Wir haben 36 große Sprachmodelle über 759 Fragen aus BIRD-SQL ausgeführt, wobei jedes Modell SQL gegen eine Datenbank schrieb, die es selbst aus 11 Kandidaten identifizieren musste. Jede parsebare Abfrage wurde gegen die echte Datenbank ausgeführt und ihre Ergebnismenge mit der Ergebnismenge der Gold-Abfrage von BIRD verglichen. Fehlende, fehlerhafte und bei der Ausführung fehlgeschlagene Abfragen…

LLM
Benchmark
21. Sep

Vergleichen Sie multimodale KI-Modelle im visuellen Schlussfolgern

Wir haben 15 führende multimodale KI-Modelle im visuellen Schlussfolgern mit 200 visuellen Fragen getestet. Die Evaluierung bestand aus zwei Bereichen: 100 Fragen zum Diagrammverständnis, die Interpretation von Datenvisualisierungen testen, und 100 Fragen zur visuellen Logik, die Mustererkennung und räumliches Denken bewerten. Jede Frage wurde 5‑mal ausgeführt, um konsistente und zuverlässige Ergebnisse zu gewährleisten. Sehen…

LLM
Einblick
21. Sep

Große multimodale Modelle (LMMs) vs LLMs

Wir haben die Leistung großer multimodaler Modelle (LMMs) bei Aufgaben des finanziellen Denkens anhand eines sorgfältig ausgewählten Datensatzes bewertet. Durch die Analyse einer Teilmenge hochwertiger Finanzbeispiele bewerten wir die Fähigkeiten der Modelle, multimodale Daten im Finanzbereich zu verarbeiten und mit ihnen zu denken. Der Abschnitt zur Methodik bietet detaillierte Einblicke in den verwendeten Datensatz und…

LLM
Einblick
21. Sep

LLM VRAM-Rechner für Self-Hosting

Self-Hosting eines LLMs bedeutet, Inferenz auf Hardware auszuführen, die der Betreiber kontrolliert, statt über eine API eines Drittanbieters, was Kosten, Datenkontrolle und Datenschutzprofil verändert. Ob ein Modell überhaupt läuft, hängt vom Speicher ab. Der Rechner schätzt den VRAM oder Unified Memory, den ein Modell lokal benötigt, basierend auf dem Modell, seiner Präzision, der Kontextlänge und…

LLM
Benchmark
18. Sep

Agentic IT: Können KI-Agenten einen Benchmark entwerfen

Wir haben 16 Models anhand eines Benchmark-Entwurfs in Text-zu-SQL und Tool-Calling getestet. Jedes Model erstellte einen Benchmark pro Thema, insgesamt 32 Einreichungen. Keine Einreichung erfüllte jedes Rubrik-Kriterium. Die Agenten konnten Tests erstellen und ausführen, aber keiner führte sowohl einen Leerantwort-Test als auch einen Richtigantwort-Test des eigenen Scorers vor. Text-zu-SQL wandelt eine Frage in natürlicher Sprache…

LLM
Benchmark
17. Sep

AIM Enterprise: Agentischer Unternehmens-Benchmark

Unternehmen nutzen LLMs jeden Tag für ihre regulären Aufgaben. Um die kosteneffizientesten LLMs zu finden, haben wir AIM Enterprise entwickelt, einen agentischen Unternehmens-Benchmark, bei dem wir 69 reale Unternehmensaufgaben aus Strategie, Marketing, HR, Vertrieb und Betrieb verwendet haben. Zwei Bewerter-Models bewerteten jede Datei, die Prüfungen bestand. Bei 32,7 % der Einzelbewertungen wichen die beiden um…

LLM
Einblick
17. Sep

Die Zukunft großer Sprachmodelle

Sehen Sie die Zukunft großer Sprachmodelle, indem Sie vielversprechende Ansätze wie Selbsttraining, Faktenprüfung und spärliche Expertise untersuchen, die Einschränkungen von LLM begegnen könnten. Erfolgsratenvergleich von LLMs Claude Sonnet 4.6 führte den Benchmark mit einer Gesamtpunktzahl von 0.748 an, wobei Basis- und Denkvarianten bis auf drei Dezimalstellen gleichauf lagen. Claude Opus 4.8 (0.702), Opus 4.6 Basis…

KI-Modelle
Einblick
15. Sep

World Foundation Models: 10 Anwendungsfälle

Das Training von Robotern und autonomen Fahrzeugen (AVs) in der physischen Welt kann kostspielig, zeitaufwendig und riskant sein. World Foundation Models bieten eine skalierbare Alternative, indem sie realistische Simulationen realer Umgebungen ermöglichen. Diese Models beschleunigen Entwicklung und Einsatz in Robotik, AVs und anderen Bereichen, indem sie die Abhängigkeit von physischen Tests verringern. Erfahren Sie, wie…

KI-Modelle
Einblick
15. Sep

Zeitreihen-Foundation-Models: Anwendungsfälle & Vorteile

Zeitreihen-Foundation-Models (TSFMs) sind vortrainierte Models, die Zeitreihendaten prognostizieren, klassifizieren, imputieren und Anomalien erkennen, ohne für jedes Dataset oder jede Branche ein separates Model zu benötigen. TSFMs verwenden Transformer-basierte Architekturen und umfangreiche Zeitreihen-Datasets, um über Domänen wie Finanzen, Einzelhandel, Energie und Gesundheitswesen zu generalisieren. Entdecken Sie die Architektur, Anwendungsfälle, branchenweite Einführung, Vorteile, Herausforderungen und Vergleiche von…