KI-Modelle
KI-Modelle machen Vorhersagen auf Basis ihrer Trainingsdaten. Sie können in jedem Bereich eingesetzt werden, beispielsweise in Zahlen, Texten oder Multimedia-Inhalten.
Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol
Wir haben LLMs anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Teilmenge zielt auf die anspruchsvollsten Aufgaben zum finanziellen Denken ab und bewertet komplexe, mehrstufige quantitative Schlussfolgerungen mit Finanzkonzepten und -formeln. Unsere Evaluierung verwendete ein eigenes Prompt-Design und Bewertungskriterien für Genauigkeit und Token-Verbrauch. Eine detaillierte Erklärung, wie diese Metriken berechnet…
Text-zu-SQL: Vergleich der LLM-Genauigkeit
Wir haben 36 große Sprachmodelle über 759 Fragen aus BIRD-SQL ausgeführt, wobei jedes Modell SQL gegen eine Datenbank schrieb, die es selbst aus 11 Kandidaten identifizieren musste. Jede parsebare Abfrage wurde gegen die echte Datenbank ausgeführt und ihre Ergebnismenge mit der Ergebnismenge der Gold-Abfrage von BIRD verglichen. Fehlende, fehlerhafte und bei der Ausführung fehlgeschlagene Abfragen…
Vergleichen Sie multimodale KI-Modelle im visuellen Schlussfolgern
Wir haben 15 führende multimodale KI-Modelle im visuellen Schlussfolgern mit 200 visuellen Fragen getestet. Die Evaluierung bestand aus zwei Bereichen: 100 Fragen zum Diagrammverständnis, die Interpretation von Datenvisualisierungen testen, und 100 Fragen zur visuellen Logik, die Mustererkennung und räumliches Denken bewerten. Jede Frage wurde 5‑mal ausgeführt, um konsistente und zuverlässige Ergebnisse zu gewährleisten. Sehen…
Große multimodale Modelle (LMMs) vs LLMs
Wir haben die Leistung großer multimodaler Modelle (LMMs) bei Aufgaben des finanziellen Denkens anhand eines sorgfältig ausgewählten Datensatzes bewertet. Durch die Analyse einer Teilmenge hochwertiger Finanzbeispiele bewerten wir die Fähigkeiten der Modelle, multimodale Daten im Finanzbereich zu verarbeiten und mit ihnen zu denken. Der Abschnitt zur Methodik bietet detaillierte Einblicke in den verwendeten Datensatz und…
LLM VRAM-Rechner für Self-Hosting
Self-Hosting eines LLMs bedeutet, Inferenz auf Hardware auszuführen, die der Betreiber kontrolliert, statt über eine API eines Drittanbieters, was Kosten, Datenkontrolle und Datenschutzprofil verändert. Ob ein Modell überhaupt läuft, hängt vom Speicher ab. Der Rechner schätzt den VRAM oder Unified Memory, den ein Modell lokal benötigt, basierend auf dem Modell, seiner Präzision, der Kontextlänge und…
Agentic IT: Können KI-Agenten einen Benchmark entwerfen
Wir haben 16 Models anhand eines Benchmark-Entwurfs in Text-zu-SQL und Tool-Calling getestet. Jedes Model erstellte einen Benchmark pro Thema, insgesamt 32 Einreichungen. Keine Einreichung erfüllte jedes Rubrik-Kriterium. Die Agenten konnten Tests erstellen und ausführen, aber keiner führte sowohl einen Leerantwort-Test als auch einen Richtigantwort-Test des eigenen Scorers vor. Text-zu-SQL wandelt eine Frage in natürlicher Sprache…
AIM Enterprise: Agentischer Unternehmens-Benchmark
Unternehmen nutzen LLMs jeden Tag für ihre regulären Aufgaben. Um die kosteneffizientesten LLMs zu finden, haben wir AIM Enterprise entwickelt, einen agentischen Unternehmens-Benchmark, bei dem wir 69 reale Unternehmensaufgaben aus Strategie, Marketing, HR, Vertrieb und Betrieb verwendet haben. Zwei Bewerter-Models bewerteten jede Datei, die Prüfungen bestand. Bei 32,7 % der Einzelbewertungen wichen die beiden um…
Die Zukunft großer Sprachmodelle
Sehen Sie die Zukunft großer Sprachmodelle, indem Sie vielversprechende Ansätze wie Selbsttraining, Faktenprüfung und spärliche Expertise untersuchen, die Einschränkungen von LLM begegnen könnten. Erfolgsratenvergleich von LLMs Claude Sonnet 4.6 führte den Benchmark mit einer Gesamtpunktzahl von 0.748 an, wobei Basis- und Denkvarianten bis auf drei Dezimalstellen gleichauf lagen. Claude Opus 4.8 (0.702), Opus 4.6 Basis…
World Foundation Models: 10 Anwendungsfälle
Das Training von Robotern und autonomen Fahrzeugen (AVs) in der physischen Welt kann kostspielig, zeitaufwendig und riskant sein. World Foundation Models bieten eine skalierbare Alternative, indem sie realistische Simulationen realer Umgebungen ermöglichen. Diese Models beschleunigen Entwicklung und Einsatz in Robotik, AVs und anderen Bereichen, indem sie die Abhängigkeit von physischen Tests verringern. Erfahren Sie, wie…
Zeitreihen-Foundation-Models: Anwendungsfälle & Vorteile
Zeitreihen-Foundation-Models (TSFMs) sind vortrainierte Models, die Zeitreihendaten prognostizieren, klassifizieren, imputieren und Anomalien erkennen, ohne für jedes Dataset oder jede Branche ein separates Model zu benötigen. TSFMs verwenden Transformer-basierte Architekturen und umfangreiche Zeitreihen-Datasets, um über Domänen wie Finanzen, Einzelhandel, Energie und Gesundheitswesen zu generalisieren. Entdecken Sie die Architektur, Anwendungsfälle, branchenweite Einführung, Vorteile, Herausforderungen und Vergleiche von…