KI-Modelle
KI-Modelle machen Vorhersagen auf Basis ihrer Trainingsdaten. Sie können in jedem Bereich eingesetzt werden, beispielsweise in Zahlen, Texten oder Multimedia-Inhalten.
Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol
Wir haben 40+ LLMs im Finanzwesen anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark evaluiert, um herauszufinden, welche Modelle bei komplexen Finanzlogik-Aufgaben wie Bilanzanalyse, Prognosen und Kennzahlenberechnungen hervorragend sind. Wir haben LLMs auf 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Untergruppe zielt auf die anspruchsvollsten Finanzlogik-Aufgaben ab und bewertet komplexe, mehrstufige…
Zeitreihen-Foundation-Models: Anwendungsfälle & Vorteile
Zeitreihen-Foundation-Models (TSFMs) sind vortrainierte Models, die Zeitreihendaten prognostizieren, klassifizieren, imputieren und Anomalien erkennen, ohne für jedes Dataset oder jede Branche ein separates Model zu benötigen. TSFMs verwenden Transformer-basierte Architekturen und umfangreiche Zeitreihen-Datasets, um über Domänen wie Finanzen, Einzelhandel, Energie und Gesundheitswesen zu generalisieren. Entdecken Sie die Architektur, Anwendungsfälle, branchenweite Einführung, Vorteile, Herausforderungen und Vergleiche von…
AIM Enterprise: Agentischer Enterprise-Benchmark
Unternehmen nutzen LLMs täglich für ihre regulären Aufgaben. Um die kosteneffizientesten LLMs zu finden, haben wir AIM Enterprise entwickelt, einen agentischen Enterprise-Benchmark, bei dem wir 69 Unternehmensaufgaben aus verschiedenen Kategorien verwendet haben. Jedes Modell lieferte eine Datei pro Aufgabe. Die Punktzahlen sind relativ: Die Juroren stufen jede Antwort im Vergleich zu den anderen Antworten auf…
LLM-Skalierungsgesetze: Analyse von KI-Forschern
LLM sagen auf der Grundlage von aus Textdaten gelernten Mustern das nächste Token voraus. Der Begriff LLM-Skalierungsgesetze bezieht sich auf empirische Regelmäßigkeiten, die Modellleistung mit der Menge an Rechenleistung, Trainingsdaten und Modellparametern verknüpfen, die während des Trainings verwendet werden. Um zu verstehen, wie diese Beziehungen das moderne Modelldesign in der Praxis beeinflussen, haben wir…
LLM Observability-Tools: Weights & Biases, Langsmith
LLM-Anwendungen haben sich von Single-Turn-Chats zu mehrstufigen Agenten entwickelt, die Tools verwenden, Datenbanken abfragen und mit anderen Modellen koordinieren, wodurch ihr Verhalten schwieriger zu interpretieren ist. LLM-Observability bietet kontinuierliche Transparenz über diese komplexen Workflows und hilft Unternehmen, die Qualität zu überwachen, Fehler zu erkennen, Probleme zu beheben sowie Leistung und Kosten zu verwalten. W&B Weave…
Große multimodale Modelle (LMMs) vs LLMs
Wir haben die Leistung großer multimodaler Modelle (LMMs) bei Aufgaben des finanziellen Denkens anhand eines sorgfältig ausgewählten Datensatzes bewertet. Durch die Analyse einer Teilmenge hochwertiger Finanzbeispiele bewerten wir die Fähigkeiten der Modelle bei der Verarbeitung von und dem Schlussfolgern mit multimodalen Daten im Finanzbereich. Der Abschnitt zur Methodik bietet detaillierte Einblicke in den verwendeten Datensatz…
ChatGPT für Kundenservice: Top 10 Anwendungsfälle
ChatGPT hat sich im Kundenservice von einer Neuheit zu einer Infrastruktur entwickelt. Unternehmen nutzen es, um Antwortzeiten zu verkürzen, ein Volumen zu bewältigen, das ihre Teams nicht absorbieren können, und die Kosten für Routineinteraktionen zu senken. Doch die Ergebnisse variieren stark je nach Implementierung. OpenAI hat GPT-5.6 veröffentlicht, ein wesentlich leistungsfähigeres Modell, das besser darin…
Zeitreihen-Klassifikations-Benchmark: Foundation-Models vs klassische Methoden
Wir haben 13 Methoden zur Zeitreihenklassifikation verglichen, von vortrainierten Zeitreihen-Foundation-Models bis zu einer 22-Merkmals-Baseline aus dem Jahr 2019, an 33 UCR/UEA-Datasets unter einem eingefrorenen Protokoll. Das sind 14.638 aufgezeichnete Methode-Dataset-Resample-Zellen, 11.874 davon bewertet. Das Diagramm zeigt den Hauptvergleich des Benchmarks: 12 Methoden auf den 15 univariaten Datasets, bei denen jede Methode ein Ergebnis lieferte, jedes…
LLM Latenz-Benchmark nach Anwendungsfällen
Wir haben 11 führende große Sprachmodelle mit insgesamt 1.320 Anfragen gebenchmarkt, dabei zwischen Reasoning- und Nicht-Reasoning-Modellen unterschieden und die First-Token-Latenz, die Per-Token-Latenz und die Gesamtantwortzeit gemessen. Details dazu, wie wir die Latenz gemessen haben, finden Sie hier. Wir berichten Reasoning- und Nicht-Reasoning-Modelle getrennt. Reasoning-Modelle verbringen mehrere Sekunden mit Nachdenken vor der ersten sichtbaren Antwort; daher…
Top LLMOps Tools & Vergleich mit MLOPs
LLMOps-Plattformen übernehmen den operativen Teil des Betriebs von Large Language Models: Bereitstellung, Überwachung, Evaluierung und Kostenmanagement. Wir haben führende LLMOps-Tools, deren Kernfunktionen, Preismodelle und ihre Unterschiede untersucht, um die beste Lösung für verschiedene Anwendungsfälle zu identifizieren. Eine Aufschlüsselung jeder Metrik finden Sie unten: LLMOps-Plattformen unterstützen den Lebenszyklus von LLMs durch die Ermöglichung von: LLMOps-Plattformen unterscheiden…