Künstliche Intelligenz
Entdecken Sie praxisnahe Einblicke, Forschungsergebnisse und Benchmarks im Bereich der künstlichen Intelligenz, darunter generative KI, große Sprachmodelle, RAG, Governance-Frameworks, MLOps-Praktiken und KI-Hardware. Verschaffen Sie sich ein Verständnis für wichtige Werkzeuge, Implementierungsstrategien und Anwendungsfälle in Unternehmen, die KI-Landschaft prägen.
Künstliche Intelligenz erkunden
Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol
Wir haben 40+ LLMs im Finanzwesen anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark evaluiert, um herauszufinden, welche Modelle bei komplexen Finanzlogik-Aufgaben wie Bilanzanalyse, Prognosen und Kennzahlenberechnungen hervorragend sind. Wir haben LLMs auf 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Untergruppe zielt auf die anspruchsvollsten Finanzlogik-Aufgaben ab und bewertet komplexe, mehrstufige…
LLM-Automatisierung: Top 7 Tools & 8 Fallstudien
LLM-Automatisierung bezeichnet den Wandel hin zu intelligenten Automatisierungstools, die LLMs nutzen, einschließlich KI-Agenten, feinabgestimmten LLMs und RAG-Modellen, um Aufgaben zu automatisieren und zu koordinieren. Erkunden Sie, was LLM-Automatisierung ist, ihre wichtigsten praktischen Anwendungen und die wesentlichen Tools: LLM in der Automatisierung sind ein systematischer Ansatz, der Natural Language Processing (NLP) mit bestehenden Prozessautomatisierungsmethoden kombiniert. Es…
Empfehlungssysteme: Anwendungen und Beispiele
Wir haben die Haupttypen von Empfehlungssystemen, Schlüsselkonzepte und reale Anwendungen untersucht und LightFM, Cornac BPR und TensorFlow Recommenders anhand von AUC, Precision@10 und Recall@10 bewertet. Diese Bibliotheken implementieren Algorithmen des maschinellen Lernens, um Trainingsdaten zu verarbeiten und personalisierte Empfehlungen mithilfe kollaborativer oder inhaltsbasierter Filtertechniken zu generieren. Darüber hinaus implementieren diese Bibliotheken Modelle des maschinellen Lernens,…
200+ Führende KI-Benchmarks
Wir haben eine Liste mit über 200 KI-Benchmarks für LLMs, GPUs, Cloud-GPUs, KI-Agenten, tabellarische KI und Cybersicherheit zusammengestellt, die noch nicht gesättigt sind. Wir stellten fest, dass die Benchmarking-Aktivität in den Jahren 2024–2025 relativ gering und stabil war, dann aber Anfang 2026 anstieg. Dies spiegelt das rasante Wachstum der zu evaluierenden KI-Systeme wider, insbesondere da…
LLM-Latenz-Benchmark nach Anwendungsfällen
Wir haben 11 führende große Sprachmodelle mit insgesamt 1.320 Anfragen einem Benchmark unterzogen, wobei wir zwischen Reasoning- und Nicht-Reasoning-Modellen unterschieden und die Time to First Token, die Latenz pro Token sowie die gesamte Antwortzeit gemessen haben. Details zur Messung der Latenz finden Sie hier. Wir berichten über Reasoning- und Nicht-Reasoning-Modelle getrennt. Reasoning-Modelle verbringen mehrere Sekunden…
Vergleichen Sie 20+ verantwortungsvolle KI-Plattformen & Bibliotheken
Der Markt für verantwortungsvolle KI-Plattformen umfasst zwei Arten von Software:Enterprise-Plattformen für verantwortungsvolle KI und Open-Source-Frameworks und -Bibliotheken für verantwortungsvolle KI. Wir haben einige der anerkanntesten Tools basierend auf Metriken wie Bewertungsvolumen, Funktionsumfang, GitHub-Bewertungen und Referenzen von Fortune 500 aufgelistet. Hier sind einige dieser führenden Tools: Data Governance bezieht sich auf das übergreifende Framework, das Datenpraktiken…
HALC-Bench: LLM Halluzination bei Langkontext-Retrieval-Benchmark
HALC-Bench (LLM Halluzination bei Langkontext-Retrieval-Benchmark) misst die Beständigkeit eines großen Sprachmodells gegenüber der Erfindung von Belegen für eine Metrik, die im Zieldokument nicht existiert, indem 3 Heuhaufen am Anfang, in der Mitte und am Ende des Kontextfensters des Modells platziert werden, mit 204 Fragen. claude-fable-5 beantwortete alle 204 Fallen an jeder Heuhaufenposition korrekt. Unter den…
Intelligenzdichte von 71 LLMs: Intelligentere und dichtere Modelle
Wir haben 71 LLMs verfolgt, die zwischen Februar 2023 und Mai 2026 veröffentlicht wurden, und 10 öffentliche Benchmarks gesammelt, um die Intelligenzdichte zu messen. Wir haben den Fähigkeitswert durch die vom Modell verbrauchten Ressourcen (aktive Parameter, Trainingsrechenleistung und Inferenzpreis) dividiert. Um die Intelligenzdichte zu berechnen, haben wir die folgenden Schritte ausgeführt: Siehe Methodik für den…
50+ ChatGPT-Anwendungsfälle mit realen Beispielen
ChatGPT erreichte Anfang 2026 etwa 1 Milliarde wöchentlich aktive Nutzer, was rund 10 % der Weltbevölkerung entspricht.1 OpenAI übertraf im Jahr 2025 einen Jahresumsatz von 20 Milliarden US-Dollar, bestätigt durch CFO Sarah Friar.2 Der Anthropic Economic Index unterscheidet zwei Nutzungsarten: Erweiterung, bei der ein Mensch mit KI interagiert, und Automatisierung, bei der KI Aufgaben unabhängig…
Benchmark für Open-Source-Einbettungsmodelle für RAG
Wir haben 14 Open-Source-Einbettungsmodelle auf einer einzelnen H100 selbst gehostet und anhand von über 500 manuell kuratierten Abfrageanfragen getestet, die Rechtsverträge, technische Support-Notizen und medizinische Zusammenfassungen abdecken. NVIDIA Llama-Embed-Nemotron-8B führt in der Genauigkeit. Bei den Kosten läuft Google EmbeddingGemma-300m etwa 4x günstiger als Nemotron, bei einem kleinen Genauigkeitsverlust. nDCG@3: Normalisierter kumulierter diskontierter Nutzen bei Cutoff…