Künstliche Intelligenz
Entdecken Sie praxisnahe Einblicke, Forschungsergebnisse und Benchmarks im Bereich der künstlichen Intelligenz, darunter generative KI, große Sprachmodelle, RAG, Governance-Frameworks, MLOps-Praktiken und KI-Hardware. Verschaffen Sie sich ein Verständnis für wichtige Werkzeuge, Implementierungsstrategien und Anwendungsfälle in Unternehmen, die KI-Landschaft prägen.
Künstliche Intelligenz erkunden
DecisionBench: Jev vs. Kev vs. LLMs
Entscheidungsmodelle, auch System-One-Modelle genannt,1 wählen die nächste Aktion eines Agenten in einem einzigen Durchgang, statt Text Token für Token zu erzeugen. Um zu sehen, ob sie Browser-Automatisierung günstiger machen können als LLMs, haben wir drei Entscheidungsmodelle und zwei LLMs, Gemini 3.8 Flash und GPT-6 Astra, an denselben 50 Browser-Aufgaben getestet, insgesamt 250 Versuche. Kev-9B erledigte…
Bias in KI: Beispiele und 6 Wege zur Behebung
Das Interesse an KI nimmt zu, da Unternehmen ihre Vorteile in KI-Anwendungsfällen erleben. Es gibt jedoch berechtigte Bedenken hinsichtlich der KI-Technologie: Um festzustellen, ob durch das Fragenformat Verzerrungen entstehen könnten, haben wir dieselben Fragen sowohl in offenen als auch in Multiple-Choice-Formaten getestet. Über 64 Fragen hinweg stellt jede Frage zwei Kandidaten gegenüber, die bis auf…
Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol
Wir haben LLMs anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Teilmenge zielt auf die anspruchsvollsten Aufgaben zum finanziellen Denken ab und bewertet komplexe, mehrstufige quantitative Schlussfolgerungen mit Finanzkonzepten und -formeln. Unsere Evaluierung verwendete ein eigenes Prompt-Design und Bewertungskriterien für Genauigkeit und Token-Verbrauch. Eine detaillierte Erklärung, wie diese Metriken berechnet…
Agentic RAG-Benchmark: Routing über 11 SQL-Datenbanken
Routing-Genauigkeit ist der Prozentsatz der bewerteten Fragen, bei denen das Modell in seiner endgültigen Antwort explizit die richtige Datenbank nennt. Die Hauptkennzahl verwendet die 184 Fragen, die sowohl von unserem Ähnlichkeitstest als auch von einer Jury aus drei LLMs als schwierig markiert wurden. Fehlende explizite Deklarationen werden nicht gewertet. Qwen3.8-max beantwortete 153 von 184 schweren…
Top 5 KI-Leitplanken: Xnode Cortx & Weights and Biases
KI-Sicherheitsfehler sind teuer und treten immer häufiger auf. Viele Vorfälle sind auf eine schwache Governance zurückzuführen, insbesondere auf Lücken bei der Zugriffskontrolle, den Datenberechtigungen und der Überwachung der Model-Nutzung. KI-Leitplanken reduzieren dieses Risiko, indem sie durchsetzbare Grenzen dafür festlegen, wie KI-Systeme auf Daten zugreifen, Ausgaben generieren und mit Nutzern oder Geschäftsabläufen interagieren. Erfahren Sie, wie…
KI-Code-Review-Tools Benchmark
Mit dem zunehmenden Einsatz von KI-Coding-Tools sind Codebases anfälliger für Schwachstellen geworden, was den Bedarf an effektiven Code-Reviews erhöht hat. Um dem zu begegnen, stellen wir RevEval (KI Code Review Eval) vor, das die vier führenden KI-Code-Review-Tools über 309 Pull Requests aus Repositories unterschiedlicher Größe benchmarkt und ihre Leistung anhand von Beiträgen von 10 Entwicklern…
Text-zu-SQL: Vergleich der LLM-Genauigkeit
Wir haben 36 große Sprachmodelle über 759 Fragen aus BIRD-SQL ausgeführt, wobei jedes Modell SQL gegen eine Datenbank schrieb, die es selbst aus 11 Kandidaten identifizieren musste. Jede parsebare Abfrage wurde gegen die echte Datenbank ausgeführt und ihre Ergebnismenge mit der Ergebnismenge der Gold-Abfrage von BIRD verglichen. Fehlende, fehlerhafte und bei der Ausführung fehlgeschlagene Abfragen…
Cloud GPU-Mietpreisindex
Wir verfolgen veröffentlichte Cloud-GPU-Mietpreise für 17 Models bei 75 Anbietern und decken On-Demand-, Spot- und Reservierungstarife ab. Zuletzt veröffentlicht weist den größten Preisanstieg unter den drei Gruppen auf. Sein On-Demand-Median stieg von $2,12 pro GPU-Stunde im Oktober 2024 auf $4,72 im September 2026. Im selben Zeitraum bewegte sich die Gruppe Modern von $1,35 auf $1,45,…
Reranker-Benchmark: Top 8 Modelle im Vergleich
Wir haben 8 Reranker-Modelle auf ~145k englischen Amazon-Rezensionen getestet, um zu messen, wie stark eine Reranking-Stufe das Dense Retrieval verbessert. Wir haben Top-100-Kandidaten mit multilingual-e5-base abgerufen, sie mit jedem Modell neu gerankt und die Top-10-Ergebnisse anhand von 300 Anfragen bewertet, von denen sich jede auf konkrete Details aus ihrer Quell-Rezension bezieht. Der beste Reranker erhöhte…
Top 30+ KI-Chip-Hersteller: NVIDIA & seine Konkurrenten
Basierend auf unserer Erfahrung mit dem AIMultiple-Cloud-GPU-Benchmark vergleichen wir Chip-Hersteller nach Produkt, Verfügbarkeit und Architektur, einschließlich Rechenzentrums-GPUs, Mobil-Chips, Edge-Beschleunigern und Foundries. Jede Zeile nennt ein repräsentatives Produkt, seinen Typ und seine Verfügbarkeit. Die Verfügbarkeit unterscheidet zwischen Hardware zum Verkauf, Cloud-Diensten, internen Bereitstellungen und angekündigten Produkten. Daten beziehen sich auf dokumentierte Meilensteine. Zukünftige Auslieferungstermine bleiben Zielwerte.…