Premium
Dienstleistungen
Premium

Künstliche Intelligenz

Entdecken Sie praxisnahe Einblicke, Forschungsergebnisse und Benchmarks im Bereich der künstlichen Intelligenz, darunter generative KI, große Sprachmodelle, RAG, Governance-Frameworks, MLOps-Praktiken und KI-Hardware. Verschaffen Sie sich ein Verständnis für wichtige Werkzeuge, Implementierungsstrategien und Anwendungsfälle in Unternehmen, die KI-Landschaft prägen.

Künstliche Intelligenz erkunden

Vergleichen Sie die Top 21 Fertigungs-KI-Lösungen & Software

KI-gestützte Fertigung
Open-World-Bewertung
24. Sep

KI-Lösungen für die Fertigung können Wartungskosten senken und Produktdesigns individuell anpassen. Nach der Prüfung von über 50 KI-Tools für die Fertigung haben wir die besten Optionen auf dem Markt identifiziert. Die Sortierung erfolgt alphabetisch innerhalb der jeweiligen Gruppe, mit Ausnahme der Abonnenten, die ganz oben platziert sind. Wir berücksichtigen in der Regel B2B-Bewertungen, aber da…

Mehr lesen
KI-Modelle
Benchmark
24. Sep

DecisionBench: Jev vs. Kev vs. LLMs

Entscheidungsmodelle, auch System-One-Modelle genannt,1 wählen die nächste Aktion eines Agenten in einem einzigen Durchgang, statt Text Token für Token zu erzeugen. Um zu sehen, ob sie Browser-Automatisierung günstiger machen können als LLMs, haben wir drei Entscheidungsmodelle und zwei LLMs, Gemini 3.8 Flash und GPT-6 Astra, an denselben 50 Browser-Aufgaben getestet, insgesamt 250 Versuche. Kev-9B erledigte…

KI-Ethik
Benchmark
24. Sep

Bias in KI: Beispiele und 6 Wege zur Behebung

Das Interesse an KI nimmt zu, da Unternehmen ihre Vorteile in KI-Anwendungsfällen erleben. Es gibt jedoch berechtigte Bedenken hinsichtlich der KI-Technologie: Um festzustellen, ob durch das Fragenformat Verzerrungen entstehen könnten, haben wir dieselben Fragen sowohl in offenen als auch in Multiple-Choice-Formaten getestet. Über 64 Fragen hinweg stellt jede Frage zwei Kandidaten gegenüber, die bis auf…

LLM
Benchmark
24. Sep

Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol

Wir haben LLMs anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Teilmenge zielt auf die anspruchsvollsten Aufgaben zum finanziellen Denken ab und bewertet komplexe, mehrstufige quantitative Schlussfolgerungen mit Finanzkonzepten und -formeln. Unsere Evaluierung verwendete ein eigenes Prompt-Design und Bewertungskriterien für Genauigkeit und Token-Verbrauch. Eine detaillierte Erklärung, wie diese Metriken berechnet…

RAG
Benchmark
23. Sep

Agentic RAG-Benchmark: Routing über 11 SQL-Datenbanken

Routing-Genauigkeit ist der Prozentsatz der bewerteten Fragen, bei denen das Modell in seiner endgültigen Antwort explizit die richtige Datenbank nennt. Die Hauptkennzahl verwendet die 184 Fragen, die sowohl von unserem Ähnlichkeitstest als auch von einer Jury aus drei LLMs als schwierig markiert wurden. Fehlende explizite Deklarationen werden nicht gewertet. Qwen3.8-max beantwortete 153 von 184 schweren…

Grundlagen der KI
Open-World-Bewertung
23. Sep

Top 5 KI-Leitplanken: Xnode Cortx & Weights and Biases

KI-Sicherheitsfehler sind teuer und treten immer häufiger auf. Viele Vorfälle sind auf eine schwache Governance zurückzuführen, insbesondere auf Lücken bei der Zugriffskontrolle, den Datenberechtigungen und der Überwachung der Model-Nutzung. KI-Leitplanken reduzieren dieses Risiko, indem sie durchsetzbare Grenzen dafür festlegen, wie KI-Systeme auf Daten zugreifen, Ausgaben generieren und mit Nutzern oder Geschäftsabläufen interagieren. Erfahren Sie, wie…

KI-Codierung
Benchmark
22. Sep

KI-Code-Review-Tools Benchmark

Mit dem zunehmenden Einsatz von KI-Coding-Tools sind Codebases anfälliger für Schwachstellen geworden, was den Bedarf an effektiven Code-Reviews erhöht hat. Um dem zu begegnen, stellen wir RevEval (KI Code Review Eval) vor, das die vier führenden KI-Code-Review-Tools über 309 Pull Requests aus Repositories unterschiedlicher Größe benchmarkt und ihre Leistung anhand von Beiträgen von 10 Entwicklern…

LLM
Benchmark
22. Sep

Text-zu-SQL: Vergleich der LLM-Genauigkeit

Wir haben 36 große Sprachmodelle über 759 Fragen aus BIRD-SQL ausgeführt, wobei jedes Modell SQL gegen eine Datenbank schrieb, die es selbst aus 11 Kandidaten identifizieren musste. Jede parsebare Abfrage wurde gegen die echte Datenbank ausgeführt und ihre Ergebnismenge mit der Ergebnismenge der Gold-Abfrage von BIRD verglichen. Fehlende, fehlerhafte und bei der Ausführung fehlgeschlagene Abfragen…

KI-Hardware
Funktionsvergleich
22. Sep

Cloud GPU-Mietpreisindex

Wir verfolgen veröffentlichte Cloud-GPU-Mietpreise für 17 Models bei 75 Anbietern und decken On-Demand-, Spot- und Reservierungstarife ab. Zuletzt veröffentlicht weist den größten Preisanstieg unter den drei Gruppen auf. Sein On-Demand-Median stieg von $2,12 pro GPU-Stunde im Oktober 2024 auf $4,72 im September 2026. Im selben Zeitraum bewegte sich die Gruppe Modern von $1,35 auf $1,45,…

RAG
Benchmark
22. Sep

Reranker-Benchmark: Top 8 Modelle im Vergleich

Wir haben 8 Reranker-Modelle auf ~145k englischen Amazon-Rezensionen getestet, um zu messen, wie stark eine Reranking-Stufe das Dense Retrieval verbessert. Wir haben Top-100-Kandidaten mit multilingual-e5-base abgerufen, sie mit jedem Modell neu gerankt und die Top-10-Ergebnisse anhand von 300 Anfragen bewertet, von denen sich jede auf konkrete Details aus ihrer Quell-Rezension bezieht. Der beste Reranker erhöhte…

KI-Hardware
Funktionsvergleich
21. Sep

Top 30+ KI-Chip-Hersteller: NVIDIA & seine Konkurrenten

Basierend auf unserer Erfahrung mit dem AIMultiple-Cloud-GPU-Benchmark vergleichen wir Chip-Hersteller nach Produkt, Verfügbarkeit und Architektur, einschließlich Rechenzentrums-GPUs, Mobil-Chips, Edge-Beschleunigern und Foundries. Jede Zeile nennt ein repräsentatives Produkt, seinen Typ und seine Verfügbarkeit. Die Verfügbarkeit unterscheidet zwischen Hardware zum Verkauf, Cloud-Diensten, internen Bereitstellungen und angekündigten Produkten. Daten beziehen sich auf dokumentierte Meilensteine. Zukünftige Auslieferungstermine bleiben Zielwerte.…