Künstliche Intelligenz
Entdecken Sie praxisnahe Einblicke, Forschungsergebnisse und Benchmarks im Bereich der künstlichen Intelligenz, darunter generative KI, große Sprachmodelle, RAG, Governance-Frameworks, MLOps-Praktiken und KI-Hardware. Verschaffen Sie sich ein Verständnis für wichtige Werkzeuge, Implementierungsstrategien und Anwendungsfälle in Unternehmen, die die KI-Landschaft prägen.
Künstliche Intelligenz erkunden
Vision-Language-Modelle im Vergleich zur Bilderkennung
Können fortschrittliche Vision-Language-Modelle (VLMs) traditionelle Bilderkennungsmodelle ersetzen? Um das herauszufinden, haben wir 16 führende Modelle in drei Paradigmen einem Benchmark unterzogen: traditionelle CNNs (ResNet, EfficientNet), VLMs (wie GPT-4.1, Gemini 2.5) und Cloud-APIs (AWS, Google, Azure). Die mittlere durchschnittliche Präzision (Mean Average Precision, mAP) diente als unsere primäre Genauigkeitsmetrik, ergänzt durch Latenz-, Kosten- und klassenspezifische Leistungsanalysen.…
Top 10 Multilinguale Embedding-Modelle für RAG
Wir haben 10 multilinguale Embedding-Modelle anhand von ~606k Amazon-Bewertungen in 6 Sprachen (Deutsch, Englisch, Spanisch, Französisch, Japanisch, Chinesisch) verglichen. Wir haben 1.800 Abfragen (300 pro Sprache) generiert, die jeweils konkrete Details aus der ursprünglichen Bewertung referenzieren. Modelle, die für die Suche trainiert wurden (Trennung von Abfrage und Dokument), übertreffen größere Modelle, die für allgemeine Textähnlichkeit…
Mehr-GPU-Benchmark: B200 vs H200 vs H100 vs MI300X
Seit über zwei Jahrzehnten ist die Optimierung der Rechenleistung ein Eckpfeiler meiner Arbeit. Wir haben die GPUs von NVIDIA (B200, H200, H100) und AMD (MI300X) getestet, um zu bewerten, wie gut sie sich für die Inferenz von Large Language Models (LLM) skalieren lassen. Mit dem vLLM-Framework und dem Modell meta-llama/Llama-3.1-8B-Instruct führten wir Tests mit 1,…
DGX Spark im Vergleich zu Mac Studio & Halo: Benchmarks & Alternativen
NVIDIA’s DGX Spark betrat 2025 den Desktop-AI-Markt für 4.699 $ und positioniert sich als „Desktop-AI-Supercomputer". Er verfügt über 128 GB einheitlichen Speicher und verspricht eine Petaflop-FP4-AI-Leistung in einem Gehäuse in Mac-Mini-Größe. Sehen Sie sich die Benchmark-Ergebnisse zu Wert und Leistung im Vergleich zu Alternativen an: Beim Vergleich von Systemen mit dem anspruchsvollen GPT-OSS 120B-Modell (MXFP4-Format)…
GPU Software für KI: CUDA vs. ROCm
Rohe Hardware-Spezifikationen erzählen nur die Hälfte der Geschichte im GPU-Computing. Um die KI-Leistung in der Praxis zu messen, führten wir 52 verschiedene Tests durch, um AMDs MI300X mit NVIDIAs H100, H200 und B200 in Multi-GPU- und Hochkonkurrenz-Szenarien zu vergleichen. Während AMDs MI300X mit 1.307 TFLOPS im Vergleich zu NVIDIAs H100/H200 mit 990 TFLOPS einen theoretischen…
Top 8 Open-Source-KI-Coding-Agenten
In früheren Evaluierungen haben wir sowohl Open-Source- als auch proprietäre agentische CLIs gebenchmarkt, wobei der Fokus auf deren Leistung bei Webentwicklungsaufgaben lag, und einige Open-Source-Agenten schnitten ebenso erfolgreich ab wie die kostenpflichtigen Optionen. Daher haben wir auch die Top-Open-Source-Coding-Agenten für Benutzer mit Datenschutzbedenken aufgelistet. Informationen zur Methodik finden Sie im KI-Coding-Benchmark. Weitere Details zu diesen…
Embedding-Modelle: OpenAI vs Gemini vs Voyage
Wir haben 15 englische Text-Embedding-Modelle und eine BM25-Baseline mit über 500 manuell kuratierten Abfragen in drei Retrieval-Domänen verglichen: Verträge (CUAD), Kundensupport (IBM TechQA) und Gesundheitswesen (MedRAG PubMed). Voyage-3.5 belegt insgesamt den ersten Platz. Perplexity Embed V1 0.6b erreicht das obere Mittelfeld zum niedrigsten Preis in unserem Benchmark. nDCG@3: Normalisierter diskontierter kumulierter Gewinn bei Cutoff 3.…
RAG-Frameworks: LangChain vs LangGraph vs LlamaIndex
Wir haben 5 RAG-Frameworks einem Benchmark unterzogen: LangChain, LangGraph, LlamaIndex, Haystack und DSPy, indem wir denselben agentischen RAG-Workflow mit standardisierten Komponenten aufgebaut haben: identische Modelle (GPT-4.1-mini), Embeddings (BGE-small), Retriever (Qdrant) und Tools (Tavily-Websuche). Dies isoliert den tatsächlichen Overhead und die Token-Effizienz jedes Frameworks. Der Benchmark bestand aus 100 Abfragen, wobei jedes Framework den vollständigen Satz…
Top 14 KI-Excel-Tools im Benchmark-Vergleich
79 % der Unternehmen geben an, bereits KI-Agenten eingeführt zu haben, und zwei Drittel dieser Nutzer sagen, dass diese Agenten die Produktivität auf messbare Weise gesteigert haben.1 Wir testen und vergleichen 14 KI-Excel-Tools, um zu sehen, wie sie performen. Quadratic, R2 Copilot und Paradigm erzielten die höchsten Gesamterfolgsquoten (75 %), wobei die Stärken im strukturierten…
Dokumentation der Testautomatisierung mit Best Practices
Testautomatisierung ist entscheidend für die Sicherstellung der Qualität und Zuverlässigkeit von Anwendungen in der Softwareprüfung und -entwicklung. Unternehmen und QA-Teams stellen zunehmend von manuellen Tests auf automatisierte Tests um, da diese: Was oft übersehen wird, ist die Rolle einer effektiven Dokumentation, um den Nutzen der Testautomatisierung zu maximieren. Wir untersuchen die Bedeutung der Dokumentation von…