KI-Modelle
KI-Modelle machen Vorhersagen auf Basis ihrer Trainingsdaten. Sie können in jedem Bereich eingesetzt werden, beispielsweise in Zahlen, Texten oder Multimedia-Inhalten.
LLM in der Cybersicherheit
Wir haben 7 große Sprachmodelle in 9 Cyberbereichen mit SecBench evaluiert, einem groß angelegten und mehrformatigen Benchmark für Sicherheitstasks. Wir haben jedes Modell an 44.823 Multiple-Choice-Fragen (MCQs) und 3.087 Kurzantwort-Fragen (SAQs) getestet, die Bereiche wie Datensicherheit, Identitäts- und Zugriffsverwaltung, Netzwerksicherheit, Schwachstellenmanagement und Cloud-Sicherheit abdecken. Diese großen Sprachmodelle wurden nicht ausschließlich auf Cybersicherheitsdaten trainiert, können aber…
LLM-Skalierungsgesetze: Analyse von KI-Forschern
LLM sagen auf der Grundlage von aus Textdaten gelernten Mustern das nächste Token voraus. Der Begriff LLM-Skalierungsgesetze bezieht sich auf empirische Regelmäßigkeiten, die Modellleistung mit der Menge an Rechenleistung, Trainingsdaten und Modellparametern verknüpfen, die während des Trainings verwendet werden. Um zu verstehen, wie diese Beziehungen das moderne Modelldesign in der Praxis beeinflussen, haben wir…
Vergleichen Sie 9 große Sprachmodelle im Gesundheitswesen
Wir haben 9 LLMs mithilfe des MedQA-Datasets verglichen, einem Benchmark für klinische Prüfungen auf Graduierten-Niveau, der aus USMLE-Fragen abgeleitet ist. Jedes Model beantwortete dieselben klinischen Multiple-Choice-Szenarien mit einem standardisierten Prompt und ermöglichte so einen direkten Vergleich der Genauigkeit. Wir haben außerdem die Latenz pro Frage erfasst, indem wir die Gesamtlaufzeit durch die Anzahl der abgeschlossenen…
Zielgruppensimulation: Können LLMs menschliches Verhalten vorhersagen?
Im Marketing ist die Bewertung, wie genau LLMs menschliches Verhalten vorhersagen, entscheidend für die Beurteilung ihrer Wirksamkeit bei der Antizipation von Zielgruppenbedürfnissen und der Erkennung der Risiken von Fehlausrichtung, ineffektiver Kommunikation oder unbeabsichtigter Beeinflussung. Die Zielgruppensimulation mit LLMs ermöglicht die Modellierung virtueller Zielgruppen und hilft Organisationen, Reaktionen auf Inhalte oder Produkte vorherzusehen, ohne auf teure…
HALC-Bench: LLM Halluzination im Long-Context Retrieval Benchmark
HALC-Bench (LLM Halluzination im Long-Context Retrieval Benchmark) misst die Widerstandsfähigkeit eines großen Sprachmodells gegenüber dem Erfinden von Beweisen für eine Kennzahl, die im Zieldokument nicht existiert, indem es 3 Heuhaufen verwendet, die am Anfang, in der Mitte und am Ende des Kontextfensters des Modells platziert sind, mit 204 Fragen. claude-fable-5 beantwortete alle 204 Fallen an…
KI-Gateways für OpenAI: Alternativen zu OpenRouter
Wir haben OpenRouter, SambaNova, TogetherAI, Groq und KI/ML API anhand von drei Indikatoren (First-Token-Latenz, Gesamtlatenz und Output-Token-Anzahl) verglichen, mit 300 Tests unter Verwendung kurzer Prompts (ca. 18 Tokens) und langer Prompts (ca. 203 Tokens) für die Gesamtlatenz. Wenn Sie planen, eines dieser KI-Gateways zu nutzen, können Sie: In diesem Benchmark haben wir OpenRouter, SambaNova, TogetherAI,…
Beste Flatrate-LLM-API-Anbieter
Flatrate-LLM-Anbieter verkaufen unbegrenzte Modellnutzung zu einem festen monatlichen Preis statt pro Token abzurechnen. Dieses Modell verbreitete sich, weil agentische Codierungssitzungen Dutzende Millionen Token verbrauchen können, sodass eine Token-basierte Rechnung schwer vorhersehbar ist. Nur sehr wenige Anbieter bieten eine echte Flatrate; die meisten als Pauschalpreis vermarkteten Pläne enthalten darunter ein Nutzungskontingent. Im Folgenden vergleichen wir die…
LLM Observability-Tools: Weights & Biases, Langsmith
LLM-Anwendungen haben sich von Single-Turn-Chats zu mehrstufigen Agenten entwickelt, die Tools verwenden, Datenbanken abfragen und mit anderen Modellen koordinieren, wodurch ihr Verhalten schwieriger zu interpretieren ist. LLM-Observability bietet kontinuierliche Transparenz über diese komplexen Workflows und hilft Unternehmen, die Qualität zu überwachen, Fehler zu erkennen, Probleme zu beheben sowie Leistung und Kosten zu verwalten. W&B Weave…
Vergleich großer visueller Modelle: GPT-4o vs YOLOv8n
Große visuelle Modelle (LVMs) können visuelle Aufgaben wie Fehlererkennung, medizinische Diagnose und Umweltüberwachung automatisieren und verbessern. Wir haben drei Objekterkennungsmodelle getestet: YOLOv8n, DETR und GPT-4o Vision, jeweils über 1.000 Bilder, wobei Metriken wie mAP@0.5, Inferenzgeschwindigkeit, FLOPs und Parameteranzahl gemessen wurden. Um einen fairen Vergleich zu gewährleisten, wurden alle Bilder auf 800×800 Pixel skaliert und unter…
Cloud LLM vs. lokale LLMs: Beispiele & Vorteile
Cloud-LLMs, die auf fortschrittlichen Modellen wie GPT-5.5 und Claude Opus 4.7 basieren, bieten Skalierbarkeit und Zugänglichkeit. Umgekehrt gewährleisten lokale LLMs, die auf Open-Source-Modellen wie Llama 4, DeepSeek V4 und Qwen3.6-Plus basieren, stärkeren Datenschutz und Anpassbarkeit. Erkunden Sie, was Cloud-LLMs sind, Stärken und Schwächen, die häufigsten Fallstudien mit Beispielen aus der Praxis und wie sie sich…