Wir haben Bright Data Video-Suche mit der YouTube-Suche anhand von 50 englischen Suchanfragen über fünf Anfragetypen verglichen. Beide Engines wurden bis zur Erschöpfung abgefragt, und ein Gremium aus drei Modellen bewertete ausgewählte Videoframes.
Die Schätzung der verwendbaren Clips pro Suche gibt an, wie viele der zurückgegebenen Videos das gesuchte Motiv oder die gesuchte Handlung enthalten. Sie kombiniert die Anzahl der zurückgegebenen eindeutigen Videos mit der Relevanzdichte. Jedes Video zählt einmal pro Suche.
Die Relevanzdichte ist der geschätzte Anteil der zurückgegebenen Videos, die Relevanzschwelle erfüllen. Ein Video gilt als relevant, wenn ein ausgewähltes Einzelbild eine Panel-Median-Punktzahl von mindestens 2 auf einer Skala von 0 bis 3 erhält.
Clip-Anzahlen und Relevanzprozentsätze sind Mittelpunktschätzungen. Die Spannen der Dichtequoten berücksichtigen Stichprobenunsicherheit und nicht bewertete Top-Ergebnisse, wie unter Retrieval und Stichprobenziehung erläutert.
Ergebnisse des Video-Such-Benchmarks
Bright Data lieferte in jedem Anfragetyp mehr verwendbare Clips
Die geschätzte Anzahl verwendbarer Clips pro Suche von Bright Data reichte vom 3.7-Fachen der YouTube-Anzahl bei Actionszenen bis zum 14.5-Fachen bei abstrakten Suchanfragen. Über alle 50 Suchanfragen hinweg lagen die Schätzungen bei 817 und 108.
Bright Data lieferte durchschnittlich 2.122 eindeutige Videos pro Suche, verglichen mit 288 bei YouTube, also etwa das 7.4-Fache.
Die allgemeinen Relevanzraten waren ähnlich
Die geschätzte Relevanzdichte betrug 38,5 % für Bright Data und 37,7 % für YouTube. Der Dichtequotenbereich von 0.85 bis 1.23 belegt keinen allgemeinen Relevanzvorteil.
Bright Data wies in zwei Anfragetypen eine höhere Relevanzdichte auf
Bright Data wies bei abstrakten und Ich-Perspektive-Suchanfragen eine höhere Relevanzdichte auf. YouTube wies bei Robotik, bestimmten Momenten und Actionszenen eine höhere Dichte auf. Diese Vergleiche hielten über alle berichteten Spannen hinweg stand.
Der größte Dichteunterschied von Bright Data lag bei abstrakten Suchanfragen und betrug 67,5 % gegenüber 36,2 % bei YouTube. Das Verhältnis verwendbarer Clips von 14.5x übertraf den vor dem Retrieval prognostizierten Bereich von 2x bis 6x. Vier abstrakte Suchanfragen waren bei diesem Durchlauf neu. Ihr mittleres Dichteverhältnis betrug 2.1x, verglichen mit 1.7x für die sechs wiederverwendeten Suchanfragen.
Methodik des Video-Such-Benchmarks
Auswahl der Suchanfragen
Wir modellierten eine Suche nach Videomaterial anhand einer kurzen Beschreibung in natürlicher Sprache. Jede Kategorie enthielt zehn Suchanfragen zu unterschiedlichen Themen und visuellen Umgebungen, mit Relevanzkriterien, die anhand von Videoframes beurteilt werden konnten.
Die Suchanfragen hatten eine mediane Länge von acht Wörtern, und jede hatte eine Relevanzdefinition von etwa 100 Wörtern. Wir legten sowohl die Suchanfragen als auch ihre Relevanzdefinitionen fest, bevor wir eine der beiden Engines abfragten.
Vier Kategorien beschreiben sichtbare Handlungen oder Agentenverhalten. Abstrakte Suchanfragen testen Situationen oder Bedeutungen, die möglicherweise nicht in Titeln oder Bezeichnungen angegeben sind.
Kurze Beschreibungen werden auch in der Forschung verwendet, um Videodaten zu finden. InternVid sammelte Videos über Handlungsabfragen.1 RefAV verwendet natürlichsprachliche Beschreibungen, um Fahrszenarien zu lokalisieren.2 Movie Gen nutzte Text-zu-Video-Retrieval, um Videomaterial mit Personen auszuwählen.3 Diese Studien betreffen das Retrieval aus bestehenden Videosammlungen. Der Kauf von Videomaterial über eine kommerzielle API lag außerhalb ihres Rahmens.
Wir schlossen doppelte Szenarien und navigationsartige Formulierungen wie „First-Person-Shooter“ aus. Wir vermieden außerdem Suchanfragen, die direkt aus von YouTube abgeleiteten Handlungstaxonomien stammen, deren Bezeichnungen wörtlich in Videotiteln vorkommen können. Diese Entscheidungen schränken ein, wie gut die Auswahl allgemeine YouTube-Suchen repräsentiert.
Retrieval und Stichprobenziehung
Keine der beiden Engines verwendete einen Filter für das Hochladedatum. Doppelte Video-IDs wurden aus den Trefferzahlen für jede Suche entfernt.
Wir zogen pro Suchanfrage und Engine eine Stichprobe von 125 Ergebnissen, gleichmäßig innerhalb von Rangbändern, mit einem protokollierten Zufallsstartwert. Die gemessene Relevanzrate jedes Bandes wurde über seine Ergebnispopulation hochgerechnet, um die gesamte Rückgabe zu schätzen.
Die obersten 50 Ergebnisse von Bright Data und die obersten 20 YouTube-Ergebnisse wurden nicht bewertet. Jede Schätzung hat Grenzen, die es zulassen, dass eine beliebige Anzahl dieser Videos relevant ist, von keiner bis zu allen. Die Tabellen zeigen die Mittelpunkte, mit Grenzen von ±25 verwendbaren Clips pro Suche für Bright Data und ±10 für YouTube.
Die Dichtequotenbereiche kombinieren diese Grenzen mit 95 %-Stichprobenintervallen für die bewertete Stichprobe.
Relevanzbewertung
Die Bewertung umfasste 12.455 Ergebnisse, wobei pro Video zehn gleichmäßig verteilte Frames entnommen wurden. Ein Vision-Gremium aus drei Modellen bewertete die Frames von 0 bis 3. Wir verwendeten den Medianwert pro Frame und dann den höchsten Frame-Wert als Video-Score.
Die Verwendung von zehn Frames erhöhte die gemessene Videorelevanz im Vergleich zur Verwendung von drei Frames. Innerhalb dieses Durchlaufs lagen die Faktoren bei 1.517 für Bright Data und 1.359 für YouTube. Alle berichteten Ergebnisse verwenden das Zehn-Frame-Verfahren.
Teilnehmer
Dieser Benchmark konzentriert sich auf die semantische Suche über den bestehenden Index öffentlich verfügbarer Videos eines Anbieters, wobei die herkömmliche Videosuche als Baseline dient. Tools, bei denen Nutzer eigene Videosammlungen bereitstellen müssen, und Dienste, die auf lizenziertes Stockmaterial beschränkt sind, fallen nicht in diesen Rahmen.
Einschränkungen
Dieser Benchmark umfasst zwei Engines und 50 ausgewählte englische Suchanfragen, mit gleicher Anzahl in jeder Kategorie. Das Gesamtergebnis hängt von dieser Mischung ab. Er trifft keine Aussage über die Leistung in anderen Sprachen oder über die breitere Verteilung von Suchanfragen.
Fazit
Bright Data erzielte schätzungsweise 7.5-mal so viele verwendbare Videos pro Suche, bei ähnlicher Gesamtrelevanzdichte. Dies spiegelte größtenteils das Retrieval-Volumen wider. Mit diesem Gremium wies Bright Data bei abstrakten und Ich-Perspektive-Suchanfragen eine höhere Relevanzdichte auf, während YouTube bei Robotik, bestimmten Momenten und Actionszenen eine höhere Dichte aufwies.
Weiterführende Literatur
- Top 7 Video-Scraper: Getestet & Bewertet
- Beste YouTube-Datasets: Bright Data & Oxylabs
- Beste Video-Proxys: Benchmark-Ergebnisse 2026
- World Foundation Models: 10 Anwendungsfälle
- Agentische Suche im Jahr 2026: Benchmark von 8 Such-APIs für Agenten
- Top 15 Trainingsdaten-Plattformen
- RELC-Bench: Retrieval bei Long-Context-Benchmark
Zitieren Sie diesen Benchmark
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{sari2026,
author = {Sarı, Ekrem},
title = {{Video-Suche API Benchmark: Bright Data vs YouTube}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/video-search-api}},
note = {AIMultiple. Abgerufen am 18. September 2026}
}Ergebnisse und Zeitstempel von 19 Datenpunkten. Laden Sie die Zusammenfassungsdaten aus den Diagrammen und Tabellen dieses Artikels als ZIP-Datei herunter, die 3 CSV-Dateien und eine README enthält.
Möchten Sie die granularen Daten dahinter? Premium beitreten
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.