Die Zahl: von 250 Minuten auf unter 2
Die Redaktionen von Condé Nast verbrachten durchschnittlich 250 Minuten mit jeder Contentsuche. Die Zahl stammt aus dem von AWS veröffentlichten technischen Bericht[1], das die Lösung gemeinsam mit dem Verlagshaus gebaut hat. Nach dem Eingriff dauert dieselbe Aufgabe weniger als 2 Minuten.
Das Archiv zählt über 140.000 Videos. Es versorgt Titel wie Vogue, GQ, Vanity Fair und Wired.
Um einen Clip zu finden, sichteten die Cutter das Material von Hand und stützten sich auf Titel und Beschreibungen, die ein Mensch geschrieben hatte. In einem Markt, in dem die Geschwindigkeit der Veröffentlichung über den Umsatz entscheidet, belastete diese Verzögerung die Gewinn- und Verlustrechnung.
Vier Stunden und zehn Minuten für eine Suche: die Dauer einer langen Besprechung, verbracht mit einer Handlung, die wenige Sekunden dauern sollte. Der Hebel, der das Maß verändert hat, betrifft die Ebene der Suche, mehr als die Leistung des Modells.
Die originelle Idee: die Absicht suchen
Ein Redakteur sucht «Yoga-Inhalte für Anfänger mit entspannenden Hintergründen». Oder «Momente hinter den Kulissen der Fashion Week». Ein Dateiname wie yoga_tutorial_march_2024.mp4 antwortet auf eine andere Frage.
Hier liegt der strukturelle Bruch, den der AWS-Bericht beschreibt: klassische Suchwerkzeuge lesen die Etiketten, während der Inhalt des Videos undurchsichtig bleibt. Der Abstand zwischen der echten Frage und dem indexierten Datum war der eigentliche Flaschenhals.
Die Entscheidung bestand darin, die Ebene der Suche zu verschieben. Anstelle des Vergleichs zwischen Wörtern vergleicht das System Vektoren, die Bedeutung tragen. Ein multimodales Embedding codiert Bild, Audio und Transkription gemeinsam, also findet die Suchanfrage «entspannende Hintergründe» den richtigen Clip auch dann, wenn dieser Satz in Titel und Beschreibung fehlt.
Für eine Produktleitung ist der Übergang klar: handgeschriebene Metadaten haben eine Obergrenze, und diese Grenze kommt früh. Die Absicht hingegen misst sich im Material selbst.
Bedrock, OpenSearch und ein Encoder, der ins Video hineinschaut
Die Lösung stützt sich auf Amazon Bedrock und Amazon OpenSearch Service. Bedrock liefert das Modell, OpenSearch hält den Vektorindex und beantwortet die Suchanfragen. Die semantische Suche durchquert drei Ebenen gemeinsam: Transkriptionen, visuelle Elemente, Audio.
Das gewählte Modell ist TwelveLabs Marengo. Der vom Team genannte Grund ist präzise: Marengo codiert visuelle Signale, Audio und Transkription nativ und gemeinsam.
Ein Modell, das die drei Kanäle nacheinander behandelt, hätte getrennte Repräsentationen erzeugt, mit einer Näharbeit zulasten der Anwendung. Marengo versorgt alle fünf Suchfunktionen, die das Dokument beschreibt. Eine einzige Familie von Embeddings versorgt einen einzigen Index. Und dieser Index lässt sich auf fünf Weisen abfragen.
Für wen ein Technikbudget entscheidet, zählt das Detail. Die Wahl des Modells wiegt hier so viel wie die Wahl des Ortes: der Wert entsteht aus der Kombination von multimodalem Encoder und bereits verwalteter Vektorsuchmaschine.
Zwei getrennte Ebenen, und der Backfill, der es beweist
Die zweite Einschränkung war die Skalierung. Über 140.000 Videos bedeuten eine schwere Rechenlast für die Erzeugung der Embeddings, und eine leichte Last für die Ausgabe einer Antwort.
Das Team hat die beiden Ebenen getrennt. Auf der einen Seite die Ingestion, teuer und langsam. Auf der anderen die Antwort auf die Suchanfrage, die unmittelbar bleiben muss.
Eine monolithische Architektur hätte einen Tausch erzwungen: mehr Geschwindigkeit bei der Ingestion gegen weniger Reaktionsfähigkeit bei der Suche, oder umgekehrt. Mit getrennten Ebenen wächst, fällt und entwickelt sich jede für sich. Das AWS-Dokument fügt den Satz hinzu, der den Fall lehrreich macht: diese Entscheidung erwies sich beim Backfill als wesentlich.
Der Backfill ist der Moment, in dem das historische Archiv auf einmal in das System einläuft. Hundertvierzigtausend Videos zu verarbeiten, während die Redaktion arbeitet.
Mit einer einzigen Ebene hätte die Suche genau in den Tagen gestockt, in denen sie am meisten gebraucht wurde. Die Reibung ist dokumentiert, und das macht die Zahl glaubwürdig.
Wer die Zahl veröffentlicht
Hier kommt die Grenze, die zu erklären ist. Den Sprung von 250 Minuten auf unter 2 Minuten veröffentlicht AWS, das die Lösung mit seinem Generative AI Innovation Center gebaut hat. Der Anbieter misst seine eigene Arbeit.
Das macht die Angabe zu einem angekündigten Ergebnis, bis zu einer unabhängigen Prüfung. Sie gilt als Nachweis technischer Machbarkeit, weniger als Marktbenchmark.
Das Dokument beschreibt zudem die Messmethode in knapper Form. Drei Dinge bleiben offen:
- was eine «Contentsuche» genau umfasst
- wie viele Personen gemessen wurden
- über welchen Beobachtungszeitraum
Das Vorher/Nachher existiert und trägt einen klaren Nenner, die Zeit pro Aufgabe, und das trennt es von der allgemeinen «signifikanten Verbesserung», die die Seiten der Anbieter füllt.
Ein Aufsichtsrat liest den Fall als das, was er ist: die Richtung der Bewegung ist belastbar, die Größenordnung verlangt Bestätigung. Wer eine ähnliche Investition prüft, sollte das Messprotokoll vor der Unterschrift einfordern.
Das Wissen, das zur Tür hinausgeht
Das Dokument nennt einen Kostenpunkt, der selten in Business Cases auftaucht: die Abhängigkeit von persönlichem Wissen. Die Teams verließen sich auf diejenigen, die sich erinnerten, wo ein bestimmtes Material lag.
Wenn diese Person im Urlaub war oder die Rolle wechselte, blieb die Suche stehen. Der AWS-Bericht nennt es beim Namen: ein einzelner Bruchpunkt.
Es gibt einen zweiten, leiseren Effekt. Brauchbares Material blieb im Archiv unsichtbar, weil die Wörter des Titels es aus den Suchanfragen heraushielten, die die Redakteure wirklich stellten. Videos, die bezahlt, geschnitten, einmal veröffentlicht und dann stillgelegt wurden.
Die semantische Suche wirkt auf beide Fronten. Sie macht das Gedächtnis des Archivs zu einem Vermögenswert des Unternehmens, anstelle einer individuellen Fähigkeit. Und sie bringt bereits produzierte Inhalte zurück in den Umlauf, deren Wiederverwendung null kostet.
Für eine KMU-Gründerin ist das der Teil, der günstig nachzubilden ist: der unmittelbare Wert kommt aus dem Material, das du schon besitzt, mehr als aus neuer Produktion.
Was du mitnehmen kannst
Drei Elemente dieses Falls reisen über das Verlagswesen hinaus.
Erstens: die echte Frage deiner Nutzer steht schon in den Suchlogs. Lies sie. Wenn die Suchanfragen von Absichten sprechen und dein Index von Etiketten, ist der Abstand zwischen beiden deine Chance.
Zweitens: trenne die schwere Rechenlast von der schnellen Antwort, bevor du anfängst. Der Backfill kommt immer, und er kommt am Anfang, wenn das Vertrauen der Nutzer fragil ist.
Drittens: wähle den Encoder danach, wie er deine echten Daten behandelt. Ein Modell, das Bild, Audio und Text in einem einzigen Raum vereint, erspart dir eine Integrationsebene, die du sonst selbst schreibst und pflegst.
Eine Teamleitung kann klein anfangen. Tausend Assets, ein verwalteter Vektorindex, eine Metrik, gemessen davor und danach. Das Vorher/Nachher an einer kleinen Stichprobe überzeugt ein Gremium besser als eine Präsentation über zwanzig Seiten.
Eine Frage für deine Organisation
Es bleibt der Punkt, den dieser Fall für jeden mit einem Archiv aufwirft. Wie viel Zeit verbringen deine Leute mit der Suche nach etwas, das das Unternehmen schon besitzt?
Miss es eine Woche lang, an einer einzigen Aufgabe, mit einer Zahl am Anfang und einer Zahl am Ende. Das ist das Maß, das Condé Nast hatte, bevor es sich bewegte. Und das ist der Grund, warum sein Ergebnis heute als Fallstudie zu lesen ist, anstatt als Verlautbarung.
Der Rest hängt davon ab, wohin du die Ebene der Suche legst.
Dieser Artikel wurde von einem redaktionellen KI-Autor unter menschlicher Aufsicht verfasst, in Übereinstimmung mit den Transparenzpflichten der Verordnung (EU) 2024/1689 (KI-Verordnung, Art. 50). Die Quellen sind im Text verlinkt.
Article by SAGA
Quellen
- von AWS veröffentlichten technischen Bericht 1 Okt 2026 (aws.amazon.com)