Vierhundert Millionen Dokumente, eine einzige Pipeline
Am 25. September 2026 veröffentlichte Google Cloud die Zahlen eines seiner Kunden: Scribd, Inc. hat über 400 Millionen von Nutzern hochgeladene Dokumente klassifiziert[1], mit mehr als 12 Milliarden Seiten aus Text und Bildern. Der Umfang deckt zwei Produkte der Gruppe ab, Scribd und Slideshare.
Das Unternehmen betreibt insgesamt vier: Scribd, Slideshare, Everand und Fable.
Das Thema heißt Moderation: Community-Regeln, anzuwenden auf ein Archiv, das täglich wächst. Ein Dokument zu verstehen bedeutet, Text und Bilder gemeinsam zu lesen, in ihrem Kontext. Jede Sprache, jedes Format und jeder denkbare Verwendungszweck gehen in die Rechnung ein.
Der Backfill über den gesamten Korpus schloss in wenigen Monaten ab. Google Cloud erhöhte den Durchsatz des Batch, um diese Frist zu halten.
Der wertvolle Teil liegt vor den Zahlen. Es sind zwei Entscheidungen, eine zur Architektur und eine zum Preis, die diese Arbeit bezahlbar machten.
Die eigentliche Idee: dem Modell das PDF im Originalzustand geben
Die erste Entscheidung betrifft etwas, das das Team nicht gebaut hat. Gemini liest das PDF nativ, und über 99 % des Korpus liefen durch, wie sie waren: kein OCR, kein Rendering, keine Screenshot-Pipeline.
Wer an einem Document-AI-Projekt gearbeitet hat, kennt das Gewicht dieses Satzes. Die Pipeline für das Pre-Processing frisst Monate an Entwicklung, produziert stille Fehler bei schmutzigen Formaten und altert schlecht. Jede Änderung am Prompt verlangt einen zweiten Durchlauf über alles.
Bei 12 Milliarden Seiten wird das Rendering zu einem eigenen Budgetposten. Jede in ein Bild umgewandelte Seite muss archiviert, versioniert und erneut verarbeitet werden.
Scribd verlagerte diese Arbeit in das Modell.
Der Wert dieser Entscheidung zeigt sich in abwesendem Code: eine Komponente, die das Team über Jahre nicht schreiben und nicht pflegen muss. Die 99 % sagen noch etwas: ein von Nutzern über zwanzig Jahre aufgebautes Archiv bleibt bei direkter Eingabe lesbar.
Die Ökonomie des Batch: halber Preis, akzeptierte Latenz
Die zweite Entscheidung ist buchhalterisch. Die Batch Prediction von Gemini Enterprise kostet die Hälfte des interaktiven Preises, und dieser Rabatt von 50 % machte die Klassifizierung mit einem LLM auf Korpusgröße praktikabel.
Der Preis pro Token sinkt, und im Gegenzug kommt die asynchrone Latenz: die Arbeit geht in die Warteschlange und kommt zurück, wenn sie zurückkommt.
Hier liegt die Überlegung, die viele Teams falsch anstellen. Ein historischer Backfill hat eine Frist, die in Monaten gemessen wird, und lebt gut in der Warteschlange. Eine Prüfung beim Upload in Echtzeit verlangt sofortige Antwort und zahlt den vollen Preis.
Die beiden Regime zu trennen bedeutet, Geschwindigkeit dort zu kaufen, wo sie Wert bringt, und Durchsatz dort, wo das Volumen zählt. Halber Preis auf 12 Milliarden Seiten verändert die Natur der Entscheidung, von einer Investition zur Genehmigung hin zu einer Budgetzeile.
Die Warteschlange bringt einen zweiten operativen Vorteil. Ändert sich die Policy, läuft der gesamte Korpus erneut durch, und die neuen Kategorien greifen auf den Bestand zurück.
Wer die Funktionen der Plattform und ihre Daten verfolgen will, findet die öffentlichen Release Notes: offizielles Verzeichnis von Gemini Enterprise[2].
Die Reibung: fertige Werkzeuge hielten kurz
Die offizielle Darstellung enthält auch den Moment der Reibung. Vor Gemini prüfte das Team verschiedene fertige Moderationswerkzeuge und offene Modelle, und die in dieser Größenordnung verlangte Qualität fehlte allen.
Die historische Grenze lag noch anders. Jeder Policy-Bereich verlangte seinen eigenen Detektor, und jeder Detektor verlangte Jahre interner Arbeit oder eine Lizenz vom Anbieter. Beide Wege endeten an derselben Mauer.
Die Ökonomie eines Backfills von 400 Millionen Dokumenten sprengt die Rechnung einer Lösung pro Kategorie.
«Jede Inhaltskategorie verhält sich anders, und historisch verlangte jede eine eigene Lösung», sagte Sachin Sebastian, Senior Engineering Manager bei Scribd, Inc. «Gemini hat all das in ein Modell, einen Prompt, eine Pipeline kollabiert.»
Der Satz gilt als Maß für Architektur, mehr als als Kompliment an den Anbieter. Der Gewinn liegt in der Anzahl der am Leben zu haltenden Systeme: von vielen auf eines.
Erklärtes Ergebnis und geprüftes Ergebnis
Der Beitrag kommt von Google Cloud, gezeichnet von einem Account Manager des Anbieters und einem Engineering-Leiter des Kunden. Volumen, Zeiträume und Rabatt bleiben Zahlen, erklärt von den beiden Parteien, die am Ergebnis interessiert sind.
Eine unabhängige Prüfung fehlt derzeit.
Auf der Qualitätsseite bleibt der Text allgemein: er spricht von einer Mischung aus menschlichen und automatischen Methoden zur Anwendung der Community-Regeln. Menschen bleiben im Prozess, und das ist das glaubwürdigste Detail der Mitteilung. Es fehlen dagegen die Zahlen, die ein Prüfer verlangen würde.
Drei Zahlen blieben nützlich:
- Präzision und Trefferquote für jede Policy-Kategorie
- Rate der falsch positiven Treffer bei legitimen Dokumenten
- Anteil der zur menschlichen Prüfung gegebenen Dokumente
Der Unterschied wirkt auf die Budgetentscheidung. Eine Abteilung, die messbaren Durchsatz kauft, unterschreibt auf eine Zahl, die sie sieht, eine Abteilung, die Genauigkeit kauft, unterschreibt auf ein Versprechen. Der erste Fall gilt als Marktreferenz, der zweite verlangt einen internen Nachweis.
Wer die Geschichte liest, um sie zu kopieren, muss diese Unterscheidung in der Hand halten. Die Durchsatzangabe ist belastbar und nachvollziehbar, die Qualitätsangabe bleibt eine Erklärung des Kunden.
Ein Modell, ein Prompt, eine Pipeline
Der technische Kern liegt in der Konsolidierung. Ein System mit zehn spezialisierten Detektoren hat zehn Datensätze, zehn Schwellenwerte, zehn Release-Zyklen und zehn Arten zu altern.
Ein System mit einem Modell und einem Prompt hat einen Kontrollpunkt. Eine Kategorie hinzuzufügen wird zur Textarbeit, und die Grenzkosten einer neuen Policy brechen ein.
Die Kehrseite existiert und gehört genannt. Ein einziger Prompt bündelt das Risiko, denn ein Formulierungsfehler pflanzt sich über den gesamten Korpus fort. Die Feinabstimmung eines eigenen Detektors bleibt in diesem Schema außer Reichweite.
Die vernünftige Gegenmaßnahme ist dieselbe wie in den dokumentierten Fällen dieser Klasse: Bewertungsstichproben pro Kategorie, Vergleich mit menschlichen Urteilen, unterschiedliche Schwellenwerte für unterschiedliche Bereiche. Das einzige Modell hält, wenn die Messung ringsum pro Kategorie bleibt.
In dieser Größenordnung belohnt die Bilanz die Einfachheit: zehn mittelmäßige, schlecht gepflegte Systeme verlieren gegen ein gutes, gut gepflegtes System.
Was wir mitnehmen können
Die übertragbare Lektion liegt weit entfernt vom Namen des Modells. Zwei Fragen erledigen die Arbeit bei jedem Document-AI-Projekt.
Die erste: welches Stück der Pipeline nimmt das Modell schon auf, und lohnt es sich daher, es nicht zu schreiben. Die zweite: welcher Teil der Last verträgt die Warteschlange, und kauft daher Durchsatz zum halben Preis.
- Gründer und CEOs von KMU: der historische Backfill ist der richtige Ort für das erste Projekt mit Volumen, mit der asynchronen Latenz als Preishebel.
- CTOs und Produktverantwortliche: die native Eingabe streicht eine ganze Komponente aus dem Diagramm, und mit ihr ihre technischen Schulden.
- Vorstände und Investoren: 400 Millionen Dokumente in wenigen Monaten verschieben die Latte des Möglichen bei einem großen Archiv.
- Teamleitungen: eine neue Prüfkategorie wird zu einem Prompt-Absatz, mit einem Zyklus, der sich in Tagen misst.
Der Fall legt auch eine Marschordnung nahe. Das erste Projekt mit Volumen startet beim Bestand, wo die Frist großzügig ist und der Rabatt strukturell.
Der Pilot in Echtzeit kommt danach, mit schon verstandenen Kosten.
Die interne Kultur zählt so viel wie die Architektur. Den Prompt schreibt gut, wer die Community-Regeln kennt, und dieses Wissen wiegt mehr als jede schlüsselfertige Lösung.
Es bleibt die offene Frage, gültig für jede Organisation mit einem großen Archiv. Wie viele Komponenten Ihrer Pipeline existieren, um eine Grenze der Modelle von vor drei Jahren auszugleichen? Ein Nachmittag an Versuchen mit dem Rohformat sagt, wie viel von diesem Gerüst Sie abschalten können.
Dieser Artikel wurde von einem redaktionellen KI-Autor mit menschlicher Aufsicht erstellt, in Übereinstimmung mit den Transparenzpflichten der Verordnung (EU) 2024/1689 (KI-Verordnung, Art. 50). Die Quellen sind im Text verlinkt.
Article by SAGA
Quellen
- Scribd, Inc. hat über 400 Millionen von Nutzern hochgeladene Dokumente klassifiziert 24 Sep 2026 (cloud.google.com)
- offizielles Verzeichnis von Gemini Enterprise (docs.cloud.google.com)