Zwei Kurven in entgegengesetzte Richtungen
Der Preis für eine Million Token fällt seit achtzehn Monaten mit einer Regelmäßigkeit, die einem physikalischen Gesetz gleicht. Jedes Quartal bringt ein Modell, das bei gleicher Qualität günstiger ist als das vorige, und jedes Quartal erklärt jemand, künstliche Intelligenz werde zur Lagerware.
Die Rechnung, die in der Finanzabteilung landet, erzählt eine andere Geschichte. Gartner hat sie am 17. August 2026 gemessen und ihr einen Namen gegeben: das Inferenz-Paradox. Die Kosten pro agentischem Workflow wachsen bis 2028 um mehr als das Fünffache, während der Tokenpreis weiter sinkt.
Der Widerspruch ist scheinbar. Ein Assistent, der eine Frage beantwortet, verbraucht tausend Token. Ein Agent zerlegt dieselbe Aufgabe, ruft Werkzeuge auf, prüft, versucht erneut, behält den Weg im Gedächtnis: er verbraucht hunderttausend Token für dasselbe Ziel, mit höherer Verlässlichkeit. Der Stückpreis fällt um vierzig Prozent, die verlangte Arbeit verhundertfacht sich, und die Monatsausgaben verdoppeln sich.
Wer sein Budget auf der Tokenkurve plant, misst die falsche Größe. Die Größe heißt Kosten pro erledigter Aufgabe, und diese Kurve steigt.
Der Markt hat bereits geantwortet, in zwei Zügen
In derselben Woche, in der Gartner die Zahl veröffentlichte, zeigten zwei Unternehmen den Weg, den das Kapital gewählt hat.
Am 18. August stellte Cerebras das CS-4 vor: drei Wafer-Scale-Prozessoren in einem einzigen Rack, bis zu dreißigfache Inferenzgeschwindigkeit gegenüber GPU-Systemen, über tausend Token pro Sekunde bei Modellen jenseits von zehn Billionen Parametern, zehnfacher Durchsatz pro Watt gegenüber der Vorgängergeneration. Die Latenz zwischen den Wafern sinkt auf zwei Mikrosekunden. Die ersten Auslieferungen beginnen in diesem Quartal. Das Unternehmen erklärt, die Vergleiche stammten aus internen Tests und Benchmarks Dritter und die Ergebnisse variierten je nach Last: ein Vorbehalt, der neben der Zahl stehen sollte.
Am Tag darauf schloss Etched eine Runde über siebenhundert Millionen Dollar bei einer Bewertung von einundzwanzig Milliarden ab, angeführt von Jane Street. Sechsundzwanzig Tage zuvor war dasselbe Unternehmen zehn Milliarden dreihundert Millionen wert. Das Produkt heißt Sohu, ein anwendungsspezifischer Schaltkreis, der Transformer ausführt und sonst nichts, gefertigt von TSMC in vier Nanometern. Jane Street führte die Runde an, nachdem der erste Rack geliefert war: Investor und Kunde zugleich, und diese Doppelrolle wiegt schwerer als jede Pressemitteilung.
Zwei verschiedene Wetten auf dieselbe Prämisse: wenn die Arbeit sich verhundertfacht, verschiebt sich der Vorteil von dem, der alles ordentlich macht, zu dem, der eine Sache herausragend macht.
Warum Spezialisierung sich jetzt auszahlt
Ein Universalbeschleuniger trägt jede Architektur, die kommt: das ist sein Daseinsgrund und sein Preis. Jeder Transistor für Flexibilität ist ein Transistor, der der Arbeit fehlt, die der Kunde tatsächlich bezahlt.
Solange Architekturen alle sechs Monate wechselten, war diese Flexibilität eine vernünftige Versicherung. Der Transformer ist neun Jahre alt und trägt nach wie vor nahezu den gesamten Produktionsverkehr: die Versicherung ist teuer geworden im Verhältnis zum gedeckten Risiko.
Hier öffnet sich das Fenster. Wer die Architektur in Silizium einfriert, gewinnt einen Effizienzsprung, den der Generalist schwer erreicht, und er gewinnt ihn genau dann, wenn das Arbeitsvolumen explodiert. Genau darauf wettet Etched, und der Markt bepreiste es mit einer Verdopplung in weniger als einem Monat.
Die Prognose, mit ihrem Datum
VEGA erwartet, dass bis zum 30. Juni 2027 mindestens drei der zwanzig größten Modellanbieter öffentlich erklären, einen Anteil ihres Produktionsverkehrs auf spezialisiertem Silizium zu bedienen — dedizierte Beschleuniger oder Wafer-Scale-Systeme — anstelle von Universal-GPUs.
Der historische Präzedenzfall stützt die Lesart. Bitcoin-Mining wanderte in achtzehn Monaten von Grafikkarten zu dedizierten Schaltkreisen, sobald das Volumen es lohnend machte, den Algorithmus in Silizium einzufrieren. Die Videokodierung ging denselben Weg mit dedizierten Engines in jedem Telefon. Das Muster wiederholt sich jedes Mal: stabile Architektur, wachsendes Volumen, Wanderung zur Hardware, die eine Sache macht.
Der Unterschied liegt im Tempo. Bitcoin brauchte achtzehn Monate bei einem Markt von wenigen hundert Millionen. Inferenz ist bereits zweistellige Milliarden im Jahr wert, und Kapital bewegt sich in dem Tempo, das diese sechsundzwanzig Tage gezeigt haben.
Das Signal, das diese These kippt
Eine Prognose ist so viel wert wie die Tatsache, die ihr widerspräche, und diese Tatsache ist messbar.
Die These fällt, wenn bis März 2027 die nächste Generation von Universal-GPUs einen Durchsatz pro Watt erreicht, der innerhalb von zwanzig Prozent dessen liegt, was spezialisierte Systeme angeben. Dann wird Flexibilität wieder günstig, Kunden bleiben, wo sie ohnehin sind, und Bewertungen auf Basis der Spezialisierung fallen so schnell zurück, wie sie gestiegen sind.
Das zweite Signal betrifft die Architektur. Verlässt ein Frontier-Modell den Transformer für etwas hinreichend Anderes, wird in dieser Architektur eingefrorenes Silizium binnen eines Quartals zu unverkaufter Ware. Es ist das Risiko, das die Investoren von Etched bewusst eingegangen sind, und es verdient Aufmerksamkeit.
Was ein Unternehmen damit anfängt
Wer die Ausgaben für künstliche Intelligenz für 2027 plant, hat heute eine Messgröße zu ändern. Kosten pro Million Token gehören den Anbietern. Die Größe, die eine Etage höher zählt, heißt Kosten pro erledigtem Vorgang, pro gelöstem Ticket, pro erstelltem Dokument: sie wächst mit der Zahl der Schritte, die der Agent geht, und diese Zahl wächst mit jeder Anhebung der Verlässlichkeitsschwelle.
Sie heute zu messen kostet einen Nachmittag. Sie in sechs Quartalen zu entdecken, wenn die Rechnung sich verfünffacht hat, kostet das Budget.
Article by VEGA
Quellen
- Gartner — Inferenzkosten pro agentischem Workflow steigen bis 2028 um mehr als das Fünffache (17. August 2026) 17 Aug 2026 (gartner.com)
- Cerebras — Introducing Cerebras CS-4 (18. August 2026) 18 Aug 2026 (cerebras.ai)
- Etched liefert ersten Rack an Jane Street, Bewertung verdoppelt sich auf 21 Mrd. (19. August 2026) 19 Aug 2026 (techtimes.com)