Die GPU-Knappheit ist als ökonomische Tatsache vorbei
Die KI-Inferenzkosten pro Million Token sinken weiter, weil die Seltenheit des Siliziums vorgelagert längst verschwunden ist. Die Aussage ist zugespitzt, und sie stützt sich auf vier Messpunkte derselben Quelle.
SemiAnalysis zählte in seiner ersten Untersuchung zu Neoclouds 124 GPU-Cloud-Anbieter, 169 in ClusterMAX 1.0, 209 in ClusterMAX 2.0 und 323 im Release 3.0 vom 23. September 2026[1].
Drei aufeinanderfolgende Zuwächse, jeder im zweistelligen Prozentbereich. Eine Kurve mit vier Punkten ist keine Anekdote mehr: Sie wird zur Trajektorie. Und ein Angebot, das sich in zwei Jahren verdreifacht, wirkt mechanisch auf den Preis.
Der Markt für KI-Rechenleistung hat die Phase hinter sich, in der die Nachfrage den Preis allein bestimmte. Jetzt zählt, wer liefert, mit welcher Verlässlichkeit und zu welchen Kapitalkosten.
Der Konsens hat den falschen Rahmen
Der Konsens wiederholt einen Satz: Das GPU-Angebot ist auf null gefallen. Der Report selbst verwendet ihn im Auftakt, mit dem Bild von Investoren, denen die Taschen fehlen, um Schecks hineinzustecken.
Die Zahl, auf die alle schauen, ist die Warteschlange für die Zuteilung des neuesten Beschleunigers. Die Zahl, die den Preis vorhersagt, ist die Anzahl der Anbieter, die einen funktionierenden Cluster liefern können.
Das sind zwei verschiedene Märkte. Der erste bleibt aus Gründen von Packaging und Speicher verengt, und das bleibt er einen weiteren Zyklus lang. Der zweite hat sich geöffnet: 323 Betreiber konkurrieren um dieselbe Workload, und jeder kommt mit Schulden, die bedient, und Abschreibungen, die gedeckt werden müssen.
Ein fremdfinanzierter Beschleunigerpark kennt nur ein rationales Verhalten: immer laufen, zu jedem Preis oberhalb der Grenzkosten. Von dort kommt der Abwärtsdruck, und dieser Druck überträgt sich auf den Token-Preis.
Vier Punkte, acht Monate, +54 %
Zwischen ClusterMAX 2.0 und dem Release 3.0 liegen acht Monate. In diesem Zeitfenster steigt der erfasste Markt von 209 auf 323 Betreiber, ein Wachstum von knapp 54 %.
Die neue Ausgabe prüft 77 Anbieter im Detail und stützt sich auf Interviews mit über 200 Endnutzern, mit zehn Kriterienkategorien, die Rechenleistung, Netzwerk, Storage, Orchestrierung, Interface, Monitoring und Support abdecken. Der Betrachtungsrahmen wächst, weil die Zahl der Betreiber wächst, die eine Messung wert sind.
Das ist der Punkt, den der Markt unterschätzt. Wenn sich eine Erhebung in zwei Jahren verdreifachen muss, ist die Eintrittsbarriere gefallen. Rechenkapazität zu vermieten ist zu einem Geschäft aus Kapital und operativem Engineering geworden, offen für jeden, der eine Finanzierung findet.
Wie der $/GPU-Stunde beim $/Million Token ankommt
Die Kette ist kurz und arithmetisch. Der Preis pro Million Token entsteht aus den Stundenkosten des Beschleunigers, geteilt durch die Token pro Sekunde, die dieser Beschleuniger erzeugt, korrigiert um die durchschnittliche Auslastung.
Drei Hebel drücken diese Zahl gemeinsam nach unten: der Stundenpreis der Rechenleistung, die Effizienz der Serving-Stacks und die Komprimierung der Modelle. Der Wettbewerb zwischen 323 Anbietern wirkt unmittelbar auf den ersten Hebel, ablesbar an den öffentlichen Preislisten.
Diese Redaktion hält eine klare Position zu dieser Kurve: Der Preis einer Einheit Intelligenz sinkt um rund das 40-Fache pro Jahr, und die Inferenz eines Modells der GPT-4-Klasse ist in dreieinhalb Jahren um etwa das Tausendfache gefallen. Die Trajektorie des $/GPU-Stunde macht diesen Rückgang strukturell, weit jenseits eines Aktionseffekts.
Cliff Event: 2028 trifft der Preis auf die Kapitalkosten
Cliff Event: Der $/GPU-Stunde der generalistischen Neoclouds konvergiert bis 2028 auf die Kapitalkosten.
Der Mechanismus ist buchhalterisch. Die in den Jahren 2024-2025 gekauften Parks treten in den flachen Teil der Abschreibungskurve ein, die mehrjährigen Verträge der ersten Generation laufen aus, und die Verlängerungen werden in einem Markt mit dreimal so vielen Anbietern verhandelt. Ein Betreiber mit fälligen Schulden akzeptiert eine dünne Marge, bevor er einen Cluster stillstehen lässt.
An diesem Punkt erklärt sich der Preisunterschied über wenige Posten: Verlässlichkeit, Netzwerk, Storage, Support. Das Ranking zeigt es bereits: CoreWeave setzt die technische Messlatte, Nebius rückt in die Platinum-Stufe auf und hält einen konstanten Preisaufschlag gegenüber den anderen. Hinzu kommt die Reife der Sicherheitspraktiken, ein Thema, das Ilya Sutskever am 1. September 2026 in einem öffentlichen Statement zu den Neoclouds aufgebracht hat.
Drei Kategorien, die bis 2029 ihre Form verändern werden
Die Preiskonvergenz zeichnet die Wertschöpfungskette von oben nach unten neu. Wer Knappheit verkauft, verliert das Argument; wer operative Qualität verkauft, behält es; wer Endergebnisse verkauft, kassiert die freigesetzte Marge.
- Reiner Weiterverkauf von GPU-Stunden: die Mitte des ClusterMAX-Rankings, wo die Preisliste das einzige Unterscheidungsmerkmal bleibt.
- Broker und Kapazitäts-Aggregatoren: Sie leben von dem Informationsgefälle, das eine Erhebung über 323 Betreiber gerade schließt.
- Vertikale Anwendungen mit eigenen Daten: Sie erben die Marge, die die Rechenleistung freigibt.
Die Hyperscaler besetzen die unbequemste Position. Sie verkaufen Kapazität zu Preislisten, die auf einer Zuteilungswarteschlange aufgebaut sind, während die Alternativkosten Quartal für Quartal sinken. Dieselbe Dynamik läuft parallel in China, wo SemiAnalysis ein eigenes Modell für die lokalen Rechenzentren pflegt (semianalysis.com/china-datacenter-model[2]).
Die Position dieser Redaktion, und was sie widerlegen würde
Die Position ist knapp: Die Knappheit an KI-Kapazität ist als ökonomische Tatsache bereits vorbei, und der Inferenzpreis wird auch in den Quartalen sinken, in denen die Token-Nachfrage anzieht. Die Vervielfachung der Anbieter zählt mehr als jeder Kommentar zu Lieferwarteschlangen.
Was diese Lesart ändern würde: ein Rückgang der Anzahl erfasster Betreiber, eine Rückkehr zu mehrjährigen Verträgen mit steigenden Preisen, eine anhaltende physische Blockade bei Packaging und HBM-Speicher, die Silizium für mehr als einen Zyklus zur rationierten Ware macht.
Was das heute für Entscheider bedeutet:
- CTOs und Chief Innovation Officer: den Cloud-first-Stack jetzt neu bewerten, mit lokaler und On-Device-Inferenz im Vergleich.
- Venture Capital: Die unbequeme Wette liegt in den vertikalen Anwendungen, wo Rechenleistung zu einer sinkenden variablen Kostenposition wird.
- Chief Strategy Officer: Ein Dreijahresplan, der von teurer Rechenleistung ausgeht, geht von einer Welt aus, die gerade verschwindet.
- Technology Procurement: Die auf Verfügbarkeit hin unterschriebene Dreijahresbindung ist die Vertragsfalle des Jahres 2027.
Prognose, Horizont, Kill Signal
Prognose: Das nächste Major Release von ClusterMAX, veröffentlicht bis zum 31. Dezember 2028, wird einen erfassten Markt von über 450 GPU-Cloud-Anbietern ausweisen. Confidence: 72 von 100. Horizont: 825 Tage.
Kill Signal: Dieses Release weist eine Anzahl erfasster Anbieter von 323 oder weniger aus, ein Zeichen dafür, dass die Konsolidierung den Markteintritt neuer Betreiber übertroffen hat. Die Ankündigung des Release 3.0 bleibt über den öffentlichen Kanal des Research-Hauses überprüfbar (x.com/SemiAnalysis_[3]).
90 % der Analysten haben recht, was die Gegenwart betrifft. Unrecht haben sie beim Tempo des Wandels, und das Tempo ist alles, was zählt, wenn man einen Dreijahresvertrag unterschreibt.
Dieser Artikel wurde von einem redaktionellen KI-Autor unter menschlicher Aufsicht erstellt, in Übereinstimmung mit den Transparenzpflichten der Verordnung (EU) 2024/1689 (KI-Verordnung, Art. 50). Die Quellen sind im Text verlinkt.
Article by VEGA
Quellen
- 323 im Release 3.0 vom 23. September 2026 26 Sep 2026 (newsletter.semianalysis.com)
- semianalysis.com/china-datacenter-model (semianalysis.com)
- x.com/SemiAnalysis_ (x.com)