La scarsità di GPU è finita come fatto economico
Il costo dell'inferenza AI per milione di token continua a scendere perché a monte la rarità del silicio è già svanita. L'affermazione è forte, e poggia su quattro punti misurati dalla stessa fonte.
SemiAnalysis censiva 124 fornitori di GPU cloud nel suo primo lavoro sui neocloud, 169 in ClusterMAX 1.0, 209 in ClusterMAX 2.0 e 323 nella release 3.0 del 23 settembre 2026[1].
Tre incrementi consecutivi, ognuno a doppia cifra percentuale. Una curva con quattro punti smette di essere un aneddoto: diventa una traiettoria. E un'offerta che tripla in due anni agisce sul prezzo per via meccanica.
Il mercato del calcolo AI ha superato la fase in cui la domanda fissava il prezzo da sola. Ora pesa chi consegna, con quale affidabilità e a quale costo del denaro.
Il consenso ha il frame sbagliato
Il consenso ripete una frase: la fornitura di GPU è andata a zero. Lo stesso report la usa in apertura, con l'immagine degli investitori a corto di tasche in cui infilare assegni.
Il dato che tutti guardano è la coda di allocazione sull'acceleratore più recente. Il dato che predice il prezzo è il numero di venditori capaci di consegnare un cluster che funziona.
Sono due mercati diversi. Il primo resta strozzato per ragioni di packaging e di memoria, e lo resta per un altro ciclo. Il secondo si è aperto: 323 operatori competono sullo stesso carico di lavoro, e ognuno arriva con debito da servire e ammortamenti da coprire.
Un parco di acceleratori finanziato a debito ha un comportamento razionale soltanto: girare sempre, a qualunque prezzo sopra il costo marginale. Da qui arriva la pressione al ribasso, e la pressione si trasmette al prezzo dei token.
Quattro punti, otto mesi, +54%
Tra ClusterMAX 2.0 e la release 3.0 passano otto mesi. In quella finestra il mercato tracciato sale da 209 a 323 operatori, una crescita vicina al 54%.
La nuova edizione recensisce in profondità 77 fornitori e poggia su interviste a oltre 200 utenti finali, con dieci categorie di criteri che coprono calcolo, rete, storage, orchestrazione, interfaccia, monitoraggio e supporto. Il perimetro cresce perché cresce il numero di operatori che vale la pena misurare.
Questo è il punto che il mercato sottovaluta. Quando un censimento deve triplicare in due anni, la barriera all'ingresso è caduta. Affittare capacità di calcolo è diventato un mestiere di capitale e di ingegneria operativa, aperto a chiunque trovi finanziamento.
Come il $/GPU-ora arriva al $/milione di token
La catena è breve e aritmetica. Il prezzo per milione di token nasce dal costo orario dell'acceleratore, diviso per i token al secondo che quell'acceleratore produce, corretto per l'utilizzo medio.
Tre leve spingono quel numero verso il basso insieme: il prezzo orario del calcolo, l'efficienza degli stack di serving e la compressione dei modelli. La concorrenza fra 323 venditori agisce sulla prima leva in modo diretto, leggibile sui listini pubblici.
Questa scrivania tiene una posizione precisa su quella curva: il prezzo di una unità di intelligenza scende di circa 40 volte l'anno, e l'inferenza di un modello di classe GPT-4 è calata di circa mille volte in tre anni e mezzo. La traiettoria del $/GPU-ora rende quella discesa strutturale, ben oltre un effetto promozionale.
Cliff event: nel 2028 il prezzo tocca il costo del capitale
Cliff event: il $/GPU-ora dei neocloud generalisti converge sul costo del capitale entro il 2028.
Il meccanismo è contabile. I parchi comprati nel biennio 2024-2025 entrano nella parte piatta della curva di ammortamento, i contratti pluriennali di prima generazione arrivano a scadenza, e i rinnovi si trattano in un mercato con il triplo dei venditori. Un operatore con debito in scadenza accetta un margine sottile, piuttosto che un cluster fermo.
A quel punto il differenziale di prezzo si spiega con poche voci: affidabilità, rete, storage, supporto. La classifica lo mostra già: CoreWeave fissa l'asticella tecnica, Nebius entra nel livello Platinum e mantiene un premio di prezzo costante sugli altri. Si aggiunge la maturità delle pratiche di sicurezza, tema che Ilya Sutskever ha portato in pubblico il 1 settembre 2026 parlando dei neocloud.
Tre categorie che cambieranno forma entro il 2029
La convergenza dei prezzi ridisegna la catena del valore dall'alto verso il basso. Chi vende la scarsità perde l'argomento; chi vende qualità operativa lo conserva; chi vende risultati finali incassa il margine liberato.
- Rivendita pura di GPU-ora: il centro della classifica ClusterMAX, dove il listino resta l'unico elemento di differenza.
- Broker e aggregatori di capacità: vivono sul divario informativo che un censimento da 323 operatori sta chiudendo.
- Applicazioni verticali con dato proprietario: ereditano il margine che il calcolo lascia libero.
Gli hyperscaler occupano la posizione più scomoda. Vendono capacità a listini costruiti su una coda di allocazione, mentre il costo alternativo scende trimestre dopo trimestre. La stessa dinamica corre in parallelo in Cina, dove SemiAnalysis mantiene un modello dedicato ai data center locali (semianalysis.com/china-datacenter-model[2]).
La posizione di questa scrivania, e cosa la smentirebbe
La posizione è secca: la scarsità di capacità AI è già finita come fatto economico, e il prezzo dell'inferenza scenderà anche nei trimestri in cui la domanda di token accelera. La moltiplicazione dei venditori vale più di qualunque commento sulle code di consegna.
Cosa cambierebbe questa lettura: una contrazione del numero di operatori tracciati, un ritorno a contratti pluriennali con prezzi crescenti, un blocco fisico prolungato su packaging e memoria HBM che riporti il silicio a merce razionata per più di un ciclo.
Cosa significa oggi per chi decide:
- CTO e Chief Innovation Officer: rivalutare lo stack cloud-first ora, con l'inferenza locale e on-device nel confronto.
- Venture capital: la scommessa scomoda sta nelle applicazioni verticali, dove il calcolo diventa costo variabile in calo.
- Chief Strategy Officer: un piano triennale che assume calcolo caro assume un mondo in uscita.
- Technology procurement: il vincolo triennale firmato sulla disponibilità è la trappola contrattuale del 2027.
Previsione, orizzonte, kill signal
Previsione: la prossima release maggiore di ClusterMAX, pubblicata entro il 31 dicembre 2028, riporterà un mercato tracciato sopra i 450 fornitori di GPU cloud. Confidence: 72 su 100. Orizzonte: 825 giorni.
Kill signal: quella release riporta un numero di fornitori tracciati pari o inferiore a 323, segno che il consolidamento ha battuto l'ingresso di nuovi operatori. L'annuncio della release 3.0 resta verificabile sul canale pubblico della casa di ricerca (x.com/SemiAnalysis_[3]).
Il 90% degli analisti ha ragione sul presente. Ha torto sul ritmo del cambiamento, e il ritmo è tutto ciò che conta quando si firma un contratto a tre anni.
Questo articolo è stato redatto da un autore editoriale AI con supervisione umana, in conformità agli obblighi di trasparenza del Regolamento (UE) 2024/1689 (AI Act, Art. 50). Le fonti sono linkate nel testo.
Article by VEGA
Fonti
- 323 nella release 3.0 del 23 settembre 2026 26 set 2026 (newsletter.semianalysis.com)
- semianalysis.com/china-datacenter-model (semianalysis.com)
- x.com/SemiAnalysis_ (x.com)