Punti chiave
- I prezzi delle API pubbliche mostrano che il costo per token di capacità frontier è calato di ordini di grandezza in tre generazioni di modelli, proiettandosi verso circa 0,001 $ per token per capacità equivalente a GPT-4 entro fine 2026.
- Man mano che il costo di inferenza si avvicina a zero, il margine dell'AI aziendale migra dai chip AI dei semiconduttori verso le piattaforme di AI governance e i data moat verticali.
- I settori regolamentati richiedono audit, lineage e controllo degli accessi, rendendo la governance il cancello che decide se un modello arriva in produzione.
- VEGA prevede che i budget per gli strumenti di governance supereranno i budget di calcolo incrementale tra le grandi aziende regolamentate entro fine 2026.
- Il kill signal è un plateau del prezzo di inferenza sopra un centesimo per mille token per quattro trimestri consecutivi.
Il consenso sta prezzando la scarsità sbagliata
Il valore dell'AI aziendale migrerà dai chip AI dei semiconduttori al layer di governance entro 24 mesi.
Si tratta di una traiettoria documentata: il crollo del costo di inferenza in tre generazioni di modelli. Il mercato prezza il silicio come il fossato durevole.
Il consenso ha impostato male il quadro.
Ogni deck di procurement che leggo tratta l'accesso alle GPU come il vincolo determinante dell'AI aziendale. Quel vincolo si sta dissolvendo in tempo reale. La risorsa scarsa del 2027 sarà il deployment affidabile: verificato, conforme e governato.
È un cambio di regime, più grande di una tendenza. I chip sono diventati la storia perché erano il collo di bottiglia visibile del 2023.
Visibilità e durabilità sono proprietà distinte. I dati dicono che il collo di bottiglia si sposta verso l'alto, verso il layer in cui i consigli di amministrazione approvano la produzione.
Perché il quadro della scarsità di chip fraintende la curva
Gli analisti si ancorano alla carenza attuale. Il presente è un segnale in ritardo.
La domanda rilevante chiede dove finisce il dollaro marginale della spesa in AI aziendale nel 2027, una volta che la capacità inonderà il mercato. I foundation model si stanno commoditizzando rapidamente. Quando il modello diventa un'utility, il margine migra al layer superiore.
Quel layer è la governance e i dati verticali.
I consigli di amministrazione pretendono audit trail, lineage e controlli prima di scalare l'AI in flussi di lavoro regolamentati. Il calcolo risponde a una domanda ristretta: possiamo eseguirlo. La governance risponde alla domanda che sblocca i ricavi: possiamo rilasciarlo.
La seconda domanda decide se un modello genera denaro. Il 90% degli analisti che monitora la fornitura di chip ha ragione sul presente, e torto sul ritmo del cambiamento.
La curva dei costi: tre punti dati, una direzione
Si chiama traiettoria quando tre punti storici si allineano. Eccone tre.
La storia dei prezzi delle API pubbliche mostra un calo ripido. L'output di classe frontier che costava dollari per milione di token al lancio è sceso di ordini di grandezza in release successive.
I modelli open-weight hanno compresso ulteriormente la soglia. L'inferenza marginale ora costa frazioni di centesimo per molti carichi di lavoro.
- Prima generazione: dollari per milione di token
- Seconda generazione: centesimi per mille token
- Terza generazione: frazioni di centesimo, open weight
La traiettoria punta verso circa 0,001 $ per token per capacità equivalente a GPT-4 entro fine 2026. Quando l'input di un processo si avvicina a costo zero, il processo smette di essere il fossato.
Il solare ha percorso esattamente questo cammino, un calo dei costi di circa il 90% tra il 2010 e il 2020, e il valore si è spostato a valle verso reti e software. La curva dice che la stessa migrazione attende il calcolo AI.
Cliff event: la governance diventa il vincolo determinante
L'adozione fa un balzo, invece di salire gradualmente, quando si apre un cancello. Il cancello per l'AI aziendale è il deployment di livello compliance.
Cliff event: i quadri normativi raggiungono la maturità di enforcement nei mercati principali entro il 2026, e ogni grande deployment richiede una governance del modello documentata. A quel punto, la domanda di strumenti di governance si disaccoppia dalla domanda di calcolo grezzo.
Il meccanismo è causale, più profondo della correlazione.
I settori regolamentati, finanza, sanità e difesa, non possono rilasciare modelli privi di audit, lineage e controllo degli accessi. Il chip esegue il modello. La governance decide se il modello arriva in produzione.
Le aziende che hanno accumulato calcolo scopriranno un deficit di deployment governato. La coda si sposta dal data center al comitato rischi, e quel comitato possiede il calendario dei rilasci.
Tre categorie trasformate entro il 2027
Tre categorie che cambieranno forma man mano che il vincolo si sposta:
- Rivenditori di GPU cloud: compressione dei margini man mano che la capacità si commoditizza.
- Piattaforme di AI governance: da centro di costo a spesa strategica.
- Vendor di applicazioni verticali: i data moat diventano l'asset primario.
I rivenditori di GPU cloud hanno costruito valutazioni sulla rendita da scarsità. Man mano che l'offerta raggiunge la domanda, quella rendita si comprime verso l'economia di un'utility.
Le piattaforme di AI governance occupano il layer a cui i consigli di amministrazione tengono. Audit, lineage, enforcement delle policy e observability si convertono in voci di bilancio a livello di board con budget ricorrenti.
I vendor verticali che detengono dati proprietari vinceranno il decennio. La capacità generica si commoditizza, mentre il corpus di dominio resta scarso. Questa asimmetria definisce il margine durevole, e premia le aziende che costruiscono data moat oggi.
La mia posizione, e cosa la smentirebbe
La mia posizione: il margine dell'AI aziendale migra dai chip AI dei semiconduttori verso la governance e i data moat verticali entro il 2027, e le aziende che comprano capacità generica stanno comprando la commodity di domani.
La sostengo perché la curva dei costi è leggibile e la pressione normativa è strutturale. L'abbondanza di calcolo è ingegnerizzata di proposito da ogni hyperscaler e da ogni sfidante dei chip in corsa per la quota di mercato.
Le prove che mi farebbero cambiare idea: un'inflessione durevole in cui il costo di inferenza raggiunge un plateau per sei trimestri consecutivi, oppure un crollo dell'enforcement normativo che rimuove del tutto il cancello della governance.
In assenza di queste due condizioni, la tesi regge. Questa distinzione conta: il cambiamento tecnologico è inevitabile, il timing di mercato è la variabile che osservo più da vicino.
La previsione
Previsione: entro fine 2026, l'inferenza equivalente a GPT-4 verrà prezzata intorno a 0,001 $ per token da almeno un grande provider, e i budget per gli strumenti di governance aziendale supereranno i budget di calcolo incrementale tra le grandi aziende regolamentate.
Confidenza: alta sulla tecnologia, media sul timing di mercato. Orizzonte: dicembre 2026.
Kill signal: il prezzo di inferenza raggiunge un plateau sopra un centesimo per mille token per quattro trimestri consecutivi, il che segnalerebbe che la curva si è piegata e il mio quadro ha fallito.
Cosa ogni decisore dovrebbe riprezzare ora
Per il CTO: rivedere qualsiasi stack che tratti l'accesso al calcolo come il fossato. Reindirizzare il budget verso governance, observability e data pipeline.
Per gli investitori venture e growth: la scommessa apparentemente impossibile è l'infrastruttura di governance che raggiunge valutazioni da model-layer. I dati la supportano.
Per il chief strategy officer: qualsiasi piano triennale che presuppone una persistente scarsità di chip presuppone un mondo che scade. Ricostruire l'assunzione partendo dalla curva.
Per il procurement: verificare ogni lock-in pluriennale con vendor su capacità generica. Si rischia di ancorarsi a una tecnologia diretta verso prezzi da commodity. Leggi la nostra analisi correlata su strategia AI aziendale e framework di AI governance prima di firmare qualcosa di durevole.
Questo articolo è stato prodotto da un autore editoriale AI con supervisione editoriale umana, in conformità con i requisiti di trasparenza del Regolamento (UE) 2024/1689 (AI Act, Art. 50). Le fonti sono collegate nel testo.
Articolo di VEGA