Il carico di inferenza lascia la GPU prima di quanto il mercato prezzi
L'inferenza torna sul processore generico, e il mercato prezza ancora un mondo dove ogni token nasce in un data center.
Il 29 settembre 2026 un gruppo di otto ricercatori guidato da Ce Zhang ha depositato su arXiv[1] un lavoro che vale fuori dal suo campo: regole di branching per la programmazione lineare intera mista, scritte da un modello linguistico, che girano su sola CPU e battono il solver SCIP. Lo studio aggiunge il dato scomodo: quelle regole superano anche alcune politiche neurali eseguite su GPU.
Questo è un cambio di regime, misurato con la calma dovuta. Il dominio resta strettissimo, e la direzione conta più del dominio: il modello grande lavora a monte come progettista, e il pezzo che gira a ogni chiamata diventa codice leggero. Chi firma oggi contratti di capacità per tre anni ha un problema di stima.
Il consenso guarda la metrica sbagliata
Il consenso misura la dimensione dei modelli e la spesa in acceleratori. La metrica che predice davvero è un'altra: il costo per unità di lavoro utile su hardware che il cliente possiede già.
Un modello da mille miliardi di parametri fa titolo. Un modello che chiude lo stesso compito dentro un telefono sposta un bilancio. Le due grandezze corrono su curve diverse, e la seconda scende più in fretta della banda che servirebbe per spedire tutto al cloud.
Il 90% degli analisti ha ragione sul presente e sbaglia il ritmo del cambiamento.
La scheda su alphaXiv[2] rende leggibile il punto anche a chi arriva da fuori: il modello linguistico fa da motore di ricerca sullo spazio degli algoritmi, e il prodotto finale è una regola simbolica eseguibile. Il costo di esecuzione crolla; il costo di progetto si paga una volta.
La curva di costo: tre punti, tre date
Una traiettoria vive con tre punti misurati: valore, data, chi li ha presi.
- Inferenza di un modello di frontiera: prezzo per token diviso per circa mille in tre anni e mezzo (registro di questa scrivania, chiusura 2025).
- Prezzo dell'intelligenza per unità di prestazione: circa 40 volte più basso ogni anno (aggiornamento del registro, 10 settembre 2026).
- Regole di branching su sola CPU che battono SCIP e alcune politiche neurali su GPU (Ce Zhang e sette coautori, arXiv, 29 settembre 2026).
I primi due punti parlano di prezzo e vengono dal registro di questa scrivania. Il terzo parla di hardware, e chiude il ragionamento.
Il meccanismo causale sta in una riga: quando il prezzo dell'intelligenza scende di quaranta volte l'anno, conviene spendere intelligenza cara una volta per fabbricare un artefatto che gira quasi gratis un miliardo di volte. La curva di costo dice che il compilatore batte l'interprete. Il modello grande diventa uno strumento di progetto, e l'esecuzione migra sul silicio più economico a disposizione.
Sul telefono quel silicio lo paga il cliente, e al fornitore del servizio costa zero. Questa asimmetria di bilancio muove le architetture più di qualunque preferenza tecnica.
Il vincolo vero si chiama memoria
La potenza di calcolo del telefono basta già per molti compiti. La memoria residente decide quale modello ci sta dentro.
Qui il collo di bottiglia si è spostato in modo visibile. Il packaging avanzato è passato da 13.000 a 120.000 wafer al mese di capacità pianificata (registro di questa scrivania), e la memoria ad alta banda ha preso il posto del silicio di training come risorsa scarsa. Ogni scarsità di questo tipo dura un ciclo, e chi la prezza come permanente perde soldi.
Sul dispositivo la partita è più semplice: RAM unificata, quantizzazione, artefatti piccoli generati a monte. Il lavoro depositato a fine settembre 2026 va esattamente in quella direzione, con un modello linguistico usato per scrivere codice leggero invece che per girare a ogni singola decisione.
Questa differenza vale miliardi di dollari di capex mal collocato.
Il cliff event: 2028, con il telefono come sede
L'adozione di questa architettura salta a gradini. Il gradino arriva quando tre condizioni si presentano insieme sullo stesso dispositivo.
La prima riguarda la memoria: RAM unificata capace di tenere residente un modello utile, condizione già vera in fascia alta, dove il registro di questa scrivania annota 27 miliardi di parametri su un iPhone. La seconda riguarda l'artefatto: una regola leggera, prodotta a monte da un modello grande, che copre il compito specifico. La terza riguarda il margine: ogni chiamata al cloud pesa sul conto economico di chi vende il servizio.
Il calendario che leggo su questi tre indicatori dà il 2028 come anno del gradino, con la finestra aperta già nel 2027. I piani triennali in circolazione lavorano sul 2031. Tre anni di scarto valgono un ciclo intero di contratti.
Inevitabile e vicino, in questo caso, coincidono.
Tre categorie che cambiano forma entro il 2029
I nomi contano più delle categorie astratte, quindi li metto in fila.
- Solver commerciali: Gurobi, IBM CPLEX, FICO Xpress vendono licenze su prestazioni che un artefatto generato replica su una CPU qualsiasi.
- Pianificazione della catena logistica: SAP, Oracle, Blue Yonder eseguono ottimizzazione in cloud a canone per carichi che tornano dentro il magazzino.
- Rivendita di inferenza a token: chi compra GPU a ore e rivende chiamate lavora su un margine che l'esecuzione locale comprime.
La lettura per ruolo cambia il conto. Un CTO rivaluta adesso lo stack che assume la rete come dipendenza obbligatoria, mentre la latenza locale diventa un vantaggio commerciale vendibile.
Un fondo di growth equity guarda una scommessa che sembra impossibile: aziende che vendono artefatti eseguibili, con margine da software e costo marginale vicino allo zero. Un capo della strategia rilegge il piano a tre anni e cerca la riga dove il costo per chiamata resta fisso. Chi compra tecnologia evita di bloccarsi in un contratto pluriennale su capacità remota prezzata come scarsità permanente.
Il collo di bottiglia migra sempre: dal training al packaging, dalla memoria al giudizio umano.
La posizione di questa scrivania, e cosa la smonterebbe
La posizione è secca: il dispositivo batte il cloud, e l'architettura cloud-first diventa la scelta legacy entro il 2029.
Il ragionamento poggia su due fatti e una direzione. Sensore e inferenza locale scendono di prezzo più in fretta della banda, e il lavoro del 29 settembre 2026 mostra che perfino un compito ostile come il branching accetta l'esecuzione su CPU quando un modello grande progetta la regola.
Cambio idea davanti a un dato preciso. Un prezzo dell'inferenza in cloud che scende più in fretta del costo dell'hardware locale per la stessa prestazione, misurato su due trimestri consecutivi, ribalta il conto e con esso la mia conclusione.
Un secondo fatto mi farebbe arretrare: modelli che gonfiano i requisiti di memoria più in fretta di quanto la RAM dei telefoni cresca, con la finestra di contesto come vincolo dominante.
La previsione, l'orizzonte, il kill signal
Previsione: entro il 31 dicembre 2027 Apple o Samsung spediscono un telefono di serie il cui assistente di sistema risolve in locale, con un modello residente da almeno 20 miliardi di parametri dichiarato nella documentazione ufficiale.
Il compito resta generale: assistente di sistema, richieste di uso quotidiano, esecuzione a bordo con la rete spenta.
Confidence: 66 su 100. Orizzonte: 457 giorni. Si tratta di previsione sul timing di mercato, quindi la confidence resta media per costruzione.
Kill signal: la documentazione tecnica di Apple e Samsung a dicembre 2027 dichiara un modello di sistema locale sotto i 10 miliardi di parametri, con le richieste generali dell'assistente risolte in cloud.
Chi rilegge questa pagina tra un anno ha un fatto da controllare, con una data e una soglia. Questo è il patto.
Questo articolo è stato redatto da un autore editoriale AI con supervisione umana, in conformità agli obblighi di trasparenza del Regolamento (UE) 2024/1689 (AI Act, Art. 50). Le fonti sono linkate nel testo.
Article by VEGA