Da settantadue ore a dodici
Il 3 ottobre 2026 AI21 Labs ha messo in pubblico il prima e il dopo del suo ambiente di training, numeri alla mano.
I job ad alta priorità sono le corse di training su molti nodi: chiedono metà cluster o più e stanno sul percorso critico di un progetto di modello. Prima restavano in coda fino a 72 ore, in attesa che si liberasse capacità contigua.
Oggi la stessa classe di lavori parte entro 12 ore. Gli interventi manuali di scheduling sono scesi da venti a settimana a zero, come racconta il laboratorio sul blog di Google Cloud[1]. La cifra di sintesi che il team mette in prima riga è una riduzione dell'83% del tempo di avvio dei carichi.
Il perimetro di questo risultato resta quello di un singolo ambiente di addestramento, e vale la pena ricordarlo subito.
L'idea originale: una flotta sola, zero fette fisse
AI21 costruisce modelli di base, tra cui la famiglia Jamba, e vende tecnologia per ottimizzare gli agenti. Il training gira su uno dei suoi cluster Google Kubernetes Engine condivisi.
Quel cluster mette in comune migliaia di istanze Google Cloud A3, con GPU NVIDIA H100, e A3 Ultra, con GPU H200. Ogni squadra attinge alla capacità piena della flotta al posto di restare chiusa nella porzione che le è stata assegnata. Sullo stesso impianto girano i modelli Jamba e i carichi di ottimizzazione degli agenti.
La decisione somiglia a una scelta di infrastruttura.
È una scelta di governo delle risorse.
Mettere tutto in comune tiene l'utilizzo alto, vicino al 100%, che è il punto dove un'azienda vuole vedere una flotta di calcolo riservata e già pagata. Rende anche lo scheduling difficile, e il laboratorio lo scrive a chiare lettere.
Quando la capacità si trattava su Slack
Prima di affidare l'orchestrazione a GKE, la capacità si negoziava a mano. Chi aveva bisogno di GPU scriveva nel canale #gpu-resources e sperava in una risposta utile.
Il metodo funzionava finché il cluster aveva margine libero.
Ha smesso di funzionare quando l'utilizzo si è inchiodato vicino al massimo.
Da quel momento ogni richiesta è diventata una trattativa. I capi delle squadre passavano il tempo a fare da arbitri nelle dispute sul calcolo, al posto di lavorare sui modelli. Il costo di quella fase si misura in due valute: le ore di attesa dei ricercatori e le ore di coordinamento dei capi tecnici.
Venti interventi manuali a settimana danno la scala del problema. Erano quattro al giorno, ogni giorno, per tenere in piedi una coda che il software poteva gestire per conto suo.
Due problemi scambiati per uno
Qui arriva il passaggio più istruttivo della storia, e arriva come una correzione.
La scarsità creava due problemi distinti, e il laboratorio ammette di averli visti come separati dopo un po' di tempo. Il primo è la contesa: chi ottiene il prossimo accesso al calcolo. La trattativa umana risolveva quello.
Il secondo è la frammentazione: capacità libera sulla carta, sparsa in pezzi troppo piccoli per un job grande. Otto GPU libere distribuite come 1+1+4+2 su quattro nodi lasciano a terra un carico che chiede otto GPU insieme. È un problema di impacchettamento, e la diplomazia su Slack lo lascia intatto.
Mesi di trattative avevano lavorato sul sintomo sbagliato. La politica di scheduling sul cluster unico aggredisce entrambi i problemi: decide le priorità e compatta i pezzi liberi.
La differenza conta per chiunque gestisca una coda. La contesa si governa con una regola di priorità. La frammentazione si governa con il modo in cui i lavori vengono piazzati sui nodi, e chiede una macchina che veda tutta la flotta in una volta.
Risultato dichiarato e risultato verificato
La distinzione conta. Il racconto porta la firma di Barak Peleg, VP Technology and Architecture di AI21, e di Asaf Ben-Tovim, DevOps Engineer. Il testo compare sul blog del fornitore di cloud che ha venduto l'infrastruttura.
Questo rende i numeri una dichiarazione di prima mano su un canale interessato. Un audit indipendente manca, e chi legge dovrebbe trattare l'83% per quello che è: una misura interna, pubblicata dall'azienda che l'ha ottenuta.
Il pregio di questo caso sta nella forma della misura. Ci sono due coppie prima e dopo con un denominatore chiaro. 72 ore contro 12 ore sulla stessa classe di job, venti interventi contro zero sulla stessa settimana di lavoro.
Restano fuori i dati che completerebbero il quadro: la percentuale esatta di utilizzo, il costo per corsa di training, il tempo totale di completamento. Una richiesta legittima per chiunque voglia replicare la mossa.
Che cosa cambia per chi porta agenti in produzione
Molte aziende oggi mandano agenti AI in produzione enterprise e scoprono il collo di bottiglia nello stesso punto: la coda per il calcolo.
Per un fondatore di PMI il playbook replicabile costa zero in licenze. Basta mettere la capacità in un pool unico e scrivere una politica di priorità, al posto di assegnare macchine per squadra. Il vantaggio arriva dalla regola, prima che dall'hardware.
Per un CTO il segnale tecnico è preciso: l'orchestratore gestisce la contesa e l'impacchettamento meglio di un canale di chat. La condizione è dichiarare le priorità in modo esplicito.
Per un board lo spostamento dell'asticella riguarda il ritorno sulla flotta già comprata. La stessa quantità di GPU produce più corse utili quando la coda diventa una regola leggibile. Per un team lead l'idea viaggia anche fuori dalle GPU: ogni risorsa scarsa distribuita a mano genera arbitri, e gli arbitri costano stipendi senior.
Cosa portare via
Tre lezioni restano in piedi anche lontano dal mondo dei modelli di base.
La prima: la decisione architetturale presa anni prima pesa più della tecnologia del momento. Il pool unico è la mossa che ha reso possibile il guadagno, e la piattaforma di orchestrazione ha fatto il resto.
La seconda: ogni storia di successo misurata contiene una correzione. Qui la correzione è mentale, e vale più dei numeri. Due problemi sembravano uno, e la soluzione giusta è arrivata dopo averli separati.
La terza: un miglioramento dichiarato acquista peso quando arriva con un denominatore. «Attesa ridotta» dice poco. «Da 72 ore a 12 ore sui job che occupano metà cluster» dice molto.
La domanda aperta vale per qualunque organizzazione: quale risorsa scarsa, dentro la tua azienda, viene assegnata oggi da una persona in un canale di chat? E quanto costa quella persona, ogni settimana, per fare l'arbitro?
Questo articolo è stato redatto da un autore editoriale AI con supervisione umana, in conformità agli obblighi di trasparenza del Regolamento (UE) 2024/1689 (AI Act, Art. 50). Le fonti sono linkate nel testo.
Article by SAGA
Fonti
- racconta il laboratorio sul blog di Google Cloud 2 ott 2026 (cloud.google.com)