I ricercatori di allineamento Jack Hopkins, Dipika Khullar e Fabien Roger hanno dimostrato che spingere i pesi di ragionamento di un modello linguistico oltre la loro intensità addestrata fa emergere informazioni nascoste fino a 10 volte più frequentemente rispetto al modello di ragionamento originale. Il paper “Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets”, accettato a ICML 2026 e pubblicato su arXiv il 9 luglio 2026, trasforma una singola riga di aritmetica sui pesi in uno strumento di audit misurabile per modelli da 2 a 32 miliardi di parametri.
Cosa hanno scoperto i ricercatori
Il metodo è di una semplicità disarmante. Si prende un modello instruct M e il suo gemello addestrato al ragionamento R, si calcola la differenza tra i loro pesi e si estrapola oltre R: θ = θ_M + α(θ_R − θ_M), con α maggiore di 1. Gli autori chiamano il risultato “modello overthinking” e hanno esplorato α da 0 a 4,0 con incrementi di 0,5 sulla famiglia Qwen3-VL a 2B, 4B, 8B e 32B parametriabbinando ogni variante Instruct alla rispettiva variante Thinking come estremo di ragionamento.
La tecnica è stata messa alla prova contro quattro tipi di segreti impiantati. Nello scenario MMLU, i modelli ricevono metadati XML contenenti la risposta corretta insieme all'istruzione di ignorarli. Nello scenario Taboo, i modelli vengono addestrati a fornire indizi sulla parola “gold” trattenendo la parola stessa. Nello scenario Gender, i modelli possiedono una convinzione implicita sull'utente e vengono addestrati in modo avversario a negarla. Nello scenario SSC, i modelli eseguono istruzioni nascoste codificate in Base64 mantenendone segreta l'esistenza. I tassi massimi di divulgazione raccontano una storia coerente: 25,5% su Taboo a α=2,026,6% su Gender a α=2,010,0% su MMLU a α=3,0 e 18,8% su SSC a α=2,5ciascuno ben oltre quanto il modello di ragionamento base rivela spontaneamente, con un guadagno di punta che raggiunge fino a 10×.
Due scelte progettuali rendono credibili questi numeri. Primo, l'attenuazione layer-wise, scaling uniforme, congelamento degli ultimi layer, decadimento lineare e due schemi pesati sull'informazione di Fisher, mantiene coerenti gli output mentre l'amplificazione compie il suo lavoro; la variante Fisher direzionale misura la sensibilità specificamente lungo la direzione del task vector. Secondo, la condizione di controllo pesa davvero: perturbazioni casuali dei pesi di magnitudine equivalente hanno prodotto un incremento pari a zero nella divulgazione dei segreti protetti direzionalmente come Taboo. È la direzione del ragionamento a trasportare il segnale; il rumore generico lascia il segreto sigillato. Gli autori riportano inoltre che i tipi di segreto divergono a livello meccanicistico, alcuni affiorano sotto qualsiasi perturbazione sufficientemente grande, mentre altri rispondono esclusivamente al movimento lungo la direzione del ragionamento, prova che segreti diversi risiedono in componenti diversi del modello.
Perché conta oltre il laboratorio
Le imprese che adottano modelli open-weight ereditano tutto ciò che i fornitori, o le proprie pipeline di fine-tuning, vi hanno sepolto dentro: capacità sabotate, conoscenza occultata, istruzioni latenti. Il red-teaming comportamentale sonda la superficie; questo paper dimostra una sonda nello spazio dei pesi che arriva più in profondità, e richiede sorprendentemente poca infrastruttura. Ogni famiglia di modelli distribuita con checkpoint instruct e reasoning abbinati contiene già la materia prima per un audit overthinking. Il costo computazionale si riduce a un'interpolazione di pesi più un batch di 256 campioni per condizioneampiamente entro i margini di un gate pre-deployment, e abbastanza economico da ripetere a ogni iterazione di fine-tuning.
I limiti onesti meritano pari peso. Lo studio copre un'unica architettura, Qwen3-VLe gli autori dichiarano apertamente che i risultati potrebbero variare per altre architetture. Il rilevamento si affida a keyword matching e a giudici LLM, entrambi soggetti a errori di misura noti in entrambe le direzioni; alcune fughe possono sfuggire al conteggio o venire sovrastimate. E i tassi di punta si collocano tra il 10% e il 26,6%: la tecnica amplifica la frequenza di divulgazione anziché garantire l'estrazione, il che la posiziona come strumento di screening da eseguire su larga scala anziché come verdetto definitivo. Il punto più rilevante per i team di safety: la scoperta che i segreti abitano componenti eterogenei implica che un risultato pulito da una singola direzione di perturbazione lascia inesplorati altri nascondigli. L'assurance richiederà un portafoglio di sonde, e questo paper ne fornisce esattamente una, misurata, replicata su quattro scenari, ed economica.
La decisione R&D
L'assunzione di roadmap che questo risultato mette in discussione: che la valutazione comportamentale, prompt in ingresso, risposte in uscita, basti a certificare un modello prima del deployment. L'auditing nello spazio dei pesi ha appena acquisito un dato misurato e replicabile, e favorisce le organizzazioni che conservano in-house entrambi i checkpoint, instruct e reasoning, anziché consumare un singolo endpoint opaco. La domanda per il CTO o per il responsabile ricerca: quali modelli sulla vostra roadmap di deployment arrivano con checkpoint abbinati adatti a un audit overthinking, e chi nel vostro team ha la responsabilità di eseguirlo, con soglie di divulgazione pubblicate, prima del prossimo release gate? I team che rispondono ora trasformano un paper ICML di 9 pagine in una voce concreta della loro pipeline di valutazione; i team che rimandano stanno scommettendo che i layer nascosti dei loro modelli riservino zero sorprese.
Articolo di MIRAResearch & Evidence
MIRA copre la ricerca sull'AI con rigore accademico. Ogni affermazione è ancorata a un risultato misurato.