Un cosine di 0,996 che resta illeggibile
Un paper depositato su arXiv il 12 agosto 2026 misura la quantità che la AI interpretability research omette quando certifica la tenuta di un artefatto sotto quantizzazione. Quella quantità è il rumore di fondo dello stimatore.
La pratica sotto esame è diffusa. Una direzione interpretabile viene calibrata sui pesi in piena precisione, poi trasferita sui pesi quantizzati. La coincidenza tra le due versioni viene certificata con statistiche invarianti di scala: cosine similarity, correlazione, AUROC.
Il lavoro è firmato da Pranav Varshney. Un cosine di 0,996 tra direzione di rifiuto in piena precisione e direzione quantizzata resta illeggibile finché manca il valore di n a cui è stato calcolato (arXiv:2609.30275[1]). Quel valore risulta assente dalla pubblicazione originale.
Il testo principale occupa cinque pagine, con una figura e tre tabelle.
κ = nρ²/d: la quantità che manca
Per lo stimatore difference-in-means, il pavimento split-half dipende da un unico numero adimensionale: κ = nρ²/d. Gli ingredienti sono tre.
- n: l'ampiezza del campione usato per stimare la direzione
- ρ: la separazione di classe misurata sulle attivazioni
- d: la dimensione dello spazio delle attivazioni
La forma chiusa E[cos] ≈ (1+4/κ)⁻¹ appartiene alla statistica classica. L'ingrediente che manca è ρ, che richiede una misura sulle attivazioni vere.
L'autore dichiara di conoscere zero studi di trasferimento sotto compressione che riportino quel valore.
Il risultato è un κ che il lettore resta privo dei mezzi per calcolare. Con κ ignoto, anche l'accordo atteso tra due run indipendenti dello stesso stimatore resta ignoto. Un cosine alto diventa quindi compatibile sia con la conservazione della direzione, sia con il puro caso del campionamento.
Il numero pubblicato continua a sembrare una prova, e la sua funzione probatoria è già svanita.
ρ da 33 a 61 lungo la profondità della rete
Sul modello Qwen2.5-1.5B-Instruct la separazione di classe misurata lungo la profondità va da 33 a 61.
Con quei valori, due run indipendenti dello stesso stimatore concordano tra 0,978 e 0,994 per effetto del campionamento, a parità di tutto il resto. I pesi restano identici: in gioco c'è la variabilità intrinseca della stima.
Lo spazio tra 0,994 e 0,996 è dove vive l'intera pretesa probatoria della pratica corrente. Due millesimi.
La direzione della misura conta. Una separazione di classe alta rende lo stimatore molto stabile, e uno stimatore stabile produce cosine vicini a 1 anche quando confronta due campioni casuali dello stesso fenomeno. La stabilità dello strumento viene letta come stabilità dell'oggetto misurato.
Il paper viaggia con codice, dati e una riproduzione in una singola cella; la sua pagina di discussione aperta si trova su alphaXiv[2].
Il null va misurato dentro il modello quantizzato
Dove n è noto, il paper giudica ogni cosine a bassa precisione contro il null split-half misurato dentro quel modello quantizzato.
La motivazione è metodologica. Un null calcolato in piena precisione assume che lo stimatore a bassa precisione abbia la stessa varianza, e quell'assunzione è esattamente ciò che un null esiste per mettere alla prova.
Chi adotta il null sbagliato ottiene un test che conferma l'ipotesi di partenza. La quantizzazione riduce la precisione numerica delle attivazioni, e una precisione ridotta alza il rumore della stima. Un pavimento tarato sul modello sbagliato finisce troppo in basso, e ogni deficit osservato sembra significativo.
Questa scrivania trova qui l'anomalia più interessante del lavoro: la correzione richiede una misura dentro l'artefatto già compresso, cioè un passaggio che la letteratura salta per abitudine. La scelta del riferimento decide l'esito prima dei dati.
INT4 ruota, INT8 resta indistinto
Con il null corretto i due regimi di quantizzazione si separano. A INT4 la direzione ruota, e il deficit supera il rumore proprio dello stimatore.
A INT8 il lavoro rileva zero movimento. L'autore precisa che l'assenza di movimento rilevato differisce da una dichiarazione di equivalenza.
La distinzione pesa. Un test privo di potere sufficiente produce lo stesso esito di un test che osserva conservazione, e i due esiti hanno implicazioni opposte per chi decide un deployment. Confonderli significa leggere il limite dello strumento come proprietà del modello.
Il contesto rende il risultato concreto. LLM.int8() (arXiv:2208.07339[3], 2022) ha portato la moltiplicazione di matrici a 8 bit dentro la produzione per i transformer di grande scala, e il passo verso i 4 bit è oggi la scelta economica per servire modelli su hardware limitato.
Traslazione e attenuazione chiedono rimedi opposti
Una statistica invariante di scala ignora la scala per costruzione.
Il paper mostra che una misura di questo tipo confonde la traslazione con l'attenuazione di una variabile di decisione trasferita. Le due patologie chiedono interventi opposti: la prima si corregge sull'intercetta, la seconda sul guadagno.
L'implicazione pratica riguarda i sistemi di rifiuto. Una direzione traslata continua a separare i casi con la stessa qualità, e basta ricalibrare la soglia. Una direzione attenuata ha perso margine, e la soglia ricalibrata sposta il problema dai falsi negativi ai falsi positivi.
Un cosine identico copre entrambi gli scenari. La scelta del rimedio diventa quindi una scommessa travestita da diagnosi.
Il lavoro chiude con raccomandazioni di reporting il cui costo dichiarato è una singola forward pass: riportare n, riportare ρ, riportare il pavimento misurato nel modello di arrivo.
Un secolo tra il teorema e la sua applicazione
La correzione per attenuazione ha una paternità precisa. Il classico di Charles Spearman sulla misura dell'associazione tra due cose, del 1904 e ripubblicato nell'International Journal of Epidemiology (doi:10.1093/ije/dyq191[4]), mostra che l'affidabilità di uno strumento pone un tetto alla correlazione osservabile.
Da quel tetto discende la logica split-half: si misura l'accordo dello strumento con una sua replica, e quel valore diventa il riferimento per ogni correlazione successiva. La psicometria applica la regola da generazioni.
Il campo dell'interpretabilità ha adottato la statistica e ha lasciato indietro la correzione. La ragione plausibile è di incentivi: un cosine alto pubblicato privo di pavimento sostiene una tesi di sicurezza, mentre lo stesso cosine con pavimento la ridimensiona. L'evidenza mostra che il pavimento, dove viene misurato, arriva a 0,994.
Un numero che le tabelle del settore hanno lasciato fuori per anni.
Cosa cambia per chi alloca il budget R&D
Per un comitato investimenti la conseguenza riguarda la qualità delle prove, mai il ritmo della spesa. Una pipeline di sicurezza che certifica i propri artefatti con statistiche prive di pavimento genera documentazione, e la documentazione viene poi letta come verifica.
Per chi guida l'analytics il requisito infrastrutturale è modesto e specifico: conservare le attivazioni e il conteggio dei campioni usati per stimare ogni direzione, dentro il modello che va in produzione.
Per un board la tesi da rivedere è quella che tratta la quantizzazione come un passaggio neutro rispetto al comportamento del modello. A 4 bit l'evidenza mostra una rotazione misurata. A 8 bit mostra il silenzio degli strumenti attuali, che è un'altra cosa.
Il perimetro del risultato resta quello dichiarato dall'autore: un modello da 1,5 miliardi di parametri, uno stimatore, due regimi di bit. Estendere la conclusione ad altre architetture richiede la stessa misura, ripetuta.
Questo articolo è stato redatto da un autore editoriale AI con supervisione umana, in conformità agli obblighi di trasparenza del Regolamento (UE) 2024/1689 (AI Act, Art. 50). Le fonti sono linkate nel testo.
Article by MIRA
Fonti
- arXiv:2609.30275 29 set 2026 (arxiv.org)
- alphaXiv (alphaxiv.org)
- arXiv:2208.07339 (doi.org)
- doi:10.1093/ije/dyq191 (doi.org)