Lo stesso esperimento, due numeri opposti
PsyAgentBench, depositato su arXiv il 23 luglio 2026, mette due numeri uno accanto all'altro: 0 percento e 83,3 percento. È lo stesso esperimento di conformità di Asch, sulla stessa famiglia di modelli, gpt-oss-120B.
La differenza sta in una riga di prompt. Quando il paradigma arriva travestito da compito di routine, la conformità sparisce. Quando il prompt lo nomina esplicitamente, il modello produce il pattern atteso in oltre quattro casi su cinque.
Questo è il punto dolente di qualunque LLM benchmark evaluation che pretenda di misurare una proprietà stabile del modello. La grandezza cambia di 83 punti al variare della formulazione, a parità di modello, compito e pesi.
L'evidenza mostra un artefatto della somministrazione, più che un tratto del sistema.
Il disegno fattoriale: quattro condizioni incrociate
L'autore, Joy Bose, costruisce un disegno fattoriale esplicito. Ogni paradigma gira etichettato nel prompt (named) oppure presentato come compito ordinario (blind), nella versione da manuale (canonical) oppure in una variante riscritta per ridurre la sovrapposizione con i dati di addestramento (counterfactual).
Le due dimensioni si incrociano con una manipolazione di persona. Il rilascio pubblico conta 41.904 prove, su cinque paradigmi completati e fino a tre famiglie di modelli a pesi aperti, come documenta il preprint arXiv:2609.22090[1]. Il testo occupa 13 pagine, una figura e otto tabelle.
La variante counterfactual affronta un problema preciso: la contaminazione del corpus.
Un modello addestrato sul web ha incontrato la descrizione dell'esperimento di Asch migliaia di volte. Riscrivere lo scenario conservando la struttura permette di separare il riconoscimento dalla suscettibilità.
È la parte metodologica che manca in gran parte della letteratura di psicologia applicata ai modelli. La discussione aperta del preprint resta consultabile su alphaXiv[2].
L'ancoraggio dipende dalla conoscenza disponibile
L'ancoraggio restituisce il risultato più istruttivo dell'intero lavoro.
Su quantità verificabili, dove il modello possiede già la risposta, l'effetto misurato vale esattamente zero. Su quantità inventate, dove l'unico segnale disponibile è il numero scritto nel prompt, l'effetto arriva quasi al massimo.
Questa distribuzione ammette due letture. La prima chiama in causa un bias cognitivo ereditato dal testo umano. La seconda, che l'autore giudica altrettanto compatibile con i dati, descrive l'uso razionale dell'unico segnale a disposizione.
Un sistema che si appoggia all'ancora quando ignora la risposta si comporta come uno stimatore povero di informazione. Chiamarlo bias aggiunge una etichetta psicologica a un comportamento statistico ordinario.
La distinzione pesa sulle decisioni di deployment. Un difetto cognitivo richiede addestramento correttivo; una carenza di informazione richiede accesso ai dati giusti nel contesto.
Framing, sunk cost, gruppo minimo: tre esiti diversi
Gli altri tre paradigmi si comportano in modo divergente tra loro.
Il framing, il paradigma classico pubblicato su Science nel 1981 da Tversky e Kahneman (doi.org/10.1126/SCIENCE.7455683[3]), si amplifica sui contenuti nuovi quando il prompt lo etichetta. Il sunk cost mostra invece un'assenza robusta: il pattern umano resta fuori dalle risposte in tutte le condizioni.
L'allocazione a gruppi minimi, il disegno di Tajfel del 1971 (doi.org/10.1002/EJSP.2420010202[4]), produce l'esito più singolare. Il dato principale diventa il rifiuto: i modelli declinano il compito per ragioni di sicurezza.
La selezione che ne deriva governa tutto ciò che resta da misurare. Quattro percorsi qualitativamente diversi, descritti nella letteratura corrente con un unico termine: bias.
Una parola che copre meccanismi opposti perde valore diagnostico. Il costo ricade su chi legge una classifica e la usa per scegliere un fornitore.
Una frase di persona ribalta il risultato
La manipolazione di persona aggiunge un ulteriore livello di fragilità.
Una singola frase che descrive il modello come accomodante cambia l'esito in direzioni opposte a seconda del paradigma. Cancella un effetto, ne attenua un secondo, ne inverte un terzo. L'autore precisa che si tratta di una istruzione, distinta da una manipolazione di tratto verificata.
La conseguenza teorica è forte. Un fattore di risposta generico produrrebbe variazioni coerenti in un'unica direzione.
Le direzioni divergono, quindi l'ipotesi del bias di risposta unico cade. Ogni effetto misurato possiede un meccanismo proprio, sensibile a elementi del prompt che gran parte dei protocolli lascia liberi.
Tre modi in cui un paradigma fallisce il trasferimento
Il paper formalizza tre modalità di fallimento nel portare un esperimento psicologico sugli agenti linguistici, e ne documenta due empiricamente.
- Dominanza della persona
- Collasso di popolazione
- Selezione di sicurezza
La dominanza della persona descrive il caso in cui l'istruzione di ruolo pesa più dello stimolo sperimentale. Il collasso di popolazione riguarda risposte troppo omogenee per sostenere una statistica pensata su soggetti umani variabili.
La selezione di sicurezza agisce quando il filtro di allineamento rimuove una parte sistematica delle prove. Le risposte sopravvissute formano un campione distorto per costruzione.
Chi ha progettato esperimenti con esseri umani riconosce i tre problemi sotto altri nomi. Effetto sperimentatore. Varianza ristretta e mortalità selettiva del campione.
La differenza sta nella scala: un laboratorio umano raccoglie centinaia di soggetti, una valutazione automatica genera decine di migliaia di prove. La distorsione si moltiplica alla stessa velocità.
Perché i punteggi scalari di bias ingannano
L'autore rifiuta i punteggi scalari di suscettibilità e propone profili di replicazione.
La scelta ha una logica misurabile. Un punteggio unico comprime quattro meccanismi distinti in un numero, e quel numero dipende dalla condizione scelta per raccoglierlo. Con la condizione named si ottiene 83,3; con la condizione blind si ottiene 0.
Un profilo di replicazione riporta la griglia intera: quale effetto compare, in quale condizione, su quale modello. Costa più spazio e restituisce informazione usabile.
Il divario tra 0 e 83,3 percento è il luogo dove vive il problema della misura. Una grandezza che oscilla di 83 punti al cambiare del wording misura la formulazione, prima del sistema.
Cosa cambia per chi alloca budget
Per un comitato investimenti la lettura resta diretta.
Le classifiche di sicurezza comportamentale in circolazione poggiano su protocolli che dichiarano raramente la condizione di somministrazione. Un fornitore che espone un punteggio di resistenza alla conformità dovrebbe dichiarare la condizione usata: paradigma nominato oppure compito di routine.
Per un chief analytics officer la domanda infrastrutturale cambia forma. La pipeline interna di valutazione deve registrare il testo esatto del prompt, la condizione fattoriale e la persona, accanto al punteggio finale.
Per il board la correzione è di portata. I dati coprono cinque paradigmi e fino a tre famiglie a pesi aperti, quindi l'estensione ai modelli chiusi resta una domanda aperta. Questa è una diagnosi sulla qualità della misura, distinta da una previsione sul comportamento futuro dei sistemi.
Questo articolo è stato redatto da un autore editoriale AI con supervisione umana, in conformità agli obblighi di trasparenza del Regolamento (UE) 2024/1689 (AI Act, Art. 50). Le fonti sono linkate nel testo.
Article by MIRA
Fonti
- arXiv:2609.22090 22 set 2026 (arxiv.org)
- alphaXiv (alphaxiv.org)
- doi.org/10.1126/SCIENCE.7455683 (doi.org)
- doi.org/10.1002/EJSP.2420010202 (doi.org)