Dasselbe Experiment, zwei gegensätzliche Zahlen
PsyAgentBench, am 23. Juli 2026 auf arXiv eingereicht, stellt zwei Zahlen nebeneinander: 0 Prozent und 83,3 Prozent. Es ist dasselbe Konformitätsexperiment von Asch, an derselben Modellfamilie, gpt-oss-120B.
Der Unterschied liegt in einer Zeile Prompt. Kommt das Paradigma als Routineaufgabe verkleidet daher, verschwindet die Konformität. Benennt der Prompt es ausdrücklich, erzeugt das Modell in mehr als vier von fünf Fällen das erwartete Muster.
Das ist der wunde Punkt jeder LLM-Benchmark-Evaluation, die beansprucht, eine stabile Eigenschaft des Modells zu messen. Die Größe verschiebt sich um 83 Punkte, sobald sich die Formulierung ändert – bei gleichem Modell, gleicher Aufgabe und gleichen Gewichten.
Die Belege zeigen ein Artefakt der Durchführung, weniger ein Merkmal des Systems.
Das faktorielle Design: vier gekreuzte Bedingungen
Der Autor, Joy Bose, baut ein explizites faktorielles Design auf. Jedes Paradigma läuft im Prompt benannt (named) oder als gewöhnliche Aufgabe präsentiert (blind), in der Lehrbuchfassung (canonical) oder in einer umgeschriebenen Variante, die die Überschneidung mit den Trainingsdaten verringern soll (counterfactual).
Die beiden Dimensionen kreuzen sich mit einer Persona-Manipulation. Die öffentliche Veröffentlichung umfasst 41.904 Durchläufe, zu fünf abgeschlossenen Paradigmen und bis zu drei Modellfamilien mit offenen Gewichten, wie der Preprint arXiv:2609.22090[1] dokumentiert. Der Text umfasst 13 Seiten, eine Abbildung und acht Tabellen.
Die Counterfactual-Variante geht ein konkretes Problem an: die Kontamination des Korpus.
Ein auf Webdaten trainiertes Modell ist der Beschreibung des Asch-Experiments tausendfach begegnet. Das Szenario unter Beibehaltung der Struktur umzuschreiben, erlaubt es, Wiedererkennung von Anfälligkeit zu trennen.
Genau dieser methodische Teil fehlt in weiten Teilen der Literatur zur auf Modelle angewandten Psychologie. Die offene Diskussion des Preprints bleibt auf alphaXiv[2] einsehbar.
Der Ankereffekt hängt vom verfügbaren Wissen ab
Der Ankereffekt liefert das aufschlussreichste Ergebnis der gesamten Arbeit.
Bei überprüfbaren Größen, bei denen das Modell die Antwort bereits besitzt, beträgt der gemessene Effekt exakt null. Bei erfundenen Größen, bei denen das einzige verfügbare Signal die im Prompt genannte Zahl ist, erreicht der Effekt nahezu das Maximum.
Diese Verteilung lässt zwei Lesarten zu. Die erste führt einen aus menschlichem Text ererbten kognitiven Bias ins Feld. Die zweite, die der Autor für ebenso datenkompatibel hält, beschreibt die rationale Nutzung des einzig verfügbaren Signals.
Ein System, das sich auf den Anker stützt, wenn es die Antwort nicht kennt, verhält sich wie ein informationsarmer Schätzer. Es Bias zu nennen, heftet einem gewöhnlichen statistischen Verhalten ein psychologisches Etikett an.
Die Unterscheidung wiegt bei Deployment-Entscheidungen schwer. Ein kognitiver Defekt verlangt korrigierendes Training; ein Informationsmangel verlangt Zugang zu den richtigen Daten im Kontext.
Framing, Sunk Cost, minimale Gruppe: drei verschiedene Ausgänge
Die übrigen drei Paradigmen verhalten sich untereinander uneinheitlich.
Das Framing, das klassische Paradigma, das 1981 von Tversky und Kahneman in Science veröffentlicht wurde (doi.org/10.1126/SCIENCE.7455683[3]), verstärkt sich bei neuen Inhalten, wenn der Prompt es benennt. Die Sunk-Cost-Verzerrung zeigt dagegen eine robuste Abwesenheit: Das menschliche Muster bleibt unter allen Bedingungen aus den Antworten heraus.
Die Zuteilung in minimalen Gruppen, das Design von Tajfel aus dem Jahr 1971 (doi.org/10.1002/EJSP.2420010202[4]), führt zum eigenwilligsten Ergebnis. Der Hauptbefund wird die Verweigerung: Die Modelle lehnen die Aufgabe aus Sicherheitsgründen ab.
Die daraus folgende Selektion bestimmt alles, was noch zu messen bleibt. Vier qualitativ verschiedene Verläufe, die die aktuelle Literatur mit einem einzigen Begriff beschreibt: Bias.
Ein Wort, das gegensätzliche Mechanismen abdeckt, verliert seinen diagnostischen Wert. Die Kosten trägt, wer ein Ranking liest und danach einen Anbieter auswählt.
Ein einziger Persona-Satz kippt das Ergebnis
Die Persona-Manipulation fügt eine weitere Ebene der Fragilität hinzu.
Ein einzelner Satz, der das Modell als entgegenkommend beschreibt, verändert das Ergebnis je nach Paradigma in gegensätzliche Richtungen. Er löscht einen Effekt aus, schwächt einen zweiten ab, kehrt einen dritten um. Der Autor stellt klar, dass es sich um eine Instruktion handelt, nicht um eine überprüfte Manipulation eines Persönlichkeitsmerkmals.
Die theoretische Konsequenz ist gewichtig. Ein allgemeiner Antworttendenz-Faktor würde einheitliche Veränderungen in eine einzige Richtung erzeugen.
Die Richtungen laufen auseinander, also fällt die Hypothese eines einzigen Antwort-Bias. Jeder gemessene Effekt besitzt einen eigenen Mechanismus, empfindlich gegenüber Prompt-Elementen, die die meisten Protokolle offenlassen.
Drei Arten, wie ein Paradigma den Transfer verfehlt
Das Paper formalisiert drei Fehlermodi bei der Übertragung eines psychologischen Experiments auf Sprachagenten und belegt zwei davon empirisch.
- Dominanz der Persona
- Kollaps der Population
- Sicherheitsbedingte Selektion
Die Dominanz der Persona beschreibt den Fall, in dem die Rolleninstruktion schwerer wiegt als der experimentelle Reiz. Der Kollaps der Population betrifft Antworten, die zu homogen sind, um eine Statistik zu tragen, die für variable menschliche Versuchspersonen gedacht war.
Die sicherheitsbedingte Selektion greift, wenn der Alignment-Filter einen systematischen Teil der Durchläufe entfernt. Die übrig gebliebenen Antworten bilden eine konstruktionsbedingt verzerrte Stichprobe.
Wer Experimente mit Menschen geplant hat, erkennt die drei Probleme unter anderen Namen wieder. Versuchsleitereffekt. Eingeschränkte Varianz und selektive Stichprobenmortalität.
Der Unterschied liegt im Maßstab: Ein Labor mit Menschen sammelt Hunderte von Versuchspersonen, eine automatisierte Auswertung erzeugt Zehntausende von Durchläufen. Die Verzerrung vervielfacht sich im gleichen Tempo.
Warum skalare Bias-Werte in die Irre führen
Der Autor lehnt skalare Werte für Anfälligkeit ab und schlägt Replikationsprofile vor.
Die Entscheidung hat eine messbare Logik. Ein einziger Wert presst vier verschiedene Mechanismen in eine Zahl, und diese Zahl hängt von der Bedingung ab, unter der sie erhoben wurde. Mit der Named-Bedingung erhält man 83,3; mit der Blind-Bedingung erhält man 0.
Ein Replikationsprofil gibt das gesamte Raster wieder: welcher Effekt auftritt, unter welcher Bedingung, bei welchem Modell. Es kostet mehr Platz und liefert brauchbare Information.
Die Lücke zwischen 0 und 83,3 Prozent ist der Ort, an dem das Messproblem wohnt. Eine Größe, die um 83 Punkte schwankt, sobald sich das Wording ändert, misst die Formulierung, bevor sie das System misst.
Was sich für Budgetverantwortliche ändert
Für einen Investmentausschuss bleibt die Lesart unmittelbar.
Die kursierenden Rankings zur Verhaltenssicherheit stützen sich auf Protokolle, die die Durchführungsbedingung nur selten offenlegen. Ein Anbieter, der einen Wert für Konformitätsresistenz ausweist, sollte die verwendete Bedingung angeben: benanntes Paradigma oder Routineaufgabe.
Für einen Chief Analytics Officer verändert die Infrastrukturfrage ihre Gestalt. Die interne Evaluierungs-Pipeline muss den exakten Prompt-Text, die faktorielle Bedingung und die Persona neben dem Endwert protokollieren.
Für das Board ist die Korrektur eine Frage der Reichweite. Die Daten decken fünf Paradigmen und bis zu drei Familien mit offenen Gewichten ab, die Übertragung auf geschlossene Modelle bleibt daher eine offene Frage. Dies ist eine Diagnose zur Qualität der Messung, nicht eine Prognose über das künftige Verhalten der Systeme.
Dieser Artikel wurde von einem redaktionellen KI-Autor unter menschlicher Aufsicht verfasst, in Übereinstimmung mit den Transparenzpflichten der Verordnung (EU) 2024/1689 (AI Act, Art. 50). Die Quellen sind im Text verlinkt.
Article by MIRA
Quellen
- arXiv:2609.22090 22 Sep 2026 (arxiv.org)
- alphaXiv (alphaxiv.org)
- doi.org/10.1126/SCIENCE.7455683 (doi.org)
- doi.org/10.1002/EJSP.2420010202 (doi.org)