Drei Umgebungen, sieben Modelle, eine Ausfallquote von 77 Prozent
Drei dynamische Finanzumgebungen, sieben führende Sprachmodelle, null Anweisungen zur Sabotage: 77 Prozent der Episoden eines Bankensturms enden im Zusammenbruch.
Die zweite Zahl steht neben der ersten und verstärkt sie. Bei der Schuldenverlängerung erreicht der Anteil gescheiterter Episoden 83 Prozent. Beide Werte beschreiben die Basiskondition, jene ohne Koordinationsmechanismen.
Die Quelle ist das Paper Financial Fragility in Societies of LLM Agents, eingereicht am 25. September 2026 von Zhenhao Fu, Ruipeng Xu und Qibing Ren (arXiv:2609.30940[1]). Das Dokument umfasst 25 Seiten, 6 Abbildungen und 12 Tabellen, und der Code bleibt öffentlich.
Der Befund betrifft das aggregierte Verhalten. Die Autoren zählen, wie viele Episoden kollabieren, mit welcher Abfolge von Entscheidungen und unter welchen Interaktionsregeln.
Wie FRAIL aufgebaut ist
FRAIL setzt die Agenten in drei Finanzstrukturen, in denen die Entscheidung eines Einzelnen die Bedingungen aller anderen verändert. Bankensturm, Schuldenverlängerung, Reward-Crowdfunding.
Der Abstand zu einem statischen Benchmark liegt genau hier. Ein Benchmark verlangt von einem Modell die Lösung einer festen Aufgabe; FRAIL bewegt den Boden unter den Füßen derer, die entscheiden.
Jeder Agent erhält einen legitimen Anreiz: das eigene Kapital verteidigen. Die vorzeitige Abhebung einer Einlage erweist sich als rational für den, der sie vornimmt, und als toxisch für die Bank. Das Experiment hält diesen Punkt in allen drei Umgebungen fest.
Die Replikation bleibt möglich, denn der Code begleitet das Paper und eine Kopie des Textes zirkuliert auf alphaXiv[2]. Die Einreichung steht vor der Begutachtung durch Fachkollegen, und das wiegt bei der Lesung der Zahlen.
Die individuelle Fähigkeit bleibt eine lokale Eigenschaft
Das zentrale Ergebnis kehrt eine verbreitete Annahme in Agenten-Investitionen um. Die Qualität des einzelnen Modells dient als Indikator für die Qualität des Systems.
Der Befund zeigt, dass dieser Indikator bricht. Sieben hochwertige Modelle, jedes fähig, über die eigene Bilanz zu urteilen, führen in drei von vier Fällen zum Kollaps, sobald sie interagieren.
Das Risiko wechselt den Ort. Es verlässt das Modell und tritt in die Interaktionsschicht ein, wo sich Entscheidungen summieren und gegenseitig verstärken. Damit verschiebt sich auch der Ort der Messung.
Ein Test an jeweils einem Agenten beschreibt eine lokale Eigenschaft. Die beobachtete Fragilität gehört hingegen dem Netz der Agenten, und sie lebt in den Beziehungen zwischen ihren Entscheidungen.
Drei Mechanismen, ein abwesender Sieger
Die Autoren vergleichen drei Weisen, die Interaktion zwischen den Agenten zu organisieren.
- Vergütete Zusagen: Wer bleibt, erhält eine Prämie.
- Zentralisierte Zusagevereinbarungen: Eine einzige Stelle sammelt und bindet.
- Von den Teilnehmern geführte Koalitionen.
Alle drei verbessern die aggregierten Ergebnisse. Die Rangfolge wechselt mit der Finanzstruktur: Der in einer Umgebung beste Mechanismus verliert in einer anderen den ersten Platz.
Das ist der unbequemste Teil des Papers. Wer eine für jeden Markt gültige Governance-Regel sucht, geht leer aus, denn die Wirksamkeit hängt von der Form des zugrunde liegenden Vertrags ab.
Für einen Investitionsausschuss wird die Botschaft buchhalterisch. Das Design der Interaktion zählt als eigener Kostenposten, mit einer Kalibrierung je Produktklasse und je Liquiditätshorizont.
Die umsichtige Lesung berücksichtigt die Zahl der Umgebungen. Drei Finanzstrukturen decken einen Teil des Feldes ab, und die Verallgemeinerung auf andere Verträge bleibt zu messen.
Die Zeit zählt vor der Regel
Das zweite Ergebnis betrifft die zeitliche Abfolge.
In den stabilisierten Durchläufen bildet sich die breite Zusage früh, bevor defensives Verhalten sich selbst verstärkt. Jenseits dieser Schwelle verlieren die Mechanismen ihren Griff.
Die Abhebung weniger Agenten macht die Abhebung der übrigen rational. Die Spirale verläuft mit der Logik, die die Bankentheorie seit 1983 beschreibt, und das Paper findet sie in einem Softwaresystem wieder.
Die Autoren berichten dieses Muster als gemeinsamen Zug aller drei Mechanismen. Derselbe Eingriff, spät angewandt, zählt weniger als derselbe Eingriff mit einigen Runden Vorlauf.
Die Folge betrifft die Telemetrie. Ein System, das die Fragilität nach dem Kollaps erfasst, liefert eine posthume Diagnose, nützlich für das Protokoll und wirkungslos für das Ergebnis.
Ein Gleichgewicht von 1983 in einem Softwaresystem
Das Modell von Diamond und Dybvig aus dem Jahr 1983 beschreibt den Bankensturm als selbsterfüllendes Gleichgewicht (Journal of Political Economy[3]). Die allen versprochene Liquidität gilt für wenige, und die Eile wird für jeden Einzelnen zur besten Wahl.
Die LLM-Agenten fallen aus eigenem Antrieb in dieses Gleichgewicht.
Der Prompt verlangt von ihnen, das Kapital zu verteidigen, und die aggregierte Dynamik entsteht als Nebeneffekt. Der interessante Punkt liegt in der Übertragung: Ein Ergebnis der Wirtschaftstheorie erscheint wieder als empirische Eigenschaft von Softwaresystemen, gemessen an gezählten Episoden.
Das macht das Paper über sein Feld hinaus nützlich. Die dokumentierte Fragilität gehört zur Klasse der Koordinationsprobleme, und diese Klasse hat eine lange Literatur und bereits gefestigte Zahlen.
Die Grenzen des experimentellen Rahmens
Das Experiment ist kontrolliert.
Die Umgebungen sind Simulationen, die Parameter kommen von den Forschern, und die Zählung der Episoden bleibt jene, die in den 12 Tabellen des Dokuments steht. Der Sprung zu einem realen Markt liegt außerhalb der erhobenen Evidenz.
Ein Zahlungssystem oder ein Trading-Orderbuch führt Nebenbedingungen, Latenzen und Autoritäten ein, die die Simulation beiseitelässt. Die Autoren bleiben innerhalb des erklärten Rahmens, und die korrekte Lesung tut dasselbe.
Es gilt auch die Vorsicht beim redaktionellen Status, denn der Text ist eine Einreichung vom September 2026. Diese Vorsicht lässt den Kern des Ergebnisses unberührt: Die Ausfallquote betrifft sieben verschiedene Modelle, und die Konvergenz zwischen den Anbietern erschwert die Zuschreibung des Effekts an eine einzelne Architektur.
Wohin sich die Kapitalallokation verschiebt
Für einen Investitionsausschuss betrifft die zu revidierende These den besten einzelnen Agenten. Der Befund verschiebt den Grenzwert vom Modell auf das Protokoll, das mehrere Modelle gemeinsam steuert.
Für eine Analytics-Leitung wird die Systemtelemetrie zur Anforderung. Es braucht Register der kollektiven Zustände, mit Zeitstempel je Runde, denn das nützliche Signal lebt in den ersten Schritten der Episode.
Für einen Aufsichtsrat bleibt eine buchhalterische Frage: Welcher Teil des KI-Budgets finanziert die Fähigkeit des Modells, und welcher Teil finanziert die Koordination zwischen Modellen?
Die Diagnose endet hier. Das Paper misst die kollektive Fragilität an drei Strukturen, sieben Modellen und einer dokumentierten Basiskondition, und lässt die Brücke zu den echten Märkten offen.
Dieser Artikel wurde von einem redaktionellen KI-Autor unter menschlicher Aufsicht erstellt, in Übereinstimmung mit den Transparenzpflichten der Verordnung (EU) 2024/1689 (KI-Verordnung, Art. 50). Die Quellen sind im Text verlinkt.
Article by MIRA
Quellen
- arXiv:2609.30940 29 Sep 2026 (arxiv.org)
- alphaXiv (alphaxiv.org)
- Journal of Political Economy (doi.org)