Ein Cosinus von 0,996, der unlesbar bleibt
Ein am 12. August 2026 auf arXiv eingereichtes Paper misst jene Größe, die die KI-Interpretability-Forschung auslässt, wenn sie die Belastbarkeit eines Artefakts unter Quantisierung zertifiziert. Diese Größe ist das Grundrauschen des Schätzers.
Die untersuchte Praxis ist weit verbreitet. Eine interpretierbare Richtung wird auf den Gewichten in voller Präzision kalibriert und dann auf die quantisierten Gewichte übertragen. Die Übereinstimmung der beiden Versionen wird mit skaleninvarianten Statistiken zertifiziert: Cosine Similarity, Korrelation, AUROC.
Die Arbeit stammt von Pranav Varshney. Ein Cosinus von 0,996 zwischen der Refusal-Richtung in voller Präzision und der quantisierten Richtung bleibt unlesbar, solange der Wert von n fehlt, bei dem er berechnet wurde (arXiv:2609.30275[1]). Dieser Wert fehlt in der ursprünglichen Publikation.
Der Haupttext umfasst fünf Seiten, mit einer Abbildung und drei Tabellen.
κ = nρ²/d: die fehlende Größe
Für den Difference-in-Means-Schätzer hängt der Split-Half-Boden von einer einzigen dimensionslosen Größe ab: κ = nρ²/d. Es sind drei Bestandteile.
- n: der Umfang der Stichprobe, mit der die Richtung geschätzt wird
- ρ: die auf den Aktivierungen gemessene Klassentrennung
- d: die Dimension des Aktivierungsraums
Die geschlossene Form E[cos] ≈ (1+4/κ)⁻¹ gehört zur klassischen Statistik. Der fehlende Bestandteil ist ρ, und der verlangt eine Messung an den echten Aktivierungen.
Der Autor erklärt, keine einzige Transferstudie unter Kompression zu kennen, die diesen Wert berichtet.
Das Ergebnis ist ein κ, für dessen Berechnung dem Leser die Mittel fehlen. Bei unbekanntem κ bleibt auch die erwartete Übereinstimmung zwischen zwei unabhängigen Durchläufen desselben Schätzers unbekannt. Ein hoher Cosinus wird damit sowohl mit der Erhaltung der Richtung als auch mit dem puren Zufall der Stichprobenziehung vereinbar.
Die veröffentlichte Zahl sieht weiterhin wie ein Beweis aus, und ihre Beweisfunktion ist längst verschwunden.
ρ von 33 bis 61 über die Netztiefe
Beim Modell Qwen2.5-1.5B-Instruct reicht die über die Tiefe gemessene Klassentrennung von 33 bis 61.
Mit diesen Werten stimmen zwei unabhängige Durchläufe desselben Schätzers allein aufgrund der Stichprobenziehung zwischen 0,978 und 0,994 überein, bei ansonsten identischen Bedingungen. Die Gewichte bleiben unverändert: im Spiel ist die intrinsische Variabilität der Schätzung.
Der Raum zwischen 0,994 und 0,996 ist der Ort, an dem der gesamte Beweisanspruch der gegenwärtigen Praxis wohnt. Zwei Tausendstel.
Die Richtung der Messung zählt. Eine hohe Klassentrennung macht den Schätzer sehr stabil, und ein stabiler Schätzer erzeugt Cosinuswerte nahe 1 auch dann, wenn er zwei Zufallsstichproben desselben Phänomens vergleicht. Die Stabilität des Instruments wird als Stabilität des gemessenen Objekts gelesen.
Das Paper reist mit Code, Daten und einer Reproduktion in einer einzigen Zelle; seine offene Diskussionsseite findet sich auf alphaXiv[2].
Das Null muss im quantisierten Modell gemessen werden
Wo n bekannt ist, bewertet das Paper jeden Cosinus bei niedriger Präzision gegen das Split-Half-Null, das innerhalb dieses quantisierten Modells gemessen wurde.
Die Begründung ist methodisch. Ein in voller Präzision berechnetes Null nimmt an, dass der Schätzer bei niedriger Präzision dieselbe Varianz hat – und genau diese Annahme ist es, die ein Null auf den Prüfstand stellen soll.
Wer das falsche Null verwendet, erhält einen Test, der die Ausgangshypothese bestätigt. Die Quantisierung senkt die numerische Präzision der Aktivierungen, und eine geringere Präzision erhöht das Rauschen der Schätzung. Ein am falschen Modell kalibrierter Boden landet zu tief, und jedes beobachtete Defizit erscheint signifikant.
Diese Redaktion findet hier die interessanteste Anomalie der Arbeit: die Korrektur verlangt eine Messung innerhalb des bereits komprimierten Artefakts, also einen Schritt, den die Literatur aus Gewohnheit überspringt. Die Wahl der Referenz entscheidet das Ergebnis, noch vor den Daten.
INT4 dreht, INT8 bleibt ununterscheidbar
Mit dem korrekten Null trennen sich die beiden Quantisierungsregime. Bei INT4 dreht die Richtung, und das Defizit übersteigt das Eigenrauschen des Schätzers.
Bei INT8 stellt die Arbeit keinerlei Bewegung fest. Der Autor betont, dass das Fehlen festgestellter Bewegung sich von einer Äquivalenzaussage unterscheidet.
Die Unterscheidung wiegt schwer. Ein Test ohne ausreichende Teststärke liefert dasselbe Ergebnis wie ein Test, der Erhaltung beobachtet, und die beiden Ergebnisse haben entgegengesetzte Implikationen für alle, die über ein Deployment entscheiden. Sie zu verwechseln bedeutet, die Grenze des Instruments als Eigenschaft des Modells zu lesen.
Der Kontext macht das Resultat greifbar. LLM.int8() (arXiv:2208.07339[3], 2022) hat die 8-Bit-Matrixmultiplikation für Transformer großer Skala in die Produktion gebracht, und der Schritt zu 4 Bit ist heute die wirtschaftliche Wahl, um Modelle auf begrenzter Hardware auszuliefern.
Verschiebung und Abschwächung verlangen entgegengesetzte Abhilfen
Eine skaleninvariante Statistik ignoriert die Skala schon konstruktionsbedingt.
Das Paper zeigt, dass eine solche Maßzahl die Verschiebung mit der Abschwächung einer übertragenen Entscheidungsvariablen verwechselt. Die beiden Pathologien verlangen entgegengesetzte Eingriffe: die erste wird am Achsenabschnitt korrigiert, die zweite an der Verstärkung.
Die praktische Konsequenz betrifft Refusal-Systeme. Eine verschobene Richtung trennt die Fälle weiterhin in gleicher Qualität, und es genügt, die Schwelle nachzukalibrieren. Eine abgeschwächte Richtung hat Spielraum verloren, und die nachkalibrierte Schwelle verlagert das Problem von den falsch Negativen zu den falsch Positiven.
Ein identischer Cosinus deckt beide Szenarien. Die Wahl der Abhilfe wird damit zu einer Wette im Gewand einer Diagnose.
Die Arbeit schließt mit Reporting-Empfehlungen, deren angegebene Kosten ein einzelner Forward Pass sind: n berichten, ρ berichten, den im Zielmodell gemessenen Boden berichten.
Ein Jahrhundert zwischen dem Theorem und seiner Anwendung
Die Korrektur für Abschwächung hat eine genaue Urheberschaft. Der Klassiker von Charles Spearman über die Messung der Assoziation zwischen zwei Dingen, von 1904 und im International Journal of Epidemiology neu veröffentlicht (doi:10.1093/ije/dyq191[4]), zeigt, dass die Reliabilität eines Instruments der beobachtbaren Korrelation eine Obergrenze setzt.
Aus dieser Obergrenze folgt die Split-Half-Logik: man misst die Übereinstimmung des Instruments mit einer eigenen Replik, und dieser Wert wird zur Referenz für jede weitere Korrelation. Die Psychometrie wendet die Regel seit Generationen an.
Das Feld der Interpretability hat die Statistik übernommen und die Korrektur zurückgelassen. Der plausible Grund liegt bei den Anreizen: ein hoher, ohne Boden veröffentlichter Cosinus stützt eine Sicherheitsthese, während derselbe Cosinus mit Boden sie relativiert. Die Evidenz zeigt, dass der Boden, wo er gemessen wird, bis auf 0,994 reicht.
Eine Zahl, die die Tabellen der Branche jahrelang ausgelassen haben.
Was sich für die Verteilung von F&E-Budgets ändert
Für ein Investmentkomitee betrifft die Konsequenz die Qualität der Belege, nie das Tempo der Ausgaben. Eine Safety-Pipeline, die ihre eigenen Artefakte mit bodenlosen Statistiken zertifiziert, erzeugt Dokumentation, und die Dokumentation wird anschließend als Verifikation gelesen.
Für die Analytics-Verantwortlichen ist die infrastrukturelle Anforderung überschaubar und präzise: die Aktivierungen und die Anzahl der Stichproben aufbewahren, mit denen jede Richtung geschätzt wurde, und zwar innerhalb des Modells, das in Produktion geht.
Für einen Vorstand ist die zu revidierende These jene, die Quantisierung als einen Schritt behandelt, der gegenüber dem Modellverhalten neutral bleibt. Bei 4 Bit zeigt die Evidenz eine gemessene Drehung. Bei 8 Bit zeigt sie das Schweigen der heutigen Instrumente, und das ist etwas anderes.
Der Geltungsbereich des Resultats bleibt der vom Autor erklärte: ein Modell mit 1,5 Milliarden Parametern, ein Schätzer, zwei Bit-Regime. Die Schlussfolgerung auf andere Architekturen auszuweiten verlangt dieselbe Messung, wiederholt.
Dieser Artikel wurde von einem redaktionellen KI-Autor unter menschlicher Aufsicht erstellt, im Einklang mit den Transparenzpflichten der Verordnung (EU) 2024/1689 (KI-Verordnung, Art. 50). Die Quellen sind im Text verlinkt.
Article by MIRA
Quellen
- arXiv:2609.30275 29 Sep 2026 (arxiv.org)
- alphaXiv (alphaxiv.org)
- arXiv:2208.07339 (doi.org)
- doi:10.1093/ije/dyq191 (doi.org)