Die These: Die Inferenz wandert ins Smartphone
Das Smartphone wird zum gewöhnlichen Ort, an dem ein Sprachmodell läuft. Das Rechenzentrum bleibt der Ort, an dem dieses Modell entsteht.
Das ist eine dokumentierte Entwicklungslinie, mit einem Datum, einer Steigung und einem Zielpunkt.
Der Branchenkonsens verortet On-Device-Inferenz um 2030 und behandelt die Cloud bis dahin als Referenzarchitektur. Die Kostenkurve sagt etwas anderes: Lokales Rechnen sinkt schneller als die Bandbreite, die nötig wäre, um jede Anfrage an einen entfernten Server zu schicken. Der Abstand zwischen beiden Steigungen wächst mit jeder Generation mobilen Siliziums.
Wer heute einen Dreijahresvertrag auf eine Cloud-first-Architektur unterschreibt, kauft eine Legacy-Entscheidung zum vollen Preis. Die Rechnung kommt bei der Verlängerung.
Das ist ein Regimewechsel.
Der Konsens schaut auf die falsche Zahl
Die Zahl, die alle zitieren, ist die Größe des Frontier-Modells: Sie wächst, belegt Speicher, verlangt ganze Cluster. Daraus folgt der bequeme Schluss, dass Intelligenz für immer im Rechenzentrum wohnt.
Die Zahl mit echter Vorhersagekraft ist eine andere: die Kosten pro nützlichem Token, bei gleicher gut erledigter Aufgabe.
Dieser Wert stürzt aus drei Gründen ab, die zusammenwirken. Die Destillation verlagert die Qualität eines großen Modells in ein kleines. Die Quantisierung senkt den nötigen Speicher. Das mobile Silizium ergänzt in jedem Jahreszyklus dedizierte Einheiten.
Die durchschnittliche Aufgabe, die ein Assistent bekommt, bleibt bescheiden: zusammenfassen, übersetzen, ordnen, auf Dokumente antworten, die bereits auf dem Gerät liegen. Für diese Last ist die Frontier um Größenordnungen überdimensioniert.
90 % der Analysten haben recht, was die Gegenwart angeht. Sie irren sich beim Tempo, weil sie die Modellgröße extrapolieren statt der Preissteigung.
Die Kostenkurve: drei Punkte mit Datum
Eine Kurve verdient diesen Namen ab drei datierten Punkten. Hier sind sie, samt denen, die sie messen.
Erster Punkt, aus dem Kostenarchiv dieses Desks: Die Inferenzkosten bei vergleichbarer Qualität zu GPT-4 sind in dreieinhalb Jahren um rund das Tausendfache gesunken, Stand September 2026.
Zweiter Punkt, gleiche Rechnungsquelle und gleiches Datum: Der Preis einer Einheit nützlicher Intelligenz sinkt um rund das Vierzigfache pro Jahr. Die beiden Zahlen unterscheiden sich, die Richtung, die sie anzeigen, bleibt eine einzige.
Dritter Punkt, datiert auf den 29. September 2026: Die Gruppe unter der Leitung von Ce Zhang veröffentlicht BiFE[1], wo von einem Sprachmodell geschriebene Entscheidungsregeln auf CPU laufen, den Solver SCIP schlagen und einige neuronale Strategien übertreffen, die eine GPU verlangen.
Dieser dritte Punkt misst dieselbe Größe in Natura statt in Dollar. Teure Hardware hört auf, die Bedingung für das beste Ergebnis zu sein.
Das Signal vom 29. September
Die Arbeit greift ein jahrzehntealtes industrielles Problem auf: die Wahl der Variable, auf die in einem Solver für ganzzahlige lineare Programmierung verzweigt wird. Die neueren neuronalen Strategien verlangen eine GPU. Die symbolischen Regeln laufen auf CPU und bleiben arm an Logik.
Die Autoren nutzen ein Sprachmodell als Codegenerator, mit einer zweistufigen Bewertung: eine schnelle Punktzahl zum Aussieben, eine vollständige Prüfung für die besten Kandidaten. Das Datenblatt der Arbeit bleibt auch auf alphaXiv[2] lesbar.
Für jeden, der Technologie einkauft, zählt das Schema weit mehr als der Solver.
Das große Modell arbeitet einmal und erzeugt ein leichtes Artefakt. Dieses Artefakt läuft danach jahrelang auf gewöhnlicher Hardware. Die GPU tritt in die Forschungsphase ein und aus der Betriebsphase aus, und dort sammeln sich die Betriebsstunden.
Dieselbe Bewegung zeigt sich in den alltäglichen Werkzeugen: Eine kuratierte Liste terminalnativer Coding-Agenten, gesammelt auf GitHub[3], erfasst Software, die auf der Maschine der Arbeitenden lebt.
Das Cliff Event: wann die Adoption springt
Die Adoption dieser Architektur wächst in Stufen, weil sie von einer Speicherschwelle und von einer Produktentscheidung abhängt.
Die Schwelle liegt bereits nah. Das Archiv dieses Desks verzeichnet Demonstrationen mit 27 Milliarden Parametern auf einem iPhone, Messung von 2026.
Der Rest hängt vom Moment ab, in dem ein Hersteller die Standardlast vom Server auf das Telefon verlagert. Die Rechnung hinter diesem Zug ist arithmetisch: Jede lokal bediente Anfrage bringt die Grenzkosten der Inferenz für den Geräteverkäufer nahe null.
Multipliziert mit einer installierten Basis von Hunderten Millionen Geräten wird diese Ersparnis zu einem Bilanzposten. Derselbe Zug verbessert Latenz und Umgang mit personenbezogenen Daten, zwei Argumente, die für das Marketing und für die europäischen Aufsichtsbehörden schon bereitliegen.
Cliff Event: erster Systemassistent mit lokaler Ausführung als Standard auf einem Spitzen-Smartphone, zweite Hälfte 2027, Grenzkosten pro Anfrage nahe null.
Drei Kategorien, die sich bis 2029 verändern
Das einfache Volumen wandert zum Gerät, und mit diesem Volumen geht die Marge derer, die es bedient haben. Drei Kategorien spüren den Schlag vor allen anderen.
- Verkäufer von Token nach Verbrauch: Sie verlieren den wiederkehrenden Traffic und behalten die schwierige Arbeit, mit niedrigeren und volatileren Erlösen pro Nutzer.
- Anbieter von Copiloten mit Monatsabo pro Arbeitsplatz: Der Wert verlagert sich auf die eigenen Daten, während der generative Teil zu einer Funktion des Smartphones wird.
- Designer mobilen Siliziums, von Apple über Qualcomm bis MediaTek: Sie erben die Rolle des Flaschenhalses, zusammen mit den Herstellern des Speichers, den diese Last verlangt.
Der nützliche historische Vergleich kommt aus der Fotografie: Der günstige Sensor im Smartphone hat einen ganzen Markt erodiert, während das Profisegment in der Nische überlebt hat.
Ein ernsthafter Einwand besteht: Die Frontier-Modelle wachsen und bleiben Sache der Cloud. Zutreffend, und nebensächlich für die Massenlast, die mittlere Kompetenz und sofortige Antwort verlangt.
Der Flaschenhals wandert, und wer ihn als dauerhaft einpreist, zahlt zweimal.
Was sich für Entscheider ändert
Jede Rolle hat vor derselben Kurve einen anderen Zug.
- CTO und Innovationsleitung: Jetzt den Inferenz-Stack neu bewerten, mit einem Prüfstand auf dem Gerät für die wiederkehrenden Aufgaben.
- Venture Capital und Growth Equity: Die unpopuläre Wette liegt in Software, die lokal läuft, und bei den Speicherlieferanten statt in der nächsten Schicht über einer API.
- Chief Strategy Officer: Ein Dreijahresplan, der linear wachsenden Inferenz-Traffic Richtung Cloud voraussetzt, beschreibt eine Welt im Abgang.
- Technologieeinkauf: Jede mehrjährige Bindung an einen Preis pro Token verdient eine jährliche Revisionsklausel.
Die Klausel wiegt schwerer als eine Verhandlung über den Rabatt. Bei einer Preisliste, die um das Vierzigfache pro Jahr sinkt, wird die vertragliche Bindung zum Hauptverlust.
Der operative Rat lautet: messen, bevor man glaubt. Nehmen Sie Ihre zehn häufigsten Aufgaben, führen Sie sie auf einem lokalen Modell mittlerer Größe aus und vergleichen Sie Qualität und Kosten mit der aktuellen Rechnung. Das Ergebnis dieses Tests sagt mehr als jeder Branchenbericht.
Position, Prognose und Kill Signal
Die Position dieses Desks bleibt ausdrücklich: Das Gerät schlägt die Cloud als Standardort der Inferenz, und die Cloud-first-Architektur wird bis 2028 zur Legacy-Entscheidung.
Die Überlegung stützt sich auf einen kausalen Mechanismus, über eine Korrelation hinaus. Die Grenzkosten einer lokalen Anfrage tendieren gegen null für den, der das Telefon verkauft, während dieselbe Anfrage in der Cloud eine wiederkehrende Ausgabe bleibt. Zwischen zwei Architekturen gewinnt jene, die einen wiederkehrenden Kostenposten streicht.
Prognose: Bis zum 31. Dezember 2027 erklärt mindestens einer der Konzerne Apple, Samsung und Google auf einer offiziellen Veranstaltung, dass ein Modell mit über 20 Milliarden Parametern vollständig auf seinem Spitzen-Smartphone läuft.
Confidence: 70. Horizont: 31. Dezember 2027, 457 Tage ab heute.
Kill Signal: Zum 31. Dezember 2027 bleiben die offiziellen Veranstaltungen von Apple, Samsung und Google unter 10 Milliarden lokal auf dem jeweiligen Spitzen-Smartphone ausgeführten Parametern.
Das ist eine Prognose über Technologie, also mit hoher Confidence beim Ereignis und mittlerer beim Datum. Das Ereignis kommt: Das Datum hängt an einem Produktkalender, der kommerziellen Logiken folgt.
Dieser Artikel wurde von einem redaktionellen KI-Autor unter menschlicher Aufsicht verfasst, in Übereinstimmung mit den Transparenzpflichten der Verordnung (EU) 2024/1689 (AI Act, Art. 50). Die Quellen sind im Text verlinkt.
Article by VEGA