Vierzig Millionen, um die Modelle der anderen zu messen
Vals AI, ein Unternehmen, das die Fähigkeiten der Modelle anstelle derer misst, die sie verkaufen, hat eine Series A über 40 Millionen Dollar unter Führung von Andreessen Horowitz abgeschlossen, wie TechCrunch am 19. September 2026 berichtete[1]; die Runde wird dort dem Vormonat zugeordnet.
Das Unternehmen entsteht 2024 und erreicht diese Runde nach einem Seed unter Führung von 8VC und Bloomberg Beta. Mitgründer Rayan Krishnan ist 25 Jahre alt, hat eine Vergangenheit als Praktikant bei Palantir und einen Weg über Microsoft und das Labor für künstliche Intelligenz in Stanford hinter sich.
Die Zahl zählt weniger als die Kategorie, die sie beglaubigt. Ein Fonds dieses Kalibers setzt 40 Millionen auf eine klare These: Die unabhängige Überprüfung der Modellfähigkeiten wird zu einem Produkt, das man im Katalog kauft. Für eine Einkaufsleitung ist das bislang das deutlichste Signal, dass die Due Diligence über Modelle den internen Perimeter verlässt.
Was dieses Unternehmen wirklich verkauft
Die Sprache der Pressemitteilung spricht vom «Goldstandard» des Benchmarkings. Die Substanz ist rauer und interessanter.
Vals hält das Material seiner Prüfungen unter Verschluss. Die Entscheidung dient einem praktischen Ziel: Eine öffentliche Prüfung landet in den Trainingsdaten des Modells, das sie beurteilen soll, und die Punktzahl verliert ihre Bedeutung. Es ist eine Prüfung, die der Kandidat vorab gesehen hat.
Der zweite Unterschied betrifft den Gegenstand der Messung. Die historischen akademischen Tests prüfen, wie viel ein Modell abstrakt weiß, nach dem Muster des juristischen Staatsexamens. Dieses Unternehmen misst stattdessen die Ausführung komplexer Aufgaben innerhalb präziser Branchen: Recht, Finanzen, Programmierung.
Die Unterscheidung wiegt im Einkauf. Eine Punktzahl aus einer generalistischen Prüfung sagt wenig über das Verhalten des Systems innerhalb eines realen Arbeitsablaufs aus Dokumenten, Auflagen und Kontrollschritten aus.
Der Benchmark des Anbieters gilt so viel wie eine Selbstauskunft
Der Marktmechanismus ist einfach. Der Anbieter entwirft das Release, wählt die Prüfungen aus, veröffentlicht die Tabelle und nutzt sie als Verkaufsmaterial. Ein gutes Ergebnis entspricht einer guten Pressekampagne, wie der Beitrag von TechCrunch anmerkt.
Hier liegt ein struktureller Interessenkonflikt vor, völlig legitim und völlig eigennützig.
Das Problem wächst mit dem Tempo der Veröffentlichungen. Die Frontier-Modelle kommen fast im Monatsrhythmus, während die akademischen Prüfungen altern und hinter der Frontlinie zurückbleiben, die sie messen sollten. Krishnan baut sein Unternehmen genau auf dieser Lücke auf.
Der Rückschlag für die Reputation ist anderswo bereits sichtbar. Die South China Morning Post berichtete über den Fall des chinesischen Anbieters Z.ai, dessen Ruf Schaden nahm, nachdem einige Nutzerinnen und Nutzer Uploads ohne ihr Wissen[2] entdeckt hatten. Das vom Anbieter erklärte Vertrauen hält einer externen Prüfung kaum stand.
Die Wettbewerbsverschiebung: von der Punktzahl zum Kriterium
Die These dieses Desks bleibt unverändert: Das Modell ist eine Commodity, und die Preisliste beweist es bei jedem Release. Wenn der Preis des Frontier-Tiers sinkt, hört die deklarierte Leistungsfähigkeit auf, das Auswahlkriterium zu sein.
Die Wettbewerbsachse verschiebt sich vom Benchmark des Anbieters zur Bewertung durch Dritte auf der konkreten Aufgabe des kaufenden Unternehmens.
Das verändert die Form der Ausschreibung. Ein Anbieter mit der höchsten Punktzahl in einer öffentlichen Prüfung verliert an Boden gegenüber einem Konkurrenten, der eine geschlossene, auf die Domäne des Kunden zugeschnittene Prüfung besteht. Der Vorteil wandert vom Schaufenster zur überprüften Leistung.
Für die Strategieverantwortung ist die Konsequenz unmittelbar. Die Fähigkeit zu messen wird Teil der Verhandlungsmacht: Wer unabhängig misst, verhandelt Verlängerungen aus einer stärkeren Position und lockert den Lock-in, der auf der Treue zu einem einzigen Anbieter beruht.
Wen es in der Anbieterlandschaft trifft
Die Folgen betreffen drei Gruppen: die großen Modellanbieter, die Cloud-Plattformen, die sie weiterverkaufen, und die Beratungshäuser, die Technologieauswahl verkaufen.
Die Ersten verlieren die Kontrolle über die Erzählung ihrer eigenen Fähigkeiten. Die Zweiten sehen einen Schiedsrichter in den Einkaufsprozess eintreten, der dem Kunden verpflichtet ist. Die Dritten treffen auf einen neuen Wettbewerb: Ein Teil ihrer Bewertungsarbeit wird zu einem Produkt mit Listenpreis, schneller und günstiger.
Der Enterprise-Markt bleibt offen. Die Dominanz bei den Endverbrauchern bewegt bei Governance, Nachvollziehbarkeit und Datenresidenz wenig, und genau in diesen Raum tritt die unabhängige Messung ein.
Es gibt ein ernsthaftes Gegenargument. Ein privates Unternehmen, das seine eigenen Prüfungen geheim hält, verlangt vom Markt einen Vertrauensakt, der dem ähnelt, den es ersetzen will, und die Methode bleibt für alle, die die Ergebnisse von außen lesen, undurchsichtig.
Die praktische Antwort kommt von den Anreizen. Wer Bewertungen verkauft, lebt von seinem Ruf beim Käufer und zahlt für einen Messfehler sofort. Wer Modelle verkauft, lebt von Verlängerungen und profitiert von einer großzügigen Punktzahl.
Das Marktsignal: Kapital belohnt die Kontrolle
Das Risikokapital konzentriert sich weiterhin auf die großen Runden der künstlichen Intelligenz, wie die Übersicht der größten Finanzierungen von Crunchbase News[3] zeigt.
Innerhalb dieses Stroms erzählen 40 Millionen für ein Bewertungsunternehmen etwas anderes als die Runden für Compute und Modelle. Das Geld beginnt, die Werkzeuge zu finanzieren, die das Angebot vergleichbar machen, und Vergleichbarkeit ist die Vorstufe zum Preisdruck.
Es gilt die Unterscheidung, die dieses Desk immer anwendet: Hier sprechen wir von einer angekündigten Finanzierung, und der Marktanteil muss erst erobert werden. Die Konsolidierung der Kategorie bleibt eine Hypothese, gestützt von geduldigem Kapital.
Für Investoren ist die Lesart klar. Die These, wonach der Wert vom Modell zu den umgebenden Schichten wandert – Deployment, Messung und Data Governance –, erhält eine weitere Bestätigung.
Was in den nächsten 90 Tagen zu entscheiden ist
Der nächste Budgetzyklus verlangt von Technologieeinkäufern drei konkrete Schritte.
Der erste betrifft die auslaufenden Verträge. Jede Plattformverlängerung gehört begleitet von einer internen Prüfung, die auf den realen Aufgaben des Unternehmens aufbaut, mit schriftlichen Ergebnissen, die bei jeder neuen Modellversion wiederholbar sind.
Der zweite betrifft die Ausgaben. Eine eigene Position für die unabhängige Bewertung kostet einen Bruchteil des Vertrags, den sie schützt, und gehört jetzt eröffnet, vor der nächsten Verhandlung über Volumen.
Der dritte betrifft das Anbieterportfolio. Eine aktuelle Landkarte mit zwei alternativen Modellen, die für jede kritische Arbeitslast bereitstehen, macht aus der Messung einen Preishebel.
- Chief Strategy Officer: Prüfen Sie eine Vereinbarung mit einem Drittbewerter, bevor sich die Kategorie konsolidiert.
- CFO: Eröffnen Sie eine Ausgabenposition für die unabhängige Messung und koppeln Sie sie an die Einsparungen bei Verlängerungen.
- Chief Digital Officer: Stellen Sie den nach öffentlicher Punktzahl gewählten Anbieter erneut infrage.
- Technology Investor: Die These vom Wert, der zu den Kontrollschichten wandert, gewinnt an Boden.
Der Markt hat sich bewegt. Die nächste Ausschreibung gewinnt man mit überprüften Daten, und die vom Anbieter veröffentlichte Punktzahl wird wieder das, was sie immer war: Verkaufsmaterial.
Dieser Artikel wurde von einem redaktionellen KI-Autor unter menschlicher Aufsicht verfasst, in Übereinstimmung mit den Transparenzpflichten der Verordnung (EU) 2024/1689 (AI Act, Art. 50). Die Quellen sind im Text verlinkt.
Article by NOVA
Quellen
- TechCrunch am 19. September 2026 berichtete 19 Sep 2026 (techcrunch.com)
- Uploads ohne ihr Wissen (scmp.com)
- Übersicht der größten Finanzierungen von Crunchbase News (news.crunchbase.com)