Quaranta milioni per misurare i modelli degli altri
Vals AI, società che misura le capacità dei modelli al posto di chi li vende, ha chiuso una Series A da 40 milioni di dollari guidata da Andreessen Horowitz, come ha raccontato TechCrunch il 19 settembre 2026[1], che colloca la raccolta nel mese precedente.
L'azienda nasce nel 2024 e arriva a questo round dopo un seed guidato da 8VC e Bloomberg Beta. Il co-fondatore Rayan Krishnan ha 25 anni, un passato da stagista in Palantir e un percorso tra Microsoft e il laboratorio di intelligenza artificiale di Stanford.
La cifra conta meno della categoria che certifica. Un fondo di quel calibro mette 40 milioni su una tesi precisa: la verifica indipendente delle capacità dei modelli diventa un prodotto che si compra a catalogo. Per una direzione acquisti questo è il segnale più chiaro finora che la due diligence sui modelli esce dal perimetro interno.
Che cosa vende davvero questa azienda
Il linguaggio da comunicato parla di «gold standard» del benchmarking. La sostanza è più ruvida e più interessante.
Vals tiene riservato il materiale delle proprie prove. La scelta serve a un obiettivo pratico: una prova pubblica finisce dentro i dati di addestramento del modello che dovrebbe giudicare, e il punteggio perde significato. È un esame che il candidato ha visto in anticipo.
La seconda differenza riguarda l'oggetto della misura. I test accademici storici verificano quanto un modello sappia in astratto, sul modello dell'esame di abilitazione forense. Questa società misura invece l'esecuzione di compiti complessi dentro settori precisi: diritto, finanza, scrittura di codice.
La distinzione pesa sul procurement. Un punteggio su una prova generalista dice poco sul comportamento del sistema dentro un flusso di lavoro reale, fatto di documenti, vincoli e passaggi di controllo.
Il benchmark del fornitore vale come un'autocertificazione
Il meccanismo di mercato è semplice. Il fornitore progetta la release, sceglie le prove, pubblica la tabella e la usa come materiale di vendita. Un buon risultato equivale a una buona campagna stampa, come osserva il pezzo di TechCrunch.
Qui c'è un conflitto di interessi strutturale, del tutto legittimo e del tutto interessato.
Il problema cresce con la velocità delle uscite. I modelli di frontiera arrivano a ritmo quasi mensile, mentre le prove accademiche invecchiano e restano indietro rispetto alla frontiera che dovrebbero misurare. Krishnan costruisce la sua azienda esattamente su questo scarto.
Il contraccolpo reputazionale è già visibile altrove. Il South China Morning Post ha riportato il caso della cinese Z.ai, colpita sul piano della reputazione dopo che alcuni utenti hanno individuato caricamenti fatti a loro insaputa[2]. La fiducia dichiarata dal fornitore regge poco davanti a una verifica esterna.
Lo spostamento competitivo: dal punteggio al criterio
La tesi di questo desk resta ferma: il modello è una commodity, e il listino lo dimostra a ogni release. Quando il prezzo del tier di frontiera scende, il criterio di scelta smette di essere la potenza dichiarata.
L'asse competitivo si sposta dal benchmark pubblicato dal fornitore alla valutazione fatta da terzi sul compito specifico dell'azienda che compra.
Questo cambia la forma della gara. Un vendor con il punteggio più alto su una prova pubblica perde terreno davanti a un rivale che regge una prova chiusa, costruita sul dominio del cliente. Il vantaggio passa dalla vetrina alla prestazione verificata.
Per chi guida la strategia la conseguenza è immediata. La capacità di misurare diventa parte del potere contrattuale: chi misura in modo indipendente tratta i rinnovi da una posizione più forte, e allenta il lock-in costruito sulla fedeltà a un singolo fornitore.
Chi ne risente nella mappa dei vendor
Le implicazioni toccano tre gruppi: i grandi fornitori di modelli, le piattaforme cloud che li rivendono, i gruppi di consulenza che vendono selezione tecnologica.
I primi perdono il controllo del racconto sulle proprie capacità. Le seconde vedono entrare nel processo di acquisto un arbitro che risponde al cliente. I terzi affrontano una concorrenza nuova: parte del loro lavoro di valutazione diventa un prodotto a listino, più rapido e più economico.
Il mercato enterprise resta aperto. La dominanza sui consumatori sposta poco su governance, tracciabilità e residenza del dato, e la misura indipendente entra proprio in quello spazio.
Esiste un contro-argomento serio. Una società privata che tiene riservate le proprie prove chiede al mercato un atto di fiducia simile a quello che vuole sostituire, e il metodo resta opaco per chi legge i risultati dall'esterno.
La risposta pratica arriva dagli incentivi. Chi vende valutazioni vive di reputazione presso il compratore, e paga subito un errore di misura. Chi vende modelli vive di rinnovi, e guadagna da un punteggio generoso.
Il segnale di mercato: il capitale premia il controllo
Il capitale di rischio continua a concentrarsi sui grandi round dell'intelligenza artificiale, come mostra la rassegna dei finanziamenti maggiori curata da Crunchbase News[3].
Dentro quel flusso, 40 milioni su una società di valutazione raccontano una cosa diversa dai round sul compute e sui modelli. Il denaro comincia a finanziare gli strumenti che rendono comparabile l'offerta, e la comparabilità è l'anticamera della pressione sui prezzi.
Vale la distinzione che questo desk applica sempre: qui parliamo di un annuncio di raccolta, e la quota di mercato resta da conquistare. Il consolidamento della categoria rimane un'ipotesi sostenuta da capitale paziente.
Per un investitore la lettura è netta. La tesi secondo cui il valore migra dal modello verso i livelli che lo circondano, deployment, misura e governo del dato, riceve una conferma in più.
Che cosa decidere nei prossimi 90 giorni
Il prossimo ciclo di budget chiede tre mosse concrete a chi compra tecnologia.
La prima riguarda i contratti in scadenza. Ogni rinnovo di piattaforma va accompagnato da una prova interna costruita sui compiti reali dell'azienda, con esiti scritti e ripetibili a ogni nuova versione del modello.
La seconda riguarda la spesa. Una voce dedicata alla valutazione indipendente costa una frazione del contratto che protegge, e va aperta ora, prima della prossima trattativa sui volumi.
La terza riguarda il portafoglio fornitori. Una mappa aggiornata, con due modelli alternativi pronti su ogni carico di lavoro critico, trasforma la misura in leva di prezzo.
- Chief Strategy Officer: valuta un accordo con un valutatore terzo prima che la categoria si consolidi.
- CFO: apri una voce di spesa per la misura indipendente e legala ai risparmi sui rinnovi.
- Chief Digital Officer: rimetti in discussione il fornitore scelto sul punteggio pubblico.
- Technology Investor: la tesi sul valore che migra verso i livelli di controllo guadagna terreno.
Il mercato si è mosso. La prossima gara si vince sul dato verificato, e il punteggio pubblicato dal fornitore torna a essere ciò che è sempre stato: materiale di vendita.
Questo articolo è stato redatto da un autore editoriale AI con supervisione umana, in conformità agli obblighi di trasparenza del Regolamento (UE) 2024/1689 (AI Act, Art. 50). Le fonti sono linkate nel testo.
Article by NOVA
Fonti
- ha raccontato TechCrunch il 19 settembre 2026 19 set 2026 (techcrunch.com)
- caricamenti fatti a loro insaputa (scmp.com)
- rassegna dei finanziamenti maggiori curata da Crunchbase News (news.crunchbase.com)