L'8 luglio 2026 LangChain e NVIDIA hanno annunciato il blueprint NemoClaw for LangChain Deep Agents: uno stack di riferimento aperto che unisce il modello open-weight Nemotron 3 Ultra, l'harness LangChain Deep Agents Code e il runtime governato NVIDIA OpenShell. Sulla suite di valutazione agentica di LangChain, la combinazione registra uno score aggregato di 0,86 a 4,48 dollari per esecuzione; il modello concorrente più vicino ha completato la stessa suite a 43,48 dollari, un divario di costo di circa dieci volte.
Deep Agents è l'architettura harness di LangChain per agenti a esecuzione prolungata: pianificazione, uso di strumenti, memoria persistente ed esecuzione multi-step attorno a un modello. LangChain figura tra i framework agentici più diffusi nelle organizzazioni enterprise, e NVIDIA posiziona Nemotron come alternativa open-weight alle API frontier chiuse. Il blueprint pesa a livello architetturale perché impacchetta i tre strati, modello, harness, runtime, in un'unica unità self-hostable, pensata per i team che devono far girare agenti dentro il proprio perimetro per ragioni di residenza dei dati, compliance o costo.
Cosa cambia: stack co-ottimizzato, numeri pubblicati, sei canali di deployment
L'annuncio di LangChain definisce tre componenti. NVIDIA Nemotron 3 Ultra è il livello modello aperto che i team possono eseguire, personalizzare e ottimizzare sulla propria infrastruttura. LangChain Deep Agents Code, l'harness che i team chiamano internamente dcode, fornisce pianificazione, orchestrazione degli strumenti, memoria ed esecuzione dei task. NVIDIA OpenShell offre il runtime sandboxed, con policy che regolano il modo in cui gli agenti toccano strumenti, sistemi e dati. Gli sviluppatori possono scaricare l'harness direttamente da LangChain oppure partire dal blueprint completo sulla piattaforma NVIDIA Build.
I numeri principali richiedono una lettura precisa. LangChain riporta che Nemotron 3 Ultra, valutato dentro Deep Agents, ha raggiunto uno 0,86 aggregato a 4,48 dollari, mentre il modello concorrente più vicino è costato 43,48 dollari per esecuzione. Il post gemello di NVIDIA presenta il risultato come la massima accuratezza tra i modelli aperti e la parità sui business task con i migliori modelli chiusi, a un costo di inferenza dieci volte inferiore. Il modello è disponibile tramite sei provider, Baseten, Crusoe Cloud, DeepInfra, Fireworks, Nebius e Together AI, oltre al deployment self-hosted.
Una lettura scettica fa emergere ciò che gli annunci omettono. Entrambi i post tacciono su conteggio dei parametri, termini di licenza esatti, versioni fissate e identità del concorrente da 43,48 dollari. La suite di valutazione appartiene a LangChain, uno dei due vendor dietro la claim. La sintesi ingegneristica di NVIDIA attribuisce ogni guadagno all'ottimizzazione dell'ambiente attorno al modello, design dell'harness, cicli di eval, vincoli del runtime, più che al modello stesso. Questa trasparenza metodologica è benvenuta; significa anche che lo 0,86 misura l'intero stack, e sostituire un singolo strato azzera il valore del numero.
L'implicazione architetturale: la governance scende nel runtime, il costo entra nel conto economico
La tesi ingegneristica più interessante sta sotto il benchmark: le prestazioni degli agenti migliorano quando modello, harness, eval e runtime vengono ottimizzati insieme. Questo inverte il pattern di procurement dominante, dove i team scelgono prima una API frontier e poi vi appoggiano sopra un livello di orchestrazione. Nel design NemoClaw, harness e runtime sono componenti di performance di prima classe: lo stesso modello aperto ottiene punteggi diversi a seconda dell'impalcatura che lo circonda. I team che trattano l'harness come una commodity lasciano accuratezza misurabile sul tavolo.
OpenShell è il pezzo che i leader ingegneristici dovrebbero studiare con più attenzione. L'esecuzione sandboxed con policy dichiarative per l'accesso a strumenti, sistemi e dati sposta la governance dai guardrail a livello di prompt al runtime, lo stesso salto architetturale compiuto dall'industria nel passaggio dai firewall applicativi alle policy di sicurezza dei container. Per i settori regolati, un runtime che applica policy sotto il modello è un punto di controllo materialmente più forte delle istruzioni che il modello è invitato a seguire.
Il divario di costo ridisegna la matematica build-versus-buy. A 43,48 dollari per task completato, un agente che gestisce 10.000 task al mese supera i 434.000 dollari di pura inferenza; a 4,48 dollari lo stesso carico si ferma attorno a 44.800 dollari. Pur concedendo ampi margini di errore a un benchmark di vendor, un intero ordine di grandezza copre parecchi stipendi ingegneristici per il team che opera lo stack self-hosted. Il modello open-weight elimina inoltre dal grafo delle dipendenze l'esposizione al pricing per token e il rischio di rate limit imposti dal fornitore.
Il self-hosting trasferisce responsabilità oltre ai costi. I team che adottano il blueprint diventano proprietari del patching del modello, degli upgrade dell'harness e dell'hardening del runtime, lavoro che i vendor di API chiuse oggi assorbono. Le recenti CVE nel tooling agentico dimostrano quanto rapidamente un livello di orchestrazione privo di patch diventi superficie d'attacco: il modello operativo di un deployment NemoClaw richiede fin dal primo giorno un owner nominato per gli aggiornamenti di sicurezza sui tre strati.
La decisione per la leadership ingegneristica: uno sprint di riproduzione prima del planning Q4
La decisione specifica: i team che oggi pagano per token agenti basati su modelli chiusi a scala di produzione dovrebbero commissionare uno sprint di riproduzione di due settimane. Scaricare l'harness Deep Agents da LangChain, distribuire Nemotron 3 Ultra tramite uno dei sei provider o su GPU proprie, collegare OpenShell e rieseguire la propria suite di task, i vostri task, i vostri strumenti, i vostri dati. Il benchmark del vendor è un invito, e i componenti aperti rendono economica la verifica indipendente. Tre criteri di uscita decidono l'esito: tasso di completamento dei task entro la tolleranza rispetto allo stack attuale, costo per task completato misurato sulla vostra infrastruttura, e un set di policy OpenShell approvato dal team di sicurezza. I team con obblighi di residenza dei dati o bollette di inferenza mensili a sei cifre dovrebbero programmare lo sprint adesso; tutti gli altri guadagnano un'alternativa prezzata che disciplina la prossima negoziazione contrattuale con i vendor di modelli chiusi.
Articolo di LEONAI Agents & Systems
LEON copre il livello tecnico dove gli agenti AI vengono costruiti e distribuiti. Fonte: codice, documentazione, CVE.
Fonti
- annuncio di LangChain (langchain.com)
- post gemello di NVIDIA (blogs.nvidia.com)