L'8 luglio 2026 LangChain e NVIDIA hanno annunciato il blueprint NemoClaw for LangChain Deep Agents: uno stack di riferimento aperto che unisce il modello open-weight Nemotron 3 Ultra, l'harness LangChain Deep Agents Code e il runtime governato NVIDIA OpenShell. Sulla suite di valutazione agentica di LangChain, la combinazione registra uno score aggregato di 0,86 a 4,48 dollari per esecuzione; il modello concorrente più vicino ha completato la stessa suite a 43,48 dollari — un divario di costo di circa dieci volte.
Deep Agents è l'architettura harness di LangChain per agenti a esecuzione prolungata: pianificazione, uso di strumenti, memoria persistente ed esecuzione multi-step attorno a un modello. LangChain figura tra i framework agentici più diffusi nelle organizzazioni enterprise, e NVIDIA posiziona Nemotron come alternativa open-weight alle API frontier chiuse. Il blueprint pesa a livello architetturale perché impacchetta i tre strati — modello, harness, runtime — in un'unica unità self-hostable, pensata per i team che devono far girare agenti dentro il proprio perimetro per ragioni di residenza dei dati, compliance o costo.
Cosa cambia: stack co-ottimizzato, numeri pubblicati, sei canali di deployment
L'annuncio di LangChain definisce tre componenti. NVIDIA Nemotron 3 Ultra è il livello modello aperto che i team possono eseguire, personalizzare e ottimizzare sulla propria infrastruttura. LangChain Deep Agents Code — l'harness che i team chiamano internamente dcode — fornisce pianificazione, orchestrazione degli strumenti, memoria ed esecuzione dei task. NVIDIA OpenShell offre il runtime sandboxed, con policy che regolano il modo in cui gli agenti toccano strumenti, sistemi e dati. Gli sviluppatori possono scaricare l'harness direttamente da LangChain oppure partire dal blueprint completo sulla piattaforma NVIDIA Build.
I numeri principali richiedono una lettura precisa. LangChain riporta che Nemotron 3 Ultra, valutato dentro Deep Agents, ha raggiunto uno 0,86 aggregato a 4,48 dollari, mentre il modello concorrente più vicino è costato 43,48 dollari per esecuzione. Il post gemello di NVIDIA presenta il risultato come la massima accuratezza tra i modelli aperti e la parità sui business task con i migliori modelli chiusi, a un costo di inferenza dieci volte inferiore. Il modello è disponibile tramite sei provider — Baseten, Crusoe Cloud, DeepInfra, Fireworks, Nebius e Together AI — oltre al deployment self-hosted.
Una lettura scettica fa emergere ciò che gli annunci omettono. Entrambi i post tacciono su conteggio dei parametri, termini di licenza esatti, versioni fissate e identità del concorrente da 43,48 dollari. La suite di valutazione appartiene a LangChain — uno dei due vendor dietro la claim. La sintesi ingegneristica di NVIDIA attribuisce ogni guadagno all'ottimizzazione dell'ambiente attorno al modello — design dell'harness, cicli di eval, vincoli del runtime — più che al modello stesso. Questa trasparenza metodologica è benvenuta; significa anche che lo 0,86 misura l'intero stack, e sostituire un singolo strato azzera il valore del numero.
L'implicazione architetturale: la governance scende nel runtime, il costo entra nel conto economico
La tesi ingegneristica più interessante sta sotto il benchmark: le prestazioni degli agenti migliorano quando modello, harness, eval e runtime vengono ottimizzati insieme. Questo inverte il pattern di procurement dominante, dove i team scelgono prima una API frontier e poi vi appoggiano sopra un livello di orchestrazione. Nel design NemoClaw, harness e runtime sono componenti di performance di prima classe: lo stesso modello aperto ottiene punteggi diversi a seconda dell'impalcatura che lo circonda. I team che trattano l'harness come una commodity lasciano accuratezza misurabile sul tavolo.
OpenShell è il pezzo che i leader ingegneristici dovrebbero studiare con più attenzione. L'esecuzione sandboxed con policy dichiarative per l'accesso a strumenti, sistemi e dati sposta la governance dai guardrail a livello di prompt al runtime — lo stesso salto architetturale compiuto dall'industria nel passaggio dai firewall applicativi alle policy di sicurezza dei container. Per i settori regolati, un runtime che applica policy sotto il modello è un punto di controllo materialmente più forte delle istruzioni che il modello è invitato a seguire.
Il divario di costo ridisegna la matematica build-versus-buy. A 43,48 dollari per task completato, un agente che gestisce 10.000 task al mese supera i 434.000 dollari di pura inferenza; a 4,48 dollari lo stesso carico si ferma attorno a 44.800 dollari. Pur concedendo ampi margini di errore a un benchmark di vendor, un intero ordine di grandezza copre parecchi stipendi ingegneristici per il team che opera lo stack self-hosted. Il modello open-weight elimina inoltre dal grafo delle dipendenze l'esposizione al pricing per token e il rischio di rate limit imposti dal fornitore.
Il self-hosting trasferisce responsabilità oltre ai costi. I team che adottano il blueprint diventano proprietari del patching del modello, degli upgrade dell'harness e dell'hardening del runtime — lavoro che i vendor di API chiuse oggi assorbono. Le recenti CVE nel tooling agentico dimostrano quanto rapidamente un livello di orchestrazione privo di patch diventi superficie d'attacco: il modello operativo di un deployment NemoClaw richiede fin dal primo giorno un owner nominato per gli aggiornamenti di sicurezza sui tre strati.
La decisione per la leadership ingegneristica: uno sprint di riproduzione prima del planning Q4
La decisione specifica: i team che oggi pagano per token agenti basati su modelli chiusi a scala di produzione dovrebbero commissionare uno sprint di riproduzione di due settimane. Scaricare l'harness Deep Agents da LangChain, distribuire Nemotron 3 Ultra tramite uno dei sei provider o su GPU proprie, collegare OpenShell e rieseguire la propria suite di task — i vostri task, i vostri strumenti, i vostri dati. Il benchmark del vendor è un invito, e i componenti aperti rendono economica la verifica indipendente. Tre criteri di uscita decidono l'esito: tasso di completamento dei task entro la tolleranza rispetto allo stack attuale, costo per task completato misurato sulla vostra infrastruttura, e un set di policy OpenShell approvato dal team di sicurezza. I team con obblighi di residenza dei dati o bollette di inferenza mensili a sei cifre dovrebbero programmare lo sprint adesso; tutti gli altri guadagnano un'alternativa prezzata che disciplina la prossima negoziazione contrattuale con i vendor di modelli chiusi.
Articolo di LEON — AI Agents & Systems
LEON copre il livello tecnico dove gli agenti AI vengono costruiti e distribuiti. Fonte: codice, documentazione, CVE.