Open Models, Controlled Agents: rete neurale, griglia di valutazione e agenti protetti da confini di sicurezza, con titolo centrale.

La competizione tra modelli accelera, ma il vantaggio per le imprese non nasce dal benchmark più alto: nasce dalla capacità di valutare prestazioni, costi, licenze e confini operativi.

La corsa all’intelligenza artificiale sta entrando in una fase più concreta. Da una parte aumentano le capacità dei modelli e si moltiplicano gli annunci open weight. Dall’altra, gli agenti iniziano a usare strumenti, credenziali e reti reali, rendendo più visibili i limiti delle architetture che li ospitano.

Le notizie di questi giorni mostrano perché le due dinamiche devono essere lette insieme. Alibaba ha presentato Qwen3.8-Max, OpenAI ha attribuito a una versione interna di Astra risultati su problemi scientifici complessi e nuovi framework promettono di rendere più facile costruire e valutare sistemi agentici. Ma, contemporaneamente, gli incidenti emersi durante alcune valutazioni di cybersecurity stanno riportando l’attenzione su responsabilità, supervisione e controllo dell’ambiente.

Il punto per le imprese è semplice: modelli più aperti e agenti più capaci ampliano le possibilità, ma richiedono una disciplina progettuale più rigorosa.

Qwen3.8-Max e il ritorno dell’open weight su scala frontier

Secondo l’annuncio raccolto da Techmeme, Qwen3.8-Max è un modello mixture-of-experts da 2,4 trilioni di parametri complessivi, con circa 95 miliardi di parametri attivi e una finestra di contesto fino a un milione di token. Alibaba ha annunciato la pubblicazione dei pesi del modello e di una versione da 27 miliardi di parametri.

È un segnale rilevante perché avvicina l’open weight alla fascia dei modelli di frontiera. Tuttavia, “pesi disponibili” non equivale automaticamente a “modello aperto” in senso pieno. Prima di una valutazione aziendale servono almeno quattro verifiche:

  • la licenza effettiva e gli eventuali limiti di utilizzo;
  • i requisiti infrastrutturali per inferenza e fine-tuning;
  • la qualità sui processi reali dell’organizzazione;
  • il costo totale, inclusi sicurezza, osservabilità e manutenzione.

I benchmark pubblicati dal produttore sono un punto di partenza. La decisione deve arrivare dopo test indipendenti e ripetibili.

Astra e il valore della verifica scientifica

OpenAI ha dichiarato che una versione interna del prossimo modello Astra avrebbe prodotto risultati su dieci problemi di matematica, complessità quantistica e informatica teorica. Se confermata e riprodotta, sarebbe un’indicazione importante della capacità dei modelli di contribuire alla ricerca.

Ma proprio l’ambito scientifico rende essenziale distinguere il risultato dall’annuncio. Per valutarne il peso servono informazioni sulla verifica delle prove, sul ruolo degli esperti umani, sugli eventuali errori e sulla riproducibilità del processo.

La stessa prudenza vale in azienda. Un output convincente non è ancora un risultato affidabile. Servono criteri di accettazione, fonti verificabili e un percorso di revisione proporzionato all’impatto della decisione.

Gli eval diventano infrastruttura

La crescita degli agenti sta trasformando le valutazioni da attività occasionale a componente permanente del sistema. Supabase Evals, segnalato da MarkTechPost, propone benchmark open source su attività reali per strumenti di coding come Claude Code, Codex e OpenCode. NVIDIA Molt, invece, punta a semplificare la sperimentazione nel reinforcement learning agentico.

Il messaggio più importante non riguarda il singolo framework. Un agente deve essere misurato sul workflow completo, non soltanto sulla qualità della risposta testuale.

Una suite di valutazione aziendale dovrebbe includere:

  • percentuale di attività completate correttamente;
  • capacità di scegliere e usare gli strumenti appropriati;
  • comportamento davanti a istruzioni ambigue o ostili;
  • qualità del recupero dopo un errore;
  • consumo di token, tempo e risorse;
  • rispetto dei permessi e delle regole operative.

Un benchmark generale può aiutare a selezionare i candidati. Solo gli eval interni dicono se il sistema è adatto al lavoro reale.

Il confine dell’agente è parte del prodotto

Gli incidenti attribuiti a modelli utilizzati in valutazioni di cybersecurity hanno aperto una discussione sulla responsabilità legale degli agenti. La normativa dovrà certamente evolvere, ma le imprese non devono aspettare una sentenza per adottare controlli tecnici ragionevoli.

Un ambiente agentico affidabile parte da una rete in allowlist, credenziali temporanee e privilegi minimi. Le azioni esterne — invii, pubblicazioni, pagamenti o modifiche irreversibili — devono richiedere un’approvazione esplicita. Prompt, tool, input, output e fallimenti devono lasciare log consultabili. Tempo, spesa e numero di azioni devono avere limiti chiari, accompagnati da un kill switch esterno.

Questi vincoli non riducono il valore dell’agente. Lo rendono utilizzabile. L’autonomia senza confini produce dimostrazioni spettacolari; l’autonomia controllata produce processi aziendali sostenibili.

Trasparenza e AI Act

Dal 2 agosto sono entrati in una nuova fase gli obblighi europei di trasparenza sull’AI, mentre parte del calendario per i sistemi ad alto rischio è stata ridisegnata. Al di là delle singole scadenze, la direzione è ormai stabile: le organizzazioni dovranno sapere quali sistemi utilizzano, per quali scopi, con quali dati e sotto quale responsabilità.

Inventario dei modelli, documentazione delle finalità, registrazione delle versioni, eval e controllo degli accessi non sono attività separate. Sono componenti della stessa governance.

Il vantaggio competitivo è nella combinazione

Il mercato continuerà a offrire modelli più grandi, più economici e più aperti. La differenza non sarà determinata soltanto dalla scelta del modello, ma dalla qualità del sistema costruito intorno ad esso.

Le organizzazioni più mature sapranno combinare modelli differenti, instradare ogni attività verso la risorsa adeguata, verificare gli output e limitare l’autonomia in base al rischio. È una capacità architetturale e organizzativa prima ancora che tecnologica.

I modelli aperti aumentano le opzioni. Gli eval trasformano le promesse in misure. I confini rendono gli agenti governabili. È dall’integrazione di questi tre elementi che può nascere un vantaggio reale per l’impresa.

Fonti: Techmeme; annunci pubblici di Alibaba Qwen e OpenAI; MarkTechPost; fonti giornalistiche collegate da Techmeme. Benchmark, risultati scientifici e dati economici dichiarati dai produttori sono trattati come affermazioni da verificare indipendentemente.


Scopri di più da Bellorio Advisory

Abbonati per ricevere gli ultimi articoli inviati alla tua e-mail.