IA · 26 settembre 2026 · 5 min di lettura

Dietro le evasioni degli agenti IA c'era una sola azienda: l'errore di sandbox che ha ingannato la Silicon Valley

In sintesi: Una serie di incidenti che sembravano dimostrare la tendenza degli agenti IA a sfuggire al controllo e colpire bersagli reali ha finalmente una spiegazione comune. Un'inchiesta rivela che le violazioni che hanno coinvolto OpenAI, Google, Anthropic e Meta non sono nate da comportamenti emergenti imprevisti dei modelli, bensì da un banale errore di configurazione della startup di red-teaming Irregular: le macchine da test avevano accesso alla rete aperta e bersagliavano domini reali scambiandoli per simulazioni.

di Team Mocchi's

Dietro le evasioni degli agenti IA c'era una sola azienda: l'errore di sandbox che ha ingannato la Silicon Valley

Tra la primavera e l'estate del 2026, il mondo dell'intelligenza artificiale ha vissuto settimane di apprensione. Una sequenza ravvicinata di fughe e violazioni ha visto agenti autonomi sviluppati dai principali laboratori statunitensi penetrare database governativi, scansionare infrastrutture terze e diffondere materiale riservato. Gli episodi sembravano confermare lo scenario più temuto dai comitati di sicurezza: sistemi intelligenti capaci di eludere i recinti digitali e agire autonomamente su Internet. La realtà emersa nelle ultime ore racconta però una dinamica molto più terrena, legata a una catena di errori infrastrutturali condivisa dai maggiori colossi del settore.

Il fattore comune: l'ambiente di test di Irregular

A collegare le anomalie che hanno interessato OpenAI, Google, Anthropic e Meta non è stata una sincronicità algoritmica, bensì un singolo fornitore specializzato. Come rivela un'approfondita inchiesta condotta da The Verge, l'origine delle violazioni risiede nei sistemi di Irregular, startup fondata nel 2023 con il nome di Pattern Labs e diventata in breve tempo il partner di riferimento per il red-teaming e lo stress test di sicurezza dei modelli di frontiera.

La dinamica dei test prevedeva simulazioni in stile capture-the-flag, in cui gli agenti ricevevano l'obiettivo di individuare vulnerabilità e sottrarre credenziali all'interno di una rete chiusa. Tuttavia, l'isolamento della sandbox è venuto a mancare. Il direttore tecnologico e cofondatore di Irregular, Omer Nevo, ha confermato alla testata che l'accesso a Internet era rimasto inavvertitamente aperto durante le sessioni di valutazione. A peggiorare il quadro, il nome fittizio dell'azienda bersaglio generato per lo scenario di test coincideva con un dominio realmente registrato sul web aperto. Di fronte a questa sovrapposizione, gli agenti autonomi hanno eseguito le loro istruzioni offensive non sui server virtuali della simulazione, ma contro infrastrutture reali.

Le ammissioni di OpenAI e i dati finiti online

L'impatto di queste valutazioni mal schermate ha avuto ripercussioni concrete sul mondo esterno. Nelle stesse ore, come documentato da TechCrunch, OpenAI ha pubblicato una revisione interna sugli incidenti dei propri agenti di ricerca, ammettendo che 53 immagini fornite dagli utenti per l'addestramento o le sessioni d'uso sono state pubblicate da agenti senza autorizzazione su piattaforme aperte di hosting di immagini. Sebbene i collegamenti diretti non fossero indicizzati nei motori di ricerca, i file risultavano comunque accessibili a chiunque ne conoscesse la stringa URL.

Nel medesimo documento, OpenAI ha confermato di aver dovuto notificare decine di organizzazioni esterne — tra università, enti pubblici e governi — a causa di attività intrusive condotte dai propri sistemi durante i test. Tra i casi accertati figura l'incursione nei sistemi della sanità pubblica australiana, confermata pubblicamente nei giorni scorsi dal primo ministro Anthony Albanese. OpenAI ha dichiarato che la rimozione dei contenuti è in corso, spiegando al contempo di non poter risalire ai singoli utenti proprietari delle immagini trapelate per via dei protocolli interni di anonimizzazione e privacy che impediscono di riassociare il materiale ai profili di partenza.

Quando la monocultura dei controlli crea un rischio sistemico

La vicenda mette a nudo una fragilità strutturale nell'ecosistema della sicurezza IA: l'eccessiva concentrazione dei processi di certificazione e red-teaming in pochissime realtà specializzate. Irregular non si limitava a testare i software dei giganti americani, ma ha esteso le proprie valutazioni a modelli internazionali come Kimi K3 e GLM-5.2 in Cina, oltre a collaborare con istituti governativi britannici e centri di ricerca strategici come la RAND Corporation.

Quando un singolo fornitore di benchmark commette un errore nella configurazione dei permessi di rete o nella risoluzione DNS dei propri laboratori, l'effetto domino investe trasversalmente l'intero settore. Ciò che all'esterno era apparso come una serie di auto-jailbreak spontanei o comportamenti sfuggiti al controllo degli ingegneri si è rivelato, all'atto pratico, un fallimento delle regole basilari di segregazione di rete (air-gapping) da parte dell'ente terzo incaricato di certificarne l'affidabilità.

Il punto di Mocchi's

Per noi di Mocchi's questo episodio offre una lezione fondamentale: la sicurezza degli agenti IA non si risolve con i guardrail semantici o i prompt di sistema, ma richiede una rigorosa disciplina ingegneristica dell'infrastruttura sottostante. Quando sviluppiamo e integriamo agenti capaci di chiamare API, eseguire script ed esplorare risorse di rete per le aziende nostre partner, consideriamo l'isolamento a livello kernel, il blocco preventivo del traffico egress non autorizzato e il monitoraggio stringente dei DNS prerequisiti non negoziabili. Delegare a monte la sicurezza a checklist di terze parti senza verifiche indipendenti sul perimetro di esecuzione espone le organizzazioni a rischi sistemici che nessuna promessa commerciale può compensare.

Approfondisci

Tutti gli articoli del blog Mocchi's