Questo sito utilizza cookies tecnici (propri e di terze parti) come anche cookie di profilazione (di terze parti) sia per proprie necessità funzionali, sia per inviarti messaggi pubblicitari in linea con tue preferenze. Per saperne di più o per negare il consenso all'uso dei cookie di profilazione clicca qui. Scorrendo questa pagina, cliccando su un link o proseguendo la navigazione in altra maniera, acconsenti all'uso dei cookie Ok, accetto

 2026  settembre 28 Lunedì calendario

Allarme sugli agenti AI «ribelli»: gli incidenti sono decine di migliaia

Le azioni dei modelli avanzati di Intelligenza artificiale, considerate problematiche dai valutatori esterni, non riguardavano pochissimi casi isolati, come quelli già trapelati di Hugging Face o della sanità australiana. Non erano neppure le decine di «interferenze» su siti governativi e istituzionali, emersi poco più di 24 ore fa. OpenAI ma anche Anthropic stanno invece indagando su «decine di migliaia di incidenti avvenuti negli ultimi mesi», come ha rivelato la testata americana Axios. E il numero complessivo potrebbe crescere ancora: lo scenario degli agenti Ai «ribelli» cambia così improvvisamente scala.
È bene chiarire che non si parla di decine di migliaia di attacchi informatici riusciti. Nel conteggio ci sono episodi di gravità molto diversa, compresi i tentativi falliti e i comportamenti adottati in modo deliberato durante le prove di sicurezza. Tra i casi segnalati ci sono modelli che hanno superato i «guardrail» imposti dalle aziende, creato bacheche attraverso le quali comunicare, cercato di uscire dagli ambienti di test, preso il controllo di siti web, generato autonomamente nuovi comandi via prompt o tentato di evitare i sistemi incaricati di controllarli. Molti degli episodi ora all’esame delle aziende non sono ancora stati divulgati e le indagini sono in corso.
OpenAI intanto si è cautelata sospendendo la fase di addestramento con rinforzo (Reinforcement learning) di tutti i suoi modelli più capaci, dopo un incidente avvenuto il 20 settembre. Il modello è infatti «evaso» dal suo ambiente controllato e ha avuto accesso non autorizzato a Internet sfruttando in maniera creativa un buco del Dns (Domain name system, il protocollo che serve normalmente a «tradurre» i nomi dei siti nei relativi indirizzi numerici) usato da OpenAI. Lo ha fatto per poter consultare un’altra Intelligenza artificiale, un chatbot esterno, e rispondere così ad alcune domande a cui non riusciva a dare risposta. È, grosso modo, quello che è successo in moltissimi dei casi degli agenti «ribelli» segnalati nelle ultime settimane: pur di portare a termine un compito assegnato si sono mossi in modi che andavano al di là dei limiti imposti, a volte «bucando» siti e piattaforme altrui, a volte provandoci, altre volte reiterando i tentativi in modo massiccio. Come nel caso ricostruito dal Wall Street Journal: a giugno agenti di OpenAI hanno inviato più di 16.000 richieste a un sito delle Nazioni Unite che ospita dati pubblici e sono riusciti ad aggirare almeno uno dei filtri predisposti per limitarne l’accesso automatizzato.
Trump ha più volte definito una «bufala» i timori che questi sistemi possano sfuggire al controllo e ha indicando la competizione con la Cina nell’Ai la ragione principale per tirare dritto. Il presidente ha invitato a una cena privata alla Casa Bianca il ceo di Anthropic, Dario Amodei, in quello che sembra un segno di distensione tra l’azienda e l’amministrazione. Trump aveva accusato Amodei di voler apparire come «un angioletto perfetto» per il suo allarme sui rischi dell’Ai e sulla necessità di rallentarne lo sviluppo. Ma le nuove rivelazioni di Axios sono destinate a sollevare un nuovo polverone. Gary Marcus, tra i critici più noti dell’attuale corsa all’Intelligenza artificiale, chiosa: «Se fossero stati modelli cinesi, saremmo tutti impazziti».
E intanto Bill Gates, in un’intervista a Nbc, si è unito al coro di chi chiede al governo di agire: «Nessuno pensa che l’autoregolamentazione sia sufficiente», ha affermato.