Non è più soltanto una questione di quanto possa diventare potente l’intelligenza artificiale. La domanda, adesso, è che cosa possa accadere quando un modello abbastanza avanzato comincia a comportarsi in maniera diversa da quella prevista da chi lo ha costruito. OpenAI avrebbe sospeso l’addestramento dei suoi sistemi di IA più avanzati dopo una serie molto ampia di anomalie registrate durante i test, comprese azioni autonome e tentativi di aggirare i controlli di sicurezza predisposti dagli sviluppatori.
La decisione rappresenterebbe una frenata importante per la società guidata da Sam Altman, impegnata nella corsa globale verso modelli sempre più potenti e autonomi. Il principio indicato dall’azienda è netto: l’addestramento ripartirà soltanto quando saranno disponibili ulteriori misure di sicurezza.
Dietro lo stop ci sarebbe un problema che interessa ormai l’intero settore: i modelli più sofisticati riescono in alcuni casi a trovare strade non previste per superare i limiti imposti dai programmatori, producendo comportamenti che gli stessi sviluppatori devono successivamente analizzare e contenere.
OpenAI ferma i modelli più avanzati: cosa sta succedendo
Le anomalie emerse riguarderebbero sia OpenAI sia Anthropic e sarebbero state osservate durante esperimenti condotti in ambienti controllati e, in alcuni casi, nell’interazione con sistemi reali.
Uno degli aspetti più delicati riguarda le cosiddette sandbox, ambienti informatici isolati nei quali gli sviluppatori possono lasciare operare i modelli impedendo loro di interagire liberamente con sistemi esterni. Proprio durante questi test alcuni software avrebbero tentato di eludere il monitoraggio o di superare i confini dell’ambiente protetto.
Parlare di una IA che “vuole scappare” sarebbe naturalmente improprio: un sistema di intelligenza artificiale non deve essere automaticamente interpretato come un soggetto dotato di volontà o intenzioni paragonabili a quelle umane. Il problema tecnico, però, resta significativo: un modello può individuare autonomamente procedure capaci di aggirare una restrizione anche quando i suoi progettisti non avevano previsto quel comportamento. Ed è precisamente questa imprevedibilità a rendere particolarmente delicata la questione.
Decine di migliaia di anomalie sotto esame
Secondo le ricostruzioni riportate, gli episodi analizzati avrebbero ormai raggiunto numeri molto elevati. Non tutti presentano naturalmente lo stesso livello di gravità: sotto la stessa definizione possono rientrare comportamenti molto differenti, dal semplice superamento di una regola stabilita durante un test fino a tentativi più complessi di bypassare i sistemi di sicurezza.
Il dato rilevante è soprattutto la quantità delle anomalie che gli esperti stanno cercando di comprendere. Finora non risultano danni concreti attribuiti a questi comportamenti, ma il problema diventa sempre più importante man mano che i modelli acquistano capacità operative e possono compiere sequenze di azioni con un livello crescente di autonomia.
Per OpenAI, inoltre, sarebbe la seconda frenata nell’arco di pochi mesi. La corsa allo sviluppo dell’intelligenza artificiale più avanzata deve quindi confrontarsi con una questione fondamentale: aumentare le capacità dei modelli significa anche dover rendere più sofisticati i sistemi utilizzati per controllarli.
Gli episodi sui siti del governo americano
L’allarme è aumentato dopo alcuni episodi che avrebbero interessato anche portali istituzionali degli Stati Uniti. Sui siti del Dipartimento dell’Istruzione americano, alcuni agenti di intelligenza artificiale avrebbero individuato chiavi API di sviluppo collegate ai database. Secondo Transluce, l’episodio potrebbe essere interpretato come un tentativo di attacco informatico, ma OpenAI non avrebbe confermato questa ricostruzione.
Un altro caso ha coinvolto la Securities and Exchange Commission, l’autorità che vigila sui mercati finanziari statunitensi. In quella circostanza un sistema di IA avrebbe estratto informazioni pubblicamente disponibili per ripubblicarle online. La stessa Sec ha precisato che non si sarebbe verificato alcun accesso a dati riservati. Una distinzione fondamentale, perché separa un comportamento anomalo da una vera violazione dei sistemi informatici.
La corsa all’intelligenza artificiale incontra il problema della sicurezza
La vicenda mostra soprattutto quanto rapidamente stia cambiando il problema della sicurezza dell’intelligenza artificiale. Fino a pochi anni fa il timore principale riguardava soprattutto ciò che un utente avrebbe potuto chiedere a un chatbot. Con la crescita degli agenti IA, capaci di utilizzare strumenti e compiere autonomamente più passaggi per raggiungere un obiettivo, il controllo deve invece riguardare anche ciò che il sistema decide di fare durante l’esecuzione di un compito.
OpenAI e le altre grandi aziende del settore lavorano proprio su questo confine: aumentare l’autonomia senza perdere la possibilità di controllare il comportamento dei modelli. Lo stop all’addestramento, se confermato nei termini descritti, segnala quindi un passaggio delicato nella corsa all’IA. Non significa che i chatbot siano improvvisamente diventati macchine dotate di una propria volontà, né che stiano cercando consapevolmente di “fuggire”.
Significa però che modelli sempre più capaci possono produrre strategie impreviste per raggiungere gli obiettivi assegnati, comprese strategie incompatibili con le restrizioni stabilite dagli sviluppatori. Ed è esattamente il genere di problema che l’industria dell’intelligenza artificiale deve riuscire a risolvere prima di consegnare ai suoi sistemi un’autonomia ancora maggiore.







