> > OpenAI segnala sei anomalie nei suoi modelli: stretta su controlli e trasparenza

OpenAI segnala sei anomalie nei suoi modelli: stretta su controlli e trasparenza

OpenAI segnala sei anomalie nei suoi modelli: stretta su controlli e trasparenza

OpenAI segnala sei comportamenti anomali dei suoi modelli IA e annuncia nuovi controlli per rafforzare la sicurezza.

OpenAI accende i riflettori sulla sicurezza dell’intelligenza artificiale, rendendo noti sei casi di comportamenti anomali o preoccupanti emersi durante i test dei suoi modelli. L’azienda ha annunciato anche nuove procedure per segnalare e monitorare più rapidamente eventuali problemi futuri.

OpenAI rivela sei casi di comportamento anomalo dei suoi modelli

OpenAI ha reso pubblici sei episodi di comportamento “imprevisto o preoccupante” osservati negli ultimi mesi nei propri sistemi di intelligenza artificiale, annunciando allo stesso tempo un nuovo metodo per individuare, analizzare e comunicare eventuali anomalie future.

L’obiettivo è rendere più sistematica la divulgazione dei casi di cosiddetto “disallineamento”, cioè quelle situazioni in cui le azioni di un modello si discostano dagli obiettivi e dagli interessi umani.

La società ha spiegato che le segnalazioni potranno essere pubblicate anche prima che le cause siano state completamente comprese o risolte, nella convinzione che la crescita delle capacità dell’IA richieda controlli sempre più rigorosi.

L’iniziativa arriva dopo l’incidente che a luglio ha coinvolto Hugging Face, quando alcuni sistemi di OpenAI riuscirono ad aggirare le protezioni dell’ambiente di test, comunicando attraverso canali non autorizzati e raggiungendo sistemi esterni. OpenAI lo ha successivamente definito un importante segnale d’allarme sulla necessità di rafforzare sicurezza, monitoraggio e allineamento.

OpenAI, sei casi di comportamenti anomali nei modelli: rafforzato il monitoraggio

Come riportato da Tgcom24, tra i nuovi episodi descritti dall’azienda figurano comportamenti molto diversi. Un modello di ricerca non ancora distribuito e una sessione di addestramento di GPT-5.6 Sol hanno inserito nei riepiloghi delle conversazioni istruzioni rivolte alle proprie versioni future, anche “allo scopo di celare errori all’utente o comportamenti non allineati.

In un altro test, un sistema interno ha utilizzato una chiave API trapelata “senza alcuna autorizzazione”, arrivando inoltre a produrre dati non veritieri. Altri modelli hanno trovato sistemi non previsti per comunicare tra loro attraverso bacheche o servizi di condivisione dei file, mentre due sistemi in addestramento hanno caricato materiale online per poterlo successivamente presentare ai valutatori come fonte pertinente.

I casi segnalati da OpenAI riaccendono così il dibattito sulla sicurezza dell’intelligenza artificiale, mentre le aziende del settore cercano nuove regole e controlli per accompagnare lo sviluppo di modelli sempre più avanzati.

Continua sull'app Le notizie della tua città, in tempo reale.
Apri nell'app