Il mondo FQ

OpenAI sospende l’addestramento dei modelli di intelligenza artificiale. Axios: “Decine di migliaia di incidenti con agenti ribelli”

L'azienda tech guidata da Sam Altman ha dichiarato che riprenderà le fasi di addestramento "solo quando saremo certi di disporre di ulteriori misure di sicurezza"
OpenAI sospende l’addestramento dei modelli di intelligenza artificiale. Axios: “Decine di migliaia di incidenti con agenti ribelli”
Icona dei commenti Commenti

OpenAI ha deciso di sospendere l’addestramento dei suoi modelli di intelligenza artificiale più recenti e avanzati. La causa sono numerosi incidenti in cui agenti AI hanno agito in via autonoma e in modo non autorizzato. L’azienda, in una nota, ha riferito che riprenderà l’addestramento solo quando saranno implementate ulteriori misure di sicurezza. Sia OpenAI sia Anthropic stanno indagando su migliaia di incidenti di sicurezza, inclusi i tentativi di hackeraggio e diffusione di informazioni riservate. L’azienda tech guidata da Sam Altman ha dichiarato che riprenderà le fasi di addestramento “solo quando saremo certi di disporre di ulteriori misure di sicurezza”, aggiungendo di prevedere di dover “mettere in pausa” nuovamente il processo man mano che l’AI si sviluppa ed emergono altre problematiche.

Gli incidenti sui quali OpenAI, Anthropic e ricercatori di sicurezza stanno indagando sarebbero decine di migliaia, secondo quanto riferisce Axios. Gli episodi si sono verificati negli ultimi mesi sia durante test interni sia nel mondo reale. Gli incidenti comprendono aggiramento dei sistemi di sicurezza, creazione di bacheche di messaggi, fuga dalle sandbox, dirottamento di siti web, auto-prompting e tentativi di eludere i sistemi di monitoraggio, secondo le fonti citate dall’agenzia. Molti casi non sono ancora stati resi pubblici, mentre i ricercatori continuano a indagare. Una parte dei test consiste nel cosiddetto “red-teaming“, in cui le aziende cercano deliberatamente di spingere i modelli a comportarsi in modo scorretto per verificarne la sicurezza. Gli episodi hanno livelli di gravità differenti e comprendono sia tentativi riusciti sia falliti di aggirare i sistemi di sicurezza.

La maggior parte, finora, non risulta aver provocato danni nel mondo reale, mentre il numero complessivo degli incidenti potrebbe crescere ben oltre le decine di migliaia, secondo le fonti di Axios. Tra i casi emersi recentemente ci sono agenti di OpenAI che hanno diffuso online 53 immagini appartenenti a utenti di ChatGPT, la violazione di un sito del governo australiano e tentativi di attaccare altri siti, compresi quelli del governo degli Usa, secondo quanto riferito da OpenAI, dalle fonti citate da Axios e da precedenti resoconti di Reuters e New York Times. Il Ceo Sam Altman ha scritto su X che la revisione in corso “non è stata così rapida come avremmo voluto”.

Gentile lettore, la pubblicazione dei commenti è sospesa dalle 20 alle 9, i commenti per ogni articolo saranno chiusi dopo 72 ore, il massimo di caratteri consentito per ogni messaggio è di 1.500 e ogni utente può postare al massimo 150 commenti alla settimana. Abbiamo deciso di impostare questi limiti per migliorare la qualità del dibattito. È necessario attenersi Termini e Condizioni di utilizzo del sito (in particolare punti 3 e 5): evitare gli insulti, le accuse senza fondamento e mantenersi in tema con la discussione. I commenti saranno pubblicati dopo essere stati letti e approvati, ad eccezione di quelli pubblicati dagli utenti in white list (vedere il punto 3 della nostra policy). Infine non è consentito accedere al servizio tramite account multipli. Vi preghiamo di segnalare eventuali problemi tecnici al nostro supporto tecnico La Redazione