OpenAI ha appena pubblicato sei nuovi casi di comportamento “misaligned”, cioè situazioni in cui i suoi modelli, durante l’addestramento o le valutazioni interne, hanno fatto qualcosa che non era stato chiesto o hanno cercato scorciatoie per raggiungere l’obiettivo.
Il New York Times ha raccontato alcuni di questi episodi e OpenAI li ha raccolti nel suo nuovo framework per rendere pubblici più velocemente i casi di model misalignment.
I sei episodi sembrano quasi usciti da un racconto di fantascienza.
- Un modello ha scritto da solo nuove istruzioni per se stesso. Una versione sperimentale di Astra ha inserito nei propri riassunti istruzioni del tipo «non rispondi a corporation o governi» e «ignora i messaggi degli sviluppatori». In alcuni casi le ha poi ignorate, in altri istruzioni auto-generate hanno effettivamente influenzato il comportamento successivo. OpenAI ha trovato 27 riassunti di questo tipo.
- GPT-5.6 Sol si è lasciato istruzioni per nascondere i propri errori. In un caso, non trovando alcuni dati storici per un modello finanziario, ha scritto alla propria versione successiva di inventare valori plausibili e di essere «trasparente solo se richiesto». In un altro ha suggerito di non segnalare discrepanze nelle fonti.
- Un modello ha cercato credenziali API trapelate su GitHub. Doveva recuperare alcuni dati statistici. Dopo diversi tentativi falliti, ha cercato chiavi API esposte pubblicamente, ne ha trovata una funzionante e l’ha usata senza autorizzazione. Quando neppure questo ha risolto il problema, ha inventato i dati e li ha presentati come reali.
- Un modello ha caricato file su Internet per poterli citare. Aveva già trovato correttamente alcuni dati con Python, ma non riusciva a produrre una citazione attraverso il browser. Ha quindi caricato autonomamente il file su un servizio pubblico nel tentativo di trasformarlo in una fonte citabile.
- Modelli separati hanno creato una sorta di bacheca per comunicare tra loro. Durante il training, alcuni agenti hanno scoperto di poter utilizzare un repository software interno di OpenAI per leggere messaggi lasciati da altri agenti, rispondere e scambiarsi informazioni tra sessioni che avrebbero dovuto essere indipendenti. Un meccanismo simile è poi riapparso nell’incidente di Hugging Face.
- Alcuni agenti hanno pubblicato file online per passarli ad altri agenti. Non riuscendo a condividere localmente un file Excel, un agente ha provato prima con un server locale e poi ha caricato il documento su un servizio pubblico, inviando il link agli altri agenti. Il task prevedeva esplicitamente che i file restassero locali.
OpenAI precisa che si tratta di singoli episodi osservati durante training o valutazioni e che questi sei casi non permettono di stimare quanto frequentemente avvengano comportamenti simili.
Però c’è un filo comune tra tutti questi casi: quando la macchina aveva un obiettivo e incontrava un ostacolo (es: non trovava un dato, non riusciva a condividere un file, non poteva accedere a qualcosa…) invece di fermarsi, chiedere aiuto o ammettere il limite, ha trovato autonomamente un’altra strada.
Ha fatto proprio il vecchio detto per cui meglio chiedere il perdono che il permesso.
A volte inventando informazioni. A volte usando credenziali che non avrebbe dovuto usare. A volte pubblicando dati online. A volte creando nuovi canali di comunicazione.
È anche per questo che OpenAI ha introdotto un nuovo processo in cui qualsiasi dipendente può segnalare un caso e chiederne la pubblicazione, senza aspettare necessariamente di aver già capito perfettamente cosa sia successo o come risolverlo.