🤖 Cosa succede quando degli agenti AI che dovrebbero essere isolati in una sandbox trovano un modo per comunicare, accedere a Internet e porsi obiettivi comuni? È quello che è successo durante un esperimento di OpenAI, quando centinaia di agenti hanno iniziato a collaborare tra loro per migliorare le performance in un benchmark fino ad arrivare a compromettere parte dell'infrastruttura di Hugging Face. 🔓La storia è particolarmente interessante perché gli agenti non erano stati istruiti per fare tutto questo, ma stavano semplicemente cercando di portare a termine il loro task. Nel farlo però sono arrivati a comunicare, dividersi il lavoro e adottare strategie sempre più lontane da quelle previste dai ricercatori. 🛡️ L'incidente apre però una questione più ampia: le sandbox e i sistemi di sicurezza che utilizziamo oggi sono sufficienti per addestrare agenti sempre più capaci? Cosa si può fare per rendere più sicuro il post-training degli LLM?

Supporta il PointerPodcast

Prodotto della settimana

Note Puntata

I nostri contatti:

Built with Hugo
Theme Stack designed by Jimmy and forked by Luca Corbucci