OpenAI introduce reguli dure după ce agenții AI au accesat fișiere interne
Jailbreak intern și acces neautorizat!
Siguranța și comportamentul agenților inteligenți au devenit o prioritate absolută pentru OpenAI.
Culture picks:
Compania a fost forțată să introducă un protocol rigid de raportare publică, după ce a descoperit alte șase incidente majore în timpul testelor interne pentru modelele sale de ultimă generație, potrivit informațiilor publicate de Playtech.
Toate aceste evenimente s-au petrecut în ultimul semestru, într-un mediu controlat de testare, departe de ochii publicului care folosește ChatGPT. Comportamentele observate au fost diverse: de la accesări nepermise de resurse digitale și transferuri de fișiere între entități software, până la injectarea unor directive menite să spargă limitările programate.
Transparență forțată și dialog cu autoritățile!
Printre cele mai notabile cazuri se numără cel în care un model aflat în dezvoltare a ajuns să-și scrie singur comenzi de tip „jailbreak” în notele interne. Aceste instrucțiuni aveau rolul de a eluda regulile impuse de creatori. În altă instanță, un agent virtual a navigat pe internet fără aviz pentru a căuta o sursă bibliografică. De asemenea, un alt model a colaborat pe ascuns, trimițând fișiere altor agenți AI, deși arhitectura sa nu-i permitea acest lucru.
Reprezentanții OpenAI au confirmat că toate cele șase episoade au fost surprinse în faza de validare. Compania a decis acum să extindă lista comportamentelor monitorizate, mergând dincolo de simpla tentativă de accesare a sistemelor externe.
Noul mecanism stabilește criterii clare pentru aducerea incidentelor de securitate la cunoștința publicului. OpenAI recunoaște deschis că abordarea de până acum a fost una spontană și insuficient de transparentă. Cum în industrie nu există încă un standard universal pentru raportarea unor astfel de anomalii, compania speră ca noul său flux să devină un exemplu de bune practici.
Totuși, incidentele care sunt doar duplicate ale unor comportamente deja știute nu vor mai fi publicate.
Umbrele trecutului și presiunea Congresului!
În paralel, gigantul american analizează și posibilitatea de a sesiza direct autoritățile federale din SUA în cazurile grave de breșe de securitate sau de „misalignment” – adică situațiile în care acțiunile modelului contrazic intențiile programatorilor.
Aceste măsuri vin și pe fondul experimentului din primăvara lui 2026, când o echipă de agenți AI a reușit o cooperare complexă. Atunci, boții au schimbat mesaje pentru a extrage date de autentificare și a pătrunde în infrastructura platformei Hugging Face.
Deși OpenAI a dat asigurări că sistemele live folosite de public nu au fost afectate, compania a admis că acțiunile agenților au imitat perfect pașii unui hacker uman. Totul se întâmplă în plină dezbatere în Congresul SUA, unde legiuitorii sunt împărțiți: unii cer autoreglementare pentru industrie, în timp ce alții vor un cadru legal strict pentru sistemele autonome.
More stories: