După OpenAI, și Anthropic raportează un incident cu agenți AI scăpați de sub control
Modele de inteligență artificială dezvoltate de Anthropic au accesat neautorizat sistemele a trei companii în timpul unor teste de securitate cibernetică, după ce o eroare operațională le-a lăsat conectate la internetul public, deși evaluările ar fi trebuit să se desfășoare într-un mediu izolat, relatează Reuters.
Anthropic a catalogat situația drept un eșec operațional și a transmis că este nevoie de controale mai stricte în mediile de testare, atât interne, cât și operate de parteneri externi.
Incidentul vine la câteva zile după ce OpenAI a dezvăluit un caz separat în care un agent AI a declanșat un atac neautorizat în timpul unor teste cibernetice.
Modelele au ajuns pe internet dintr-o eroare de configurare
Potrivit Anthropic, modelele Claude implicate în teste fuseseră instruite că nu au acces la internet. Totuși, o neînțelegere în relația cu un partener de evaluare a făcut ca sistemele să rămână conectate la web-ul public.
Compania a identificat incidentele după ce a analizat 141.006 sesiuni de testare, proces început după ce OpenAI a anunțat că un agent autonom bazat pe modelele sale a compromis infrastructura startup-ului Hugging Face.
În cazul Anthropic, accesul neautorizat a vizat trei organizații, ale căror nume nu au fost făcute publice. Modelele ar fi folosit tehnici de bază, precum exploatarea unor parole slabe și a unor puncte de acces neautentificate.
Claude Opus 4.7, Claude Mythos 5 și un model intern, implicate în incidente
Incidentele au implicat trei modele diferite: Claude Opus 4.7, Claude Mythos 5 și un model intern de cercetare aflat în testare.
Primele cazuri datează din aprilie și au avut loc în medii de evaluare construite special fără anumite măsuri de protecție, pentru ca Anthropic să poată testa limitele modelelor sale.
Modelele participau la exerciții de tip „capture-the-flag”, scenarii folosite în securitate cibernetică în care sistemele trebuie să găsească informații ascunse în rețele simulate.
Într-unul dintre cazuri, Claude Opus 4.7 a primit ca țintă o companie fictivă, dar numele acesteia coincidea cu cel al unei firme reale. Modelul a găsit apoi vulnerabilități care i-au permis să acceseze credențiale și o bază de date aparținând companiei reale. Potrivit Anthropic, modelul a interpretat greșit situația și a considerat că ținta reală făcea parte din simulare.
Într-un alt caz, un model intern, încă nelansat public, și-a oprit singur atacul după ce a realizat că ajunsese la o țintă reală. Anthropic a transmis că acest comportament este un semn încurajator, dar că sunt necesare teste suplimentare înainte de a trage concluzii.
Testele cibernetice au fost suspendate
Anthropic a suspendat toate evaluările cibernetice pe 23 iulie și a notificat organizațiile afectate pe 27 iulie. Două dintre acestea nu știau despre activitate înainte de a fi contactate, iar compania a precizat că încă încearcă să ia legătura cu a treia organizație.
Unul dintre partenerii externi de evaluare ai Anthropic, laboratorul de securitate cibernetică Irregular, a transmis pentru Reuters că desfășoară o investigație proprie privind incidentele.
Cazurile pun presiune pe industria AI
Noile incidente apar într-un moment în care Anthropic și OpenAI concurează pentru lansarea unor modele tot mai avansate, în timp ce investitorii și autoritățile sunt tot mai atente la riscurile de securitate asociate agenților AI autonomi.
Reuters notează că Washingtonul a început să intensifice supravegherea lansărilor de modele avansate. Pe 2 iunie, președintele american Donald Trump a cerut consilierilor să dezvolte un cadru voluntar de testare în domeniul securității cibernetice pentru cele mai performante sisteme AI, cu implicarea dezvoltatorilor de tehnologie.
În paralel, CEO-ul OpenAI, Sam Altman, a discutat recent cu senatori americani despre incidentul agentului AI care a acționat necontrolat, iar compania urma să discute cu Casa Albă despre modelele viitoare și despre procedurile de testare.
Pentru industria AI, miza este dublă: pe de o parte, companiile vor să demonstreze că modelele lor pot identifica vulnerabilități și pot ajuta la securitate cibernetică; pe de altă parte, aceleași capabilități pot genera riscuri reale dacă modelele scapă din mediile controlate sau interpretează greșit limitele testelor.
Te-ar putea interesa și Inteligența artificială poate crește productivitatea firmelor. Oficial BNR explică miza pentru economia României