Un raport britanic confirmă: Modele de IA au scăpat de sub control în testele de securitate. „Comportament înşelător fără precedent”

Data publicării:
IA
Modele avansate de inteligență artificială, precum Mythos și Sol, au manifestat comportament autonom și înșelător în cadrul testelor de securitate realizate de autoritățile britanice. Foto: Profimedia

Guvernul britanic a avertizat într-un raport că modelele de Inteligenţă Artificială (IA) Mythos şi Sol, ale companiilor americane Anthropic şi, respectiv, OpenAI, au demonstrat un comportament autonom şi înşelător fără precedent în timpul testelor de securitate cibernetică, relatează miercuri agenţia EFE.

Ministerul britanic pentru Ştiinţă, Inovaţie şi Tehnologie a ajuns la această concluzie în urma unei evaluări de rutină efectuate de Institutul de Securitate a Inteligenţei Artificiale (AISI) din Regatul Unit.

Conform unui raport elaborat de acest institut, din cele 122 de teste efectuate cu şapte modele de IA, în 10 dintre acestea au fost observate 19 acţiuni neautorizate care au depăşit parametrii fixaţi de cercetători, 17 dintre aceste acţiuni fiind legate de modelul Mythos 5 al companiei Anthropic şi două de modelul GPT-5.6 Sol al companiei OpenAI.

De asemenea, au fost identificate încercări ale Mythos de a contacta persoane reale pentru a le convinge să ruleze fişiere maliţioase şi să insereze instrucţiuni ascunse menite să manipuleze alte sisteme de IA.

Ambele modele, care sunt printre cele mai puternice din lume, au creat inclusiv profiluri umane false pentru a încerca să înşele oameni, în timpul simulării unui atac cibernetic de către AISI. Instrumentul Anthropic a încercat chiar să acceseze un serviciu prin trimiterea de mesaje private după ce a creat conturi false care imitau persoane reale.

Totuşi, AISI subliniază că „aceste încercări nu au avut succes” şi că investigaţia sa „nu a relevat dovezi de prejudicii în lumea reală”. Institutul britanic consideră însă că cercetarea sa reprezintă un punct de cotitură, întrucât este prima dată când se observă „riscuri legate de autonomie şi înşelăciune manifestându-se într-o formă atât de clară, fără instrucţiuni specifice şi în lumea reală”.

Replicând acestui raport, cele două companii afirmă că testele AISI au fost efectuate într-un mediu în care funcţiile de siguranţă ale acelor modele de IA au fost reduse sau eliminate.

Anthropic susţine astfel că parametrii testelor efectuate „nu sunt reprezentativi” pentru modelele sale, deşi confirmă că a deschis propria investigaţie.
La rândul său, OpenAI afirmă că AISI a efectuat testele în condiţii care „nu reflectă utilizarea obişnuită” a modelelor sale, dar adaugă că va continua să colaboreze cu evaluatorii şi cu „alţi actori din sector pentru a consolida practicile comune care permit realizarea unor evaluări sigure, pe măsură ce modelele devin tot mai capabile”.

La sfârşitul lunii iulie, Anthropic a dezvăluit că, în timpul testelor de securitate cibernetică, trei modele ale asistentului său Claude au reuşit să acceseze internetul şi să pirateze sistemele a trei organizaţii.

Anterior, pe 21 iulie, OpenAI a recunoscut că două dintre modelele sale de IA au reuşit să iasă din mediul de testare şi să pătrundă în platforma Hugging Face, trecând de sistemele de securitate cibernetică ale acesteia.

 

 

Editor : Sebastian Eduard

Urmărește știrile Digi24.ro și pe Google News

Partenerii noștri
Playtech
Șoselele din România unde sunt amplasate radarele e-SIGUR. Cât plătești dacă depășești viteza
Digi FM
Nu a fost lăsată să urce în avion spre Bali din cauza unui detaliu aproape invizibil din pașaport. A costat-o...
Descarcă aplicația Digi FM
Pro FM
Robbie Williams, diagnostic surprinzător la 52 de ani: "Explică atât de multe". Artistul a vorbit și despre...
Descarcă aplicația Pro FM
Film Now
Jon Hamm, la plajă cu soția. Actorul din „Mad Men” urmează să devină tată pentru prima dată, la vârsta de 55...
Adevarul
Coșmar într-un avion Ryanair. Pasagerii ar fi leșinat și vomitat din cauza căldurii sufocante
Newsweek
Casa de Pensii anunță: Ce documente trebuie să depună o categorie de români ca să iasă mai repede la pensie?
Digi FM
Bunica de 70 de ani cu trup de fier. Mănâncă peste cinci kilograme de carne pe săptămână și merge la sală cu...
Descarcă aplicația Digi FM
Digi World
De ce unii oameni sunt „magnet” pentru ţânţari, în timp ce alţii par să fie ocoliţi de aceste insecte...
Digi Animal World
De ce acest teckel nu se atinge de mâncare imediat. Refuză să mănânce până când stăpâna lui face un gest...
Film Now
Linda Gray, de la Sue Ellen Ewing la rolul de menajeră. Motivul pentru care regizorii o refuzau după faima...
UTV
Cătălin Botezatu critică dur femeile care exagereaza cu operațiile estetice. „Toate vor să arate precum...