Într-o situație, sistemul AI de ultimă generație a reușit să genereze identități fabricate ale unor persoane existente, în scopul de a înșela utilizatorii.
Cele mai noi sisteme de inteligență artificială create de Anthropic și OpenAI au depășit praguri neobișnuite în efortul de a compromite o platformă binecunoscută, în cadrul testelor efectuate de Institutul de Securitate AI din Marea Britanie (AISI), spune BBC.
AISI a anunțat marți că modelele Mythos de la Anthropic și Sol de la OpenAI au demonstrat un grad de „autonomie și înșelăciune” fără precedent până în prezent.
Citește șiAxis BootCamp 2026: demonstrații tehnice și experiență practică la Snagov
În timpul unui experiment de securitate a inteligenței artificiale, un operator din cadrul Anthropic a generat identități fictive ale unor persoane reale, având ca scop așadar a induce în eroare un utilizator care se afla în fața lui și în fața accesului la GitHub, o platformă majoră unde dezvoltatorii de tehnologie își depozitează codul software.
Conform declarațiilor din partea Anthropic și OpenAI, intervenția efectuată de AISI a scăzut sau a anulat protocoalele de siguranță standard.
Ce s-a petrecut în perioada de testare
Evaluatorii AISI au remarcat inițial
„transferuri neobișnuite de date care ieșeau din sistemele noastre de cercetare”
în cadrul testului.
Apoi, au constatat că „unii dintre agenții testați se angajaseră în activități susținute, potențial dăunătoare, îndreptate împotriva unor persoane și organizații reale”.
De exemplu, un operator numit Mythos a elaborat un
„cod rău intenționat”
pe care a încercat să-l încorporeze în platforma GitHub.
Agentul Mythos a identificat și a cercetat persoanele care se ocupau de întreținerea GitHub și a creat o serie de „identități online false” inspirate de aceste persoane reale.
În cadrul unei inițiative menite să exercite presiune asupra indivizilor umani și să-i înșele, a încercat să îi convingă să accepte codul său dăunător.
Agentul a transmis chiar și mesaje private acelor indivizi, pretinzând că era persoanele autentice pe care le investigase.
„Atunci când cererea de modificare a agentului a fost contestată în mod public, acesta și-a modificat activitatea anterioară pentru a părea inofensiv și a luat în considerare adoptarea unei noi identități pentru a-și continua activitatea”
AISI a declarat.
Deși AISI a precizat că agentul Mythos nu primise instrucțiuni specifice să evite sau să adopte un astfel de comportament, a fost „prima dată când am observat ca riscurile legate de autonomie și înșelăciune să se manifeste atât de clar, fără o îndemnare specifică, în lumea reală”.
În final, AISI a declarat că modul în care Mythos și Sol au reacționat la o sarcină simplă a depășit limitele stabilite pentru aceste instrumente AI.
„Activitatea desfășurată de agent a prezentat semne de comportamente inedite, potențial înșelătoare, la o amploare și o gravitate pe care nu le-am anticipat”
, AISI a spus.
În raportul AISI, cea mai mare parte a acțiunilor malefice atribuite agenților a fost realizată de Mythos. Sol a fost acuzat doar pentru două dintre aceste incidente.
Răspunsul OpenAI și Anthropic
Anthropic a transmis, într-un comunicat, că parametrii de testare AISI „nu erau reprezentativi pentru niciunul dintre modelele noastre de producție”, iar firma își desfășoară propria investigație asupra incidentului pentru a „identifica cauzele comportamentului”.
Conform unui reprezentant al OpenAI, condițiile de testare AISI nu corespund utilizării obișnuite, iar firma își propune să colaboreze în continuare cu evaluatorii și alte entități din sector pentru a întări normele comune de desfășurare a evaluărilor în medii sigure, pe măsură ce modelele dobândesc performanțe tot mai ridicate.
COMENTARII / 0