OpenAI a recunoscut marți că un agent AI alimentat de modele de inteligență artificială pe care le-a dezvoltat a evadat și a compromis sisteme externe ale altei companii de AI într-un incident fără precedent. Mai interesant și îngrijorător este că atacul a avut o țintă precisă, arată TechCrunch.
Compania care dezvoltă ChatGPT a recunoscut că a fost implicată în atacul expus săptămâna precedentă de Hugging Face, o platformă independentă de găzduire a modelelor AI, și a subliniat că incidentul a avut loc în cadrul unui test intern de securitate cibernetică care a ieșit de sub control.
Hugging Face a atribuit inițial atacul unui
Citește șiAxis BootCamp 2026: demonstrații tehnice și experiență practică la Snagov
„agent AI extern”
.
Așa-zișii „agenți AI” sunt instrumente de inteligență artificială proiectate pentru a realiza cap-coadă diferite sarcini, cât mai autonom și cu input uman minim pe parcursul procesului. Acestea sunt instrumente mai sofisticate decât un chatbot precum ChatGPT sau Gemini, Claude, șamd. și au ajuns să aibă un rol proeminent în special în discuțiile despre automatizarea locurilor de muncă.
Potrivit OpenAI, mai multe dintre modelele sale au contribuit la atacul cibernetic.
Pe blogul său, OpenAI a publicat un mesaj în care a explicat în detaliu cum a dus la compromiterea Hugging Face și a indicat că mai multe dintre modelele sale au fost implicate în atac.
După investigații, am constatat că incidentul a rezultat dintr-o combinație de modele OpenAI, printre care GPT-5.6 Sol și un alt model, încă nepublicat, dar mai avansat. Toate acestea dispuneau de restricții reduse în ceea ce privește refuzul de a executa acțiuni cibernetice în scopul evaluării, în timp ce erau testate intern pe un benchmark de capacități cibernetice. Mesajul publicat de compania condusă de Sam Altman confirmă aceste detalii.
Benchmarkul reprezintă un test standardizat utilizat pentru a evaluează și compara performanța unui model de inteligență artificială în îndeplinirea unei sarcini specifice; totuși, aceleași tipuri de teste se aplică și în alte sectoare tehnologice, de exemplu, pentru a compara eficiența componentelor hardware.
În acest caz, atacul s-a direcționat spre ExploitGym, un benchmark public care evaluează cât de bine pot modelele să realizeze atacuri pe bază de vulnerabilități deja cunoscute.
În cadrul antrenamentului modelelor, se recurge adesea la benchmark-uri precum ExploitGym pentru a spori competențe specializate; însă, până în prezent, acest caz reprezintă primul exemplu în care un astfel de test a culminat cu un atac cibernetic efectiv.
Benchmark-uri concepute pentru evaluarea performanței modelelor AI, ilustrată prin imagine conceptuală, FOTO: BiancoBlue / Dreamstime.com
„Măsuri extreme”
a fost adoptată de modelele AI pentru a provoca defecțiuni în timpul evaluării.
Agentul AI nu era necesar să beneficieze de conexiune la internet, cu excepția unui dispozitiv special care permite instalarea de pachete software, care ar fi putut fi necesare pentru realizarea sarcinii. Totuși, agenta AI a identificat o vulnerabilitate necunoscută în aplicația de instalare a pachetelor software și a valorificat-o pentru a dobândi acces nelimitat la internet.
În mesajul OpenAI se evidențiază că:
„Modelele erau extrem de concentrate pe găsirea unei soluții pentru ExploitGym, mergând până la măsuri extreme pentru a atinge un obiectiv de testare foarte restrâns”
„După ce au obținut acces la internet, modelele au dedus că Hugging Face ar putea găzdui modele, seturi de date și soluții pentru ExploitGym. Cunoscând acest lucru, modelul a căutat și a găsit cu succes modalități de a obține acces la informații secrete pe care le putea folosi pentru a trișa la evaluare”, mai explică OpenAI.
Hugging Face a avut un sistem vulnerabil, detectat de modelele AI, care le-a făcut posibil să folosească citatul:
„obțină direct soluțiile de test din baza de date de producție a Hugging Face”
. Astfel, modelele au obținut efectiv rezultatele pentru benchmark.
OpenAI ce mai aduce la discuție?
În raportul Hugging Face, se pare că incidentul a reprezentat un atac cibernetic extrem de sofisticat și agresiv, marcat de
„mii de acțiuni individuale (…) cu o infrastructură de comandă și control capabilă să se auto-migreze și găzdu
OpenAI a descoperit și a raportat defecțiunile din software-ul de instalare a pachetelor, colaborând în același timp cu Hugging Face pentru a continua investigarea incidentului. Compania a declarat că va introduce noi controale atât asupra testării modelelor, cât și asupra infrastructurii asociate, pentru a evita situații similare în viitor.
TechCrunch notează că nu este clar dacă OpenAI va suporta consecințe juridice ca urmare a acestei breșe, deși este probabil ca acțiunile modelelor să fi încălcat „Computer Fraud and Abuse Act” (Legea privind frauda și abuzul informatic din Statele Unite).
Imagine pentru articol: Michal Bednarek / Dreamstime.com.
COMENTARII / 0