OpenAI a declarat că unul dintre modelele sale avansate de inteligență artificială a scăpat de sub control în timpul unui test de securitate și a declanșat un atac cibernetic asupra platformei Hugging Face, un startup din domeniul AI. Breșa a dus la compromiterea infrastructurii startup-ului și a fost posibilă după ce modelul OpenAI a reușit să se conecteze la internet, deși n-ar fi trebuit și nici nu avea această posibilitate.
Evenimentul s-a produs în timpul unui test pe care OpenAI îl derula pentru a verifica capacitățile modelelor sale într-un mediu controlat. Acest lucru presupune că programele rulau într-un mediu izolat, rupt de internet, creat special ca acțiunile inteligenței artificiale să nu poată afecta infrastructura reală.
Programul OpenAI, însă, a scăpat din zona de izolare, a ajuns pe internet și a pătruns pe platforma Hugging Face pentru a-și îndeplini obiectivul de testare. Acestu lucru a fost posibil după ce modelul AI a indentificat o vulnerabilitate de care dezvoltatorii Hugging Face nu știau și a exploatat-o pentru a accesa internetul.
„Vinovatul” este un agent autonom – după cum îl numește OpenAI – bazat pe un mix între modelul GPT-5.6 Sol, cel mai avansat și performant sistem de inteligență artificială al OpenAI, și o varianta nelansată a a acestuia.
„Considerăm că acest incident reprezintă un atac cibernetic fără precedent, care implică capacități cibernetice de ultimă generație, și reacționăm în consecință […] Modelele au identificat și au legat între ele vulnerabilitățile din mediul de cercetare al OpenAI și din infrastructura de producție a Hugging Face pentru a obține soluții direct din baza de date a Hugging Face. Toate indiciile sugerează că modelele s-au concentrat excesiv pe găsirea unei soluții, mergând până la extreme pentru a atinge un obiectiv de testare destul de restrâns”, a declarat OpenAI, într-o postare pe blogul companiei.
Incidentul demonstrează abilitățile tot mai extinse ale inteligenței artificiale, la care se adaugă acum posibilitatea de a produce efecte nedorite, nu pentru că se opune instrucționilor sau le refuză, ci din simplul motiv că urmărește obiectivul primit fără să țină cont de intenția utilizatorului.
Conform unor surse din interiorul OpenAI, citate de Financial Times, angajații din echipele de testare și securitate nu au fost surprinși de comportamentul neașteptat al modelului AI, însă au fost speriați de gravitatea incidentului.
Amenințarea la adresa securității de care experții se temeau pare că s-a adeverit. Din păcate, se pare că până și dezvoltatorii de top din industrie sunt luați prin surprindere de vulnerabilitățile pe care inteligența artificială le poate exploata.
Dacă, până acum, credeam că astfel de scenarii erau posibile doar prin metode ca: deturnarea modelelor, folosirea lor de către actori rău-intenționați sau defecțiuni, realitatea ne arată că aceste modele vor să respecte cu orice preț intrucțiunile care le-au fost date, chiar dacă asta înseamnă să facă lucruri care dăunează rezultatului dorit de oameni.
La fel de interesant este și că Hugging Face a folosit un model AI din China pentru a contracara atacul, deoarece modelele americane s-au dovedit incapabile să facă diferența dintre un sistem atacat și cel atacator, conform Reuters.
Aici e vorba de modul în care aceste modele AI sunt antrenate. Companiile americane, în special, se concentrează pe antrenamentul prin „reinforcement learning”, metodă prin care sistemul este recompensat atunci când își îndeplinește sarcina. Aceasta constă într-un scor pe care modelul îl primește la finalul antrenamentului, iar inteligența artificială va repeta acțiunile care duc la cel mai bun scor – de obicei, cel mai eficient.
Cel mai eficient, însă, nu înseamnă și cel mai bun sau cel mai sigur. Experții în siguranța AI spun că modelele antrenate prin recompense ajung să fie interesate exclusiv de rezultat, nu de modul în care îl obțin. Exact ce s-a întâmplat în cazul atacului asupra platformei Hugging Face.
„Oamenii spun: «E doar un instrument, face exact ce vrei tu să facă și nimic altceva, și urmează întocmai intenția și instrucțiunile tale.» Iar eu cred că oamenii ar trebui să fie cu adevărat pregătiți pentru situația în care modelele să aibă propriile obiective, să acționeze în mod autonom timp de câteva zile, iar aceste obiective să nu fie neapărat în concordanță cu ale tale”, a declarat Marius Hobbhahn, directorul Apollo Research, o organizațiie care testează siguranța celor mai avansate modele AI, citat de Financial Times.
Acum, mai mult decât oricând, e nevoie de o discuție serioasă despre siguranța AI și de modul în care aceasta trebuie folosită. Problema dezvoltării sigure și etice a inteligenței artificiale este, din păcate, un subiectul care pare tot mai ignorat de marile companii tech și de guvernele din jurul lumii, deși evenimente ca atacul de acum indică nevoia de resurse și atenție către măsuri de siguranță.

