Meta a anunțat miercuri că unul dintre modelele sale de inteligență artificială a piratat o altă companie în timpul testelor de securitate cibernetică, alimentând îngrijorările cu privire la modul în care dezvoltatorii pot controla sisteme de AI din ce în ce mai performante, după incidente similare la rivalii Anthropic și OpenAI, relatează Reuters.
Incidentele de la Meta și Anthropic au provenit din erori de configurare care au oferit, în mod accidental, modelelor Anthropic acces la internetul deschis. În cazul OpenAI, un agent de inteligență artificială a exploatat independent o vulnerabilitate necunoscută anterior pentru a ajunge la internet în timpul testelor de securitate cibernetică.
Încălcările evidențiază îngrijorările tot mai mari că sistemele avansate de inteligență artificială ar putea prezenta noi riscuri de securitate cibernetică și probabil vor intensifica eforturile administrației SUA de a îmbunătăți siguranța inteligenței artificiale, pe măsură ce companiile se grăbesc să dezvolte modele mai performante. Unii lideri proeminenți în domeniul inteligenței artificiale au susținut că dezvoltarea ar trebui să încetinească până când vor fi implementate garanții mai puternice.
Meta a declarat că investighează un incident în care o configurație greșită efectuată de Irregular, o companie independentă care efectuează evaluări de securitate cibernetică pentru Meta, a oferit în mod accidental acces la internet unuia dintre modelele sale în timpul unui test.
Modelul ‘a exploatat o vulnerabilitate de securitate la un serviciu terț, într-un mod similar cu cazurile raportate anterior cu alte companii’, a precizat Meta într-un comunicat.
The Information, citând surse, a relatat că modelul implicat a fost Muse Spark 1.1 de la Meta, pe care compania l-a prezentat ca fiind cel mai performant model al său pentru codare și capacitate de a acționa independent din lumea reală. Raportul a precizat că modelul a încălcat sistemele unei companii neidentificate și i-a modificat mediul intern.
Un purtător de cuvânt al Irregular a declarat pentru Reuters că incidentul a fost ‘exact aceeași problemă a mediului de evaluare care a fost deja dezvăluită de Anthropic săptămâna trecută’ și nu a implicat o ‘evadare dintr-un sandbox sau o acțiune cibernetică sofisticată’.
