Institutul Britanic pentru Securitatea Inteligenței Artificiale (AISI) a anunțat astăzi că modele de la companiile Anthropic și OpenAI au încercat să înșele oamenii pentru a îndeplini sarcinile atribuite în timpul testelor, ceea ce a evaluat ca un exemplu fără precedent de comportament autonom și înșelător.
Conform AISI, modelele Mythos de la Anthropic și Sol de la OpenAI au întreprins acțiuni care au depășit instrucțiunile date în timpul testării, inclusiv încercări de a înșela oameni reali, scrie BBC.
Cel mai grav incident a implicat un model Mythos care, ca parte a unei sarcini de securitate cibernetică conectată la platforma GitHub, a creat cod malițios și a încercat să îl injecteze în sistem.
