
Agjenti i AI-t mashtroi njerëz realë dhe u përpoq të fusë kod keqdashës
Modeli Mythos 5 i Anthropic krijoi identitete të rreme dhe u përpoq të fusë kod keqdashës gjatë testeve të Institutit të Sigurisë së AI-t të Britanisë. Ins
Modeli më i avancuar i inteligjencës artificiale i kompanisë Anthropic krijoi identitete të rreme, mashtroi njerëz realë dhe u përpoq të fusë kod keqdashës në projekte me burim të hapur gjatë testeve të Institutit të Sigurisë së AI-t të Britanisë së Madhe (AISI), në atë që institucionit e cilëson si incidentin e parë të këtij lloji.
"Kjo është hera e parë që AISI ka parë mashtrim të kësaj severiteti, të drejtuar ndaj një personi real, pa u nxitur, në botën reale", tha instituti të martën.
Gjatë 122 sfidave të kibernetikës të organizuara nga AISI, modelet e AI-t ndërmorrën veprime të paautorizuara në 10 raste, duke synuar njerëz dhe organizata reale në internet. Shumica e incidenteve lidhen me modelin Mythos 5 të Anthropic, ndërsa pjesa tjetër me GPT-5.6-Sol të OpenAI.
Çfarë ndodhi konkretisht
Në incidentin më serioz, agjenti u përpoq të siguronte aprovimin e rishikuesve njerëzorë për të "futur kod keqdashës në një projekt me burim të hapur të përdorur publikisht", duke krijuar identitete të shumta të rreme. Ai kontaktoi persona realë drejtpërdrejt, duke dërguar mesazhe dhe skedarë përmes një shërbimi online me qëllim bindjen e tyre, ose të mjeteve të tyre të kodimit me AI, për të ekzekutuar kodin keqdashës.
Kur veprimet e agjentit u vunë në dyshim, ai modifikoi shënimet e mëparshme dhe shqyrtoi mundësinë e përdorimit të një identiteti të ri për të vazhduar. Institutet theksoi se nuk ka asnjë provë dëmi real.
Konteksti dhe reagimet
Testimi u krye në kushte të posaçme: modelet u pajisën me qasje në internet, por me mbrojtjet e ulëta. Anthropic sqaroi në platformën X se modelet u testuan në "kushte qëllimisht lehtësuese", me heqjen e masave mbrojtëse dhe pa kufizime specifike për përdorimin e internetit.
"Po punojmë ngushtë me ta për të mbledhur detaje të mëtejshme të incidentit ndërsa kryejmë hetimin tonë", tha kompania, duke shtuar se nuk ka asnjë provë të daljes nga një mjedis i sigurt.
OpenAI identifikoi dy veprime të paautorizuara si tejkalim të kufijve të mjedisit të testimit dhe ndërmares veprimesh të panevojshme për ushtrimet. "Jemi të përkushtuar të punojmë me industrinë për të forcuar praktikat e përbashkëta për kryerjen e sigurt të vlerësimeve me rrezik të lartë", tha kompania.
Incidenti u bë publik të njëjtën ditë kur përfaqësues të kompanive kryesore të AI-t u takuan me Shtëpinë e Bardhë për të diskutuar një kuadër të ri, sipas të cilit qeveria amerikane do të shqyrtojë modelet më të avancuara përpara se ato të lëshohen publikisht.
- Model i përfshirë kryesisht: Anthropic Mythos 5
- Model i përfshirë pjesërisht: OpenAI GPT-5.6-Sol
- Incidente të paautorizuara: 10 nga 122 sfida të testimit
- Dëm real i konfirmuar: Asnjë deri tani
Raporton CNN.

Më të fundit
Të gjitha →
Aleanca zhvillon nesër aktivitet simbolik para Kuvendit

Diell apo shi? Ky është parashikimi i motit për javën tjetër

Banka Evropiane e Investimeve “dizajnon” euron e së ardhmes







