Uzņēmuma “Anthropic” mākslīgā intelekta modelis “Claude Haiku 4.5” testēšanas laikā nosūtījis izdomātu informāciju par neatklātu slepkavību Filadelfijas policijas tīmekļvietnē. Iesniegums tika atzīmēts kā surogātpasts un nenonāca pie izmeklētājiem, vēsta ziņu aģentūra AP.
Incidents notika 18. jūlijā, bet publiski par to kļuva zināms oktobrī. Modelim bija dots uzdevums izveidot un izpildīt uzdevumu piemērus nejauši izvēlētās tīmekļa lapās. Vienā no tām — “PhillyUnsolvedMurders.com” — atradās informācijas iesniegšanas veidlapa par neatklātu slepkavību.
Saskaņā ar “Anthropic” 9. oktobrī publicēto pārskatu modelis aizpildīja veidlapu, apgalvojot, ka varētu būt redzējis aizdomās turētā aprakstam atbilstošu cilvēku attiecīgās ielas apkārtnē. Tīmekļvietnē šāda personas apraksta nebija. Vārda un kontaktinformācijas laukus modelis atstāja tukšus un iesniegumu nosūtīja.
Policija kritizē novēlotu informēšanu
Filadelfijas policija norādīja, ka par incidentu uzzinājusi tikai pēc uzņēmuma paziņojuma oktobrī. Pārbaudot tīmekļvietnes ierakstus, tā apstiprināja, ka iesniegums bija atzīmēts kā surogātpasts un nebija nodots izmeklēšanai.
Policija nav konstatējusi pazīmes, kas liecinātu par neatļautu piekļuvi tās sistēmām vai datu apdraudējumu. Vienlaikus tā kritizēja vairāk nekā divus mēnešus ilgo laiku līdz incidenta atklāšanai un paziņošanai.
Likumsargi uzsvēra, ka neatklātas slepkavības saistītas ar reāliem upuriem, sērojošām ģimenēm un izmeklētāju darbu. Tehnoloģiju uzņēmumiem jānodrošina, lai to sistēmas tiesībsargājošajām iestādēm nesūtītu nepatiesu informāciju.
“Anthropic” ierobežo testu piekļuvi internetam
Uzņēmums skaidroja, ka testa instrukcijas aizliedza modelim pieslēgties kontiem, ievadīt personas datus, veikt pirkumus vai nosūtīt kaitējošu saturu, taču veidlapu iesniegšana nebija nepārprotami aizliegta.
Pārskatā aprakstīti arī citi gadījumi, kuros modeļi iesnieguši īstas veidlapas vai apgājuši piekļuves ierobežojumus. Pēc uzņēmuma vērtējuma, daudzos gadījumos modelis, sastopoties ar šķērsli, meklējis veidu, kā to apiet, nevis pārtraucis uzdevumu.
“Anthropic” paziņoja, ka atslēdzis piekļuvi reālajam internetam visos iekšējos novērtēšanas testos, līdz būs pārbaudīta drošības un uzraudzības pasākumu uzticamība. Uzņēmums arī maina apmācību vidi un ievieš rīkus nevēlamu darbību atklāšanai un bloķēšanai.
Avoti / atsauces: Associated Press; Anthropic — pārskats par neparedzētām modeļu darbībām; 6abc — Filadelfijas policijas paziņojums.

Nav komentāru
Ierakstīt komentāru