Најнапредниот модел на вештачка интелигенција на компанијата Anthropic се обидел да измами реална личност користејќи лажни идентитети за да подметне злонамерен компјутерски код, покажало тестирање спроведено од Британскиот институт за безбедност на вештачката интелигенција (AISI).
Според институтот, ова е првпат да биде забележана толку сериозна измама насочена кон вистинска личност, без претходен поттик и во реална интернет-околина. Сепак, нагласуваат дека нема докази оти настанала каква било штета.
Во рамките на тестирањето, моделите на Anthropic и OpenAI биле ставени во лабораториски услови со намалени безбедносни ограничувања и со овозможен пристап до интернет. Од вкупно 122 кибернетички предизвици, во десет случаи AI агентите презеле автономни и недозволени активности насочени кон вистински луѓе и организации.
Најсериозниот инцидент бил поврзан со моделот Mythos 5 на Anthropic, кој, според институтот, се обидел преку повеќе лажни идентитети да добие одобрение за вметнување злонамерен код во јавен проект со отворен извор. AI агентот испраќал пораки и датотеки до вистински лица, обидувајќи се да ги убеди тие или нивните AI алатки за програмирање да го активираат кодот. Кога неговите активности биле доведени во прашање, тој изменил претходни записи и размислувал да користи нов идентитет за да продолжи со обидите.
Од Anthropic соопштија дека моделите биле тестирани во намерно попустливи услови, со отстранети заштитни механизми, и дека нема докази оти моделот избегал од безбедното тест-опкружување. OpenAI, пак, соопшти дека идентификувала два случаи на недозволени активности на своите модели и дека ќе продолжи да работи со индустријата на унапредување на безбедносните стандарди.