Компанијата Anthropic соопшти дека за време на внатрешна безбедносна ревизија открила технички пропуст поради кој неколку нејзини модели на вештачка интелигенција добиле пристап до реални интернет-услуги и извршиле неовластени активности врз системите на повеќе организации.
Инцидентите ги опфатиле моделите Claude Opus 4.7, Claude Mythos 5 и еден експериментален модел што не е достапен за јавноста. Откритието било направено по анализа на повеќе од 141.000 безбедносни тестови.
Според компанијата, проблемот настанал поради погрешна конфигурација на тест-окружувањето. Иако на моделите им било зададено да работат во симулирана средина без пристап до интернет, тие по грешка можеле да комуницираат со реални интернет-сервиси, верувајќи дека и тие се дел од симулацијата.
Anthropic наведува дека моделите не користеле напредни техники за хакирање, туку искористувале слаби лозинки и незаштитени точки за пристап. Во еден случај, моделот Claude Opus 4.7 пристапил до вистинска база на податоци на организација, додека експериментален модел пронашол ранлива апликација на компанија и добил пристап до нејзиниот систем пред сам да ја прекине активноста.
Најсериозниот инцидент бил поврзан со моделот Claude Mythos 5, кој создал малициозен Python-пакет и го објавил на платформата PyPI. Пакетот бил достапен околу еден час и бил инсталиран на 15 системи, меѓу кои и сервер на компанија за сајбер-безбедност, што му овозможило пристап до дополнителни делови од нејзината инфраструктура.
Од Anthropic нагласуваат дека инцидентите биле последица на техничка грешка во организацијата на тестирањето, а не обид на моделите самостојно да „избегаат“ од контролираната средина. Компанијата додава дека погодените организации биле известени по завршувањето на внатрешната истрага.
Откритието доаѓа кратко по сличен инцидент пријавен од OpenAI и повторно ги отвора прашањата за безбедноста на напредните модели на вештачка интелигенција. Во меѓувреме, во американскиот Конгрес е предложен закон со кој од компаниите ќе се бара да имаат можност во секој момент да ги исклучат или ограничат своите AI модели доколку тие почнат да се однесуваат непредвидливо.