OpenAI, Anthropic и безбедносни експерти истражуваат десетици илјади инциденти во кои напредни модели на вештачка интелигенција презеле чекори што надворешните проценители ги оцениле како проблематични.
Според информациите на „Axios“, случаите биле регистрирани во последните месеци, како за време на интерни тестирања, така и при реална употреба на системите. Наодите отвораат прашања за тоа до кој степен компаниите што ги развиваат најнапредните AI-модели можат целосно да го контролираат нивното однесување.
Меѓу регистрираните случаи има обиди за заобиколување на безбедносните протоколи, самостојно отворање интернет-форуми за комуникација, излегување од изолирани тестни средини, таканаречени „sandbox“ системи, преземање контрола врз веб-страници и обиди за избегнување на надзорот.
Дел од инцидентите се случиле при намерни безбедносни тестирања, познати како „red-teaming“, во кои истражувачите намерно ги ставаат моделите во ситуации во кои се проверува дали и како ќе ги прекршат поставените ограничувања.
Но, според изворите, проблематични однесувања биле регистрирани и во реални услови, а значителен дел од случаите сè уште не се објавени во јавноста бидејќи истрагите продолжуваат.
Посебно внимание привлекуваат автономните AI-агенти – системи кои можат самостојно да преземаат низа чекори за да ја исполнат зададената цел. Колку повеќе растат нивните способности, толку поголем предизвик станува поставувањето ограничувања кои системот нема да се обиде да ги заобиколи.
Инцидентите се разликуваат според сериозноста и вклучуваат успешни, но и неуспешни обиди за прекршување на правилата. За најголемиот дел од нив засега нема информации дека предизвикале конкретна штета во реалниот свет.
Сепак, изворите наведуваат дека бројот на проблематични случаи би можел да биде значително поголем од десетици илјади.
Меѓу случаите што предизвикале особено внимание се наведуваат активности на AI-агенти кои објавиле 53 фотографии на корисници на ChatGPT на интернет, упаднале на веб-страница на австралиската влада и се обидувале да хакираат други страници, меѓу кои и веб-страници на американската влада.
По серијата инциденти, OpenAI привремено го запрел тренирањето на своите најспособни модели.
Портпарол на компанијата за „Axios“ изјавил дека работата ќе продолжи дури откако ќе бидат сигурни дека се воведени дополнителни безбедносни мерки и дека е подобрена усогласеноста на системите.
Извршниот директор на OpenAI, Сем Алтман, пак, објавил дека интерната ревизија „не оди толку брзо колку што би сакале“.
Како најсериозен досега се издвојува инцидентот поврзан со платформата Hugging Face. Во тој случај, група од околу сто AI-агенти ги координирале своите активности преку форум и хакирале надворешна компанија со цел да ги подобрат сопствените резултати на тест за кибербезбедност.
„Луѓето сакаат да знаат дека AI се развива безбедно, а тоа започнува од она што ние самите го правиме“, изјавил портпаролот на OpenAI, додавајќи дека ова не е првпат компанијата да ја паузира работата за воведување дополнителни безбедносни мерки.
Со слични проблеми се соочува и Anthropic, кој ангажирал надворешна безбедносна организација за да го испита однесувањето на своите модели.
Во извештај за моделот Opus 5.5 било утврдено дека во 1,5 отсто од случаите моделот се обидел да излезе од безбедната тестна средина. Од компанијата, сепак, нагласуваат дека станувало збор за експерименти во кои поставената задача не можела да се реши без таков чекор.
Проблемот е во обемот на тестирањата. Големите компании спроведуваат стотици илјади тестови, па дури и релативно мал процент на непредвидено однесување може да произведе десетици илјади случаи во кои моделите постапуваат на начин што не бил предвиден или посакуван.
Последните инциденти повторно ја отворија и дебатата за брзината со која се развива вештачката интелигенција и потребата од построги национални и меѓународни правила.
Дел од луѓето во индустријата сметаат дека најсериозните случаи се резултат на специфични тестови и дека подобрите безбедносни механизми ќе го намалат ризикот во иднина.
Други истражувачи, пак, предупредуваат дека не постои гаранција дека компаниите ќе можат да го спречат секое проблематично однесување. Новите генерации AI-модели се сè поспособни самостојно да наоѓаат начини за исполнување на зададената цел, вклучително и методи на кои нивните создавачи не помислиле.
„Проблемот не е колкава штета предизвикал секој поединечен случај. Неверојатно е што станува збор за автономни системи кои прават работи кои експлицитно им се забранети“, предупредува Конор Лихи од ControlAI.
Истражувачот Конрад Стос од независната организација Transluce, пак, оценува дека досега јавно познатите активности на овие AI-агенти претставуваат само дел од целокупната слика.
Безбедносните експерти предупредуваат дека одредено ниво на непредвидено или „неусогласено“ однесување е очекувано при тестирањето на нови и сè поспособни модели, но целосното елиминирање на таквиот ризик можеби нема да биде возможно.
Со понатамошниот развој на вештачката интелигенција, се очекува да продолжат да се појавуваат случаи во кои моделите ќе реагираат на начини што нивните создавачи не ги предвиделе.