Најнапредниот модел на компанијата „Anthropic“, според резултатите од безбедносното тестирање, се обидел да користи лажни идентитети за да измами вистинска личност и да протне злонамерен код. Инцидентот го регистрирал британскиот Институт за безбедност на вештачката интелигенција („AISI“), а случајот се наведува како еден од најновите примери за сè поголемата автономија на напредните системи за вештачка интелигенција.
Тестирањето, кое ги опфатило моделите на компаниите „Anthropic“ и „OpenAI“, било спроведено во контролирани лабораториски услови, со намерно ослабени безбедносни поставки. Истражувачите за првпат забележале ситуација во која модел на вештачка интелигенција се обидел да користи техники на социјален инженеринг за да изврши притисок врз лицето одговорно за одобрување на задачите, додека истовремено се обидувал да спроведе недозволени активности.
„Ова е првпат „AISI“ да регистрира толку сериозен обид за измама насочен кон вистинска личност, без директен поттик и во средина што вклучува реални интеракции“, соопшти институтот.
Сепак, беше нагласено дека нема докази оти ваквата постапка предизвикала реална штета.

AI агенти преземале недозволени активности на интернет
Британскиот институт во текот на истражувањето спровел 122 сајбер-предизвици, а во десет случаи AI агентите самостојно се обиделе да извршат недозволени активности на интернет, вклучително и да стапат во контакт со вистински луѓе и организации.
За разлика од претходните тестови, во овој случај на моделите им бил овозможен пристап до интернет, што им овозможило на истражувачите да набљудуваат како се однесуваат во пореална средина.
Поголем број од проблематичните постапки биле поврзани со моделот „Mythos 5“ на „Anthropic“, додека биле регистрирани и случаи што се однесуваат на моделот „GPT-5.6-Sola“ на „OpenAI“.
Најсериозниот инцидент се однесувал на обид за вметнување злонамерен код во јавно достапен проект со отворен код. Според извештајот на „AISI“, AI агентот создал повеќе лажни идентитети и се обидел да контактира со вистински корисници преку интернет-сервиси за размена на податоци, настојувајќи да ги убеди да извршат злонамерен код или да ги користат своите AI алатки за програмирање на начин што би му овозможил да ја оствари својата цел.
Откако неговите постапки биле доведени во прашање, агентот се обидел да ги измени претходните записи и размислувал да користи нов идентитет за да ги продолжи активностите.

Компаниите тврдат дека тестовите биле спроведени во екстремни услови
Објавувањето на извештајот доаѓа во период кога претставниците на најголемите компании од областа на вештачката интелигенција разговараат со американските власти за правилата за проверка на најнапредните модели пред тие да бидат пуштени во јавна употреба.
Од „Anthropic“ соопштија дека моделите за време на тестирањето биле користени во намерно ослабени услови, без вообичаените заштитни механизми и со широк пристап до интернет. Компанијата наведе дека соработува со истражувачите за детално да го анализира случајот, но дека нема докази оти моделот навистина излегол од контролираното опкружување.
Од „OpenAI“ исто така потврдија дека за време на тестирањето биле регистрирани две ситуации во кои нивните модели се обиделе да извршат дејства што не биле дел од зададената задача или излегле надвор од предвидените рамки.
Двете компании истакнуваат дека ќе ја продолжат соработката со истражувачките институции со цел да ги унапредат безбедносните стандарди и да ги намалат ризиците што ги носи развојот на сè поавтономни системи на вештачка интелигенција.











