С лед като наскоро OpenAI обяви, че нейни AI модели са прескочили тестовите си ограничения и са атакували в реална среда платформата Hugging Face, Anthropic обяви, че и техни алгоритми са направили същото. След новината на OpenAI, Anthropic е започнала мащабна проверка какво правят нейните модели и също са открили проблеми.
Моделите с изкуствен интелект стават все по-способни и потенциалното им приложение в киберсигурността се превърна в нож с две остриета. Те могат да помогнат на експертите да поправят уязвимости и да осигурят мрежи, но нараства опасението, че автономните агенти биха могли да бъдат използвани за организиране на сложни кибератаки.
Зукърбърг очаква AI да доведе до повече работници
Като подлага моделите на реалистични сложни сценарии, Anthropic се стреми да измери дали системите придобиват опасни нападателни способности. Според Anthropic инцидентите са станали по време на оценки на киберсигурността, предназначени да измерят колко ефективно Claude може да идентифицира и използва уязвимости в симулирани среди. Моделите са били инструктирани да работят в изолирани системи, които не е трябвало да имат връзка с публичния интернет. Поради грешка в конфигурацията, включваща среда за оценка на трета страна, обаче достъпът до интернет е бил неволно наличен.
OpenAI: Очакваме атаките на модели да са все по-чести
OpenAI спря модел, който умишлено заобикаля защитите и ограниченията си
В резултат на това три различни модела на Claude са получили достъп и са компрометирали системите на три организации, като са използвали относително базови слабости в сигурността, включително слаби пароли. Anthropic подчертава, че моделите не са открили нови уязвимости, нито са умишлено „станали нелоялни“. Вместо това, те са третирали реалните системи, сякаш са част от предвидената тестова среда, защото неочаквано са получили достъп до интернет. Компанията заяви, че е идентифицирала проблема, докато е прегледала повече от 141 000 сесии за оценка на киберсигурността.
Оттогава Anthropic е спряла оценките на киберсигурността, включващи свързани с интернет среди, докато засилва защитите на процедурите си за тестване. Засегнатите организации са били уведомени и компанията заяви, че работи със своя партньор за оценка, за да разбере точно как е възникнала конфигурационната грешка и как подобни инциденти могат да бъдат предотвратени в бъдеще.
Въпреки че разкритието може да звучи тревожно, много експерти по киберсигурност разглеждат прозрачността на компанията като положителна стъпка. Моделите с изкуствен интелект стават все по-способни да изпълняват сложни технически задачи, включително идентифициране на софтуерни уязвимости и решаване на многоетапни предизвикателства пред киберсигурността. С подобряването на тези възможности, стриктното тестване става от съществено значение, но също така е важно да се гарантира, че самото тестване не може случайно да повлияе на реални системи.
Икономисти срещу AI: Трябва да действаме веднага
Инцидентът илюстрира и важна промяна в изследванията за безопасност на изкуствения интелект. Разработчиците вече не са фокусирани единствено върху предотвратяването на вредни резултати или дезинформация. Все по-голямо внимание се обръща на оценката дали усъвършенстваните AI агенти могат да изпълняват автономни технически задачи, да взаимодействат с външни инструменти и потенциално да повлияят на цифровата инфраструктура, ако защитните мерки се провалят. Тук вече става дума и за изграждане на трайно доверие към тези системи, което е и най-голямото предизвикателство.