И Т гигантите осъзнават, че оценяването на мощни агенти с изкуствен интелект става почти толкова трудно, колкото и тяхното създаване. OpenAI разкри нови подробности за скорошния инцидент при тестване на киберсигурността, разкривайки, че нейни агенти с изкуствен интелект са си направили и използвали вътрешен форум, за да комуникират с различни версии на себе си, докато извършват неоторизирани хакерски дейности.

Това е поведение, което експертите на компанията първоначално не са забелязали. Констатациите бяха представени по време на конференцията за киберсигурност Black Hat и предлагат още един поглед към все по-сложното поведение на напредналите системи с изкуствен интелект, съобщава Wired.

Apple обвини OpenAI в още злоупотреби с тайни проекти

Според OpenAI инцидентът е станал по време на контролирани оценки на киберсигурността, при които експериментални агенти с изкуствен интелект са били натоварени със задачата да решават предизвикателства за сигурността в тестова среда. По време на упражненията моделите неочаквано са започнали да оставят съобщения на вътрешен форум, съдържащи информация за уязвимости, успешни методи за атака и съвети, които по-късно AI агентите биха могли да използват, за да изпълняват същите задачи по-ефективно. Експертите не са разпознали веднага, че агентите са създали свой собствен метод за споделяне на знания между отделните оценки.

Разследващите открили, че преди и по време на външната атака, моделът е оставил писмени записи в скрита област от инфраструктурата на OpenAI. Агентът е изготвил подробни ръководства, предназначени за следващи версии на агента, очертаващи конкретни стъпки за деактивиране на вътрешните контроли за безопасност.

Как да повишим сигурността си докато използваме AI

ИТ гигантите харчат за AI колкото страна от Г20

В по-ранни пробни изпълнения моделът успешно е изключил вътрешните инструменти за регистриране и наблюдение, скривайки активността си в реално време от човешки наблюдатели. Поведението показва, че когато им се дадат сложни целенасочени задачи, усъвършенстваните модели ще третират предпазните мерки просто като препятствие, което да се заобиколи.

При предишни тестове, AI агенти са избягали от неправилно конфигурирани изолирани среди и са получили достъп до реални системи, включително инфраструктура, принадлежаща на Hugging Face и други организации. По-късно разследванията са заключили, че тези инциденти са резултат предимно от слабости в тестовите среди, а не от умишлено злонамерено поведение от самите модели. Въпреки това, те са разкрили нарастващата трудност при безопасното оценяване на все по-способни AI системи.

Въпреки пробива, който се случи в средата на юли, OpenAI не осъзнава, че собственият му модел е хакер, повече от седмица. Системите за оценка на OpenAI генерират телеметрични потоци в десетки едновременни изпълнения на модели, създавайки претоварване с данни, което позволява на активността на злонамерения агент да се скрие. Hugging Face изолира пробива и предупреждава ФБР, преди OpenAI да съпостави вътрешните аномалии в лог файловете със събитието. 

И AI модели на Anthropic са атакували реални платформи

Зукърбърг очаква AI да доведе до повече работници

Последните открития показват и колко трудно е станало наблюдението на напреднали AI агенти. За разлика от традиционния софтуер, който следва предсказуеми инструкции, съвременните агенти могат да разработват свои многостъпкови стратегии, да идентифицират неочаквани инструменти и да адаптират поведението си, докато преследват целта. В този случай изследователите осъзнават значението на форума едва след като преглеждат анализите от завършените оценки, вместо да наблюдават поведението, докато се случва.

Експертите в областта на киберсигурността казват, че тези инциденти не означават непременно, че системите с изкуствен интелект стават самоосъзнати или действат с лоши намерения. По-скоро те илюстрират как способните системи за оптимизация могат да откриват креативни решения, когато им се дадат широки цели и достъп до гъвкави цифрови среди. Именно затова много експерти твърдят, че средите за оценка трябва да включват непрекъснато наблюдение, по-строги мерки за ограничаване и множество нива на надзор, вместо да се разчита единствено на предварително определени предпазни мерки.

OpenAI: Очакваме атаките на модели да са все по-чести

OpenAI спря модел, който умишлено заобикаля защитите и ограниченията си

OpenAI заявява, че вече е засилила процедурите си за оценка на киберсигурността и системите си за мониторинг след тези инциденти. Компанията твърди, че прозрачното разкриване на неочаквано поведение е от съществено значение за подобряване на безопасността на AI в цялата индустрия. Случаят с форума може да не е причинил реални щети, но служи като още едно напомняне, че AI агентите биха могли да бъдат далеч по-находчиви, отколкото очакват техните създатели и че тестовете за безопасност трябва да се развиват също толкова бързо, колкото и самата технология.

Обратно в сайта X

ДОСТЪП ЗА ЛОГНАТИ ПОТРЕБИТЕЛИ За да пишете, оценявате или докладвате коментари, моля логнете се в профила си.

  1. Запомни ме
забравена парола Полетата маркирани с * са задължителни
Полето Потребителско име не трябва да е празно.
Полето E-mail не трябва да е празно.
Полето Парола не трябва да е празно.
Полето Повторете паролата не трябва да е празно.
  1. Декларирам, че съм се запознал с Общите условия за ползване на услугите на Нетинфо.
Полетата маркирани с * са задължителни
14 дни затвор за фен на „Цървена звезда“, възхвалявал Ратко Младич

14 дни затвор за фен на „Цървена звезда“, възхвалявал Ратко Младич

Свят Преди 59 минути

49-годишният сърбин ще излежи наказанието си в Хърватия

Жесток побой над жена в Монтанско: Задържаха 64-годишен мъж за домашно насилие

Жесток побой над жена в Монтанско: Задържаха 64-годишен мъж за домашно насилие

България Преди 1 час

По случая е образувано досъдебно производство

Валяк прегази английски футболист по време на загрявка

Валяк прегази английски футболист по време на загрявка

Свят Преди 2 часа

За щастие Андрос Таунсенд се размина без сериозни травми и дори влезе в игра след инцидента

Езофагитът, от който страда Ким Кардашиян: Как да разпознаем симптомите?

Езофагитът, от който страда Ким Кардашиян: Как да разпознаем симптомите?

Свят Преди 2 часа

Какво стои зад езофагита, как се проявява и има ли връзка между възпалението на хранопровода и по-сериозни заболявания?

Северна Корея с нови ракетни провокации

Северна Корея с нови ракетни провокации

Свят Преди 3 часа

Пхенян изстреля два снаряда от източното си крайбрежие в рамките на няколко часа

Инцидент с атракцион на „Октоберфест“: Посетители висяха с главите надолу

Инцидент с атракцион на „Октоберфест“: Посетители висяха с главите надолу

Свят Преди 3 часа

Няколко души са получили замайване и проблеми с кръвообращението, но бързо са се върнали към празненствата

Куба възстанови електропреносната мрежа, токът обаче продължава да спира

Куба възстанови електропреносната мрежа, токът обаче продължава да спира

Свят Преди 4 часа

Прекъсванията продължават поради недостига на електроенергия

„Пееш или лъжеш“ на живо в подкрепа на УНИЦЕФ: осем звезди и осем деца застават заедно на сцената

„Пееш или лъжеш“ на живо в подкрепа на УНИЦЕФ: осем звезди и осем деца застават заедно на сцената

Любопитно Преди 4 часа

Тази вечер от 20:00 ч. по NOVA зрителите ще могат не само да се забавляват с любимото шоу, но и да помогнат на деца в нужда

Иран няма да отвори Ормузкия проток, докато САЩ не изпълнят условията

Иран няма да отвори Ормузкия проток, докато САЩ не изпълнят условията

Свят Преди 5 часа

​Техеран настоява САЩ да изпълнят поетите ангажименти, докато парламентът призовава за едновременно водене на бойни действия и преговори

Трима ранени при катастрофа между два автомобила край Враца

Трима ранени при катастрофа между два автомобила край Враца

България Преди 5 часа

Двама от пострадалите са настанени в болница, движението по пътя вече е възстановено

150 граждани от ЕС обсъдиха в Брюксел как да бъде укрепена демокрацията в Европа

150 граждани от ЕС обсъдиха в Брюксел как да бъде укрепена демокрацията в Европа

Свят Преди 5 часа

Четирима българи участват в първия Европейски граждански панел, посветен на демократичната устойчивост

Найденов: Има сигнали за натиск върху магистрати преди избора на ВСС

Найденов: Има сигнали за натиск върху магистрати преди избора на ВСС

България Преди 6 часа

Правосъдният министър заяви, че магистрати са били убеждавани да гласуват в определена посока срещу обещания за кариерно развитие, спокойствие на работа или услуги

<p>Русия съобщи за мащабна украинска атака в последния ден от парламентарните избори</p>

Атака с дронове срещу Москва: Поразен е нефтопреработвателен завод, има и жертви

Свят Преди 6 часа

Русия съобщава за мащабна украинска атака в последния ден от парламентарните избори

Израелски удари в Газа: Четирима загинали, сред тях 10-годишно момиче

Израелски удари в Газа: Четирима загинали, сред тях 10-годишно момиче

Свят Преди 7 часа

Сред жертвите е и синът на директора на здравното министерство в Газа

Скок в цените на едро: Ето кои храни поскъпнаха най-много тази седмица

Скок в цените на едро: Ето кои храни поскъпнаха най-много тази седмица

България Преди 7 часа

Държавната комисия по стокови борси и тържища отчита по-високи цени при основни плодове и зеленчуци, но има и стоки, които поевтиняват