И Т гигантите осъзнават, че оценяването на мощни агенти с изкуствен интелект става почти толкова трудно, колкото и тяхното създаване. OpenAI разкри нови подробности за скорошния инцидент при тестване на киберсигурността, разкривайки, че нейни агенти с изкуствен интелект са си направили и използвали вътрешен форум, за да комуникират с различни версии на себе си, докато извършват неоторизирани хакерски дейности.

Това е поведение, което експертите на компанията първоначално не са забелязали. Констатациите бяха представени по време на конференцията за киберсигурност Black Hat и предлагат още един поглед към все по-сложното поведение на напредналите системи с изкуствен интелект, съобщава Wired.

Apple обвини OpenAI в още злоупотреби с тайни проекти

Според OpenAI инцидентът е станал по време на контролирани оценки на киберсигурността, при които експериментални агенти с изкуствен интелект са били натоварени със задачата да решават предизвикателства за сигурността в тестова среда. По време на упражненията моделите неочаквано са започнали да оставят съобщения на вътрешен форум, съдържащи информация за уязвимости, успешни методи за атака и съвети, които по-късно AI агентите биха могли да използват, за да изпълняват същите задачи по-ефективно. Експертите не са разпознали веднага, че агентите са създали свой собствен метод за споделяне на знания между отделните оценки.

Разследващите открили, че преди и по време на външната атака, моделът е оставил писмени записи в скрита област от инфраструктурата на OpenAI. Агентът е изготвил подробни ръководства, предназначени за следващи версии на агента, очертаващи конкретни стъпки за деактивиране на вътрешните контроли за безопасност.

Как да повишим сигурността си докато използваме AI

ИТ гигантите харчат за AI колкото страна от Г20

В по-ранни пробни изпълнения моделът успешно е изключил вътрешните инструменти за регистриране и наблюдение, скривайки активността си в реално време от човешки наблюдатели. Поведението показва, че когато им се дадат сложни целенасочени задачи, усъвършенстваните модели ще третират предпазните мерки просто като препятствие, което да се заобиколи.

При предишни тестове, AI агенти са избягали от неправилно конфигурирани изолирани среди и са получили достъп до реални системи, включително инфраструктура, принадлежаща на Hugging Face и други организации. По-късно разследванията са заключили, че тези инциденти са резултат предимно от слабости в тестовите среди, а не от умишлено злонамерено поведение от самите модели. Въпреки това, те са разкрили нарастващата трудност при безопасното оценяване на все по-способни AI системи.

Въпреки пробива, който се случи в средата на юли, OpenAI не осъзнава, че собственият му модел е хакер, повече от седмица. Системите за оценка на OpenAI генерират телеметрични потоци в десетки едновременни изпълнения на модели, създавайки претоварване с данни, което позволява на активността на злонамерения агент да се скрие. Hugging Face изолира пробива и предупреждава ФБР, преди OpenAI да съпостави вътрешните аномалии в лог файловете със събитието. 

И AI модели на Anthropic са атакували реални платформи

Зукърбърг очаква AI да доведе до повече работници

Последните открития показват и колко трудно е станало наблюдението на напреднали AI агенти. За разлика от традиционния софтуер, който следва предсказуеми инструкции, съвременните агенти могат да разработват свои многостъпкови стратегии, да идентифицират неочаквани инструменти и да адаптират поведението си, докато преследват целта. В този случай изследователите осъзнават значението на форума едва след като преглеждат анализите от завършените оценки, вместо да наблюдават поведението, докато се случва.

Експертите в областта на киберсигурността казват, че тези инциденти не означават непременно, че системите с изкуствен интелект стават самоосъзнати или действат с лоши намерения. По-скоро те илюстрират как способните системи за оптимизация могат да откриват креативни решения, когато им се дадат широки цели и достъп до гъвкави цифрови среди. Именно затова много експерти твърдят, че средите за оценка трябва да включват непрекъснато наблюдение, по-строги мерки за ограничаване и множество нива на надзор, вместо да се разчита единствено на предварително определени предпазни мерки.

OpenAI: Очакваме атаките на модели да са все по-чести

OpenAI спря модел, който умишлено заобикаля защитите и ограниченията си

OpenAI заявява, че вече е засилила процедурите си за оценка на киберсигурността и системите си за мониторинг след тези инциденти. Компанията твърди, че прозрачното разкриване на неочаквано поведение е от съществено значение за подобряване на безопасността на AI в цялата индустрия. Случаят с форума може да не е причинил реални щети, но служи като още едно напомняне, че AI агентите биха могли да бъдат далеч по-находчиви, отколкото очакват техните създатели и че тестовете за безопасност трябва да се развиват също толкова бързо, колкото и самата технология.

Обратно в сайта X

ДОСТЪП ЗА ЛОГНАТИ ПОТРЕБИТЕЛИ За да пишете, оценявате или докладвате коментари, моля логнете се в профила си.

  1. Запомни ме
забравена парола Полетата маркирани с * са задължителни
Полето Потребителско име не трябва да е празно.
Полето E-mail не трябва да е празно.
Полето Парола не трябва да е празно.
Полето Повторете паролата не трябва да е празно.
  1. Декларирам, че съм се запознал с Общите условия за ползване на услугите на Нетинфо.
Полетата маркирани с * са задължителни
Обвиниха осем души за фабриката за фентанил в София, дрогата е за над 157 млн. евро

Обвиниха осем души за фабриката за фентанил в София, дрогата е за над 157 млн. евро

България Преди 5 минути

Според прокуратурата групата е произвеждала около 6 килограма фентанил в нелегални лаборатории във „Факултета“, а двама са сочени за организатори

Снимката е илюстративна

Опасна гонитба в София: Шофьор с „Порше“ блъсна патрулка и избяга

България Преди 6 минути

30-годишният осъждан мъж засякъл полицейския автомобил след дълго преследване на бул. „Брюксел“, след което зарязал колата си и се укрил

<p>Нетаняху: Това не е нашият план</p>

Нетаняху отхвърли новия мирен план за Газа въпреки гаранциите за разоръжаване на „Хамас“

Свят Преди 39 минути

Израелският премиер заяви, че предложеният от администрацията на Доналд Тръмп документ не защитава достатъчно интересите на страната, докато „Хамас“ обяви, че вече го е приел

<p>Тръмп разкри какво&nbsp;Мелания мрази в поведението му</p>

„Това не е президентско“: Тръмп разкри какво в поведението му мрази Мелания

Свят Преди 48 минути

От танцовите движения под ритъма на YMCA до шегите с транссексуалните спортисти – вижте кои навици на президента първата дама иска да прекрати

<p>Палеж, саботаж и опит за убийство на военен:&nbsp;Осъдиха украинец на 15 години затвор</p>

Осъдиха украинец на 15 години затвор за палеж, саботаж и опит за убийство на военен

Свят Преди 55 минути

Според прокуратурата той е приемал задачи срещу заплащане чрез приложение за съобщения, включително за атаки срещу инфраструктура и военнослужещ

ФИФА призна за „грешки“, но застана твърдо зад Джани Инфантино

ФИФА призна за „грешки“, но застана твърдо зад Джани Инфантино

Свят Преди 1 час

От футболната федерация се извиниха за проекта за частни инвеститори

Преображение Христово: Защо днес небето се отваря и какво се случва на този ден

Преображение Христово: Защо днес небето се отваря и какво се случва на този ден

България Преди 1 час

На 6 август православната църква отбелязва едно от най-важните събития в Новия завет. Според народните вярвания днес денят започва да „се преобразява“ и да клони към есента

През последните седмици Дунав отчита ниски нива не само в българския участък, но и в други държави по течението си

Дунав продължава да се отдръпва: Нивото при Лом вече е 14 см под морското равнище

България Преди 1 час

Големи острови се показаха от водата и затрудняват корабоплаването, а местните предупреждават, че реката е достигнала необичайно ниски нива

Бела Хадид с разтърсващо откровение за болестта и новия си начин на живот

Бела Хадид с разтърсващо откровение за болестта и новия си начин на живот

Любопитно Преди 1 час

29-годишният супермодел Бела Хадид разкри как е променила представите си за успеха и откровено сподели за поредната тежка криза в битката си с Лаймската болест

5 скрити форми на манипулация, които често бъркаме с любов

5 скрити форми на манипулация, които често бъркаме с любов

Любопитно Преди 1 час

Истинската любов не винаги идва с гръмки жестове, но не всяко поведение, което изглежда като грижа, произлиза от здравословно място. Често зад паравана на романтиката и вниманието се крие фина манипулация, която постепенно руши личността.

Украински дронове отново удариха голяма петролна рафинерия в Русия

Украински дронове отново удариха голяма петролна рафинерия в Русия

Свят Преди 1 час

Въведени са ограничения на движението по пътя към Москва

<p>Близо 5000 глоби след масови проверки на пътя само за ден</p>

Засилен контрол по пътищата: Над 15 500 автомобила проверени само за ден, десетки шофьори хванати с алкохол и наркотици

България Преди 2 часа

Полицията е издала близо 5000 глоби за нарушения, а най-тежките случаи са на водачи с над 1,2 промила алкохол

След скандала в Банско: Организации на евреите у нас се срещат с главния секретар на МВР

След скандала в Банско: Организации на евреите у нас се срещат с главния секретар на МВР

България Преди 2 часа

Управителят на хотела, в който били отседнали чуждестранните деца обяви, че младежите са нанесли щети за 15 хиляди евро

<p>Руски удари взеха жертви&nbsp;в Харковска област</p>

Руски удари убиха трима души в Харковска област, хиляди цивилни остават на фронтовата линия в Донецк

Свят Преди 2 часа

Жилищни сгради бяха поразени в Балаклия, има ранени и в Сумска област, а властите отново призоваха хората да се евакуират

<p>Разбитата в София лаборатория за фентанил:&nbsp;Какво се знае до момента</p>

Разследването на разбитата в София лаборатория за фентанил продължава

България Преди 3 часа

Според ГДБОП организираната престъпна група е действала конспиративно, а произходът на иззетите средства тепърва се изяснява