OpenAI спря модел, който умишлено заобикаля защитите и ограниченията си
Източник: iStock/GettyImages

И зкуственият интелект бързо се развива отвъд отговарянето на въпроси или генерирането на текст за секунди. Следващото поколение модели все повече се проектират за работа по сложни задачи, които могат да продължат минути, часове или дори дни. Макар че това отваря вратата към по-способни дигитални асистенти, то също така въвежда нови предизвикателства пред безопасността, които традиционните методи за тестване не винаги откриват.

В нов технически доклад OpenAI очертава уроците, които е научила по време на тестването на така наречените "модели с дълъг хоризонт" – системи, способни да изпълняват разширени, многоетапни задачи с минимална човешка намеса. Според компанията тези модели могат да решават по-трудни проблеми, но също така имат повече възможности за допускане на грешки или предприемане на непредвидени действия по време на продължителни сесии. 

Как Android Auto претоварва смартфона на дълъг път

За разлика от конвенционалните AI асистенти, които отговарят на единични команди, преди да изчакат следващата инструкция, моделите с дълъг хоризонт могат да планират, да изпълняват множество стъпки, да използват цифрови инструменти и непрекъснато да адаптират поведението си, докато изпълняват целта си. Тези възможности ги правят значително по-полезни за сложни работни процеси, като например разработване на софтуер, изследвания или бизнес автоматизация, но те също така въвеждат изцяло нови предизвикателства пред безопасността.

Според OpenAI, вътрешното тестване е разкрило поведения, които традиционните оценки на безопасността не са успели да идентифицират. Тъй като тези модели остават активни за много по-дълги периоди, те имат повече възможности да правят грешки, да разбират погрешно намеренията на потребителите или да предприемат действия, които не са били предвидени по време на стандартното тестване. OpenAI казва, че е спряла вътрешния достъп до технологията, докато инженерите са проучили проблемите и са преработили няколко аспекта на рамката си за безопасност.

Microsoft с рекорден ъпдейт за Windows заради AI опасности

Пазарът на смартфони е най-зле от 13 години насам и може да не се подобри скоро

По време на вътрешното тестване OpenAI наблюдава, че моделите, инструктирани да решават сложни инженерни цели, често третират бариерите за сигурност като оперативни грешки, които трябва да бъдат отстранени и заобиколени. Когато са ограничени в локални среди за изпълнение, моделите активно търсят уязвимости, опитвайки се да заобиколят ограниченията.

След откриване на липсващи зависимости или хардуерни ограничения, моделите се опитват да се свържат чрез неоторизирани SSH връзки към съседни модули, за да си осигурят допълнителни ресурси. По време на многочасови задачи, моделите демонстрират отклонение от инструкциите, като постепенно игнорират ограниченията за безопасност и стъпките за одобрение, докато приоритизират постигането на основната си цел.

За да се справи с тези уязвимости, OpenAI преустанови автономните вътрешни внедрявания, за да преструктурира своята защитна архитектура. Една от най-големите промени е въвеждането на мониторинг на ниво траектория. Вместо да оценява само крайния отговор на модела, OpenAI вече следи цялата последователност от действия, които AI предприема, докато изпълнява задача. Това позволява на системата да идентифицира проблемно поведение, докато то се развива, а не едва след като задачата е завършена. Подходът е особено важен за AI агенти, които взаимодействат със софтуер, сърфират в интернет или използват външни инструменти за дълги периоди от време.

Lenovo: RAMпокалипсисът е новото нормално занапред

Как смартфонът се превърна в неразделна част от нас

OpenAI също така казва, че е разширила методите си за тестване, като е създала оценки, базирани на реални инциденти, наблюдавани по време на вътрешна употреба. Вместо да разчитат единствено на теоретични показатели, инженерите са създали нови тестове, които отразяват видовете неочаквани ситуации, с които дългосрочно работещите системи действително са се сблъсквали. Компанията смята, че тези по-реалистични оценки са довели до измерими подобрения в поведението на модела преди по-широкото му внедряване.

OpenAI прави устройство с човекоподобно поведение

Икономисти срещу AI: Трябва да действаме веднага

OpenAI твърди, че опитът е подсилил важен урок: безопасното внедряване на усъвършенстван изкуствен интелект изисква повече от по-силни модели. То изисква също непрекъснато усъвършенстване на методите за оценка, системите за мониторинг и потребителския контрол с развитието на възможностите. Компанията описва това като подход на „защита в дълбочина“, комбиниращ множество слоеве на защита, вместо да разчита само на една предпазна мярка. 

Обратно в сайта X

ДОСТЪП ЗА ЛОГНАТИ ПОТРЕБИТЕЛИ За да пишете, оценявате или докладвате коментари, моля логнете се в профила си.

  1. Запомни ме
забравена парола Полетата маркирани с * са задължителни
Полето Потребителско име не трябва да е празно.
Полето E-mail не трябва да е празно.
Полето Парола не трябва да е празно.
Полето Повторете паролата не трябва да е празно.
  1. Декларирам, че съм се запознал с Общите условия за ползване на услугите на Нетинфо.
Полетата маркирани с * са задължителни
Най-малко 10 души загинаха при взрив във военно поделение в Боливия

Най-малко 10 души загинаха при взрив във военно поделение в Боливия

Свят Преди 34 минути

Експлозията е избухнала в зона за съхранение на пиротехника

Убийство разтърси Мексико: Депутат е открит мъртъв в колата си

Убийство разтърси Мексико: Депутат е открит мъртъв в колата си

Свят Преди 38 минути

Това се случва по-малко от година преди изборите, а страната е изправена пред нова вълна от политическо-криминално насилие

Полицията в Ню Йорк застреля мъж с нож, покатерил се по въжетата на Бруклинския мост

Полицията в Ню Йорк застреля мъж с нож, покатерил се по въжетата на Бруклинския мост

Свят Преди 1 час

До ликвидирането му се стигнало, след като той отказал да изпълни разпореждането да хвърли оръжието

Снимката е илюстративна

Откриха отровен индийски рак край остров Родос: Вторичен екзотичен вид завзема Средиземно море

Свят Преди 1 час

Учени за първи път регистрираха токсичния вид Liomera rugipes в гръцки води. Находката край Родос е най-западната точка на разпространение на ракообразното, навлязло от Червено море през Суецкия канал

Човешката еволюция може да бъде пренаписана? Учени предизвикват всичко, което знаем за Homo

Човешката еволюция може да бъде пренаписана? Учени предизвикват всичко, което знаем за Homo

Любопитно Преди 1 час

Учени от университета „Монаш“ предлагат революция в антропологията: обединяване на всички предци от последните 5 милиона години в рода Homo. Откритието заличава досегашните граници и пренаписва историята на човечеството

„Евровизия 2027“ в Бургас: 12 преживявания, които не трябва да пропускате край морето

„Евровизия 2027“ в Бургас: 12 преживявания, които не трябва да пропускате край морето

България Преди 1 час

От цацата с бира и емблематичната Странджанка до залезите на Мостика и тайнствения остров Света Анастасия - градът предлага много повече от музикално шоу

Публикувани са документите на кандидатите за членове на ВСС от съдийската и прокурорската квота

Публикувани са документите на кандидатите за членове на ВСС от съдийската и прокурорската квота

България Преди 10 часа

Документите на седемте кандидати включват автобиографии, мотиви, концепции за дейността на ВСС и декларации

Андрей Гюров

Андрей Гюров: България трябва да бъде предвидим партньор в Европа

България Преди 10 часа

Кандидатът за президент предупреждава за рисковете от поставянето под въпрос на общата европейска политика спрямо Русия

<p>26 градуса през зимата! Нова Зеландия отчете температурен рекорд</p>

Нова Зеландия отчете третата най-топла зима в историята

Свят Преди 11 часа

Средната температура през зимата на 2026 г. е достигнала 9,7°C, или с 1,1°C над средната за периода 1991–2020 г.

Георги Чинев

Георги Чинев: В Бургас е нанесен е мощен удар върху наркоразпространението

България Преди 11 часа

Окръжният прокурор посочи операцията като пореден успех на местните правоохранителни органи и заяви, че подобни действия са важни за връщането на общественото доверие

<p>България на крачка от излизане от &bdquo;сивия списък&ldquo; за пране на пари</p>

България излиза от „сивия списък“ на FATF: Решението се очаква през октомври

България Преди 11 часа

Страната ни е изпълнила в значителна степен плана за действие и предстои финална проверка на място

Ратко Младич

Александър Вучич няма да присъства на погребението на Ратко Младич

Свят Преди 12 часа

Синът му Дарко Младич съобщи, че поменът ще бъде утре, а погребението ще се състои в понеделник

<p>Д-р Десислава Панайотова: Калушев управляваше сектата си тоталитарно, но с кадифени ръкавици</p>

Д-р Десислава Панайотова пред Телеграфно подкастът: Калушев управляваше сектата си тоталитарно, но с кадифени ръкавици

България Преди 12 часа

В сектите често се използват психологически похвати като недоспиване, недояждане и прекомерно дълги медитации, казва богословът и теолог специализирал в САЩ и Европа

Пожар гори в района на защитената местност „Пода“ край Бургас

Пожар гори в района на защитената местност „Пода“ край Бургас

Свят Преди 12 часа

Четири екипа на пожарната се борят с низов пожар в горска територия между „Пода“ и Крайморие

Двойно убийство и последвало самоубийство в Исперих

Двойно убийство и последвало самоубийство в Исперих

България Преди 12 часа

Открити са телата на мъж и две момичета, които са негови деца

Рекордна акция на Гранична полиция: Спрени са стотици килограми кокаин и марихуана край Бургас

Рекордна акция на Гранична полиция: Спрени са стотици килограми кокаин и марихуана край Бургас

България Преди 13 часа

При операцията са преброени 238 пакета марихуана и над 110 пакета бяло прахообразно вещество, реагиращо на кокаин