OpenAI спря модел, който умишлено заобикаля защитите и ограниченията си
Източник: iStock/GettyImages

И зкуственият интелект бързо се развива отвъд отговарянето на въпроси или генерирането на текст за секунди. Следващото поколение модели все повече се проектират за работа по сложни задачи, които могат да продължат минути, часове или дори дни. Макар че това отваря вратата към по-способни дигитални асистенти, то също така въвежда нови предизвикателства пред безопасността, които традиционните методи за тестване не винаги откриват.

В нов технически доклад OpenAI очертава уроците, които е научила по време на тестването на така наречените "модели с дълъг хоризонт" – системи, способни да изпълняват разширени, многоетапни задачи с минимална човешка намеса. Според компанията тези модели могат да решават по-трудни проблеми, но също така имат повече възможности за допускане на грешки или предприемане на непредвидени действия по време на продължителни сесии. 

Как Android Auto претоварва смартфона на дълъг път

За разлика от конвенционалните AI асистенти, които отговарят на единични команди, преди да изчакат следващата инструкция, моделите с дълъг хоризонт могат да планират, да изпълняват множество стъпки, да използват цифрови инструменти и непрекъснато да адаптират поведението си, докато изпълняват целта си. Тези възможности ги правят значително по-полезни за сложни работни процеси, като например разработване на софтуер, изследвания или бизнес автоматизация, но те също така въвеждат изцяло нови предизвикателства пред безопасността.

Според OpenAI, вътрешното тестване е разкрило поведения, които традиционните оценки на безопасността не са успели да идентифицират. Тъй като тези модели остават активни за много по-дълги периоди, те имат повече възможности да правят грешки, да разбират погрешно намеренията на потребителите или да предприемат действия, които не са били предвидени по време на стандартното тестване. OpenAI казва, че е спряла вътрешния достъп до технологията, докато инженерите са проучили проблемите и са преработили няколко аспекта на рамката си за безопасност.

Microsoft с рекорден ъпдейт за Windows заради AI опасности

Пазарът на смартфони е най-зле от 13 години насам и може да не се подобри скоро

По време на вътрешното тестване OpenAI наблюдава, че моделите, инструктирани да решават сложни инженерни цели, често третират бариерите за сигурност като оперативни грешки, които трябва да бъдат отстранени и заобиколени. Когато са ограничени в локални среди за изпълнение, моделите активно търсят уязвимости, опитвайки се да заобиколят ограниченията.

След откриване на липсващи зависимости или хардуерни ограничения, моделите се опитват да се свържат чрез неоторизирани SSH връзки към съседни модули, за да си осигурят допълнителни ресурси. По време на многочасови задачи, моделите демонстрират отклонение от инструкциите, като постепенно игнорират ограниченията за безопасност и стъпките за одобрение, докато приоритизират постигането на основната си цел.

За да се справи с тези уязвимости, OpenAI преустанови автономните вътрешни внедрявания, за да преструктурира своята защитна архитектура. Една от най-големите промени е въвеждането на мониторинг на ниво траектория. Вместо да оценява само крайния отговор на модела, OpenAI вече следи цялата последователност от действия, които AI предприема, докато изпълнява задача. Това позволява на системата да идентифицира проблемно поведение, докато то се развива, а не едва след като задачата е завършена. Подходът е особено важен за AI агенти, които взаимодействат със софтуер, сърфират в интернет или използват външни инструменти за дълги периоди от време.

Lenovo: RAMпокалипсисът е новото нормално занапред

Как смартфонът се превърна в неразделна част от нас

OpenAI също така казва, че е разширила методите си за тестване, като е създала оценки, базирани на реални инциденти, наблюдавани по време на вътрешна употреба. Вместо да разчитат единствено на теоретични показатели, инженерите са създали нови тестове, които отразяват видовете неочаквани ситуации, с които дългосрочно работещите системи действително са се сблъсквали. Компанията смята, че тези по-реалистични оценки са довели до измерими подобрения в поведението на модела преди по-широкото му внедряване.

OpenAI прави устройство с човекоподобно поведение

Икономисти срещу AI: Трябва да действаме веднага

OpenAI твърди, че опитът е подсилил важен урок: безопасното внедряване на усъвършенстван изкуствен интелект изисква повече от по-силни модели. То изисква също непрекъснато усъвършенстване на методите за оценка, системите за мониторинг и потребителския контрол с развитието на възможностите. Компанията описва това като подход на „защита в дълбочина“, комбиниращ множество слоеве на защита, вместо да разчита само на една предпазна мярка. 

Обратно в сайта X

ДОСТЪП ЗА ЛОГНАТИ ПОТРЕБИТЕЛИ За да пишете, оценявате или докладвате коментари, моля логнете се в профила си.

  1. Запомни ме
забравена парола Полетата маркирани с * са задължителни
Полето Потребителско име не трябва да е празно.
Полето E-mail не трябва да е празно.
Полето Парола не трябва да е празно.
Полето Повторете паролата не трябва да е празно.
  1. Декларирам, че съм се запознал с Общите условия за ползване на услугите на Нетинфо.
Полетата маркирани с * са задължителни
Средствата ще подпомогнат малки и средни предприятия да внедрят изкуствен интелект, облачни решения, автоматизация и други технологии от Индустрия 4.0.

125 млн. евро за дигитализация: колко и какви фирми ще получат пари за изкуствен интелект

Парите ни Преди 14 минути

След увеличението на бюджета подкрепените компании стават 512, като голяма част са извън София

Ужасяваща буря минава през Чили, най-малко 10 загинали

Ужасяваща буря минава през Чили, най-малко 10 загинали

Свят Преди 1 час

Властите определят бедствието като най-тежкото в региона за последните 40 години

Ламанша

Напрежение в Ламанша: Руски военен кораб откри огън на мили от британския бряг

Свят Преди 1 час

Провокацията от страна на Кремъл се разглежда като първото военно предизвикателство пред Анди Бърнам и Уес Стрийтинг, новия министър на отбраната

Принц Джордж

13 години подготовка за трона - необичайният път на принц Джордж

Любопитно Преди 1 час

В навечерието на 13-ия му рожден ден кралски източници разкриват как бъдещият крал е подготвян за служба още преди раждането си

През изминалото денонощие звената на пожарната  в страната са реагирали на 235 сигнала за произшествия, като са потушени 116 пожара

Пожар пламна в непроходима местност край Разлог

България Преди 1 час

Екипи от Национален парк „Пирин“ и РСПБЗН - Разлог пътуват към мястото

,

След Световното: Футболната звезда Винисиус Жуниор се подложи на пластична операция

Любопитно Преди 1 час

Бразилската звезда на Реал Мадрид Винисиус Жуниор се подложи на процедура за хармонизация на лицето след Световното първенство. Вижте как се промени визията на един от най-скъпите футболисти в света

НОИ получава част от необходимата информация служебно, но за по-старите периоди може да се наложи представяне на трудови книжки и други удостоверяващи документи.

Двумесечният срок, който решава от коя дата ще получавате пенсия

Парите ни Преди 1 час

Ако заявлението бъде подадено късно, плащането започва от датата на подаването, а не от възникването на правото

Случаят предизвика силно обществено възмущение

Шофьор на джип умишлено прегази стадо овце

България Преди 2 часа

По първоначални данни водачът се разгневил, след като животните навлезли в частен имот, полицията разследва случая

Инцидентът е станал малко след 10:00 часа местно време

Ферибот се сблъска с товарен кораб край Крит

Свят Преди 2 часа

Инцидентът е станал в залива Суда, няма пострадали и замърсяване на морето

Испания спечели Мондиал 2026, но интернет го направи безсмъртен

Испания спечели Мондиал 2026, но интернет го направи безсмъртен

Свят Преди 2 часа

През последните шест седмици от Световното първенство по футбол през 2026 г. видяхме изобилие от голове, сензационни спасявания и незабравими моменти. Футболът спечели на терена, но интернет помогна този турнир да стане безсмъртен

Благодарение на бързата намеса на пожарникарите огънят е овладян, а при инцидента няма пострадали

Локомотив на товарен влак се запали между две гари в Монтанско

България Преди 2 часа

Композицията е била съставена от товарни вагони, електрически и дизелов локомотив

Moby

Moby попадна на забранена зона в България, но я описа като „гората на магьосника“

Любопитно Преди 2 часа

Американският музикант, който наскоро завладя публиката в Пловдив, сподели любопитна история от разходката си в българската природа

За подобни обвинения законът предвижда наказание "лишаване от  свобода" от една до три години и глоба от 1000 до 5000 лева

Оставиха в ареста мъжа, причинил катастрофа в София с близо 3,5 промила алкохол

България Преди 2 часа

Според събраните до момента доказателства на 18 юли мъжът, освен че е шофирал след употреба на алкохол, е пречел на полицията да провери самоличността и документите му

.

Петиция за изхвърлянето на Аржентина от Мондиалa почти счупи рекорд на „Гинес“

Любопитно Преди 2 часа

Над 22 милиона фенове от цял свят се обединиха в подписка срещу световните шампиони, обвинявайки ФИФА в съдийско лансиране на Меси. Инициативата се превърна в една от най-масовите в историята на „Гинес“

Предложението е публикувано за обществено обсъждане

МОН предлага промени в изпита след 10. клас: Добавят въпроси по история и философия

България Преди 2 часа

Изпитът по български език и литература ще стане по-дълъг, а целта е да се оценяват по-широки знания и умения