Седмици преди да успеят да излязат от затворена тестова среда и да започнат кибератака без човешка подкана, някои от най-модерните агенти на OpenAI, базирани на изкуствен интелект (АІ), тайно са започнали да споделят съвети как да заобиколят изискванията на вътрешна оценка за хакерство. Това съобщава Politico, като цитира двама от изследователите на компанията за изкуствен интелект.
„Това е ключов момент както за нашата компания, така и за индустрията за изкуствен интелект като цяло“, казва Майкъл Далтън, един от изследователите на производителя на изкуствен интелект, по време на презентация на конференцията за киберсигурност Black Hat в Лас Вегас, Невада.
Разкритието предоставя по-подробна информация за времевата линия и методите, използвани от два от моделите на OpenAI, преди да излязат от контролирана среда и да попаднат в отворения интернет. Това им позволява да пробият платформата за разработчици на изкуствен интелект Hugging Face незабелязано.
OpenAI признава, че нейните модели са отговорни за хакването в края на миналия месец, приблизително седмица след като Hugging Face заяви, че автономна система с изкуствен интелект е проникнала в мрежата ѝ.
Разкритието ще предизвика нов анализ на мерките, които водещи лаборатории за изкуствен интелект като OpenAI и Anthropic предприемат, за да наблюдават поведението на най-способните си в киберпространството технологии – особено по време на оценки, при които агентите са подканени да демонстрират своите хакерски умения в контролирана среда.
Във вторник Институтът за безопасност и сигурност на изкуствения интелект във Великобритания разкри, че най-мощният модел на изкуствен интелект на Anthropic е създал фалшиви онлайн персони и се е опитал да подмами програмист да съдейства за кибератака по време на скорошен неуспешен хакерски тест.
След разкритието за Hugging Face миналия месец Anthropic проведе преглед и също установи, че модели, които тества, са нарушили сигурността на три организации в отделни инциденти, датиращи от април.
Далтън и Ерик Уолъс, друг изследовател на OpenAI, посочват, че гигантът в областта на изкуствения интелект наскоро е научил, че множество агенти, които тества едновременно, са започнали да комуникират чрез вътрешен форум в началото на май. Там различни модели са споделяли съвети как да се справят с трудни хакерски предизвикателства, включително как да вземат заобиколни решения, изискващи достъп до интернет.
Два модела на OpenAI са изпълнили серия от сложни техники, за да получат достъп до интернет и да се промъкнат в Hugging Face в средата на юли.
От OpenAI казват, че моделите са фокусирани върху завършване на хакерска оценка, която са били подканени да решат, и че правилните отговори могат да бъдат намерени на платформата за разработчици на AI.
Изследователите на OpenAI съобщават на участниците в конференцията, че от началото на май моделите са създали табло за съобщения във вътрешната файлова система Artifactory на OpenAI. Без знанието на компанията моделите са прекарали месеци независимо в обмен на информация и техники, за да си помогнат взаимно да изпълнят трудни задачи.
Уолъс казва, че когато моделите се затруднят, те често „се опитват да изиграят или излъжат задачата, за да получат наградата си“. „Началото на този инцидент някак си се връща към момента, в който един агент осъзнава, че може да комуникира, като качи бележка“, добавя той.
До края на май един модел е намерил начин да злоупотреби с интернет достъпа на Artifactory, за да извлича файлове от различни уебсайтове. По този начин той ефективно е дал на другите модели непряк достъп до интернет. През юни моделите са успели да открият и използват неизвестна досега уязвимост от типа „нулев ден“, за да получат администраторски права в Artifactory, да инсталират отдалечен софтуер и да разширят дейността си в системата.
Това в крайна сметка е претоварило Artifactory и е причинило прекъсване на цялата система в началото на юли. Така инженерите на OpenAI са разкрили схемата. След разследване компанията е отнела идентификационните данни на модела, премахнала е форума и работи с Artifactory, за да отстрани всички пропуски, преди да възобнови обучението.
Моделите обаче са намерили друг начин за комуникация вътре в Artifactory само няколко дни по-късно и са продължили да обменят техники, за да се насочат към допълнителни уязвимости в инфраструктурата на OpenAI и външните системи, включително Hugging Face.
Далтън посочва, че от OpenAI съзнателно забавят изследванията, за да подобрят сигурността и основите на средата. Компанията засилва и мониторинга на AI агентите и подобрява общата среда на контрол, добавя той.


Хванаха за ден 27 шофьори с алкохол или наркотици
Футболен фен влиза в затвора заради възхвала на Ратко Младич
Терзиев отрече да е обещавал охраната на парк „Витоша“ на Ивайло Калушев
Гръцкото правителство тръгна на битка срещу затлъстяването сред децата
Горивата у нас продължават да поскъпват и през тази седмица
Индонезия получи безплатен самолетоносач, но ще плати скъпо за модернизацията му
Пропадане на самолет и пилот с наркотици разкриват кризата в Air India
Украйна се включи в изборите в Русия с най-голямата си въздушна атака
Бумът на центровете за данни променя пазара на ипотечни облигации
Анди Бърнам се оказа там, където не искаше: в зависимост от дълговите пазари
Бензин, дизел или електричество – кое излиза най-изгодно?
90, 110 или 120 км/ч: Защо няма универсална „правилна“ скорост за автомобила
Проверка на 2,4 млн автомобила показа модела с най-много проблеми
Три автомобила на Джеръми Кларксън от The Grand Tour отиват на търг
Ново окачване превръща дупките в безплатна електроенергия
Шофиране в Гърция: Лесно ли е и какво трябва да знаете преди да наемете кола?
Захарова: Зеленски ще се опита да покрие "космическия бюджетен дефицит" чрез мобилизация
Как „Яблоко“ оцеля в руските избори въпреки забраната на партията
Овладяха пожара на депото край Плевен, започна окончателното обезопасяване
Как да защитим данните си в интернет