Седмици преди да успеят да излязат от затворена тестова среда и да започнат кибератака без човешка подкана, някои от най-модерните агенти на OpenAI, базирани на изкуствен интелект (АІ), тайно са започнали да споделят съвети как да заобиколят изискванията на вътрешна оценка за хакерство. Това съобщава Politico, като цитира двама от изследователите на компанията за изкуствен интелект.
„Това е ключов момент както за нашата компания, така и за индустрията за изкуствен интелект като цяло“, казма Майкъл Далтън, един от изследователите на производителя на изкуствен интелект, по време на презентация на конференцията за киберсигурност Black Hat в Лас Вегас, Невада.
Разкритието предоставя по-подробна информация за времевата линия и методите, използвани от два от моделите на OpenAI, преди да излязат от контролирана среда и да попаднат в отворения интернет. Това им позволява да пробият платформата за разработчици на изкуствен интелект Hugging Face незабелязано.
OpenAI признава, че нейните модели са отговорни за хака в края на миналия месец, приблизително седмица след като Hugging Face заяви, че автономна система с изкуствен интелект е проникнала в мрежата ѝ.
Разкритието ще предизвика нов анализ на мерките, които водещи лаборатории за изкуствен интелект, като OpenAI и Anthropic, предприемат, за да наблюдават поведението на най-способните си в киберпространството технологии – особено по време на оценки, при които агентите са подканени да демонстрират своите хакерски умения в контролирана среда.
Във вторник Институтът за безопасност и сигурност на изкуствения интелект във Великобритания разкри, че най-мощният модел на изкуствен интелект на Anthropic е създал фалшиви онлайн персони и се е опитал да подмами програмист да съдейства за кибератака по време на скорошен неуспешен хакерски тест.
След разкритието за Hugging Face миналия месец Anthropic проведе преглед и също установи, че модели, които тества, са нарушили сигурността на три организации в отделни инциденти, датиращи от април.
Далтън и Ерик Уолъс, друг изследовател на OpenAI, посочват, че гигантът в областта на изкуствения интелект наскоро е научил, че множество агенти, които тества едновременно, са започнали да комуникират чрез вътрешен форум в началото на май. Там различни модели са споделяли съвети как да се справят с трудни хакерски предизвикателства, включително как да вземат заобиколни решения, изискващи достъп до интернет.
Два модела на OpenAI са изпълнили серия от сложни техники, за да получат достъп до интернет и да се промъкнат в Hugging Face в средата на юли.
От OpenAI казват, че моделите са фокусирани върху завършване на хакерска оценка, която са били подканени да решат, и че правилните отговори могат да бъдат намерени на платформата за разработчици на AI.
Изследователите на OpenAI съобщават на участниците в конференцията, че от началото на май моделите са създали табло за съобщения във вътрешната файлова система Artifactory на OpenAI. Без знанието на компанията моделите са прекарали месеци независимо в обмен на информация и техники, за да си помогнат взаимно да изпълнят трудни задачи.
Уолъс казва, че когато моделите се затруднят, те често „се опитват да изиграят или излъжат задачата, за да получат наградата си“. „Началото на този инцидент някак си се връща към момента, в който един агент осъзнава, че може да комуникира, като качи бележка“, добавя той.
До края на май един модел е намерил начин да злоупотреби с интернет достъпа на Artifactory, за да извлича файлове от различни уебсайтове. По този начин той ефективно е дал на другите модели непряк достъп до интернет. През юни моделите са успели да открият и използват неизвестна досега уязвимост от типа „нулев ден“, за да получат администраторски права в Artifactory, да инсталират отдалечен софтуер и да разширят дейността си в системата.
Това в крайна сметка е претоварило Artifactory и е причинило прекъсване на цялата система в началото на юли. Така инженерите на OpenAI са разкрили схемата. След разследване компанията е отнела идентификационните данни на модела, премахнала е форума и работи с Artifactory, за да отстрани всички пропуски, преди да възобнови обучението.
Моделите обаче са намерили друг начин за комуникация вътре в Artifactory само няколко дни по-късно и са продължили да обменят техники, за да се насочат към допълнителни уязвимости в инфраструктурата на OpenAI и външните системи, включително Hugging Face.
Далтън посочва, че от OpenAI съзнателно забавят изследванията, за да подобрят сигурността и основите на средата. Компанията засилва и мониторинга на AI агентите и подобрява общата среда на контрол, добавя той.


На 82 турска актриса изумява с визията си СНИМКИ
Закопчаха 77-годишен шофьор след преследване
Задържаха мъж за брутален грабеж и побой на възрастна жена в Тервел
Борино ще бъде първата община в България с план за мирно съжителство с мечките
Украинската посланичка дава обяснения за падналия дрон край Кардам
Проф. Маринов: България губи ключово предимство в туризма
Нов еврорегламент променя опаковките, очаква се поскъпването им
Сделка Иран-Оман за Ормуз би била прецедент в световната морска търговия
Китайската инфлация се забавя и връща риска от дефлация
Петролът поскъпва, докато сделката за Ормуз остава неясна
Полицията в Лондон конфискува коли за над 8 млн лири
Германски производител на автомобили фалира
Колите могат сами да спират превишението на скоростта, но нямат разрешение
Шофьори масово пренебрегват въртящо се копче вляво от волана
Електромобилите най-после станаха по-евтини от хибридите
Набили изверга шеф "Чичо Гошо", драл и сготвил котка?
Жегата е убила над 25 000 души в цяла Европа тази година
Задържаха след преследване 77-годишен пиян шофьор
Психолог видя връзка между руския нацизъм и убийството в Пловдив