Седмици преди да успеят да излязат от затворена тестова среда и да започнат кибератака без човешка подкана, някои от най-модерните агенти на OpenAI, базирани на изкуствен интелект (АІ), тайно са започнали да споделят съвети как да заобиколят изискванията на вътрешна оценка за хакерство. Това съобщава Politico, като цитира двама от изследователите на компанията за изкуствен интелект.
„Това е ключов момент както за нашата компания, така и за индустрията за изкуствен интелект като цяло“, казма Майкъл Далтън, един от изследователите на производителя на изкуствен интелект, по време на презентация на конференцията за киберсигурност Black Hat в Лас Вегас, Невада.
Разкритиено предоставя по-подробна информация за времевата линия и методите, използвани от два от моделите на OpenAI, преди да излязат от контролирана среда и да попаднат в отворения интернет. Това им позволява да пробият платформата за разработчици на изкуствен интелект Hugging Face незабелязано.
OpenAI признава, че нейните модели са отговорни за хака в края на миналия месец, приблизително седмица след като Hugging Face заяви, че автономна система с изкуствен интелект е проникнала в мрежата ѝ.
Разкритието ще предизвика нов анализ на мерките, които водещи лаборатории за изкуствен интелект, като OpenAI и Anthropic, предприемат, за да наблюдават поведението на най-способните си в киберпространството технологии – особено по време на оценки, при които агентите са подканени да демонстрират своите хакерски умения в контролирана среда.
Във вторник Институтът за безопасност и сигурност на изкуствения интелект във Великобритания разкри, че най-мощният модел на изкуствен интелект на Anthropic е създал фалшиви онлайн персони и се е опитал да подмами програмист да съдейства за кибератака по време на скорошен неуспешен хакерски тест.
След разкритието за Hugging Face миналия месец Anthropic проведе преглед и също установи, че модели, които тества, са нарушили сигурността на три организации в отделни инциденти, датиращи от април.
Далтън и Ерик Уолъс, друг изследовател на OpenAI, посочват, че гигантът в областта на изкуствения интелект наскоро е научил, че множество агенти, които тества едновременно, са започнали да комуникират чрез вътрешен форум в началото на май. Там различни модели са споделяли съвети как да се справят с трудни хакерски предизвикателства, включително как да вземат заобиколни решения, изискващи достъп до интернет.
Два модела на OpenAI са изпълнили серия от сложни техники, за да получат достъп до интернет и да се промъкнат в Hugging Face в средата на юли.
От OpenAI казват, че моделите са фокусирани върху завършване на хакерска оценка, която са били подканени да решат, и че правилните отговори могат да бъдат намерени на платформата за разработчици на AI.
Изследователите на OpenAI съобщават на участниците в конференцията, че от началото на май моделите са създали табло за съобщения във вътрешната файлова система Artifactory на OpenAI. Без знанието на компанията моделите са прекарали месеци независимо в обмен на информация и техники, за да си помогнат взаимно да изпълнят трудни задачи.
Уолъс казва, че когато моделите се затруднят, те често „се опитват да изиграят или излъжат задачата, за да получат наградата си“. „Началото на този инцидент някак си се връща към момента, в който един агент осъзнава, че може да комуникира, като качи бележка“, добавя той.
До края на май един модел е намерил начин да злоупотреби с интернет достъпа на Artifactory, за да извлича файлове от различни уебсайтове. По този начин той ефективно е дал на другите модели непряк достъп до интернет. През юни моделите са успели да открият и използват неизвестна досега уязвимост от типа „нулев ден“, за да получат администраторски права в Artifactory, да инсталират отдалечен софтуер и да разширят дейността си в системата.
Това в крайна сметка е претоварило Artifactory и е причинило прекъсване на цялата система в началото на юли. Така инженерите на OpenAI са разкрили схемата. След разследване компанията е отнела идентификационните данни на модела, премахнала е форума и работи с Artifactory, за да отстрани всички пропуски, преди да възобнови обучението.
Моделите обаче са намерили друг начин за комуникация вътре в Artifactory само няколко дни по-късно и са продължили да обменят техники, за да се насочат към допълнителни уязвимости в инфраструктурата на OpenAI и външните системи, включително Hugging Face.
Далтън посочва, че от OpenAI съзнателно забавят изследванията, за да подобрят сигурността и основите на средата. Компанията засилва и мониторинга на AI агентите и подобрява общата среда на контрол, добавя той.


Изплащат пенсиите от утре
Интерактивна карта дава бърз достъп до водните бази по Черноморието
Легендарният кораб на "Грийнпийс" Arctic Sunrise пристига във Варна
Осем задържани след побоя до смърт в Пловдив
Модел на Meta AI проникна във външна система при тест за киберсигурност
Пазарната стратегия „Продавай Америка“ се възражда
SpaceX не трябва да рискува репутацията си с мобилни телефонни услуги
Google измества AI ръководството си в Калифорния, за да настигне конкурентите си
Моделите на OpenAI са обединили сили месеци преди пробива в Hugging Face
Фасове в асфалта решават проблема с екологията
BMW пусна реклами на екраните в колите си
Nissan Qashqai измина близо 2000 км с един резервоар
Тази част може да се износи до 120 000 км и ремонтът не е евтин
Изоставена Honda натрупа 30 400 евро неплатени такси
“Галъп”: 42% одобрение за кабинета "Радев" след първите 100 дни управление
Дарявайте! Има недостиг на кръв от отрицателните групи
Осем цивилни загинаха след руска атака на жп гара до Киев СНИМКИ
Пожар пламна край АМ “Тракия” в посока Бургас