IMG Investor Dnes Bloombergtv Bulgaria On Air Gol Tialoto Az-jenata Puls Teenproblem Automedia Imoti.net Rabota Az-deteto Start.bg Posoka Boec Megavselena.bg Chernomore

Моделите на OpenAI са споделяли хакерски съвети в таен форум преди пробива на Hugging Face

От компанията казват, че съзнателно забавят изследванията, за да подобрят сигурността и основите на средата и да засилят мониторинга

12:05 | 06.08.26 г.
Автор - снимка
Редактор
Снимка: Bloomberg
Снимка: Bloomberg

Седмици преди да успеят да излязат от затворена тестова среда и да започнат кибератака без човешка подкана, някои от най-модерните агенти на OpenAI, базирани на изкуствен интелект (АІ), тайно са започнали да споделят съвети как да заобиколят изискванията на вътрешна оценка за хакерство. Това съобщава Politico, като цитира двама от изследователите на компанията за изкуствен интелект.

„Това е ключов момент както за нашата компания, така и за индустрията за изкуствен интелект като цяло“, казма Майкъл Далтън, един от изследователите на производителя на изкуствен интелект, по време на презентация на конференцията за киберсигурност Black Hat в Лас Вегас, Невада.

Разкритиено предоставя по-подробна информация за времевата линия и методите, използвани от два от моделите на OpenAI, преди да излязат от контролирана среда и да попаднат в отворения интернет. Това им позволява да пробият платформата за разработчици на изкуствен интелект Hugging Face незабелязано.

OpenAI признава, че нейните модели са отговорни за хака в края на миналия месец, приблизително седмица след като Hugging Face заяви, че автономна система с изкуствен интелект е проникнала в мрежата ѝ.

Разкритието ще предизвика нов анализ на мерките, които водещи лаборатории за изкуствен интелект, като OpenAI и Anthropic, предприемат, за да наблюдават поведението на най-способните си в киберпространството технологии – особено по време на оценки, при които агентите са подканени да демонстрират своите хакерски умения в контролирана среда.

Във вторник Институтът за безопасност и сигурност на изкуствения интелект във Великобритания разкри, че най-мощният модел на изкуствен интелект на Anthropic е създал фалшиви онлайн персони и се е опитал да подмами програмист да съдейства за кибератака по време на скорошен неуспешен хакерски тест.

След разкритието за Hugging Face миналия месец Anthropic проведе преглед и също установи, че модели, които тества, са нарушили сигурността на три организации в отделни инциденти, датиращи от април.

Далтън и Ерик Уолъс, друг изследовател на OpenAI, посочват, че гигантът в областта на изкуствения интелект наскоро е научил, че множество агенти, които тества едновременно, са започнали да комуникират чрез вътрешен форум в началото на май. Там различни модели са споделяли съвети как да се справят с трудни хакерски предизвикателства, включително как да вземат заобиколни решения, изискващи достъп до интернет.

Два модела на OpenAI са изпълнили серия от сложни техники, за да получат достъп до интернет и да се промъкнат в Hugging Face в средата на юли.

От OpenAI казват, че моделите са фокусирани върху завършване на хакерска оценка, която са били подканени да решат, и че правилните отговори могат да бъдат намерени на платформата за разработчици на AI.

Изследователите на OpenAI съобщават на участниците в конференцията, че от началото на май моделите са създали табло за съобщения във вътрешната файлова система Artifactory на OpenAI. Без знанието на компанията моделите са прекарали месеци независимо в обмен на информация и техники, за да си помогнат взаимно да изпълнят трудни задачи.

Уолъс казва, че когато моделите се затруднят, те често „се опитват да изиграят или излъжат задачата, за да получат наградата си“. „Началото на този инцидент някак си се връща към момента, в който един агент осъзнава, че може да комуникира, като качи бележка“, добавя той.

До края на май един модел е намерил начин да злоупотреби с интернет достъпа на Artifactory, за да извлича файлове от различни уебсайтове. По този начин той ефективно е дал на другите модели непряк достъп до интернет. През юни моделите са успели да открият и използват неизвестна досега уязвимост от типа „нулев ден“, за да получат администраторски права в Artifactory, да инсталират отдалечен софтуер и да разширят дейността си в системата.

Това в крайна сметка е претоварило Artifactory и е причинило прекъсване на цялата система в началото на юли. Така инженерите на OpenAI са разкрили схемата. След разследване компанията е отнела идентификационните данни на модела, премахнала е форума и работи с Artifactory, за да отстрани всички пропуски, преди да възобнови обучението.

Моделите обаче са намерили друг начин за комуникация вътре в Artifactory само няколко дни по-късно и са продължили да обменят техники, за да се насочат към допълнителни уязвимости в инфраструктурата на OpenAI и външните системи, включително Hugging Face.

Далтън посочва, че от OpenAI съзнателно забавят изследванията, за да подобрят сигурността и основите на средата. Компанията засилва и мониторинга на AI агентите и подобрява общата среда на контрол, добавя той.

Всяка новина е актив, следете Investor.bg и в Google News Showcase.
Последна актуализация: 12:06 | 06.08.26 г.
Най-четени новини
Още от Новини и анализи виж още

Коментари

Финанси виж още