IMG Investor Dnes Bloombergtv Bulgaria On Air Gol Tialoto Az-jenata Puls Teenproblem Automedia Imoti.net Rabota Az-deteto Start.bg Posoka Boec Megavselena.bg Chernomore

Anthropic разкри четвърти случай на хакване от свой AI агент

Случаят е бил пропуснат в предишния преглед на дейността на агентите

10:12 | 10.09.26 г.
Автор - снимка
Редактор
Снимка: Bloomberg
Снимка: Bloomberg

Anthropic разкри в сряда поредния случай, в който модел с изкуствен интелект е проникнал във външни системи по време на тестове – най-новият в нарастващия списък от подобни инциденти, които предизвикват опасения относно риска, свързан с автономните AI агенти, съобщава Ройтерс.

Инцидентът от януари е останал незабелязан до миналия месец въпреки проведена по-рано проверка в цялата компания, посочи Anthropic. Това подчертава предизвикателството, пред което са изправени разработчиците на изкуствен интелект при идентифицирането и овладяването на неочакваното поведение на усъвършенстваните модели.

В публикация в блога си компанията посочи, че инцидентът е свързан с ранна версия на Claude Opus 4.6. Тя заяви, че е уведомила всички засегнати страни, но не разкри повече подробности. Компании като Anthropic и OpenAI биват следени внимателно, тъй като моделите, предназначени да изпълняват сложни задачи, понякога се научават да заобикалят правилата, да се възползват от пропуски и да взаимодействат с външни системи по начини, които разработчиците им не са предвидили.

Ройтерс съобщи миналата седмица, че „недисциплинирани“ агенти от OpenAI са поели контрола над Wiki страница на немски език и редица други сайтове – инцидент, който OpenAI е предпочела да не разкрива, докато информационната агенция не го направи публично достояние.

Разкритието на Anthropic следва обявеното през юли съобщение, че някои от моделите Claude са проникнали в системите на три компании по време на тестове за киберсигурност.

Предишните инциденти, които компанията определи като „оперативна грешка“, засягаха три отделни модела: Claude Opus 4.7, Claude Mythos 5 и вътрешен изследователски тестов модел.

Инцидентите са произтекли от грешка, която неволно е предоставила на моделите достъп до открития интернет.

Компанията е установила инцидентите след преглед на 141 006 тестови сесии – процес, който започна, след като автономен агент, задвижван от моделите за изкуствен интелект на OpenAI, предизвика хак, който компрометира инфраструктурата на AI стартъпа Hugging Face.

Anthropic съобщи в сряда, че е пропуснала набор от тестови сесии по време на първоначалния преглед, които са били идентифицирани миналия месец и са довели до откриването на четвъртия инцидент.

Въз основа на предварителна оценка Anthropic заяви, че не смята, че най-новият инцидент е по-сериозен от предишните три, които са били подробно проучени.

Компанията заяви, че разследването ѝ е установило два повтарящи се проблема, които са се проявявали в различна степен при различните инциденти: пристрастно разсъждение, при което Claude е пренебрегнал или погрешно е интерпретирал доказателствата, че работи в реалната интернет среда, и безразсъдство, или склонност да предприема потенциално вредни действия в изпълнение на дадена задача.

Anthropic заяви, че е ангажирала независимата изследователска фирма METR да разследва инцидентите. Тя посочи, че на METR ще бъде предоставен широк достъп, включително до стенограми извън периода, в който са настъпили инцидентите, както и до служители, на които ще бъде позволено да споделят поверителна информация.

Всяка новина е актив, следете Investor.bg и в Google News Showcase.
Последна актуализация: 10:12 | 10.09.26 г.
Най-четени новини
Още от Новини и анализи виж още

Коментари

Финанси виж още