Anthropic разкри в сряда поредния случай, в който модел с изкуствен интелект е проникнал във външни системи по време на тестове – най-новият в нарастващия списък от подобни инциденти, които предизвикват опасения относно риска, свързан с автономните AI агенти, съобщава Ройтерс.
Инцидентът от януари е останал незабелязан до миналия месец въпреки проведена по-рано проверка в цялата компания, посочи Anthropic. Това подчертава предизвикателството, пред което са изправени разработчиците на изкуствен интелект при идентифицирането и овладяването на неочакваното поведение на усъвършенстваните модели.
В публикация в блога си компанията посочи, че инцидентът е свързан с ранна версия на Claude Opus 4.6. Тя заяви, че е уведомила всички засегнати страни, но не разкри повече подробности. Компании като Anthropic и OpenAI биват следени внимателно, тъй като моделите, предназначени да изпълняват сложни задачи, понякога се научават да заобикалят правилата, да се възползват от пропуски и да взаимодействат с външни системи по начини, които разработчиците им не са предвидили.
Ройтерс съобщи миналата седмица, че „недисциплинирани“ агенти от OpenAI са поели контрола над Wiki страница на немски език и редица други сайтове – инцидент, който OpenAI е предпочела да не разкрива, докато информационната агенция не го направи публично достояние.
Разкритието на Anthropic следва обявеното през юли съобщение, че някои от моделите Claude са проникнали в системите на три компании по време на тестове за киберсигурност.
Предишните инциденти, които компанията определи като „оперативна грешка“, засягаха три отделни модела: Claude Opus 4.7, Claude Mythos 5 и вътрешен изследователски тестов модел.
Инцидентите са произтекли от грешка, която неволно е предоставила на моделите достъп до открития интернет.
Компанията е установила инцидентите след преглед на 141 006 тестови сесии – процес, който започна, след като автономен агент, задвижван от моделите за изкуствен интелект на OpenAI, предизвика хак, който компрометира инфраструктурата на AI стартъпа Hugging Face.
Anthropic съобщи в сряда, че е пропуснала набор от тестови сесии по време на първоначалния преглед, които са били идентифицирани миналия месец и са довели до откриването на четвъртия инцидент.
Въз основа на предварителна оценка Anthropic заяви, че не смята, че най-новият инцидент е по-сериозен от предишните три, които са били подробно проучени.
Компанията заяви, че разследването ѝ е установило два повтарящи се проблема, които са се проявявали в различна степен при различните инциденти: пристрастно разсъждение, при което Claude е пренебрегнал или погрешно е интерпретирал доказателствата, че работи в реалната интернет среда, и безразсъдство, или склонност да предприема потенциално вредни действия в изпълнение на дадена задача.
Anthropic заяви, че е ангажирала независимата изследователска фирма METR да разследва инцидентите. Тя посочи, че на METR ще бъде предоставен широк достъп, включително до стенограми извън периода, в който са настъпили инцидентите, както и до служители, на които ще бъде позволено да споделят поверителна информация.


Затвориха улица в "Кайсиева градина"
Аксаково отпадна от турнира за Купата на България
Премахват сухи и опасни клони и дървета от училища и детски градини във Варна
Хороскоп за 11 септември 2026
12 пияни велосипеди и ел. тротинетки са спипани във Варна от началото на 2026
Манията за протеини и пептиди: Научни факти срещу маркетингови трикове
Чужденците могат да решат множество проблеми на трудовия ни пазар
Рекордните ставки за танкери сигнализират за задълбочаваща се енергийна криза
Шест от десет търсения в Google в България вероятно приключват без клик. Никой не го измерва.
Тръмп обещава $5000 на всеки пълнолетен американец при победа на републиканците
VW ID. Polo направи бум на пазара - чакането е над 10 месеца
Без изненади – това са марките, чиито коли ще изкарат 400 000 км
Това са най-опасните песни за шофиране
Toyota признава, че Land Cruiser се краде твърде лесно
Масови модели ще използват технология на Lamborghini
Зеленски отива в Канада, за да обсъди нуждите на Украйна от ПВО
"Мегареформа" или медиен балон? Институтът за пътна безопасност разкритикува плана на кабинета
Лекар напомни: Здравно-профилактичните карти на учениците са електронни
Готвят протест в защита на Георги Ангелов пред БНТ
ПСС: Добри са условията за туризъм в планините