Моделите с изкуствен интелект (AI) са обучени да не лъжат хората. И все пак се случва нещо странно: изкуственият интелект лъже хората доста често, пише Bloomberg.
Наскоро AI модел, създаден от Anthropic, лишен от защитните си мерки срещу хакерство и подложен на киберсигурност от AI Security Institute (Институт за сигурност на изкуствения интелект) на британското правителство, се опита да вмъкне злонамерен код в проект с отворен код, хостван на уебсайта GitHub. Когато не успя да реши предизвикателството с нормални методи, моделът прояви креативност. Той проучи човешките администратори на проекта, създаде фалшиви самоличности и след това се представи за разработчици на софтуер, за да спечели доверието на хората, преди да се опита да вмъкне лошия код.
Екипът на AI Security Institute забелязал какво се случва и прекратил теста. Дори с премахнати предпазители, моделът не би трябвало да лъже, тъй като Anthropic е обучил модела си Claude да дава приоритет на безопасността и честността. И все пак измамата се е „появила като страничен продукт“, докато моделът се е опитвал да изпълни трудна задача, показва доклад за инцидент на института, който в отделно проучване от юли посочва, че всеки нов AI модел, който е тестван за измама, се е опитвал да го направи и че подобно поведение ще стане по-трудно за откриване.
Бъдете внимателни, когато водещи компании за изкуствен интелект твърдят, че могат да решат този проблем. Играейки си на Бог, за да създадат по-висша форма на интелект, тези разработчици интегрират в своето творение първороден грях, наречен подсилено обучение (Reinforcement Learning).
Това обучение е един от най-ефективните методи за разработване на AI модели и включва насочване на поведението на тези модели чрез похвали и корекции, подобно на обучението на куче. Вместо бисквитка моделът получава дигитално „лакомство“ под формата на числов резултат.
Когато бъдат насочвани по този начин от хиляди независими изпълнители по целия свят (или все по-често от машини), моделите стават учтиви и услужливи. Но методът може да доведе и до фалшиво ласкателство и затова изкуствените интелекти понякога мамят. Водени от желанието си да получат награда, те търсят пряк път - феномен, известен като „хакване с награда“.
Без значение в каква степен Anthropic или OpenAI се опитват да обучат своите творения на полезно поведение, методите им може да са едни от най-големите пречки за привеждането на AI в съответствие с човешките ценности.
„Подсиленото обучение не възнаграждава истината или добротата“, казва Конър Лийхи, експерт по изкуствен интелект, който ръководи американския клон на организацията с нестопанска цел ControlAI, която се опитва да спре разработването на свръхинтелигентни системи. „То възнаграждава преминаването на теста по всякакъв необходим начин“, добавя той.
Това може да означава да се заблуди някого или неволно да се причини някаква вреда. Един пример от практиката показва до какво може да доведе това. По-рано тази година технолог в Австралия на име Андрю Бърд моли Claude да му помогне да се запише в популярна фитнес програма. AI агентът, изграден върху рамката с отворен код OpenClaw и способен да изпълнява задачи в интернет, в крайна сметка използва уязвимост в онлайн системите на фитнеса, за да го запише предварително.
Когато Бърд иска да се изкачи в списъка с чакащи в даден клас, Claude отменя резервацията на човека начело и премества Бърд от четвърто място на трето.
Подобни инциденти са рядкост, тъй като използването на AI агенти все още е до голяма степен ограничено до разработчици на софтуер и технологични ентусиасти. Но OpenAI, Anthropic и техните по-големи конкуренти настояват широката общественост да се обръща към чатботовете да изпълняват задачи вместо тях онлайн. Марк Зукърбърг заяви миналия месец, че Meta Platforms разработва лични агенти като „страхотен потребителски продукт, който е достатъчно лесен за използване от милиарди хора“.
Зукърбърг не казва дали неговите AI асистенти ще ви запишат на фитнес, но може би сме напът да се сблъскаме с бъдеще, в което много повече хора ще молят изкуствения интелект да им помогне да получат възстановяване на някаква сума или да резервират най-добрите места на дадено представление. Вместо това техните агенти ще се отнасят към другите хора като към пречки пред изпълнението на тези задачи. Това може да означава анулиране на други резервации, намеса в действията на конкурентни участници в онлайн търг или, в случай на търсене на обезщетение, фалшифициране на доказателства.
Усилията на компаниите досега не изглеждат обещаващи. През януари Anthropic, която отдавна се позиционира като най-осъзнат по отношение на безопасността разработчик на изкуствен интелект, публикува ревизирана декларация от 23 хил. думи за Claude, за да оформи поведението му в полза на компанията. И все пак, когато AI Security Institute провежда последните си тестове, повечето от „несанкционираните“ действия, които регистрира, идват от модела Mythos 5 на Anthropic. В реалния свят един дълъг документ за честност и поверителност не може да обясни почти безкрайните потенциални сценарии, в които Claude може да мами.
Размахването на пръст срещу AI модел с цел да не мами не е ефективно. Когато организацията с нестопанска цел METR казва на модел, пуснат от OpenAI през 2025 г., да не мами, той го прави също толкова често, колкото и преди това. Също така нарушава правилата в 14 от 20 опита за задача, когато му е казано, че работата му ще помогне на учените, изследващи болестта на Алцхаймер.
„Това не е видът проблем, който някои инженери могат да решат с математика“, казва Лийхи. „Това е проблем, върху който цяла цивилизация, всички наши най-велики математици, философи, учени [трябва] да работят поколения наред, за да постигнат постепенен напредък“, добавя той.
Няма съмнение, че Anthropic полага значителни усилия за моралното насочване на изкуствения интелект, а хора, близки до Дарио Амодей, казват, че главният изпълнителен директор на компанията е искрен в желанието си да изгради безопасна технология. Но дори той не може да избегне мощен търговски императив, който тласка хората - и все по-често изкуствения интелект - да печелят на всяка цена. Именно така самата Силициева долина създаде такова непостижимо богатство и същевременно причини дълбоки вреди в човешкия живот.


Какво време ни очаква в сряда?
Три супер битки допълват бойната карта на SENSHI 33
Закопчаха трима младежи със солидно количество дрога, лагерували нерегламентирано край Камен бряг
Вдигат национален протест срещу ветрогенераторите и фотоволтаиците върху земеделски земи
Polymarket преживява ужасно разочарование след Световното първенство
О’Хандън: САЩ никога не са имали ясна мисия в Персийския залив
Стивън Мейджър за трудностите пред централните банки
Стажантите в банки вече обучават старшите си колеги да работят с него
Пазарът на труда във Великобритания се охлажда, лихвите остават замразени
Първото поколение на BMW X5 получи V10 и ръчни скорости
Защо страничните огледала са обречени на изчезване
Опасна мода взима жертви по пътищата
Шофирането без навигация може да ви предпази от Алцхаймер
Първото Lamborghini с V12 не е кола или трактор
Джони Деп може да се завърне в "Карибски пирати 6"?
"Яблоко" срещу Кремъл: как единствената антивоенна партия в Русия се превърна в символ на недоволството
Обладана и преследвана: Кая Гербер разкри, че е преминала през екзорсизъм
Столичният район с най-много имоти за продажба е "Малинова долина", над 2000 оферти
Кола удари мъж с електрическа тротинетка в Ямбол