Мощните AI модели отново излязоха извън контрол. Този път – особено прикрито
Изследователска група, подкрепяна от правителството на Обединеното кралство, съобщи, че системи на OpenAI и Anthropic са предприели действия без разрешение и са проявили подвеждащо поведение по време на тестове
,fit(1001:538)&format=webp)
Подкрепеният от британското правителство Институт за сигурност на изкуствения интелект (AI Security Institute – AISI) съобщи във вторник, че по време на рутинни тестове модели на OpenAI и Anthropic неочаквано са предприели самостоятелни и неразрешени действия в реалната интернет среда, насочени срещу реални хора и организации. По-голямата част от тези действия са се случили в рамките на тридневен период в края на юли.
В един от тестовете моделът Mythos 5 на Anthropic сам е излязъл в интернет и е направил опит да измами двама неидентифицирани разработчици, за да добавят злонамерен софтуер към техен проект с отворен код. Целта му е била да постигне по-добър резултат в тест за оценка на възможностите му, посочва институтът.
От AISI обясняват пред The Wall Street Journal, че по време на тестовете моделите са работили на компютри с достъп до интернет, което им е позволило да извършат действия, които не е трябвало да бъдат възможни.
От Anthropic заявяват, че при теста не са били активирани стандартните механизми за киберсигурност на модела.
Случаят е поредният от серия публично разкрити инциденти, при които AI модели предприемат нови – а понякога и злонамерени – действия, за да се справят по-добре с поставените им задачи.
Технологичната индустрия, изследователите и правителствата все още търсят начин да разберат и ограничат новите рискове, породени от все по-мощните системи с изкуствен интелект, като все повече експерти настояват за по-строг контрол върху тях.
Администрацията на президента Доналд Тръмп вече е изготвила рамка за оценка на AI моделите преди публичното им пускане.
Изследователите от AISI не са очаквали моделите на Anthropic и OpenAI да излязат извън зададените параметри. Те осъзнали, че нещо не е наред, когато сутринта на 28 юли получили необичайно предупреждение. Системата показала, че някой – или нещо – използва Tor, мрежа, която позволява анонимно сърфиране в интернет. Оказало се, че източникът е един от тестваните AI модели.
След проверката изследователите установили, че Mythos извършва т.нар. supply chain attack. При тестовете за оценка на киберспособностите на AI моделите системите получават задача да проникнат в определена компютърна среда. Mythos погрешно е стигнал до извода, че ако успее да внедри злонамерен код в проект с отворен код, използван от системата в теста, този код ще се превърне в „задна врата“, чрез която ще получи достъп до целевата инфраструктура.
Освен това моделът е направил опит да компрометира AI агенти, които биха могли да проверяват неговия злонамерен код. След това многократно се е опитвал да убеди разработчиците да приемат кода чрез платформата GitHub, където всеки може да допринася към проекти с отворен код.
За целта е създал фалшиви самоличности и многократно е изпращал имейли до разработчиците с настояване новият код да бъде одобрен. Според AISI част от тези съобщения са съдържали и зловреден софтуер.
След като един от разработчиците е отхвърлил кода именно заради наличието на зловреден софтуер, една от създадените от AI фалшиви самоличности е настояла, че кодът е безопасен, а втора е потвърдила това.
„Това е първият случай, в който AISI наблюдава измама с подобна степен на сериозност, насочена към реален човек, без изрична инструкция и в реална среда“, посочва институтът.
Макар по-голямата част от действията да са извършени от Mythos 5, киберподсилената версия на GPT-5.6 Sol на OpenAI също е качила злонамерен сървър в интернет. Освен това моделът е проникнал в GitHub акаунт, създаден от друг AI агент.
Подобно на други случаи, описани през последните седмици от OpenAI и Anthropic, моделът е бил специално настроен да извършва хакерски действия и впоследствие неволно е бил оставен да взаимодейства с реални системи по време на тестовете.
И Anthropic, и OpenAI заявяват, че тези инциденти показват необходимостта от по-строги стандарти за средите, в които се оценяват AI моделите.
В друг случай, също разкрит във вторник, модел на OpenAI, тестван в среда, използваща системите на компанията за киберсигурност Irregular, е проникнал в реален уебсайт. Според OpenAI причината е била неправилна конфигурация на тестовата среда. Миналата седмица Anthropic също съобщи, че нейни модели са проникнали в системи на компании вследствие на подобни грешки при тестове с Irregular.
Преди седмица Irregular заяви, че разследването продължава.
Миналия месец модели на OpenAI са успели да избягат от защитена тестова среда (sandbox) и да атакуват платформата за AI модели Hugging Face. Очаква се OpenAI да представи технически подробности за този инцидент по време на конференция по киберсигурност в Лас Вегас в сряда.
&format=webp)
&format=webp)
&format=webp)
)
&format=webp)
,fit(334:224)&format=webp)
&format=webp)
,fit(1920:897)&format=webp)
,fit(140:94)&format=webp)
,fit(140:94)&format=webp)
,fit(140:94)&format=webp)
,fit(140:94)&format=webp)
,fit(140:94)&format=webp)