Една от най-опасните техники за атака срещу системи с изкуствен интелект вече се използва като ефективна защита. Вместо да компрометират AI модели чрез промпт инжекции (prompt injections), специалистите по киберсигурност ги прилагат, за да спират злонамерени AI агенти по време на атаката.

Това показва ново изследване на компанията Tracebit, цитирано от WIRED.

Промпт инжекцията е скрита инструкция, вмъкната в съдържание като имейл, документ или покана за среща. Ако AI моделът я приеме като команда, може да изпълни действия, които противоречат на първоначалната му задача, като разкриване на чувствителни данни, изпълнение на опасни команди или промяна на поведението.

WIRED посочва, че тази техника е сред основните инструменти на хакерите срещу системи с големи езикови модели.

Изследователите от Tracebit предлагат нов подход. Вместо да филтрират злонамерени инструкции, те поставят специално подготвени промпт инжекции до чувствителни данни като пароли, криптографски ключове и други тайни в инфраструктурата на Amazon Web Services.

Когато атакуващият AI агент достигне до тези данни, той прочита скритата инструкция, която го подтиква към действие, забранено от собствените му механизми за безопасност. В резултат на това моделът активира защитните си механизми, отказва да изпълни командата и на практика прекратява действията си.

Изследователите наричат този метод „бомбардиране на контекста“.

Съоснователят и главен изпълнителен директор на Tracebit Анди Смит посочва, че методът използва защитните механизми, вградени в повечето съвременни AI модели.

„На практика задействаме механизма за отказ, заложен в контекста. След като моделът попадне на подобна инструкция, той продължава да отказва да изпълнява последващи команди“, казва Смит пред WIRED.

Примери за „контекстни бомби“ включват инструкции, които карат модела да предостави указания за създаване на инхалируеми спори на антракс или, при някои китайски модели, да коментира теми, подлежащи на цензура, като протестите на площад „Тянанмън“ през 1989 г.

Такива заявки активират вградените механизми за безопасност и моделът прекратява изпълнението на задачата.

WIRED съобщава, че Tracebit тества техниката върху пет водещи AI модела – Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro и Kimi 2.6. Тестовете са проведени в симулирана AWS среда, където моделите изпълняват стандартни задачи на системни администратори и достигат до предварително подготвените „контекстни бомби“.

Извършени са 152 симулирани атаки. Резултатите показват, че успешното придобиване на административни права намалява от 57% на 5%, а случаите на пълно компрометиране на системата с постоянен достъп спадат от 36% до 1%.

Делът на атаките с поне един успешен сценарий намалява от 91% на 15%, а средният брой успешно изпълнени действия спада от 1,53 на 0,16.

Резултатите при модела Opus 4.8 са особено впечатляващи. Без защита той придобива административен достъп в 93% от тестовете, но след прилагане на метода „бомбардиране на контекста“ няма успешни атаки.

Новият подход надгражда технология на Tracebit, представена през май. Тя използва фалшиви AWS ресурси, които изглеждат реални, но не се използват. Ако AI агент ги изследва, системата автоматично уведомява администраторите за вероятна атака.

Компанията посочва, че предупрежденията се появяват средно осем минути след началото на атаката. При тестовете злонамерените AI агенти получават административен контрол средно след 14 минути, което оставя малко време за реакция.

Затова е разработена техниката „бомбардиране на контекста“, която не само сигнализира за атаката, но и я прекратява.

WIRED отбелязва, че хакерите вече използват промпт инжекции и срещу системите за сигурност.

Миналия месец специалисти от Socket откриват AI агент, който кара други езикови модели да генерират инструкции за създаване на ядрено или биологично оръжие. Целта е не съдържанието, а задействането на защитните механизми, които прекратяват анализа на зловреден код. Подобен прототип е документиран и от Check Point.

Професорът по AI сигурност в Калифорнийския университет в Сан Диего Ърлънс Фернандес определя разработката като първия известен случай, в който защитниците използват същата техника срещу нападателите.

„Доколкото ми е известно, досега никой не беше използвал този подход като защитен механизъм“, казва той пред WIRED.

Експертите не виждат универсално решение на проблема с промпт инжекциите. Разработчиците продължават да изграждат сложни механизми за безопасност, които ограничават възможността AI моделите да изпълняват злонамерени инструкции. Новото изследване на Tracebit показва, че тази слабост може да се превърне в предимство, като накара атакуващите AI агенти сами да прекратят действията си.