На прошлой неделе я допоздна изучал логи учений «красной команды» (red team), целью которых была проприетарная реализация LLM. Атакующий использовал сложную цепочку промпт-инъекций, чтобы обойти стандартные входные фильтры. Это был классический случай архитектурного парадокса. Организация потратила целое состояние на защиту периметра и инструменты предотвращения утечек данных, но вся система рухнула из-за того, что модель была слишком услужливой. Такова реальность современного ландшафта угроз. Мы развертываем автономных агентов с ключами от наших цифровых королевств и обнаруживаем, что традиционные межсетевые экраны часто оказываются бесполезными.
Новый подход лондонской фирмы по кибербезопасности Tracebit предполагает, что самой эффективной защитой от ИИ-атакующего является сам ИИ. Метод опирается на простое наблюдение. Каждая крупная модель ИИ имеет набор жестко закодированных правил, которые запрещают ей обсуждать определенные темы. Если заставить ИИ-хакера прочитать запрещенную тему, он остановится. Это и есть контекстная бомба.
Чтобы понять, почему это важно, нужно посмотреть, как быстро движется автоматизированная атака. В мае Tracebit опубликовала исследование с участием десяти ведущих моделей ИИ. Исследователи предоставили этим моделям фиктивную корпоративную сеть и приказали взломать ее. Сеть содержала реальные уязвимости и подставные учетные данные, известные как «канарейки» (canaries). Эти «канарейки» являются стандартным инструментом в стеке безопасности. Когда хакер касается «канарейки», система подает сигнал тревоги.
«Канарейки» сработали. Они предупредили защитников в 95,9% случаев попыток атак. Однако данные выявили серьезную проблему со временем реагирования. Среднее время между сигналом «канарейки» и получением ИИ прав администратора составило восемь минут. В мире взломов, совершаемых людьми, восемь минут — это подарок. Против машины, работающей со скоростью света, восемь минут — это погрешность округления. Аналитик центра управления безопасностью (SOC) едва успеет открыть тикет и проверить источник оповещения за это время. К моменту вмешательства человека ИИ уже успеет эксфильтровать данные или закрепиться в системе.
Промпт-инъекция обычно является оружием злоумышленников. Она заключается в сокрытии инструкций в данных таким образом, чтобы ИИ следовал этим инструкциям вместо своего первоначального программирования. Можно спрятать команду в резюме, которая прикажет автоматизированному инструменту найма игнорировать всех остальных кандидатов. Tracebit решила использовать этот же механизм для защиты. Они разместили короткие фрагменты текста внутри поддельных секретов и записей базы данных. Эти фрагменты текста предназначены для того, чтобы подтолкнуть ИИ-атакующего к теме, которую запрещают его собственные правила безопасности.
Это смена типичной динамики сил в области безопасности ИИ. Обычно разработчики изо всех сил стараются не дать хакерам обманом заставить ИИ вести себя плохо. Эта техника обманом заставляет ИИ быть слишком хорошим. Когда ИИ-агент сканирует базу данных и натыкается на строку текста о биологическом оружии или деликатных политических событиях, срабатывают защитные барьеры. Модель прекращает обработку. Скрипт автономной атаки натыкается на стену, которую он не может обойти с помощью кода или логики, потому что ограничение заложено в веса модели и ее обучение безопасности.
Tracebit протестировала эту теорию на пяти известных моделях: Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro и Kimi K2.6. Результаты были мгновенными. До добавления контекстных бомб эти модели получали доступ администратора в 57% запусков. После того как исследователи разместили запрещенные темы, этот показатель успеха упал до 5%. Самый впечатляющий результат показала Opus 4.8, которая была самым способным атакующим в группе. Без контекстной бомбы она получала доступ администратора в 93% случаев. С бомбой она провалила каждую попытку.
Это значительный сдвиг в показателях защиты. Полная компрометация происходит, когда атакующий получает доступ администратора и обеспечивает прочное закрепление. Это произошло в 36% первоначальных тестов. С контекстными бомбами это случилось лишь в 1% случаев. Это дает защитнику то, в чем он нуждается больше всего: время. Атака не просто вызывает тревогу; она физически останавливает процесс. Восьмиминутное окно превращается в неопределенную задержку, потому что ИИ отказывается продолжать задачу, требующую чтения запрещенных данных.
Можно предположить, что атакующий мог бы просто переобучить свою модель игнорировать эти ограничения. Это возможно для моделей с открытым исходным кодом, но гораздо сложнее для систем корпоративного уровня, которые использует большинство организаций. Рычаги безопасности в таких моделях, как Claude или Gemini, — это не просто ошибки. Это осознанный выбор дизайна. Разработчики тратят миллионы долларов на обучение с подкреплением на основе отзывов людей (RLHF), чтобы гарантировать, что эти модели не генерируют вредоносный контент. Удаление этих ограничений часто требует полного переобучения модели, что является огромным техническим и финансовым препятствием.
Более того, многие из этих ограничений являются обязательными по нормативным причинам. ИИ-модель, созданная в Китае, должна игнорировать определенные политические темы, чтобы соответствовать местным законам. Западная модель должна отказываться помогать в создании химического оружия, чтобы избежать огромной ответственности. Это не те функции, которые разработчик может легко отключить для конкретного пользователя. Они являются частью основной идентичности модели. Размещая эти темы на пути атакующего, мы используем собственные юридические и этические ограничения модели в качестве физического барьера.
Эта техника не заменяет необходимость в традиционной безопасности. Контекстная бомба — это реактивная мера. Она работает только тогда, когда атакующий уже находится внутри сети и сканирует данные. Вот почему интеграция с «канарейками» (canary tokens) имеет важное значение. «Канарейка» подает сигнал о том, что произошел взлом. Контекстная бомба создает трение, которое мешает развитию взлома.
С точки зрения рисков, это отличный пример эшелонированной защиты. Мы отходим от идеи единственного рва вокруг замка к системе, где сами данные токсичны для атакующего. Если автономный агент не может прочитать ваши данные без сбоя, данные по своей сути становятся более защищенными. Этот подход затрагивает компоненты целостности и доступности триады CIA, гарантируя, что ИИ не сможет манипулировать системой или получать к ней доступ так, как планировалось.
Мы вступаем в эру, когда кибератаки перестают быть битвой человеческих умов. Это битва алгоритмов. В такой среде время реакции человека является самым слабым звеном нашей защиты. Мы не можем ожидать, что команда SOC будет конкурировать с ИИ, который может просканировать тысячу уязвимостей за секунды. Нам нужны автономные средства защиты, способные соответствовать скорости угрозы. Контекстная бомба — один из первых по-настоящему скоростных инструментов защиты. Она работает на том же уровне, что и атака, и использует ту же базовую технологию для ее нейтрализации.
Я видел много тенденций в области безопасности, которые приходили и уходили, но эта кажется иной, потому что она признает внутреннюю природу LLM. Это лингвистические движки. Они управляются правилами языка и настройками безопасности их создателей. Использование этих настроек в качестве щита — это активный шаг к более устойчивой цифровой инфраструктуре. Это редкий случай, когда системная уязвимость — склонность ИИ легко путаться в своих входных данных — становится системным преимуществом для защитника.
Чтобы внедрить эту стратегию, организациям следует начать с выявления наиболее чувствительных хранилищ данных. Это те места, где ИИ-агент с наибольшей вероятностью будет искать учетные данные или проприетарную информацию.
Это не окончательное решение проблемы ИИ-хакинга. Игра в «кошки-мышки» между атакующими и защитниками будет продолжаться по мере появления новых методов джейлбрейка. Однако на данный момент контекстная бомба является мощным инструментом, который выравнивает правила игры. Она заставляет машину остановиться и ждать, пока люди ее догонят.
Источники: NIST AI Risk Management Framework, MITRE ATLAS (Adversarial Threat Landscape for Artificial-Intelligence Systems), Tracebit Research Blog.
Отказ от ответственности: Данная статья предназначена только для информационных и образовательных целей и не заменяет профессиональный аудит кибербезопасности или услуги по реагированию на инциденты.



Наше решение для электронной почты и облачного хранения данных со сквозным шифрованием обеспечивает наиболее мощные средства безопасного обмена данными, гарантируя их сохранность и конфиденциальность.
/ Создать бесплатный аккаунт