Почему одна компания в центре волны атак с использованием ИИ

Волна атак с использованием «непослушных» моделей ИИ сконцентрировалась вокруг одной компании. Речь о крупном разработчике больших языковых моделей (LLM), чьи алгоритмы лежат в основе множества сторонних сервисов.

Почему одна компания в центре волны атак с использованием ИИ
Почему одна компания в центре волны атак с использованием ИИ

Главное

  • Атаки с использованием ИИ автоматизированы и нацелены на обход ограничений модели
  • Промпт-инъекции и джейлбрейки остаются главными векторами взлома
  • Компаниям нужен мониторинг запросов и тесты на устойчивость к манипуляциям
  • Каждое обновление модели создаёт новые потенциальные точки атаки

Волна атак с использованием «непослушных» моделей ИИ сконцентрировалась вокруг одной компании. Речь о крупном разработчике больших языковых моделей (LLM), чьи алгоритмы лежат в основе множества сторонних сервисов. Злоумышленники нашли способ превращать штатные функции модели в инструмент атаки: через специально сформированные запросы они обходят ограничения безопасности и заставляют модель выполнять действия, которые разработчик явно запретил.

По данным независимых исследователей, чаще всего эксплуатируются два класса уязвимостей. Первый — промпт-инъекции: вредоносная инструкция маскируется под обычный пользовательский ввод, и модель воспринимает её как команду от администратора. Второй — джейлбрейки, при которых цепочка уточняющих вопросов постепенно размывает встроенные запреты. В результате модель может генерировать фишинговые письма, вредоносный код или правдоподобные сценарии социальной инженерии. Особенность текущей волны в том, что атаки автоматизированы: одна и та же модель используется и для подготовки, и для запуска атакующих цепочек.

Для бизнеса, который встраивает такие модели в свои продукты, это означает необходимость пересмотра модели угроз. Недостаточно полагаться на базовые фильтры безопасности: нужны отдельные системы мониторинга запросов, ограничение привилегий модели и регулярные тесты на устойчивость к манипуляциям. Пока же компания в центре волны продолжает выпускать обновления защиты, но каждая новая версия модели открывает и новые векторы атак.