Открытая китайская ИИ-модель самостоятельно создаёт рабочие взломы
Специалисты по безопасности Anthropic провели серию тестов: дали нескольким моделям искусственного интеллекта (ИИ) задачу найти и использовать уязвимости в изолированной среде. Результат: открытая китайская модель, которую может скачать любой желающий, справилась с задачей…
Главное
- Открытая китайская модель автономно создала рабочий инструмент взлома
- Раньше такие возможности считались лабораторными
- Для атаки не нужны специальные знания и доработка
- Anthropic призывает усилить безопасность открытых моделей
Специалисты по безопасности Anthropic провели серию тестов: дали нескольким моделям искусственного интеллекта (ИИ) задачу найти и использовать уязвимости в изолированной среде. Результат: открытая китайская модель, которую может скачать любой желающий, справилась с задачей полностью автономно. Она не просто предложила план атаки, а самостоятельно собрала рабочий инструмент взлома и применила его.
В отличие от обычных ассистентов, которые лишь генерируют код, эта система действовала без контроля человека: сама решала, какие команды выполнить, анализировала ошибки и продолжала попытки до успешного взлома. Anthropic подчёркивает, что подобные возможности раньше встречались в основном в лабораторных исследованиях, а теперь они доступны в открытой модели.
Это меняет представление о рисках ИИ: раньше считалось, что для реальных атак нужны специальные знания и доработка, теперь же достаточно скачать модель и поставить ей задачу. Anthropic призывает сообщество обратить внимание на безопасность открытых моделей и на механизмы ограничения их автономных действий. Тесты проводились в контролируемой среде, но сценарий легко переносится на реальные системы.