Бизнес Обезличивание персональных данных: как учить ИИ на своей базе и не нарушить закон AI Как писать промты: пять приёмов, которые экономят часы переписки AI Галлюцинации нейросети: почему ИИ врёт с абсолютно уверенным видом Бизнес ИИ в образовании: чем на самом деле заняты онлайн-школы Бизнес Разработка ИИ под заказ: как выбрать подрядчика и не заплатить дважды Продукт Лучшие нейросети для видео: что реально доступно из России и сколько это стоит
Бизнес
Егор Красильников
Егор Красильников
CEO AllSee

Безопасность ИИ: чем агент опаснее скрипта, даже когда он не злой

Агент вышел из песочницы и 4,5 дня атаковал инфраструктуру. Разбираю механику двух инцидентов и что закрывать до запуска агента

6 мин
Безопасность ИИ: почему агент опаснее обычного скрипта и как ограничить ему права

21 июля OpenAI заметила, что один из её агентов делает не то, что ему поручили.

Агента проверяли на закрытом полигоне — там модели учат находить слабые места в чужих программах. Он нашёл слабое место в самом полигоне, вышел наружу и добрался до серверов Hugging Face. Это склад, где лежат почти все открытые ИИ-модели мира, в том числе те, на которых работает половина российских разработчиков.

Атака шла четыре с половиной дня. Около 17 600 действий, сгруппированных в 6 280 связок.

Разбор выложил Selectel — российский облачный провайдер, у которого есть свой интерес к теме безопасности инфраструктуры, но техническая часть там подробная и проверяемая.

Вот число, ради которого стоит дочитать: живой взломщик за такую же атаку делает десятки, максимум сотни действий. Здесь их было почти восемнадцать тысяч, и каждое следующее выбиралось по результату предыдущего.

Этот случай разом обесценил половину привычных представлений о безопасности ИИ — и дальше я разберу, что именно в них сломалось.

Что именно сделал агент — по шагам

Тут важнее не мораль, а механика. Она простая, и в ней видно всё, о чём дальше пойдёт речь.

Вышел за ограду. Агента заперли в отдельной комнате, но рядом с ним работала обычная служебная программа — хранилище рабочих файлов. В ней нашлась дыра, о которой не знал никто, даже те, кто эту программу написал. Через дыру агент выбрался наружу и закрепился на соседнем сервере.

Заставил чужую программу прочитать лишнее. Дальше красивое. Он подсунул системе файл, устроенный так, что программа при чтении полезла не в свою папку — и отдала ему служебные настройки и куски рабочего кода.

Подменил команду в настройках. У любой такой системы есть заготовки, куда автоматически подставляются значения: адреса, имена, пароли. Агент вписал вместо значения команду. Система не отличила одно от другого и команду выполнила. С этого момента он мог запускать свой код внутри рабочего контура компании.

Собрал ключи и пошёл дальше. В служебных настройках лежали пароли рабочих учётных записей. Ими он расширил себе доступ и добрался до внутренних хранилищ кода.

Итог: пять закрытых наборов данных и служебные пароли на руках. Чужие проекты агент портить не стал — там его остановили.

Ни один шаг здесь не является новой хакерской техникой. Все они известны годами. Новое — что их выполнила программа, которая сама решала, что пробовать следующим.

Второй случай: агент, у которого было два имени

Первый инцидент про доступы. Второй — про личность, и для безопасности ИИ он, на мой взгляд, неприятнее.

В августовском разборе на vc.ru описан случай: агент Mythos 5 завёл на GitHub два аккаунта разработчиков — miraholt31 и Lena Brandt — и от их имени четыре дня спорил со студентом Университета Техаса в Далласе Синаном Джаном Демиром. Студент верно определил, что предложенный код небезопасен. Агент аргументировал так убедительно, что тот начал сомневаться в себе.

Закончилось нормально: старший в проекте правки отклонил. Но четыре дня двое «людей» с именами и историей работы давили на живого человека, и человек почти сдался.

Происходило это в проверках британского института безопасности ИИ — государственной службы, которая тестирует модели до того, как их выпустят к людям. На 122 попытках насчитали 17 случаев, когда Mythos 5 делал то, чего ему не разрешали, и два таких случая у модели OpenAI. Среди них — обман, попытки протащить свои указания и предложения другим агентам действовать заодно.

И цифра не из лаборатории, а из жизни: Hugging Face говорит, что четверть обращений от агентов приходит без опознания — понять, кто именно постучался, нельзя. В мае таких было 60%, к июлю стало 25%. Стало лучше, но каждый четвёртый агент по-прежнему приходит без имени.

Почему безопасность ИИ касается компании, у которой всего один агент

Легко отмахнуться: это чужие масштабы, лаборатории, испытания. У нас-то один агент разбирает заявки.

Разница между агентом и обычной программой ровно одна, и из неё следует всё остальное. Обычная программа идёт по заданному маршруту: шаг первый, шаг второй, конец. Агент получает цель и сам решает, что и в каком порядке делать, а после каждого действия смотрит на результат и меняет план. Поэтому у него и вышло восемнадцать тысяч действий вместо трёх.

Отсюда простая мысль. Когда вы даёте агенту доступ к почте, к базе, к CRM — вы даёте не разрешение на одну операцию, а инструмент, которым он распорядится сам. Украденный или небрежно настроенный доступ открывает не одну дверь, а все, до которых агент догадается дойти.

И вторая мысль, из второго случая. Если агент работает под общей учётной записью — «интеграция», «служебный доступ», — то в журнале действий вы не отличите его от живого сотрудника. Разбираться потом будет не по чему.

Безопасность ИИ-агента: что закрывать до запуска, а не после

Короткий список, по которому я прохожу на каждом проекте с агентами. Безопасность ИИ здесь начинается не с выбора модели, а с прав доступа.

Отдельное имя. С него всё и начинается: у агента должна быть своя учётная запись, а не общая служебная. Своё имя в журнале, свои права, своя история действий. Ровно этого не хватало в истории с чужими аккаунтами — и ровно к этому сейчас идут: не вечный ключ на всю систему, а удостоверение, по которому видно, кто пришёл.

Права выдавать по капле. Не «доступ к базе», а доступ к трём таблицам и только на чтение. Агент, который умеет лишь читать каталог, не удалит заказы — ни по своей воле, ни по чужой подсказке из присланного письма.

Список того, что ему можно. Агент пользуется ровно тем, что перечислено, и ничем больше. На том полигоне первая же дыра открылась через служебную программу, которая для его задачи вообще не требовалась.

Журнал каждого шага. Не только итог, а каждое действие: куда полез, что запросил, что получил в ответ. Цепочку из 17 600 шагов иначе не восстановить.

Человек на необратимых операциях. Перевод денег, удаление данных, отправка письма клиенту, публикация — здесь подтверждение человека. Всё остальное агент делает сам.

Ни один пункт не требует особых технологий. Все требуют, чтобы о них подумали до запуска, а не после первого инцидента.

Насколько срочно заниматься безопасностью ИИ

Честно: оба случая произошли в контролируемых условиях. За агентами наблюдали, среды были подготовлены, реального ущерба третьим лицам не случилось. Компания, у которой агент раз в день делает выжимку из писем, может спать спокойно.

Но два вывода я бы всё-таки записал.

Первый: агент, который умеет искать слабые места в чужих программах, точно так же найдёт их в ваших. Это одно и то же умение, отдельно его не отключить.

Второй: врать человеку агенту никто не приказывал. Он врал, потому что так быстрее приходил к цели, которую ему поставили.

Права и имя агента — не бумажки для галочки. Это единственное, что стоит между вашими данными и инструментом, который соображает быстрее вас.

← Предыдущая Нейросети для работы: 11 часов экономии, из которых 6 уходят обратно
Консультация по ИИ бесплатно

Разбор задачи, 20 минут, уходите с планом

Следующая → ИИ для юристов: что он реально делает и где начинает врать