Сатья Наделла: почему ИИ-модели нужно считать инсайдерским риском
Глава Microsoft предлагает отделять возможности ИИ-модели от её полномочий, вести проверяемые журналы действий и заранее предусматривать остановку агента.
ИИ-агент может получить доступ к почте, документам, коду и рабочим инструментам компании. Когда он не только отвечает на вопросы, но и выполняет действия, безопасность зависит уже не от убедительности ответа, а от того, какие полномочия выданы системе и можно ли остановить её работу.
Эту проблему генеральный директор Microsoft Сатья Наделла предлагает рассматривать через понятие «инсайдерского риска». Речь не о том, что модель обладает злым умыслом. Это способ проектировать защиту вокруг любой системы, которой доверили доступ к важным данным и операциям: она может ошибиться, неверно понять задачу или оказаться скомпрометированной.
Почему ИИ-модель сравнивают с инсайдером
В обычной программе инженеры часто могут проследить путь от конкретного участка кода до результата. С современными моделями такой разбор намного сложнее: нельзя надёжно указать, какой именно пример из обучающих данных или какое сочетание параметров привело к определённому ответу. При этом модели становятся способнее и получают доступ к действиям, последствия которых выходят за пределы чата.
По мысли Наделлы, заверений разработчика модели недостаточно. Компания, которая подключает агента к своей инфраструктуре, сама отвечает за то, что тот может прочитать, изменить или отправить. Это продолжение давно известных практик информационной безопасности: проверять личность, выдавать только необходимые права, фиксировать действия и разделять критические операции.
Возможности модели и право действовать — разные вещи
Наделла предлагает отделить «поставку интеллекта» от полномочий. Модель может подготовить решение, но правила доступа и выполнения команд должны задаваться за её пределами — в программной среде, которая управляет агентом, и в системе, определяющей доступные ему действия.
Для программных агентов вроде Codex, Claude Code или DeepSeek Harness это означает, что риск зависит не только от модели. Важно, видит ли агент весь репозиторий или только выбранные файлы, может ли запускать команды и требуется ли отдельное подтверждение перед изменением данных или публикацией кода.
Например, агент может предложить исправление и подготовить его в отдельной ветке, а слияние и развёртывание в рабочей системе останутся за человеком или независимым процессом проверки. Здесь защита не требует, чтобы модель всегда правильно оценивала собственные границы: эти границы задаёт внешний механизм.
Какие меры контроля предлагает Наделла
Вместо доверия одной модели или её самоотчёту Наделла перечисляет принципы, которые позволяют наблюдать за системой и ограничивать её последствия.
- Разнообразие моделей. Не следует делать одну модель единственной точкой отказа или поручать ей без независимой проверки подтверждать собственную работу.
- Запись действий. Значимые операции должны оставлять защищённый от подмены, понятный человеку след. По нему должно быть возможно восстановить ход работы без просьбы к модели объяснить, что она сделала.
- Проверка сбоев. Нужно регулярно испытывать систему на ошибках, атаках, нестандартных вводных и изменениях окружения, а не только на штатных задачах.
- Независимые права и аудит. Организация должна сама определять доступы агента, а проверка его работы не должна зависеть только от той же модели или оркестратора.
- Остановка и локализация. У ответственного человека должна быть возможность приостановить задачу или отключить агента. Чем больше у системы полномочий, тем надёжнее должен быть этот аварийный механизм.
- Раскрытие инцидентов. Если агент ошибся или был скомпрометирован, пострадавшим важно своевременно сообщить, что произошло, какие барьеры не сработали и как снизить вероятность повторения.
Почему прозрачности рассуждений недостаточно
Наделла считает прозрачность цепочки рассуждений модели (CoT) обязательным направлением: сложность внутренней работы ИИ не должна становиться оправданием полной непрозрачности. Но сам доступ к объяснению модели он не считает достаточной гарантией. Текст рассуждения может не дать надёжного подтверждения того, что система действительно следовала ему или верно описала причины своего решения.
Поэтому полезны независимые свидетельства: какие данные агент получил, какие инструменты вызвал, какие изменения предложил, кто их одобрил и чем завершилась операция. Если несколько моделей проверяют друг друга, но все они работают внутри непрозрачной цепочки, появляется ещё один слой, который тоже нужно контролировать.
Доверие строится на ограничениях
Главный вывод Наделлы — не в том, что передовые модели следует считать злонамеренными. Он предлагает исходить из более строгого допущения: система с широким доступом способна ошибиться или быть скомпрометирована, поэтому пределы её полномочий должны работать независимо от её собственных решений.
Такой подход переносит разговор об ИИ-безопасности с обещаний поставщика на устройство конкретной системы: доступы, журналы, проверки, человеческие подтверждения и возможность остановки. Подготовиться к запуску помогает и список проверок безопасности перед выпуском проекта — особенно если в нём используются агенты и внешние ИИ-сервисы.
Источник: публикация Сатьи Наделлы в X (англ.).