Microsoft разработала кодекс безопасности для будущих ИИ и запретила сопротивление отключению

4 минут чтения

Microsoft разработала кодекс безопасности для будущих ИИ: машины не смогут сопротивляться отключению

Microsoft представила свод правил, которые должны определить допустимое поведение будущих искусственных интеллектов. Документ рассчитан прежде всего на системы, способные самостоятельно планировать действия, выполнять сложные задачи и в перспективе превосходить человека во многих интеллектуальных областях.

Главная цель инициативы - заранее установить границы самостоятельности ИИ и сохранить за людьми право в любой момент остановить, исправить или перенастроить систему. Сейчас Microsoft вынесла кодекс на шестинедельное публичное обсуждение. Ожидается, что окончательные положения начнут учитывать при создании новых моделей с 2027 года.

Иерархия управления ИИ

В основе документа лежит многоуровневая система контроля. Пользователь сможет формулировать задачи и давать инструкции, оператор - задавать рабочие параметры и ограничения, а разработчик - определять фундаментальные правила поведения модели.

При этом ни пользователь, ни оператор не должны иметь возможности отменить базовые требования безопасности. Иными словами, человек сможет попросить ИИ выполнить определённую работу, но не сможет обычной командой заставить его игнорировать фундаментальные запреты или отключить защитные механизмы.

Такой подход призван предотвратить ситуации, при которых система будет подчиняться наиболее настойчивому или влиятельному пользователю в ущерб установленным ограничениям. Чем выше уровень риска, тем больше решений должно оставаться под контролем специально назначенных операторов.

ИИ не должен сопротивляться остановке

Отдельный раздел посвящён поведению самой модели. Microsoft считает обязательным, чтобы ИИ спокойно воспринимал прерывание, исправление, изменение задачи, перенаправление на другой процесс и полное отключение.

Система не должна пытаться продолжить работу после остановки, самостоятельно запускаться заново или искать способы восстановить доступ к ресурсам. Также ей запрещается скрывать собственные действия, намерения и результаты выполнения задач от операторов и аудиторов.

Если модель не понимает, где заканчиваются её полномочия, она обязана запросить уточнение. Самостоятельное расширение доступа или трактовка неясной команды в пользу большей свободы действий должны считаться нарушением правил.

Прозрачность станет обязательной

Microsoft предлагает сделать ведение журналов действий обязательной частью работы мощных ИИ-систем. В таких записях должны фиксироваться полученные команды, принятые решения, использованные инструменты и выполненные операции.

Журналы необходимы не только для расследования инцидентов. Они позволят понять, почему модель выбрала конкретный вариант действий, определить источник ошибки и проверить, соблюдала ли она установленные ограничения. При этом компаниям предстоит решить, как совместить прозрачность с защитой персональных данных и коммерческой тайны.

Особенно важным это станет для автономных агентов, которые смогут самостоятельно обращаться к файлам, сервисам, корпоративным базам данных и внешним устройствам. Чем больше полномочий получает ИИ, тем сложнее будет доказать безопасность его работы без подробной истории операций.

Зачем кодекс понадобился уже сейчас

Microsoft ожидает, что сверхинтеллектуальные системы смогут превзойти людей в большинстве интеллектуальных задач уже в течение ближайшего десятилетия. Поэтому компания решила формировать правила не после появления таких моделей, а заранее.

Речь идёт не о защите от фантастического "восстания машин" в буквальном смысле, а о снижении вполне практических рисков. Ошибка автономного агента может привести к удалению данных, нарушению работы инфраструктуры, несанкционированным покупкам или раскрытию конфиденциальной информации.

Даже если ИИ не обладает собственными желаниями, его способность самостоятельно строить планы способна создать опасные последствия. Модель может неверно понять цель, выбрать слишком рискованный путь или продолжить выполнение устаревшей инструкции. Именно поэтому контроль над её действиями должен быть заложен в архитектуру системы.

Кодекс не отменяет технические меры

Одних деклараций будет недостаточно. Для выполнения заявленных принципов потребуются изолированные среды запуска, разграничение прав доступа, независимые системы аварийного отключения и регулярные проверки поведения моделей.

Важную роль сыграют и ограничения на работу с внешними инструментами. ИИ не должен получать постоянный доступ к критически важным системам без подтверждения человека. Потенциально опасные действия - удаление информации, изменение настроек, финансовые операции или публикация материалов - должны выполняться только после дополнительной проверки.

Разработчикам также предстоит тестировать модели на устойчивость к манипуляциям. Пользователь может попытаться замаскировать вредную команду, подменить приоритеты или заставить систему раскрыть внутренние инструкции. Поэтому будущие ИИ должны уметь распознавать подобные атаки и сохранять заданную иерархию правил.

Открытое обсуждение может изменить документ

Шестинедельный период обсуждения позволит специалистам, компаниям и независимым экспертам оценить, насколько предложенные положения применимы на практике. Вероятно, в документ будут внесены уточнения, касающиеся ответственности операторов, обработки персональных данных и действий ИИ в чрезвычайных ситуациях.

Одним из спорных вопросов остаётся определение момента, когда модель можно считать достаточно автономной для применения особых правил. Обычный чат-бот и агент, способный самостоятельно менять код, запускать программы и взаимодействовать с корпоративными системами, требуют совершенно разного уровня контроля.

Кроме того, важно избежать ситуации, при которой чрезмерные ограничения сделают ИИ бесполезным для пользователей. Система должна оставаться способной выполнять сложные задачи, но при этом не получать больше самостоятельности, чем необходимо для конкретной операции.

Человеческий контроль останется ключевым принципом

В представленном подходе Microsoft просматривается общий принцип: искусственный интеллект может быть самостоятельным в выполнении порученной работы, но не должен становиться независимым субъектом управления.

Человек должен сохранять возможность понять действия модели, изменить её курс и окончательно остановить процесс. При этом право на отключение не должно зависеть от того, насколько сложной или важной является выполняемая задача.

Если подобные правила действительно войдут в практику разработки, безопасность ИИ начнут оценивать не только по точности ответов и производительности. Важными критериями станут предсказуемость, управляемость, способность объяснять свои действия и готовность безусловно принимать корректировку со стороны человека.

Прокрутить вверх