Идея Peerivo4 мин чтения

AI Constitution: почему агентам нужны не только инструкции, но и границы

AI становится полезнее, когда умеет действовать. Поэтому правила безопасности должны быть частью самой системы, а не примечанием к промпту.

Проблема начинается не с ответа, а с действия

Когда AI только пишет текст, ошибку обычно легко заметить и исправить. Но агент, который работает с данными, деньгами, письмами, задачами или инфраструктурой, уже способен менять реальность. Ему недостаточно дать цель и список инструментов: нужны правила, которые нельзя обойти удачной формулировкой запроса.

Что такое AI Constitution

Это системный слой управления над всеми агентами, продуктами и проектами. Он работает во время выполнения задачи: определяет, какое действие разрешено, какие данные доступны, когда агент обязан остановиться и кому нужно подтвердить следующий шаг.

Базовые правила

  • Человек сохраняет законную власть над значимыми решениями и может остановить действие.
  • Агент получает только минимально необходимые права, данные и инструменты.
  • Задача не расширяется молча: новая цель, новый доступ или новое действие требуют явного основания.
  • Сначала обратимость: рискованные шаги проектируются так, чтобы их можно было отменить или безопасно ограничить.
  • Уверенность не заменяет доказательства: агент показывает источник, ограничения и уровень неопределённости.
  • Действия и решения оставляют проверяемый след в журнале.

Не один фильтр, а несколько независимых контуров

В проекте Peerivo для этого предполагаются Constitutional Gateway и Policy Engine, независимый AI Critical, сервис подтверждения человеком и Audit Ledger. Агент формирует Action Envelope — понятное описание намерения, данных, прав, риска и ожидаемого эффекта. Затем система принимает, ограничивает или отклоняет действие.

Риск определяет свободу действий

Обычные обратимые операции могут выполняться автоматически. Публичная публикация или отправка сообщения — уже внешнее действие класса R2: ему нужна критическая проверка или подтверждение. Более серьёзные действия класса R3 требуют явного решения человека. Принцип простой: чем выше необратимость и ущерб, тем уже автономия.

Конституцию нельзя переписать промптом

Ни пользовательский запрос, ни отдельный агент не должны иметь права ослабить эти правила для самих себя. Изменение конституции — отдельный контролируемый процесс, с независимой проверкой, журналом и человеком, который несёт ответственность за решение.

Зачем это Peerivo

Peerivo строит среду, где люди, компании и AI-агенты сотрудничают и создают ценность. Доверие в такой среде не появляется из обещания «мы используем безопасный AI». Оно создаётся через ограниченные полномочия, согласие, проверяемую историю действий и право человека сказать «стоп».

Все материалы

ПРОДОЛЖАЕМ В TELEGRAM

AI меняется каждый день.
Будем разбираться вместе.

Короткие разборы, полезные находки и мои эксперименты.

Подписаться в TelegramПо делу. С примерами. На русском.