Разработка / Инструмент

Pi Warden проверяет AI-агента перед опасным действием

Расширение следит за действиями Pi: замечает нарушения правил проекта, рискованные команды и заявления «готово» без проверки. Чаще подсказывает агенту исправление, чем прерывает работу.

Авторская схема Pi Warden: агент получает замечание, исправляет ошибку и продолжает работу
Схема и данные автора · Оригинал
По делу

Что это решает

pi-warden наблюдает за Pi Coding Agent. Перед изменениями и опасными командами он проверяет риски, после ответа «готово» — наличие подтверждающих проверок, а при нарушении правил обычно возвращает замечание самому агенту.

Результат для пользователя

Напоминать агенту о правилах и останавливать трудновосстановимые операции

Какие ошибки ловит расширение

Warden анализирует команды bash, записи и правки файлов, правила из Markdown-файла проекта, повторяющиеся неудачи и финальные заявления о завершении работы. Если агент говорит, что всё готово, но не запускал тесты или сборку, расширение может попросить проверить результат.

Часть очевидно опасных операций, например force push или рекурсивное удаление, распознаётся локальными шаблонами. Для контекстных случаев используется Jev или настроенный другой backend: важно, что не каждое срабатывание обязано быть платным API-вызовом.

Подсказка вместо постоянной остановки

В стандартном steer-режиме Warden объясняет проблему агенту, чтобы тот исправился сам. Для трудновосстановимых действий есть hold до выполнения; отдельные режимы позволяют спрашивать пользователя или только советовать. При недоступности backend расширение показывает, что контекстные проверки отключены, а не притворяется защищающим сессию.

Проект публикует журнал решений и сведения о том, что было показано агенту. Это делает ложные срабатывания разбираемыми.

Что можно и нельзя заключать из отчётов автора

В README приведены полевые данные владельца проекта и локальные evals: часть замечаний действительно приводила к запуску тестов. Однако эти цифры собраны на его сессиях и правилах; они не гарантируют такую же эффективность для других команд, стеков или формулировок политики.

Как попробовать самому

  1. 01Установить пакет в Pi по README и запустить офлайн-режим без ключа, чтобы увидеть локальные правила.
  2. 02Добавить pi-warden.md с одной-двумя проверяемыми нормами проекта, включить контекстные оценки и выполнить /warden test.
  3. 03Перед доверием блокировкам изучить trace на собственной тестовой сессии и проверить ложные срабатывания.
Инструкция и код автора

Ограничение этого проекта

Guardrail не заменяет ревью и резервные копии. Контекстные оценки выключены без ключа или при ошибке backend; настройки доступа и приватности нужно проверять отдельно.