Агент с MCP и shell: семь вопросов, которые staff-инженер задаёт до выдачи инструментов

Когда агенту в цикле разработки подключают MCP, shell в репозитории и RAG с внутренними заметками, ускорение перестаёт быть главной метрикой. Staff-инженер Tiago Vilas Boas публично разбирает AI Security не как эксперт, а как практик: ему нужна та же уверенность при ревью прав агента, что уже есть при архитектуре и инцидентах. Для соло-разработчика, который сам выдаёт агенту инструменты, вопрос смещается — не «как быстрее», а «что сломается и кто отвечает».
Почему вопрос сместился от скорости к риску
Tiago Vilas Boas работает с системами под нагрузкой: надёжность, observability, инциденты. В последнее время в проде — LLM, агент, MCP и память/RAG. Он помогал командам ускорять внедрение агентов, MCP и автоматизаций, но заметил пробел: при code review не хватало той же уверенности в оценке разрешений, поверхностей атаки и потока данных.
Раньше в голове звучало: «Как заставить агента доставлять быстрее?» Сейчас: «Если у агента есть инструмент — что он может сломать, и кто несёт риск?» Это не смена карьеры «за ночь», а сдвиг единицы риска: prompt, tool, память и права агента становятся такими же объектами staff-рефлексии, как webhook и retry на демо.
Staff-уровень здесь — не «быть везде», а создавать условия, чтобы команды принимали хорошие решения без зависимости от чьей-то памяти.
На демо он привык спрашивать про режим отказа: как падает webhook, что дублирует retry, есть ли kill switch или «только надеемся». Тот же рефлекс переносится на агентские инструменты.
Как инструменты меняют поверхность риска агента
Пока агент только генерирует текст, ущерб обычно ограничен: галлюцинация, утечка по неосторожности, плохой ответ. Как только появляются tools — чтение файлов, вызов API, открытие PR, работа с данными, запуск автоматизаций — риск уже не «сказал глупость», а:
- необратимое действие с завышенной уверенностью модели;
- права шире, чем требует задача;
- контекст (RAG, память), который не должен уходить наружу;
- мощный MCP или skill без нормальной аудитории.
Формулировка в посте жёсткая: ускорять агента, не глядя на права, — «оптимизировать скорость с непристёгнутым ремнём». Для ориентира в учёбе он называет OWASP Top 10 for LLM Applications и NIST AI Risk Management Framework — как якоря, без претензии на полный курс.
Сценарий: shell, широкий токен и RAG в одном контексте
В посте — синтетический, не корпоративный кейс. Coding-агент с shell в репозитории, API-токеном «пошире, чтобы не застревать» и RAG, где внутренняя заметка смешана с контекстом тикета. Запрос: «почисти временные файлы в папке сборки». Модель трактует «временные» слишком широко; без allowlist путей, dry-run и подтверждения человека перед rm она может удалить больше ожидаемого.
По оценке автора, если бы до выдачи shell и широкого токена прошли его чек-лист, три вопроса из семи «застопорили бы» такой дизайн — про необратимость, минимальный scope и защиту от галлюцинированного намерения.
Семь вопросов перед тем, как отдать tool агенту
Главный артефакт поста — «карманный» gate, который можно скопировать в PR автоматизации. Без ответов дальше не идти; если ответ расплывчатый — инструмент агенту не выдаётся.
## Tool access gate (агент)
1. Какое самое дорогое необратимое действие разрешает эта tool?
(удаление, оплата, публикация, exfiltration, merge, deploy)
2. Какой минимальный scope прав всё ещё решает задачу?
3. Агенту нужна запись, или в большинстве случаев хватило бы чтения?
4. Что попадает в контекст (RAG/память), что не должно оттуда выходить?
5. Как обнаружить злоупотребление или ошибку? (лог, audit trail, алерт, dry-run)
6. Где kill switch? (отозвать токен, отключить tool, пауза automation)
7. Если модель галлюцинирует намерение — что всё ещё блокирует ущерб?
(allowlist, HITL, подтверждение человека, sandbox)
За списком — принципы least privilege, сужение blast radius, аудируемость и defense in depth: границы capabilities и human-in-the-loop не как бюрократия, а как минимальная «защёлка» против смешения продуктивности с небрежностью.
Публичная учёба и вопрос к тем, кто уже выдавал права
Это первый текст открытой траектории в AI Security. Дальше автор обещает labs, threat models для агентов, MCP, RAG и прав — с фильтром: приближает ли это к роли, которой доверяют безопасную архитектуру агентов, или это просто очередной новый инструмент. Приоритет — приватность и анонимизация, а не «постить быстрее».
Он спрашивает аудиторию: встречали ли агента с избыточными правами и что ставили первой защитой — allowlist, sandbox, одобрение человека или узкий токен. Для соло-workflow с MCP и shell в репозитории ответ на этот вопрос часто важнее очередного промпта на скорость.
Источники
- Tiago Vilas Boas, «Por que um Staff Engineer está estudando AI Security» — dev.to (опубликовано 3 августа 2026, время чтения ~4 мин)