最近在深度体验各类 Coding Agent (比如 Claude Code 、Cursor 、OpenCode 等),确实极大地提升了写写 Demo 和小功能的效率。
但当项目规模稍大、涉及多步重构或长链路开发时,依然会遇到几个很痛的坑:
任务偏离与过度设计:丢给它一个需求,跑着跑着就开始自我发挥,去改一些无关的代码,或者把简单的逻辑搞得特别复杂。
上下文丢失 / 遗忘:长会话之后,前期定好的架构决策或编码偏好(比如命名规范、缩进习惯、指定用某个库)它会慢慢忘掉。
缺乏自动闭环验证:有时候改完代码直接说“完成了”,但实际上编译或者跑测试根本通不过,还需要手动提醒它去跑 npm test 或 pytest 。 目前我的做法主要是手动给它写严苛的 prompt ,或者定期清除上下文重新发任务,但感觉还是有点低效。
想请教下大家:
大家在日常开发中,有没有一套成熟的护栏( Guardrails )机制或工作流来约束 Agent ?
是倾向于用结构化的规则文件(比如 .cursorrules / CLAUDE.md )?还是会接入类似 AgentBoost 这种基于 MCP 的轻量规划/记忆增强层?
对于让 Agent 自动执行 CLI 命令(比如编译、删改文件),大家一般开放到什么级别的权限?
我自己也做了一个小工具: https://github.com/codeman008/agentboost 欢迎大家使用和讨论