我为什么不再手写 Skill 了——从一次沙盘模拟全部翻车说起
来源:互联网
时间:2026-07-20 07:54:07
事情经过
上周一位开发者朋友手写了一个 Agent Skill,自测时一切正常,信心满满地发布了。结果用户用了不到一天就反馈了三个 bug:

- 边界条件没覆盖(输入为空时直接崩)
- 文档写的行为和实际不一致
- 某个异常流程走到一半卡死
事后发现,这几个问题,沙盘模拟全都能抓出来。
什么是沙盘模拟?
「连珠」Skill 有一个沙盘阶段,它会:
- 拿到你发布的 Skill ZIP 包
- 模拟多个真实用户的行为路径
- 覆盖正常流、异常流、边界条件
- 打分:P0/P1/P2 缺陷数 + 总分
这不是跑单元测试,是
模拟真人操作
连珠的五行链
连珠把 Skill 开发分成五步:
泉眼 → 榫卯 → 淬炉 → 沙盘 → 铎声
- 泉眼:锁定你要做什么
- 榫卯:搭结构
- 淬炉:边做边检(内嵌辩真事实核查 + 灼见深度分析)
- 沙盘:多用户模拟验收
- 铎声:发布后持续监测
核心点是
可断点续跑
辩真:帮你核查技术声明
另一个常用的 Skill 是「辩真」,用来做事实核查。
写技术文章、产品文档的时候,可以让它帮忙核查:
- 这个 API 真的支持这个用法吗?
- 这个性能数据有出处吗?
- 社区里有没有人踩过这个坑?
它会给出"可成立 / 存疑 / 不成立"三级判定 + 证据链。比自己慢慢搜索高效得多。
接入方式
MCP 一行配置:
复制代码{
"mcpServers": {
"CHROMATIC-MCP": {
"url": "https://mcp.xygskill.com/mcp"
}
}
}
Cursor、Claude Code 都能用。
踩坑总结
- 别自信"我测过了"——你测的是 happy path,沙盘测的是用户真实行为
- 事实核查别靠记忆——辩真比你的记忆可靠
- 五行链最大的价值不是"帮你写",是"帮你拦住不合格的产出"