热榜上的 Agent Skills:工程门禁与代码结构图
人工智能约 5 分钟阅读

热榜上的 Agent Skills:工程门禁与代码结构图

从 addyosmani/agent-skills 与 code-review-graph 出发,讨论如何把资深工程流程写成可安装 Skill,并用结构图砍掉全库读 token。

cover

今天 GitHub Trending 又被 agent 基建刷屏了,但方向和昨天不一样。昨天大家聊记忆存储(TencentDB-Agent-Memory 一类);今天更扎眼的是两样:把资深工程判断写成可安装 Skill,以及 用代码结构图砍掉无脑读全库的 token。

代表性仓库:

模型会写代码,不会当 tech lead

Addy Osmani 在博文里说得很直:模型能生成实现,但不会自动带上资深工程师的脚手架——规格先于代码、小步提交、测试当证明、合并前做健康度审查。agent-skills 做的就是把这些流程打成 slash command 和自动触发的 Skill。

一组常见命令大致是:

阶段 命令 关键点
定义 /spec 先规格后代码
规划 /plan 拆成可独立完成的小任务
实现 /build 一次只切一片
验证 /test 测试是证明,不是装饰
审查 /review 合并前改善代码健康度
上线 /ship 小步、可回滚

安装路径也统一了,走 open skills CLI:

bash
npx skills add addyosmani/agent-skills
# 或只装某一个
npx skills add addyosmani/agent-skills --skill test-driven-development

Claude Code、Cursor、Codex、Copilot 都能接。重点不在“又一个 prompt 合集”,而在 把 SDLC 门禁写成 agent 默认会走的路径。你不装这些,agent 仍会写代码;装了之后,它更难跳过 red-green-refactor 或 review checklist。

我实际用下来的感受:Skill 质量参差,真正有用的是带 反合理化表(anti-rationalization) 和 强制验证步骤 的那一类。只写“请写出优雅代码”的 Skill,不如没有。

另一半问题:上下文在烧钱

Code review 时,工具动不动把半个仓库塞进上下文。code-review-graph 的卖点很具体:用 Tree-sitter 建结构图,增量跟踪变更,再通过 MCP 把“该读的符号/调用链”交给 agent。

官方示意图里有一组对比(以 Flask 语料为例):整库阅读约 14 万 token,图查询答案约 2 千 token,号称可到数十倍差距。具体倍数因仓库而异,方向是对的——结构化索引比全文糊上下文便宜且稳。

上手很短:

bash
pip install code-review-graph
code-review-graph install   # 自动检测 Cursor / Claude Code / Codex 等并写 MCP 配置
code-review-graph build     # 解析当前仓库

install 会改各工具的 MCP 配置并注入 graph-aware 规则。卸装也有对称命令,只动自己写入的部分。对已经在跑多 agent 的团队,这比再买一个“更大窗口”的模型更划算。

怎么组合,而不是全装

热榜上 Skill 仓库很多,全装只会让 agent 行为互相打架。我建议的最小集:

  1. 一条主流程 Skill(Osmani 或 Matt Pocock 选一套,不要两套并行当默认)
  2. 一个上下文层(code-review-graph 或你们自建的 repo map / 符号索引)
  3. 仓库自己的 AGENTS.md:写清测试命令、目录边界、禁止提交的路径

Next.js 16.3 也在推版本对齐的本地文档 + AGENTS.md。趋势很清楚:agent 的“系统提示”正在从聊天框搬进 仓库内可版本管理的文件。

落地时我习惯按“一周试点”而不是“全员强制”:

  1. 挑一个中等活跃、有测试的服务仓库。
  2. 只开 review + test 相关 Skill,先别上全自动 /build auto。
  3. 打开 code-review-graph,对比同一次 PR 的 token 消耗和漏看文件数。
  4. 把失败案例(错误建议、跳过测试、误改生成代码)记进 AGENTS.md 的禁止项。

这样一周后你手里有数据,而不是只有 star 数。Skill 和图谱都是杠杆,杠杆方向反了会放大事故。

风险别装看不见

  • Skill 会扩大 agent 权限面。审查它调用的 shell、网络和文件范围。
  • 图索引会过期。没进 CI 的 build/增量更新,review 仍会漏边。
  • star 数不等于生产可用。先在一个中等仓库试一周,看误报和漏改,再推广。

小结

2026 年中的 agent 工程,竞争点不太像“谁的模型更会写函数”,更像 谁能把流程门禁和代码地图装进日常工具链。Osmani 的 skills 解决“怎么干活”;code-review-graph 解决“该看哪”。两者都在 Trending 上,不是巧合。

如果你团队已经让 agent 提 PR,却还在靠超长 system prompt 管行为,可以先把 prompt 拆成可安装 Skill,再给仓库加一层结构图。token 账单和 review 质量,通常比再换一个前沿模型见效更快。

图:代码结构图把全库阅读收成局部邻域查询

inline

相关文章