
今天 GitHub Trending 又被 agent 基建刷屏了,但方向和昨天不一样。昨天大家聊记忆存储(TencentDB-Agent-Memory 一类);今天更扎眼的是两样:把资深工程判断写成可安装 Skill,以及 用代码结构图砍掉无脑读全库的 token。
代表性仓库:
- addyosmani/agent-skills(8 万+ star):生产级工程 Skill 包,覆盖 spec → plan → build → test → review → ship
- tirth8205/code-review-graph(约 2.9 万 star):Tree-sitter 建本地代码图,经 MCP 只喂相关上下文
- 同榜还有 mattpocock/skills、obra/superpowers 等,说明“Skill 市场”已经过了玩具阶段
模型会写代码,不会当 tech lead
Addy Osmani 在博文里说得很直:模型能生成实现,但不会自动带上资深工程师的脚手架——规格先于代码、小步提交、测试当证明、合并前做健康度审查。agent-skills 做的就是把这些流程打成 slash command 和自动触发的 Skill。
一组常见命令大致是:
| 阶段 | 命令 | 关键点 |
|---|---|---|
| 定义 | /spec |
先规格后代码 |
| 规划 | /plan |
拆成可独立完成的小任务 |
| 实现 | /build |
一次只切一片 |
| 验证 | /test |
测试是证明,不是装饰 |
| 审查 | /review |
合并前改善代码健康度 |
| 上线 | /ship |
小步、可回滚 |
安装路径也统一了,走 open skills CLI:
npx skills add addyosmani/agent-skills
# 或只装某一个
npx skills add addyosmani/agent-skills --skill test-driven-development
Claude Code、Cursor、Codex、Copilot 都能接。重点不在“又一个 prompt 合集”,而在 把 SDLC 门禁写成 agent 默认会走的路径。你不装这些,agent 仍会写代码;装了之后,它更难跳过 red-green-refactor 或 review checklist。
我实际用下来的感受:Skill 质量参差,真正有用的是带 反合理化表(anti-rationalization) 和 强制验证步骤 的那一类。只写“请写出优雅代码”的 Skill,不如没有。
另一半问题:上下文在烧钱
Code review 时,工具动不动把半个仓库塞进上下文。code-review-graph 的卖点很具体:用 Tree-sitter 建结构图,增量跟踪变更,再通过 MCP 把“该读的符号/调用链”交给 agent。
官方示意图里有一组对比(以 Flask 语料为例):整库阅读约 14 万 token,图查询答案约 2 千 token,号称可到数十倍差距。具体倍数因仓库而异,方向是对的——结构化索引比全文糊上下文便宜且稳。
上手很短:
pip install code-review-graph
code-review-graph install # 自动检测 Cursor / Claude Code / Codex 等并写 MCP 配置
code-review-graph build # 解析当前仓库
install 会改各工具的 MCP 配置并注入 graph-aware 规则。卸装也有对称命令,只动自己写入的部分。对已经在跑多 agent 的团队,这比再买一个“更大窗口”的模型更划算。
怎么组合,而不是全装
热榜上 Skill 仓库很多,全装只会让 agent 行为互相打架。我建议的最小集:
- 一条主流程 Skill(Osmani 或 Matt Pocock 选一套,不要两套并行当默认)
- 一个上下文层(code-review-graph 或你们自建的 repo map / 符号索引)
- 仓库自己的
AGENTS.md:写清测试命令、目录边界、禁止提交的路径
Next.js 16.3 也在推版本对齐的本地文档 + AGENTS.md。趋势很清楚:agent 的“系统提示”正在从聊天框搬进 仓库内可版本管理的文件。
落地时我习惯按“一周试点”而不是“全员强制”:
- 挑一个中等活跃、有测试的服务仓库。
- 只开 review + test 相关 Skill,先别上全自动
/build auto。 - 打开 code-review-graph,对比同一次 PR 的 token 消耗和漏看文件数。
- 把失败案例(错误建议、跳过测试、误改生成代码)记进
AGENTS.md的禁止项。
这样一周后你手里有数据,而不是只有 star 数。Skill 和图谱都是杠杆,杠杆方向反了会放大事故。
风险别装看不见
- Skill 会扩大 agent 权限面。审查它调用的 shell、网络和文件范围。
- 图索引会过期。没进 CI 的
build/增量更新,review 仍会漏边。 - star 数不等于生产可用。先在一个中等仓库试一周,看误报和漏改,再推广。
小结
2026 年中的 agent 工程,竞争点不太像“谁的模型更会写函数”,更像 谁能把流程门禁和代码地图装进日常工具链。Osmani 的 skills 解决“怎么干活”;code-review-graph 解决“该看哪”。两者都在 Trending 上,不是巧合。
如果你团队已经让 agent 提 PR,却还在靠超长 system prompt 管行为,可以先把 prompt 拆成可安装 Skill,再给仓库加一层结构图。token 账单和 review 质量,通常比再换一个前沿模型见效更快。
图:代码结构图把全库阅读收成局部邻域查询



