模型路由:Flash 与 Opus 怎么分
人工智能约 4 分钟阅读

模型路由:Flash 与 Opus 怎么分

DeepSeek V4 Flash 与 Claude Opus 5 价差改的是架构。分层路由、失败升级与 Agent 循环里的省钱刹车,比单一默认模型更重要。

cover

八月的模型时间线有点吵:DeepSeek V4 Flash 系列在低价档位继续抢份额,Claude Opus 5 仍在重推理和长程 coding 上压着中位分,OpenAI 一侧又在用降价和体量说话。刷榜很容易得出“换一个默认模型就赢了”的结论。真在生产里跑 Agent,默认模型只是路由表的第一行。

我更关心的是:同一条用户任务,何时走 Flash,何时走 Opus/旗舰,何时根本不该叫大模型。

价格差会改你的架构,不只是账单

公开对比里,Flash 档相对 Opus 级旗舰,输入输出可以差出一个数量级以上(具体以各家控制台为准,数字每周都在动)。这意味着:

  • “每步都上最强模型”会很快把毛利打穿;
  • “全部用最便宜模型”会在工具选择、长上下文一致性和难 bug 上把人磨疯。

更合理的默认是 分层:

层 典型模型档 适合
L0 规则 / 小分类器 / 嵌入检索 意图分流、敏感词、是否需要工具
L1 Flash / 快速档 摘要、格式转换、单文件小改、检索后的短答
L2 中旗舰 多文件重构、带测试约束的实现
L3 Opus 级 / 最强档 架构权衡、疑难故障、安全敏感 diff 终审

L0 经常被省掉。省掉的结果是:问候语和“删库相关”的请求走同一条贵模型链。

路由不该只看“难不难”

我见过只按 prompt 长度或“是否含 code fence”切模型的网关,线上会抖。更稳的信号是组合:

  1. 工具面宽度:要动 shell、对外 HTTP、生产库只读以外的操作 → 抬档,并收紧权限。
  2. 可验证性:有单测 / 类型检查 / 评测集可自动判对错 → 可以偏低档 + 重试;只能靠人眼 → 抬档或强制人工。
  3. 上下文污染:仓库检索已经塞了大段无关文件 → 先裁剪再叫模型,而不是换更贵模型硬读。
  4. 失败形态:Flash 连续两次格式错误或测不过 → 升级;Opus 仍测不过 → 停机给人,而不是再烧一轮。

伪代码可以很土,但要能上线:

text
if needs_write_tools or security_sensitive:
    tier = L3
elif has_failing_tests and attempt >= 2:
    tier = max(tier, L2)
elif task in {summarize, extract, draft_commit_message}:
    tier = L1
else:
    tier = L2

if budget_remaining < soft_cap:
    tier = min(tier, L1)  # 降级要写进产品文案,别偷偷降

降级必须可观测:日志里留下 route_reason,否则你不知道省下的钱换来了多少静默质量下跌。

图:同一条任务在廉价快速档与重推理档之间切换

inline

Flash 擅长什么,不擅长什么

结合最近社区和评测里的共识(不是某一张榜的神谕):

Flash 类很快很便宜时,通常够用:

  • 把 PR diff 收成 changelog;
  • 从日志里抽错误码和可疑文件;
  • 按已有脚手架填模块样板;
  • RAG 后“带引用回答”,引用已由检索保证。

该升档的信号:

  • 要在多个可能设计里做取舍,且错了成本高;
  • 需要维持长会话里前后 API 约定一致;
  • 工具返回互相矛盾,要做裁决而不是顺杆爬;
  • 输出是要直接合进主干的安全/支付路径。

有个反直觉点:有时 贵模型 + 短上下文 优于 便宜模型 + 全仓库倾倒。你在买的是注意力,不是参数量广告。

Agent 循环里的钱坑

Agent 把钱烧在循环上,不在第一句问候:

  • 每轮把完整历史重喂一遍;
  • 工具结果原样回灌,包括几 MB 的构建日志;
  • 同一失败策略重试五次,没有换提示或换档;
  • 为了“更聪明”把 temperature 拉高,导致更不可复现。

可执行的收法:

  1. 工具结果截断:默认头尾 + 错误邻近,全量进对象存储,模型只拿句柄。
  2. 记忆外置:稳定结论进结构化笔记(任务目标、已试方案、环境约束),不要只靠 chat transcript。
  3. 评测门禁:用一小撮真实失败案例做 regression;换默认模型先过门禁,再动流量。
  4. 人工门槛:生产写操作、权限变更、对外群发,永远 L3 + 人确认,不看模型自信程度。

DeepSeek 路线的开放权重和低价 API,会把“多调用几次”的心理门槛打下来。这是好事,也更容易在没人盯着时放大错误。便宜是加油门,不是撤刹车。

小结

别把八月的模型新闻读成单一冠军叙事。生产形态更像交通系统:快速辅路(Flash)、主干道(中旗舰)、应急车道(Opus 级),再加红绿灯(规则与权限)。先把 L0 分流和失败升级写清楚,再去纠结榜上零点几分的差距。钱包和事故率,都会老实很多。

相关文章