团队 LLM 成本优化实战:三层模型路由,同样的活账单砍一半(2026)
大模型账单失控的根源是"全用旗舰"。三层路由方法论:批量杂活用 $0.2 档、日常主力用 $2 档、攻坚才上 $5 档,附每层的具体模型选择和真实单价。
为什么全用旗舰是最贵的错误
Opus 5 和 Luna 的单价差 28 倍,但在"从 JSON 里抽字段"这类任务上产出没有区别。审计一下你的调用日志:通常 60-70% 的调用是 L1 难度的杂活。仅把这部分降档,账单立减三到四成——这是所有优化里 ROI 最高的一步。
路由的落地方式
不需要复杂网关:在业务代码里按任务类型写死模型名就够了(反正都是同一个 base_url 同一个 key)。进阶做法:给 agent 框架配 fallback——L2 连续失败自动升 L3,成功后回落。切忌反向偷懒:用 L1 跑写码任务,返工成本比省下的 token 费贵得多。
两个隐形成本别忽略
①推理模型的思考 token:GLM-5.x、Gemini 3.6/3.7 Flash 这类会在回答前先烧思考 token(计入输出计费),max_tokens 给小了钱花了答案还是空的——批量任务用非推理模型更划算;②长重复前缀:缓存命中不保证,预算按全价估,把固定 prompt 压短是实打实的省钱。
每月一次的成本复盘
拉出账单流水按模型聚合(我们的钱包流水每笔带模型和 token 数),问三个问题:L3 的调用里有多少其实 L2 能干?L1 任务是不是混进了 L2?哪个 key/项目的用量异常增长?十五分钟的复盘,通常又能找回 10%。
三层路由速查(cocodot 价,USD/百万 token)
| 层 | 任务类型 | 推荐模型 | 单价(入/出) |
|---|---|---|---|
| L1 批量 | 分类/打标/抽取/格式化 | GPT-5.6 Luna / Gemini Flash-lite | $0.16/$0.96 · $0.23/$1.35 |
| L2 主力 | 写码/重构/内容/常规推理 | Sonnet 5 / K2.7 Code | $1.8/$9 · ¥6.17/¥25.65 |
| L3 攻坚 | 跨文件/长链 agent/难题 | Opus 5 | $4.5/$22.5 |