AI API 该用官方还是中转?分四种场景,有两种官方更划算(2026)
几乎所有中转站的文章都在说"中转更便宜",但真实答案是分场景的。缓存命中率高的场景,官方几乎一定更便宜 —— 这是中转的结构性短板,不是谁家做得差。输出多、长上下文、或者赶上官方涨价时段,中转才真正划算。这篇把四种场景拆开讲清楚,包括我们自己不占优的那两种。
1. 先承认一件事:中转不是永远更便宜
这个行业的文章几乎一边倒地说"中转比官方便宜",但那只在一部分场景成立。真实情况是:有些场景官方明显更划算,而且不是因为哪家中转做得差 —— 是结构决定的。把这件事说清楚,比多列三个优点有用,因为你迟早会自己算出来。
2. 最关键的分水岭:prompt 缓存
现在主流模型都有 prompt 缓存:同一段前缀第二次发过去,命中缓存的部分只收很低的价格 —— Claude 大约是正常输入价的 1/10,DeepSeek 更夸张,能到约 1/30(V4 全系:缓存命中 ¥0.05 对未命中 ¥1.5)。谁最吃这个红利?Agent 类应用:每一轮都要重发系统提示、工具定义、历史对话,前缀几乎完全一样。跑 50 轮,后 49 轮的前缀本可以只花 1/10 的钱。
3. 为什么中转在缓存上天然吃亏
缓存是绑在具体上游账号/实例上的。中转为了扛并发和限速,会把请求分散到一批上游账号 —— 第一次请求的缓存写在账号 A 上,第二次请求可能路由到账号 B,前缀就命中不上。除非中转为你的 key 做了会话粘性(固定路由到同一后端),否则命中率会很低。这不是某一家的问题,是中转这个形态自带的,选中转时值得直接问一句"你们做会话粘性吗"。
4. 输出侧没有这个问题
缓存只作用于输入。输出 token 无论走哪条路都是全价。所以如果你的用量以输出为主 —— 长文生成、翻译、批量改写、内容生产 —— 缓存这个变量基本不存在,谁的输出单价低谁就便宜,中转通常在这一侧有优势。一个简单的自查:打开你的用量统计,看输入输出比。输入是输出的十几倍,你大概率是 agent 型,该认真考虑缓存;输出占比高,直接比单价就行。
5. 长上下文:要看分档价有没有明写
不少模型按输入长度分档收费,越长单价越高(比如 GPT-5.5 输入超过 272K 后单价翻倍)。官方会把分档明写出来。中转如果只报最低档的价,你按低档估预算、实际被按高档扣,账单就会莫名其妙。选的时候直接问:分档价在哪看?看不到就默认它有坑。cocodot 的做法是把每一档都列在价目表里(cocodot.co/pricing#models,不用注册),长上下文不存在隐藏加价。
6. 官方涨价或改计价方式时,价差会突然拉大
DeepSeek 从北京时间 2026 年 8 月 17 日 00:00 起启用峰谷计价:高峰时段是北京时间 9:00–12:00 与 14:00–18:00,其余为空闲时段,空闲价是高峰价的一半。以 V4-Flash 为例,输入(缓存未命中)空闲 ¥1.5、高峰 ¥3.0,输出空闲 ¥4.5、高峰 ¥9.0 —— 都明显高于此前的水平。这类调整对中转的影响是滞后的:中转的成本来自它自己的上游合约,不会因为官方改零售价就同步变 —— 但也不代表永远不变,上游后续可能跟调。所以官方每次调价,都值得重新算一次账,原来的结论可能已经反过来了。这也是为什么"哪个便宜"这种问题没有永久答案,只有当期答案。
7. 那 cocodot 适合谁
适合:主要跑输出、或者国内根本付不了官方(Claude、GPT、Gemini 官方只收海外卡)、或者想用一个 key 一份余额同时调多家模型省掉多套账号。不适合:缓存命中率很高的 agent 场景 —— 我们目前的缓存命中不稳定,这种情况直连官方更划算,我们不建议你为了便宜 10% 去承担缓存失效的几倍成本。价格逐个型号公开在 cocodot.co/pricing#models,不用注册就能看,你可以自己拿去算,不用信我们的结论。真要试的话成本很低:注册验证邮箱送 $0.5 体验额度,base_url 换成 https://cocodot.co/api/ai/v1、key 换成自己的,模型名填官方名或代号都认,其余代码不用动,跑几次就知道延迟和效果对不对得上。
四种场景该选谁(2026-08)
| 你的场景 | 典型例子 | 更划算的是 |
|---|---|---|
| 缓存命中率高 | Agent 循环、每轮重发大段系统提示与工具定义 | 官方 —— 中转的结构性短板 |
| 输出为主 | 长文生成、翻译、批量改写 | 中转 |
| 长上下文 | 整个代码库/长文档塞进上下文 | 看中转有没有明写分档价 |
| 官方涨价 / 分时段计价 | DeepSeek 北京时间 2026-08-17 00:00 起启用峰谷价 | 中转 —— 成本结构不一定跟着动 |