模型概况:6 月到 8 月,Coding Plan 模型阵容大变
火山方舟 Coding Plan 这三个月连上 4 个新模型,下线 2 个旧模型,阵容彻底洗牌。 现在总共有 12 个可用模型加 Auto 路由(去年这个时候一只手数得过来),选起来确实比以前复杂了。好消息是——外部模型质量整体往上走了,GLM-5.2 和 V4-Flash 正式版比它们的前任强了不止一档。
先看时间线(来源):
| 时间 | 事件 | 说明 |
|---|---|---|
| 8/7 | DeepSeek V4-Flash 正式版全量上线 | Agent 能力大幅增强,不再预览版 |
| 8/4 | MiniMax M2.7、Kimi K2.6 下线 | 之前配这两个模型的工具会自动失效 |
| 7/23 | Doubao Seed 2.1 Turbo 上线 | 效果与成本均衡,全面升级 Coding 与 Agent |
| 7/17 | Kimi K3 上线 | 替代 K2.6,编程与复杂推理全面升级 |
| 6/17 | GLM-5.2 上线 | 智谱最新旗舰,1M 上下文 |
12 个模型可以分成两大类:
豆包自研(6 个):Seed 2.1 Turbo、2.0 Pro、2.0 Code、2.0 Lite、Seed Code、Auto
外部模型(6 个):GLM-5.2、Kimi K3、Kimi K2.7 Code、MiniMax M3、DeepSeek V4-Flash、V4-Pro
豆包自研:内部模型吃什么场景?
Auto — 新手无脑用这个
ark-code-latest 配置即 Auto 路由,平台自动按效果+速度选最优模型。 你不需要纠结用哪个,写代码的时候它自己会调。适合刚入坑、不想折腾、平时写写业务代码的场景。
缺点是:你不知道到底哪次调用走了哪个模型,不利于精细化控制成本。但大多数人其实不需要关心这个。
Seed 2.1 Turbo — 当前主力,最快最省
豆包自研里性价比最高的是 2.1 Turbo。 256K 上下文,Coding 和 Agent 能力比 2.0 Pro 更强,但更快更便宜。官方把它定位成 Coding Plan 主力推荐模型。日常补全、代码审查、小型重构,Turbo 完全够用。
如果你的工作流不是那种一个 Agent 跑几十步的类型,2.1 Turbo 是最安全的选择。
Seed 2.0 Pro vs Code:Pro 通才,Code 专才
2.0 Pro 是通用旗舰,Code 是多模态编程专长。 Pro 适合复杂推理和长链路 Agent——比如从需求文档到 PRD 到代码骨架一条龙。Code 版本有更强的视觉理解能力,前端生成和 UI 相关任务比 Pro 强。
日常全栈开发的话,Pro 和 Turbo 其实覆盖面差不多;专门的 Code 版本在你做前端原型或者从设计稿转代码时会更对路。
Seed 2.0 Lite / Seed Code — 填充用
Lite 轻量高速,适合自动补全和低复杂度任务。Seed Code 是上一代代码模型,侧重调试与重构。日常几乎用不到,除非你想在特定任务上对比一下不同豆包版本的表现。
外部模型:GLM-5.2 vs DeepSeek vs Kimi vs MiniMax
GLM-5.2 — 1M 上下文天花板
如果你做的是大型代码库级别的任务,GLM-5.2 的 1M 上下文窗口是最大优势。 什么概念呢?大约 15 万行代码可以一次性喂进去 (来源)。做全仓库级重构、跨模块链路追踪、大型项目级的代码审查时,其他模型上下文不够可能会截断,GLM-5.2 不会。
长程任务效果在 Coding Plan 外部模型里排第一。抵扣系数也高——如果你 Lite 套餐一个月 18,000 次,全跑 GLM-5.2 可能比全跑 Turbo 烧得快。所以日常别浪费,攻坚再用。
DeepSeek V4-Flash 正式版 vs V4-Pro
V4-Flash 正式版相比此前预览版,有了质的提升。 官方说 Agent 能力大幅增强,基准测试远超 V4-Pro Preview (来源)。1024K 上下文,默认开启 thinking。
V4-Flash 和 V4-Pro 的关系很简单:Flash 走量,Pro 攻坚。如果你的任务不是特别复杂、需要超高精度,Flash 够用了,还省抵扣。Pro 留给那些一步都不能错的场景。
Kimi K3 vs Kimi K2.7 Code
K3 是 Moonshot 最新旗舰,K2.6 已下线。 K3 在编程和复杂推理上全面升级,256K 上下文,长上下文与多步工具调用比 K2.6 更稳定 (来源)。
K2.7 Code 是专门针对编程优化过的版本,如果你主要做的是代码生成和调试,K2.7 Code 可能比 K3 更对路;如果你要的是一个全能模型,K3 更合适。
MiniMax M3 — M2.7 下线后的替代
M3 是 M2.7 的直接替代,编码与 Agent 评测达行业顶尖。 512K 上下文,在 Agent 推理和长上下文任务中表现突出。如果你之前用的是 M2.7,直接切 M3 就行。
不同场景模型推荐
一句话总结:日常 Turbo,攻坚 GLM-5.2 或 V4-Pro,前端 Code,不知道选啥就 Auto。
| 场景 | 推荐模型 | 理由 |
|---|---|---|
| 日常补全/审查/小型重构 | 2.1 Turbo | 快、省、稳,Coding Plan 主力 |
| 全仓库级重构 | GLM-5.2 | 1M 上下文,长程任务最优 |
| 复杂 Agent 编排 | GLM-5.2 / V4-Pro | 长链路执行稳定 |
| 前端/UI 开发 | 2.0 Code | 多模态视觉+前端生成 |
| 快速原型/高并发 | V4-Flash / 2.1 Turbo | 快、省抵扣 |
| 高精度攻坚 | V4-Pro / GLM-5.2 | 难任务上的可靠性 |
| 新手/不想折腾 | Auto | 自动帮你选 |
注意事项
- 抵扣系数:GLM-5.2 和 V4-Pro 的抵扣系数比豆包自研高。同样的请求次数,用这些模型消耗的额度更快。Lite 套餐用户要留意。
- Auto 不是万能药:Auto 路由在简单任务上表现好,但复杂 Agent 工作流建议手动指定模型,避免中途切换影响连贯性。
- K2.6 和 M2.7 已下线:如果你之前在 Claude Code 或 Cursor 里配置的是这两个模型 ID,现在会返回错误,手动改一下就行。
- Coding Plan 和 API 按量是两套系统:Coding Plan 按请求次数算,API 按 token 算。后端服务必须走 API 按量,不能用 Coding Plan Key。
- 前两个月 2.5 折:新购 Lite(约 ¥9.9)和 Pro(约 ¥49.9)前两月享受约 2.5 折,第三个月恢复原价。可以先用两个月深入对比这些模型,再决定是否续 Pro。