混元 Token API 不是「所有模型同一套价」——文本、翻译、角色扮演、图像、语音、视觉,六大系列计费方式差异巨大。要做 价格对比,不能拿着语言的 token 单价去对比图像或语音模型的成本,一开始就比错了。
本文把六条产品线的具体价格、用量规则、额度限制和限速策略全部摊开,帮你判断值不值得从其他平台迁过来。
以下价格为 2026-08-12 广州地域刊例(单位:每百万 tokens),最新价格以 TokenHub 控制台 为准。如果你还没有 API Key,去官网入口注册即可接入配置;开启缓存场景相当于自带优惠,不走缓存的用量按后付费自动充值扣除余额。
先说结论:文本模型是混元的主战场,大部分后端集成场景都走文本;翻译、角色扮演、图像、语音和视觉是各自垂直领域的特化模型,需要在特定场景下单独估算成本,不能和文本模型横向做价格对比。
文本模型:混元的主战场,重点看缓存
混元文本模型分为正式版(Hy3)和预览版(Hy3 preview)两代。两者核心区别不在模型能力,而在计费模式:正式版统一 ¥1/¥4,无上下文长度阶梯;预览版按输入长度分档,≤16K 输入 ¥1.2/¥4、16K–32K ¥1.6/¥6.4、32K+ ¥2/¥8,越长越贵。 (来源)
| 对比维度 | 正式版 (Hy3) | 预览版 (Hy3 preview) |
|---|---|---|
| 计费模式 | 统一 ¥1/¥4,无长度阶梯 | ≤16K ¥1.2/¥4、16K–32K ¥1.6/¥6.4、32K+ ¥2/¥8 |
| 缓存命中 | 输入降至 ¥0.25 | 按档位 ¥0.4 / ¥0.6 / ¥0.8 |
| 适用场景 | Agent、编码、长上下文(推荐) | 存量业务维护 |
选型逻辑很简单:新接入直接走正式版,统一价更可预测;如果历史业务用预览版且上下文总在最短档内,短期可以不迁移,但预览版将逐步下线。
对成本影响最大的不是选正式版还是预览版,而是缓存命中率。混元文本模型均支持自动上下文缓存,缓存命中时正式版输入从 ¥1 降至 ¥0.25(降 75%),预览版从 ¥1.2 降至 ¥0.4(降 67%)。在 Agent 和编程等频繁复用 system prompt 和对话历史的场景中,缓存命中是最大的降本手段。
翻译模型:Pro/Plus 同价 ¥0.5/¥2,Lite 更低 ¥0.3/¥1.2
翻译模型 Pro 和 Plus 同价(输入 ¥0.5、输出 ¥2/百万 tokens),Lite 更低(输入 ¥0.3、输出 ¥1.2)——这不是「质量高低的线性对应」,而是面向不同场景的精度选择。(来源)
| 档位 | 输入 / 输出 | 推荐场景 |
|---|---|---|
| Pro | ¥0.5 / ¥2 | 专业翻译流水线、术语密集型文档 |
| Plus | ¥0.5 / ¥2(与 Pro 同价) | 多语言组合、中等精度需求 |
| Lite | ¥0.3 / ¥1.2 | 日常句级翻译收尾、短文本批量 |
如果翻译质量是你产品的核心指标(如本地化工具、跨境文档处理),从 Pro 或 Plus 开始评估;如果只是批量短文本收尾,Lite 是性价比最高的入口。三档都是输入输出 token 后付费,与文本模型使用同一套余额扣费体系。
角色扮演模型:两代同价 ¥2.4/¥9.6,新接入走 Latest
混元有两代角色扮演模型:Hy-Role 和 Hy-Role-Latest。两代同价,均输入 ¥2.4、输出 ¥9.6/百万 tokens——没有选择困难,新接入直接用 Hy-Role-Latest。角色扮演模型适合对话机器人、虚拟角色和互动叙事场景,模型对稳定人设和语气的把控优于通用文本模型。
相比文本模型的 ¥1/¥4,角色扮演模型输入贵 2.4 倍、输出贵 2.4 倍——所以不要拿角色扮演和文本模型比价格,它们解决的是不同的问题。Agent 走文本,对话机器人走角色扮演——各司其职。
图像模型:已改用 token 计费(10 元/MT),约 20K tokens/张
混元图像模型 Hy-Image-3.0 已从按张计费切换为 token 计费:10 元/百万 tokens,约 20K tokens 消耗生成一张图像(按 1024 分辨率估算)。 不能再按「一张图多少钱」来算成本——token 消耗取决于分辨率和复杂度,需要在你的实际使用场景中测算。(来源)
旧版按张计费的 HY-Image-Lite(¥0.099/张)和视频、3D 生成模型已移入旧版本章节,新接入的视觉生成需求建议走 Hy-Image-3.0 或 TokenHub 上的合作伙伴模型。图像模型的 token 计价体系与文本模型不互通,不能从文本的单价推图像的成本。
语音和视觉:独立计费体系
语音识别模型 Hy-ASR-3.0-Preview 按 token 计价:10 元/百万 tokens,约 22 tokens 消耗对应 1 秒音频。 适合语音转文字、会议记录和字幕生成场景。
视觉理解模型按输入输出 token 计价,单价高于纯文本:HY-Vision-2.0-Instruct 输入 ¥7.5/¥17.5、HY-Vision-1.5-Thinking ¥3/¥9、HY-Vision-Video ¥3/¥9、YT-VITA ¥1.2/¥3.5。实际花费取决于输入图像的分辨率和数量,按任务复杂度在模型之间路由。
语音和视觉模型与文本模型的 token 单价不可直接横向比较——它们解决的是不同问题,token 消耗特征也完全不同,需要分别在你的场景中按实际调用量估算成本。
总结:选模型前先问三个问题
| 问题 | 走向 |
|---|---|
| 你的任务是什么类型? | 文本 Agent → 文本正式版;翻译 → Pro/Lite;对话机器人 → 角色扮演;图文 → 视觉;语音 → 语音识别 |
| 你的缓存命中率高吗? | 高 → 缓存折扣是最大降本点;低 → 先优化 prompt 结构提升复用率 |
| 你的部署地域是哪里? | 广州和新加坡部分模型单价不同,跨地域前先对比 |
混元 Token API 是计费体系最多元的 API 之一——六大系列六套规则。本文的价格对比做完了:选模型前先把场景归类,再在同类下比价,不要跨系列横向比 token 单价。