Kimi Token API 价格对比、充值、优惠、最新动态 | 文章详情

月之暗面 Kimi Token API 价格对比,Kimi K3、Kimi K2.7 Code等11个模型,OpenAI-compatible API、Claude Code、Cline等4种工具接入,含缓存与限速等级,汇总 API key 配置、用量与官网入口,帮你判断值不值得。

41
平台对比
395+
支持模型
140+
IDE Tools
11
Kimi Token API 模型数
¥2 / ¥10
Kimi Token API 入门价
详情
查看厂商详情

Kimi API 最新动态

Kimi K3 发布:全球首个开源 3T 级模型,API 同步上线

发布 更新
模型更新K3Kimi K3模型发布API 更新开源
摘要

2026年7月16日,月之暗面发布 Kimi K3——一个 2.8T 参数的混合专家模型,全球首个开源 3T 级模型。K3 API 同步上线,定价 $0.30/MTok(缓存命中输入)、$3.00/MTok(缓存未命中输入)、$15.00/MTok(输出),编程场景缓存命中率超 90%。

API 更新概览

Kimi K3 是月之暗面(Moonshot AI)于 2026 年 7 月 16 日发布的 2.8 万亿参数开源 MoE 模型,API 同步上线来源)。全球首个达到 3T 级别的开源模型,原生支持视觉理解,上下文窗口达到 100 万 token

在官方评测中,K3 在所有测试模型中持续领先于其他竞品,但整体性能仍落后于 Claude Fable 5 和 GPT 5.6 Sol。

架构创新

K3 的架构核心是 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes),配合量化感知训练和全平衡专家并行实现高效推理部署来源)。

Kimi Delta Attention(KDA)

KDA 在序列长度维度上优化注意力信息流动。团队已将 KDA 前缀缓存实现贡献给 vLLM 社区,在长上下文 API 场景下缓存命中率超过 90%,大幅降低推理成本。

Attention Residuals(AttnRes)

AttnRes 选择性检索跨深度的表示,而非均匀累积各层信息。这显著提升了深层模型的训练稳定性和信息利用效率。

Stable LatentMoE

K3 将 MoE 专家数扩展至 896 个(每次激活 16 个)。Quantile Balancing 从路由器分数分位数直接推导专家分配,消除启发式更新和敏感超参数。Per-Head Muon 独立优化每个注意力头。

量化与推理优化

K3 从 SFT 阶段开始应用量化感知训练,使用 MXFP4 权重 + MXFP8 激活以获得广泛硬件兼容性。全平衡专家并行训练方法(静态 shape、关键路径无 host 同步)防止大规模专家并行时吞吐量下降。推荐在 64 个以上加速器的超节点配置上部署以获得最佳推理效率。

编程能力

K3 在长周期自主编程任务上表现突出,内核优化性能与 Claude Fable 5 竞争激烈,自主构建了 GPU 编译器和芯片来源)。

内核优化

在与 Claude Fable 5、GPT 5.6 Sol 的 GPU 内核优化对比中,K3 在 24 小时内完成多个内核的 profiling、重写和基准测试(覆盖 NVIDIA Hopper GPU 和替代厂商 GPGPU),大幅超越 Opus 4.8 和 GPT 5.6 Sol。

GPU 编译器开发

K3 从零构建了 MiniTriton——一个类 Triton 的 GPU 编译器,包含自研 tile 级 IR 层、优化 pass 和 PTX 代码生成流水线。roofline 基准测试中性能持平或优于 Triton 和 torch.compile。

芯片设计

K3 在单次 48 小时自主运行中,使用开源 EDA 工具基于 Nangate 45nm 库设计了一款芯片。4 mm² 内集成 146 万标准单元、0.277 MB SRAM 和 INT4 MAC 阵列,模拟中维持 8,700+ tokens/s 解码吞吐量。

API 定价与可用性

K3 API 已上线 Kimi API 平台(platform.kimi.ai),模型权重于 2026 年 7 月 27 日开源发布

定价

计费项 价格 说明
缓存命中输入 $0.30 / MTok 编程场景命中率 > 90%
缓存未命中输入 $3.00 / MTok 首次或缓存过期请求
输出 $15.00 / MTok 生成 token 计费

得益于 Mooncake 分离式推理架构和 KDA 前缀缓存,编程工作负载中缓存命中率超过 90%,实际使用成本远低于标称价格。

调用方式

访问 Kimi API 平台,选择 kimi-k3 模型即可。推荐 64+ 加速器超节点部署以获得最优推理效率。

局限性

K3 的主要局限是思维历史敏感性和过度主动倾向,API 调用时建议在系统提示中施加明确的行为约束来源)。

  1. 思维历史敏感:K3 在保留思维历史模式下训练。智能体框架需正确回传历史思维内容,中途切换模型可能导致质量不稳定。
  2. 过度主动性:K3 训练侧重长周期复杂任务,API 调用时应提供更明确的行为指令。
  3. 整体用户体验仍与 Claude Fable 5 和 GPT 5.6 Sol 存在一定差距。

来源与核验

最后核验

Kimi Token API 常见问题

Kimi K3 API 价格是多少?和 K2 相比有何变化?

K3 API 定价为:缓存命中输入 $0.30/MTok、缓存未命中输入 $3.00/MTok、输出 $15.00/MTok。得益于 Mooncake 分离式推理架构和 KDA 前缀缓存优化,编程场景缓存命中率超过 90%,在百万级上下文下仍能保持极具竞争力的价格。K3 整体扩缩效率相较 K2 提升约 2.5 倍。

Kimi K3 是开源的吗?模型权重什么时候发布?

是的,K3 是全球首个开源的 3T 级模型。完整模型权重于 2026 年 7 月 27 日发布。KDA 前缀缓存实现也已贡献给 vLLM 社区,随模型同步开源。

如何在 API 中使用 Kimi K3?

访问 Kimi API 平台(platform.kimi.ai),选择 kimi-k3 模型即可。推荐在 64 个以上加速器的超节点配置上部署以获得最佳推理效率。
AI Token Plan

全球 AI Token Plan 价格对比

AI Token Plan 不是简单收集厂商链接,而是把 41+ 家国内外 AI 平台与厂商放到同一套对比框架里,覆盖 395+ 款模型资料,以及 Token Plan、Coding Plan、IDE Tools 和大模型 API 等常见套餐形态。

当你想比较 AI 订阅价格、编程套餐额度、API 调用成本或官网优惠入口时,可以在这里同时看到官方价格、套餐档位、用量规则、模型能力和工具接入方式,减少在多个官网之间反复查找的成本。

我们会随着各厂商价格页、套餐页和产品文档的变化持续整理数据,让首页适合作为 AI Token Plan 价格对比入口,也让详情页能进一步说明单个厂商的套餐是否适合个人开发者、团队采购或长期 API 调用。

价格信息来源于各平台官网,可能随时变动,请以官网实际价格为准。

© 2026 AI Token Plan · 保留所有权利 · 网站上线时间于 2026 年 6 月 18 日 · 已运营 64 天 · 站长地图