Kimi Token Plan 价格对比、充值、优惠、最新动态 | 文章详情

月之暗面 Kimi Token Plan 订阅价格对比,4个会员档位(Kimi Code,¥39/月/月起),含 1x–10x Agent credits,Kimi K3等3个模型,Kimi CLI、Claude Code、Roo Code等4种工具接入,汇总套餐额度与优惠、附带官网入口,帮你判断值不值得。

41
平台对比
395+
支持模型
140+
IDE Tools
3
Kimi Token Plan 模型数
¥39/月
Kimi Token Plan 入门价
详情
查看厂商详情

Kimi 最新动态

Kimi K3 发布:全球首个开源 3T 级模型,编程与知识工作能力大幅跃升

发布 更新
模型更新K3Kimi K3模型发布开源MoE
摘要

2026年7月16日,月之暗面发布 Kimi K3——一个 2.8T 参数的混合专家模型,全球首个开源 3T 级模型。K3 基于 Kimi Delta Attention 和 Attention Residuals 架构,支持原生视觉和 100 万 token 上下文窗口,在编程、知识工作、推理等任务上达到前沿水平,现已上线 Kimi.com、Kimi Code 和 Kimi API。

模型概览

Kimi K3 是月之暗面(Moonshot AI)于 2026 年 7 月 16 日发布的 2.8 万亿参数开源混合专家(MoE)模型,是全球首个达到 3T 级别的开源模型来源)。K3 原生支持视觉理解,上下文窗口达到 100 万 token,标志着开源模型首次进入此前仅由闭源模型占据的超大规模前沿领域。

在官方评测中,K3 在所有测试模型中持续领先于其他竞品,但整体性能仍落后于 Claude Fable 5 和 GPT 5.6 Sol 这两个最强闭源模型。

架构创新

K3 的架构创新核心是 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes),配合 896 专家的 Stable LatentMoE 框架实现稳定的大规模训练来源)。整体扩缩效率相较前代 K2 提升约 2.5 倍。

Kimi Delta Attention(KDA)

KDA 在序列长度维度上优化注意力信息流动,让百万级上下文处理更加高效。配合 vLLM 社区的 KDA 前缀缓存实现,K3 在长上下文场景下能以极具竞争力的价格提供服务。

Attention Residuals(AttnRes)

AttnRes 不再均匀累积各层的表示,而是选择性检索跨深度的表示。这让模型能在需要时回溯浅层信息,而非被迫层层传递,显著提升了深层模型的训练稳定性和信息利用效率。

Stable LatentMoE

K3 将 MoE 专家数扩展至 896 个(每次激活 16 个)。Stable LatentMoE 通过 Quantile Balancing 从路由器分数分位数直接推导专家分配,无需启发式更新和敏感的超参数;Per-Head Muon 则独立优化每个注意力头以实现更自适应的学习。

编程能力

K3 在长周期自主编程任务上表现突出,从内核优化、编译器开发到芯片设计均展示了端到端的工程能力来源)。

内核优化

在与 Claude Fable 5、GPT 5.6 Sol 等同台竞技的 GPU 内核优化测试中,K3 在 24 小时内完成 AttnRes、KDA 和 MLA 内核的 profiling、重写和基准测试,性能与 Fable 5 竞争激烈,大幅超越 Opus 4.8 和 GPT 5.6 Sol。在开发后期,K3 早期版本已承担了团队大部分内核优化工作。

GPU 编译器开发

K3 从零构建了 MiniTriton——一个类 Triton 的 GPU 编译器,包含自研 tile 级 IR 层、优化 pass 和 PTX 代码生成流水线。在 roofline 基准测试中,MiniTriton 性能持平或优于 Triton 和 torch.compile;nanoGPT 端到端训练中 loss 曲线与参考实现紧密跟踪,验证了完整流水线的正确性。

芯片设计

作为概念验证,K3 在单次 48 小时自主运行中,使用开源 EDA 工具基于 Nangate 45nm 库设计了一款芯片。在 4 mm² 面积内,芯片以 100 MHz 频率闭合时序,模拟中维持超过 8,700 tokens/s 的解码吞吐量,集成了 146 万标准单元、0.277 MB SRAM 和 INT4 MAC 阵列。

科研编程

在一次计算天体物理测试中,K3 用约两小时完成了通常需要一到两周的科研工作量——复现 I-Love-Q 普适关系,交叉验证 20+ 篇论文,实现完整数值流水线,评估 300+ 个状态方程,生成 3,000+ 行 Python 代码。

知识工作与智能体

K3 在端到端知识工作方面有显著提升,支持交互式研究、可视化 Dashboard 和多模态内容创作来源)。

  • 交互式行业研究:能通过 120+ 轮递归自我改进生成可交互的研究报告,从 2,800+ 次网页搜索中提取数据
  • Widgets 与 Dashboard:Kimi Work 新增交互式组件和个性化面板,让 AI 辅助工作更持久、直观
  • 视频编辑:K3 的原生多模态架构能从 56 个源素材中完成剪辑选择、节奏同步、音频处理和多轮修改

可用性与定价

K3 已同步上线 Kimi.com、Kimi Work、Kimi Code 和 Kimi API 四大平台,模型权重于 2026 年 7 月 27 日开源发布API 入口)。

平台 使用方式
Kimi.com 网页端直接使用
Kimi Work 桌面端 v3.1.0+(Windows / Apple Silicon Mac)
Kimi Code 终端中使用 /model 命令切换
Kimi API 平台选择 kimi-k3 模型

API 定价

计费项 价格
缓存命中输入 $0.30 / MTok
缓存未命中输入 $3.00 / MTok
输出 $15.00 / MTok

得益于 Mooncake 分离式推理架构,编程场景下缓存命中率超 90%,实际使用成本远低于标称价格。

局限性与注意事项

K3 的主要局限是思维历史敏感性和过度主动倾向,建议在系统提示中施加明确的行为约束来源)。

  1. 思维历史敏感:K3 在保留思维历史的模式下训练。智能体框架需正确回传历史思维内容,中途从其他模型切换到 K3 可能导致生成质量不稳定。
  2. 过度主动性:K3 的训练侧重长周期复杂任务,遇到小问题或模糊意图时可能替用户做出意外决策。
  3. 尽管整体竞争力强,K3 在用户体验上仍与 Claude Fable 5 和 GPT 5.6 Sol 存在一定差距。

来源与核验

最后核验

Kimi Token Plan 常见问题

Kimi K3 和 Kimi K2 相比提升有多大?

K3 相较 K2 整体扩缩效率提升约 2.5 倍。架构上引入了 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes),并将 MoE 专家数从 K2 扩展至 896 个(每次激活 16 个),配合 Stable LatentMoE 框架实现稳定训练。在 DeepSWE、Terminal-Bench、SWE Marathon 等编程基准上大幅超越 K2。

Kimi K3 的 API 价格是多少?

Kimi K3 API 定价为:缓存命中输入 $0.30/MTok、缓存未命中输入 $3.00/MTok、输出 $15.00/MTok。得益于 Mooncake 分离式推理架构,官方 API 在编程场景下缓存命中率超过 90%。

Kimi K3 是开源的吗?模型权重什么时候发布?

是的,K3 是全球首个开源的 3T 级模型。完整模型权重于 2026 年 7 月 27 日发布。
AI Token Plan

全球 AI Token Plan 价格对比

AI Token Plan 不是简单收集厂商链接,而是把 41+ 家国内外 AI 平台与厂商放到同一套对比框架里,覆盖 395+ 款模型资料,以及 Token Plan、Coding Plan、IDE Tools 和大模型 API 等常见套餐形态。

当你想比较 AI 订阅价格、编程套餐额度、API 调用成本或官网优惠入口时,可以在这里同时看到官方价格、套餐档位、用量规则、模型能力和工具接入方式,减少在多个官网之间反复查找的成本。

我们会随着各厂商价格页、套餐页和产品文档的变化持续整理数据,让首页适合作为 AI Token Plan 价格对比入口,也让详情页能进一步说明单个厂商的套餐是否适合个人开发者、团队采购或长期 API 调用。

价格信息来源于各平台官网,可能随时变动,请以官网实际价格为准。

© 2026 AI Token Plan · 保留所有权利 · 网站上线时间于 2026 年 6 月 18 日 · 已运营 64 天 · 站长地图