API 更新概览
Kimi K3 是月之暗面(Moonshot AI)于 2026 年 7 月 16 日发布的 2.8 万亿参数开源 MoE 模型,API 同步上线(来源)。全球首个达到 3T 级别的开源模型,原生支持视觉理解,上下文窗口达到 100 万 token。
在官方评测中,K3 在所有测试模型中持续领先于其他竞品,但整体性能仍落后于 Claude Fable 5 和 GPT 5.6 Sol。
架构创新
K3 的架构核心是 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes),配合量化感知训练和全平衡专家并行实现高效推理部署(来源)。
Kimi Delta Attention(KDA)
KDA 在序列长度维度上优化注意力信息流动。团队已将 KDA 前缀缓存实现贡献给 vLLM 社区,在长上下文 API 场景下缓存命中率超过 90%,大幅降低推理成本。
Attention Residuals(AttnRes)
AttnRes 选择性检索跨深度的表示,而非均匀累积各层信息。这显著提升了深层模型的训练稳定性和信息利用效率。
Stable LatentMoE
K3 将 MoE 专家数扩展至 896 个(每次激活 16 个)。Quantile Balancing 从路由器分数分位数直接推导专家分配,消除启发式更新和敏感超参数。Per-Head Muon 独立优化每个注意力头。
量化与推理优化
K3 从 SFT 阶段开始应用量化感知训练,使用 MXFP4 权重 + MXFP8 激活以获得广泛硬件兼容性。全平衡专家并行训练方法(静态 shape、关键路径无 host 同步)防止大规模专家并行时吞吐量下降。推荐在 64 个以上加速器的超节点配置上部署以获得最佳推理效率。
编程能力
K3 在长周期自主编程任务上表现突出,内核优化性能与 Claude Fable 5 竞争激烈,自主构建了 GPU 编译器和芯片(来源)。
内核优化
在与 Claude Fable 5、GPT 5.6 Sol 的 GPU 内核优化对比中,K3 在 24 小时内完成多个内核的 profiling、重写和基准测试(覆盖 NVIDIA Hopper GPU 和替代厂商 GPGPU),大幅超越 Opus 4.8 和 GPT 5.6 Sol。
GPU 编译器开发
K3 从零构建了 MiniTriton——一个类 Triton 的 GPU 编译器,包含自研 tile 级 IR 层、优化 pass 和 PTX 代码生成流水线。roofline 基准测试中性能持平或优于 Triton 和 torch.compile。
芯片设计
K3 在单次 48 小时自主运行中,使用开源 EDA 工具基于 Nangate 45nm 库设计了一款芯片。4 mm² 内集成 146 万标准单元、0.277 MB SRAM 和 INT4 MAC 阵列,模拟中维持 8,700+ tokens/s 解码吞吐量。
API 定价与可用性
K3 API 已上线 Kimi API 平台(platform.kimi.ai),模型权重于 2026 年 7 月 27 日开源发布。
定价
| 计费项 | 价格 | 说明 |
|---|---|---|
| 缓存命中输入 | $0.30 / MTok | 编程场景命中率 > 90% |
| 缓存未命中输入 | $3.00 / MTok | 首次或缓存过期请求 |
| 输出 | $15.00 / MTok | 生成 token 计费 |
得益于 Mooncake 分离式推理架构和 KDA 前缀缓存,编程工作负载中缓存命中率超过 90%,实际使用成本远低于标称价格。
调用方式
访问 Kimi API 平台,选择 kimi-k3 模型即可。推荐 64+ 加速器超节点部署以获得最优推理效率。
局限性
K3 的主要局限是思维历史敏感性和过度主动倾向,API 调用时建议在系统提示中施加明确的行为约束(来源)。
- 思维历史敏感:K3 在保留思维历史模式下训练。智能体框架需正确回传历史思维内容,中途切换模型可能导致质量不稳定。
- 过度主动性:K3 训练侧重长周期复杂任务,API 调用时应提供更明确的行为指令。
- 整体用户体验仍与 Claude Fable 5 和 GPT 5.6 Sol 存在一定差距。