模型概览
Kimi K3 是月之暗面(Moonshot AI)于 2026 年 7 月 16 日发布的 2.8 万亿参数开源混合专家(MoE)模型,是全球首个达到 3T 级别的开源模型(来源)。K3 原生支持视觉理解,上下文窗口达到 100 万 token,标志着开源模型首次进入此前仅由闭源模型占据的超大规模前沿领域。
在官方评测中,K3 在所有测试模型中持续领先于其他竞品,但整体性能仍落后于 Claude Fable 5 和 GPT 5.6 Sol 这两个最强闭源模型。
架构创新
K3 的架构创新核心是 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes),配合 896 专家的 Stable LatentMoE 框架实现稳定的大规模训练(来源)。整体扩缩效率相较前代 K2 提升约 2.5 倍。
Kimi Delta Attention(KDA)
KDA 在序列长度维度上优化注意力信息流动,让百万级上下文处理更加高效。配合 vLLM 社区的 KDA 前缀缓存实现,K3 在长上下文场景下能以极具竞争力的价格提供服务。
Attention Residuals(AttnRes)
AttnRes 不再均匀累积各层的表示,而是选择性检索跨深度的表示。这让模型能在需要时回溯浅层信息,而非被迫层层传递,显著提升了深层模型的训练稳定性和信息利用效率。
Stable LatentMoE
K3 将 MoE 专家数扩展至 896 个(每次激活 16 个)。Stable LatentMoE 通过 Quantile Balancing 从路由器分数分位数直接推导专家分配,无需启发式更新和敏感的超参数;Per-Head Muon 则独立优化每个注意力头以实现更自适应的学习。
编程能力
K3 在长周期自主编程任务上表现突出,从内核优化、编译器开发到芯片设计均展示了端到端的工程能力(来源)。
内核优化
在与 Claude Fable 5、GPT 5.6 Sol 等同台竞技的 GPU 内核优化测试中,K3 在 24 小时内完成 AttnRes、KDA 和 MLA 内核的 profiling、重写和基准测试,性能与 Fable 5 竞争激烈,大幅超越 Opus 4.8 和 GPT 5.6 Sol。在开发后期,K3 早期版本已承担了团队大部分内核优化工作。
GPU 编译器开发
K3 从零构建了 MiniTriton——一个类 Triton 的 GPU 编译器,包含自研 tile 级 IR 层、优化 pass 和 PTX 代码生成流水线。在 roofline 基准测试中,MiniTriton 性能持平或优于 Triton 和 torch.compile;nanoGPT 端到端训练中 loss 曲线与参考实现紧密跟踪,验证了完整流水线的正确性。
芯片设计
作为概念验证,K3 在单次 48 小时自主运行中,使用开源 EDA 工具基于 Nangate 45nm 库设计了一款芯片。在 4 mm² 面积内,芯片以 100 MHz 频率闭合时序,模拟中维持超过 8,700 tokens/s 的解码吞吐量,集成了 146 万标准单元、0.277 MB SRAM 和 INT4 MAC 阵列。
科研编程
在一次计算天体物理测试中,K3 用约两小时完成了通常需要一到两周的科研工作量——复现 I-Love-Q 普适关系,交叉验证 20+ 篇论文,实现完整数值流水线,评估 300+ 个状态方程,生成 3,000+ 行 Python 代码。
知识工作与智能体
K3 在端到端知识工作方面有显著提升,支持交互式研究、可视化 Dashboard 和多模态内容创作(来源)。
- 交互式行业研究:能通过 120+ 轮递归自我改进生成可交互的研究报告,从 2,800+ 次网页搜索中提取数据
- Widgets 与 Dashboard:Kimi Work 新增交互式组件和个性化面板,让 AI 辅助工作更持久、直观
- 视频编辑:K3 的原生多模态架构能从 56 个源素材中完成剪辑选择、节奏同步、音频处理和多轮修改
可用性与定价
K3 已同步上线 Kimi.com、Kimi Work、Kimi Code 和 Kimi API 四大平台,模型权重于 2026 年 7 月 27 日开源发布(API 入口)。
| 平台 | 使用方式 |
|---|---|
| Kimi.com | 网页端直接使用 |
| Kimi Work | 桌面端 v3.1.0+(Windows / Apple Silicon Mac) |
| Kimi Code | 终端中使用 /model 命令切换 |
| Kimi API | 平台选择 kimi-k3 模型 |
API 定价
| 计费项 | 价格 |
|---|---|
| 缓存命中输入 | $0.30 / MTok |
| 缓存未命中输入 | $3.00 / MTok |
| 输出 | $15.00 / MTok |
得益于 Mooncake 分离式推理架构,编程场景下缓存命中率超 90%,实际使用成本远低于标称价格。
局限性与注意事项
K3 的主要局限是思维历史敏感性和过度主动倾向,建议在系统提示中施加明确的行为约束(来源)。
- 思维历史敏感:K3 在保留思维历史的模式下训练。智能体框架需正确回传历史思维内容,中途从其他模型切换到 K3 可能导致生成质量不稳定。
- 过度主动性:K3 的训练侧重长周期复杂任务,遇到小问题或模糊意图时可能替用户做出意外决策。
- 尽管整体竞争力强,K3 在用户体验上仍与 Claude Fable 5 和 GPT 5.6 Sol 存在一定差距。