一句话摘要:Kimi K3 以 2.8 万亿参数登顶全球开源模型,编程榜首次超越闭源旗舰;本文讲清它强在哪、贵不贵、在哪用。

数据截至 2026 年 8 月 12 日
本文数据综合自新华社、Artificial Analysis、LMArena、Moonshot 官方发布材料及多家第三方评测,发布前建议再核对最新榜单。


一、引言:开源模型第一次摸到了"天花板"

2026 年 7 月 16 日,就在上海世界人工智能大会(WAIC)开幕前一天,月之暗面(Moonshot AI)扔出了一颗重磅炸弹——Kimi K3

它的头衔很唬人,但都是事实:

  • 总参数 2.8 万亿,是目前全球参数规模最大的开源模型,远超 DeepSeek V4 Pro(1.6 万亿)和智谱 GLM-5 系列(7440 亿);
  • 全球首个 3 万亿参数级别的开源模型
  • 开源模型历史上第一次在主流排行榜上正面超越闭源旗舰——在前端编程盲测榜 Frontend Code Arena 上,Kimi K3 以 1679 分登顶,压过 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol。

用新华社的话说,这"标志着我国人工智能模型发展迈出新的一步"。而对普通用户来说,更实际的问题是:它强在哪?跟我有什么关系?去哪能用上?这篇文章一次讲清楚。


二、Kimi K3 是什么?

2.1 基本档案

项目 参数
开发方 月之暗面(Moonshot AI,2023 年由清华系创业者杨植麟创立,阿里、腾讯均为投资方)
发布时间 2026 年 7 月 16 日发布,7 月 27 日开源完整权重
架构 MoE 混合专家模型,93 层,共 896 个专家,每个 token 仅激活其中 16 个
总参数 / 激活参数 2.8 万亿 / 约百亿级(稀疏激活,推理成本远低于体量给人的想象)
上下文窗口 100 万 token(1,048,576),一口价不分档
模态 原生支持文本 + 图像理解(MoonViT-V2 视觉编码器),部分渠道已支持视频输入
开源协议 自定义 Kimi K3 License(类 MIT,附收入分级条款)

2.2 两项核心技术创新

Kimi K3 的看点不只是"大",更在于它处理信息的方式:

1. KDA 混合线性注意力(Kimi Delta Attention)

传统 Transformer 的全注意力机制处理长文本时,计算量随文本长度接近平方级增长——内容增加 1 倍,计算量增至约 4 倍。这是超长文本难落地的根本原因。K3 在 93 层中的 69 层使用了自研的 KDA 线性注意力模块,把计算量压到接近线性增长。结果是:KV 缓存减少约 75%,百万 token 解码吞吐提升约 6.3 倍。简单说,同样算力下它能"读"得更长、想得更深。

2. 注意力残差(Attention Residuals / AttnRes)

模型越大、层数越多,信息在层间传递越容易衰减失真,训练越容易崩。注意力残差技术让模型跨深度有选择地检索表示,而不是机械地逐层累加——相当于给 2.8 万亿参数的巨型模型装了一套"稳定器"。官方称,两项技术叠加让 K3 相比 K2 实现了约 2.5 倍的训练扩展效率提升。

2.3 开源策略:人人可下载,但大厂要"报备"

7 月 27 日,K3 完整权重和技术报告登陆 Hugging Face 与 GitHub。许可证整体接近 MIT:任何人都可以免费使用、修改、分发、微调。只有两条收入相关限制:

  • 以"模型即服务"方式大规模转售 K3 推理的云厂商,连续 12 个月收入超 20 万美元后需与 Moonshot 单独签约;
  • 月活超 1 亿或月收入超 200 万美元的商业产品,需在界面显著标注"Kimi K3"。

对绝大多数开发者和中小企业来说,这就是"免费可商用"。


三、硬碰硬:各大排行榜上的真实位置

跑分要分开看:一类是第三方机构独立复测(可信度高),一类是厂商自报(参考即可)。先看最有含金量的两个综合榜单。

3.1 Artificial Analysis 智能指数(客观跑分,2026 年 8 月上旬数据)

排名 模型 综合智能分 属性
1 Claude Opus 5 (max) 63 闭源
3 Claude Fable 5 62 闭源
5 GPT-5.6 Sol (max) 61 闭源
6 Kimi K3 (max) 60 开源
7 GPT-5.6 Sol (xhigh) 59 闭源
9 Qwen3.8 Max 58 闭源

Kimi K3 是全榜排名最高的开源模型,也是国产模型第一。 它与前五名闭源旗舰的差距只有 1–3 分,属于"同档前沿",而不是代差。

3.2 LMArena(真人盲测投票,2026 年 8 月)

模型 文本榜 Elo 备注
Claude Fable 5 1525 文本 #1
Claude Opus 5 1522 新旗舰
GPT-5.6 Sol 1514 OpenAI 旗舰
Kimi K3 ≈1500 与闭源第一梯队持平;编程分榜 #1
GLM-5.2 1483 开源
DeepSeek V4 Pro 1462 开源

最值得大书特书的是编程分榜:Kimi K3 在 Frontend Code Arena 以 1679 Elo 拿下第一(Claude Fable 5 为 1631,GPT-5.6 Sol 为 1618),在 7 个子领域中拿下 6 个第一。这是开源模型首次在 Arena 系列榜单上登顶——上一代 K2.6 还在第 18 名,一代提升了 17 个位次。

3.3 专项能力对比(Moonshot 官方数据 + 第三方整理)

评测项 Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
SWE Marathon(超长时序开发) 42(第1) 35 39 40
Program Bench(软件逆向) 77.8(第1) 76.8 77.6 71.9
Terminal-Bench 2.1(终端运维) 88.3 84.6 88.8 84.6
FrontierSWE(高难度软工) 81.2 86.6 71.3 66.7
BrowseComp(网页深度调研) 91.2(SOTA) 88.0 90.4 84.3
Automation Bench(办公自动化) 30.8(第1) 29.1 29.7 27.2
SpreadsheetBench 2(Excel 建模) 第1
GPQA-Diamond(科学推理) 93.5 92.6 94.1 91.0
MMMU-Pro(视觉推理) 81.6 81.2 83.0 78.9
OmniDocBench(文档理解) 91.1(第1) 89.8 85.8 87.9

(注:部分项目各家用不同 agent 框架测试,横向对比仅供参考。)

一句话总结 K3 的能力画像:

  • 长程编程和前端开发:目前开源界无对手,多项第一;
  • 深度调研与办公自动化:BrowseComp 创下新纪录;
  • 超长文档理解:100 万 token 上下文 + 文档理解第一,适合整仓代码、大部头资料分析;
  • ⚠️ 综合体验:官方自己也承认,在交互细节、任务完成度的"体感"上仍略逊 Claude Fable 5 和 GPT-5.6 Sol;第三方实测输出速度约 36–55 token/s,不算快,且思考模式下 token 消耗偏多。

3.4 性价比:便宜是相对的

模型 输入($/百万 token) 输出($/百万 token) 缓存命中输入
Kimi K3 3.0 15.0 0.30
Claude Fable 5 10.0 50.0
Claude Opus 4.8 5.0 25.0
GPT-5.6 Sol 5.0 30.0
Kimi K2.6 0.95 4.0 0.16

国内官方定价为输入 ¥20/百万 token、输出 ¥100/百万 token、缓存命中 ¥2/百万 token。

K3 的价格约为 Claude Fable 5 的 1/3,但比自家 K2.6 贵了 4–5 倍。关键省钱技巧是缓存:编程场景下官方称缓存命中率可超 90%,命中部分输入价打一折,OpenRouter 实测有效输入成本约 $0.55/百万 token。第三方测算,同样一轮 agent 编码任务(10 万输入 + 2 万输出),K3 约 $0.60,Fable 5 约 $2.00。


四、在哪里可以用上 Kimi K3?

这是大家最关心的部分,也是我最近一直在找的,记录在这里分享给大家,按门槛从低到高排列:

4.1 WorkBuddy(最省心的方式之一)

https://www.workbuddy.cn/ (WorkBuddy 邀请链接)

为什么不是首推 Kimi 官网呢?因为现在压根就不开放,不知道什么时候开放订阅,等了有 2 周了我。除非你是 Kimi 的老会员,可以直接跳过哈哈。

WorkBuddy 已经内置接入 Kimi K3——你现在正在阅读的这段对话,背后跑的就是 Kimi K3。对于不想折腾 API key、不想研究参数的普通用户和办公场景,打开 WorkBuddy 直接用即可:写文档、做表格、读 PDF、跑代码、生成网页,K3 的长上下文和 Agent 能力在 WorkBuddy 里是开箱即用的状态。这也是国内用户零门槛体验 K3 完整能力的最短路径之一。

4.2 Kimi 官方产品矩阵

https://kimi.com

  • Kimi 网页版 / App(kimi.com / kimi.moonshot.cn):注册即可对话,免费额度有上下文和频率限制,会员解锁完整 1M 上下文;
  • Kimi Work:桌面端知识工作环境(Windows / Apple 芯片 Mac,3.1.0 版本起);
  • Kimi Code:终端编程 Agent,npm i @moonshot-ai/kimi-code 安装,用 /model 切换到 K3。

4.3 官方 API(开发者)

  • 平台:platform.moonshot.cn(国内)/ platform.kimi.ai(国际);
  • 完全兼容 OpenAI SDK,模型 ID 为 kimi-k3,把 base_url 指向 https://api.moonshot.ai/v1 即可迁移现有代码。
from openai import OpenAI

client = OpenAI(
    api_key="你的 API Key",
    base_url="https://api.moonshot.ai/v1"
)
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "帮我分析这段代码"}]
)

4.4 第三方平台

  • OpenRouter:模型 ID moonshotai/kimi-k3,官方同价无加价;
  • 硅基流动 SiliconFlow:国内访问友好;
  • Cloudflare Workers AI、Groq:也已上架;
  • 自部署:Hugging Face / GitHub 下载权重,支持 vLLM / SGLang,MXFP4/NVFP4 量化——但生产级部署需要 64 卡以上的超节点,普通人看看就好。

4.5 一个小提醒

K3 发布后因需求火爆,Kimi 官方会员一度暂停新购(7 月 20 日起优先保障存量用户)。如果遇到官方渠道拥挤,WorkBuddy、OpenRouter、硅基流动等都是可靠的替代入口。


五、写在最后

Kimi K3 的意义,可能要到几年后才能完全看清:

  1. 它证明了开源可以追平闭源。 2.8 万亿参数、Arena 编程榜第一、智能指数开源第一——"开源 = 二流"的时代结束了;
  2. 它证明了中国团队能做底层架构创新。 KDA 线性注意力和注意力残差不是工程堆料,而是针对"超长文本算得省、超大模型训得稳"这两个世界级难题给出的原创解法;
  3. 它把前沿能力的价格打了下来。 三分之一的 Claude 价格、人人可下载的权重,会让更多产品和研究站在 K3 的肩膀上长出来。

当然也要清醒:综合体验上它仍落后于最强的两三个闭源模型,推理速度不快,思考模式烧 token 也狠。它不是万能钥匙,但如果你面对的是长文档、整仓代码、深度调研、前端开发这类硬骨头任务,Kimi K3 就是目前开源世界能给你的最强答案——而且现在打开 WorkBuddy 就能用上。


参考资料

  1. 新华社:《新突破 中国企业发布全球最大规模的开源模型 Kimi K3》,2026-07-17
  2. Artificial Analysis Intelligence Index,2026-08 数据
  3. LMArena 排行榜,2026-08 快照
  4. Moonshot AI 官方发布材料及 Kimi K3 技术报告,2026-07
  5. PureAI / Neowin / SiliconFlow / dev.to 等第三方评测,2026-07~08

免责声明:文中跑分含厂商自报数据,不同测试框架下结果不完全可比;价格和可用渠道以各平台实时页面为准。