易君召
易君召
发布于 2026-07-28 / 1 阅读
0
0

🏆 Kimi K3 正式开源:2.8 万亿参数权重开放,登顶 Hugging Face 趋势榜,全球最大开源模型易主

#AI

2026 年 7 月 27 日 · 月之暗面正式开源 · 2.8 万亿参数权重 + 技术报告 + 三大 Infra 工具 · 12 个月中 9 个月保持开源规模上限

🔥 一、发布背景:一个月前登顶,一个月后开源

2026 年 7 月 27 日,月之暗面(Moonshot AI)兑现了张予彤在 K3 发布时的承诺——正式开源 Kimi K3 模型权重,同步发布技术报告,并开源支撑 K3 训练的三项关键 Infra 技术。模型发布后迅速登顶 Hugging Face 趋势榜。

时间线

7 月 17 日 ── Kimi K3 发布,2.8 万亿参数,Frontend Code Arena 登顶
7 月 18 日 ── 总裁张予彤表态「近日开放权重」
7 月 27 日 ── 🏆 正式开源,HF 趋势榜登顶

关键信息

数据

开源时间

2026 年 7 月 27 日

参数量

2.8 万亿(全球最大开源模型)

开源内容

模型权重 + 技术报告 + MoonEP / FlashKDA / AgentEnv

榜单表现

Hugging Face 趋势榜登顶

架构

KDA 混合线性注意力 + 896 专家 MoE(激活 16)

扩展效率

相比 K2 提升约 2.5 倍

⚡ 二、核心功能与性能参数

架构创新

技术

说明

🧠 KDA 混合线性注意力

Kimi Delta Attention,兼顾长上下文效率和注意力质量

🔄 注意力残差(Attention Residuals)

保持深层网络的梯度流动,支持更深的 MoE 层

🏗️ 896 专家 MoE(激活 16)

Stable LatentMoE 框架,极大扩展稀疏度

👁️ 原生视觉理解

模型原生支持多模态输入

📐 2.5 倍扩展效率

结构性改进让算力更高效地转化为模型能力

完整开源的三件套

工具

功能

状态

MoonEP

高性能通信框架

✅ 本次开源

FlashKDA

高性能 KDA 算子

✅ 此前已开源

AgentEnv

分布式 RL 训练环境

✅ 本次开源

三项技术覆盖了从高性能通信、高性能算子到分布式 RL 环境的关键链路,是 K3 从技术论文走向工程落地的核心基础设施。

与闭源模型的对比定位

月之暗面官方坦诚的表述:

层级

模型

🥇 最强闭源

Claude Fable 5 / GPT-5.6 Sol

🥈 Kimi K3

整体仍落后于前两者,但稳定超过其他所有模型

🥉 其他开源

均被 K3 超越

长程编码与视觉推理能力

能力

说明

💻 长程编码

极少人工监督下持续完成长时间工程任务、理解和处理大型代码库、协调使用终端工具

👁️ 视觉+代码融合

结合截图和视觉反馈优化游戏开发、前端和 CAD 等场景

🌍 三、开源规模对比:全球最大开源模型

开源模型参数规模演进

时间

模型

参数规模

2024

Llama 3.1

4,050 亿

2025

DeepSeek V3

6,710 亿

2025

Kimi K2

1 万亿

2026.06

DeepSeek V4

1.5 万亿

2026.07

Kimi K3 🏆

2.8 万亿

月之暗面官方指出:过去 12 个月中的 9 个月里,Kimi 模型都保持着开源模型的规模上限。

开源 vs 闭源差距

Kimi K3 2.8万亿开源
    ↓ 整体仍落后
Claude Fable 5(闭源)- Frontend Code Arena 被 K3 超越
GPT-5.6 Sol(闭源)- 部分维度被 K3 超越

🔑 关键判断: K3 不是最强模型,但它是最强的开源模型。当开源模型达到 2.8 万亿参数时,开源与闭源的「能力差距」正在被快速填平。

🏭 四、产业生态:0day 适配全面开启

开源发布后,国内主流 AI 基础设施厂商实现了0day 适配

企业

适配内容

阿里云

灵骏真武 M890 超节点实例已支持 K3

华为

昇腾 0day 支持 K3 的训练适配及推理部署

LM Studio

Bionic 智能体工具新增 K3 支持并公布定价方案

这意味着 K3 发布即可用,开发者无需等待——从云端到终端、从训练到推理、从华为昇腾到阿里云,全链路就绪。

📊 五、产业战略意义

1️⃣ 验证了「大参数 + 大稀疏 + 开源」路线

K3 证明了:2.8 万亿参数 + 896 专家 MoE + 完整开源的三位一体模式是可行的。这为后续更大规模的开源模型铺平了道路。

2️⃣ 开源生态从「追随者」到「引领者」

过去中国开源模型常被贴上「便宜但不够强」的标签。K3 改变了这一格局——它是全球最强的开源模型,而它来自中国。

月之暗面开源的不仅是权重,更是全套训练基础设施(MoonEP / FlashKDA / AgentEnv),这意味着其他团队可以直接复用这些技术来训练类似规模的模型。

3️⃣ 中美 AI 开源格局的此消彼长

维度

中国开源

美国开源

最大模型

Kimi K3 2.8 万亿 🏆

Llama 4 ~2 万亿

代表机构

月之暗面、DeepSeek、智谱、Qwen

Meta、Mistral

关键特征

MoE 大稀疏、参数规模领先

通用架构、生态完善

趋势

规模 + 效率双轮驱动

更注重生态和社区

⚠️ 六、不足与差距

问题

说明

程度

仍落后于最强闭源模型

K3 整体不如 Claude Fable 5 和 GPT-5.6 Sol

🟡 明确差距

推理成本高

2.8 万亿参数的推理需要顶尖硬件

🟡 使用门槛

生态成熟度

与 Llama 生态的插件/工具链仍有差距

🟡 建设期

权重文件巨大

模型下载和部署需要极强网络和存储

🟢 工程问题

海外影响力

HF 趋势登顶是开端,社区生态仍需时间积累

🟢 自然

端侧部署困难

2.8 万亿参数不适合边缘设备

🟢 定位不同

🔮 七、未来演进方向

阶段

方向

🚀 短期(2026 下半年)

社区生态建设、推理优化、API 部署方案完善

🧠 中期(2027)

追赶闭源模型差距、多模态能力增强、Agent 能力深化

🏆 长期

从「最大开源」到「最强模型」、从 2.8 万亿到更大的参数规模

月之暗面总裁张予彤此前已表态:Scaling Law 仍然有效,模型的智能极限还远未被触及。

📌 八、总结

Kimi K3 正式开源是中国 AI 开源史上的里程碑事件。它以 2.8 万亿参数成为全球最大的开源模型,凭借 KDA 混合注意力 + 896 专家 MoE 的创新架构实现了 2.5 倍的扩展效率提升,并通过开源 MoonEP、FlashKDA、AgentEnv 三大 Infra 工具,将训练能力回馈给整个开源社区。

三个核心信号

  1. 🏆 全球最大开源模型来自中国——12 个月中 9 个月由 Kimi 保持开源规模上限,这不是偶发,是体系性优势

  2. 🏆 权重 + 技术 + Infra 三位一体开源——月之暗面不只是「给鱼」,还「给了渔」——全套训练基础设施一并开源

  3. 🏆 开源的 2.8 万亿离闭源前沿已经不远——K3 虽仍不及 Fable 5,但差距在缩小。当开源模型达到这个体量时,闭源的优势窗口正在关闭

一句话总结

Kimi K3 开源的意义不仅是「最大」,更是「最高质量的开源」——权重、技术报告、训练基础设施三位一体。当一个 2.8 万亿参数的模型愿意把全部身家交给社区,中国 AI 开源的历史翻开了新的一页。


评论