北京时间7月27日晚,月之暗面Kimi在全球开源社区HuggingFace正式发布KimiK3完整模型权重。同步公开的还有详细技术报告,以及支撑该模型训练的三项关键基础设施技术——MoonEP、FlashKDA和AgentEnv。此次开源采用修改版MIT许可证,开发者可按需下载、修改并本地部署。
KimiK3总参数规模达2.8万亿,激活参数1040亿,是全球首个迈入3万亿参数级别的开源模型。模型基于混合专家(MoE)架构,在896个路由专家中每个Token仅激活16个。架构上采用自研KimiDeltaAttention(KDA)混合线性注意力机制与AttentionResiduals(注意力残差)技术,原生支持视觉理解,上下文窗口达100万Token。相比上一代KimiK2,整体扩展效率提升约2.5倍。

技术报告披露,KimiK3在编程、智能体、推理与视觉等数十项基准测试中超越所有开源模型及多数闭源模型。在ArenaIntelligence的WebDevArena中,KimiK3以1679Elo登顶,成为首个在该榜单夺冠的开源模型;ArtificialAnalysisIntelligenceIndexv4.1得分57.1,排名全球第四。报告同时指出,其整体性能仍略逊于ClaudeFable5和GPT-5.6Sol。
此次开源尤为值得关注的是KimiK3在GPU与芯片算力层面展现的自主工程能力。
技术报告显示,在GPU内核优化测试中,KimiK3在24小时内独立完成了AttnRes、DeepSeekSparseAttention、KDA和MLA四种代表性内核的优化。其中AttnRes延迟从283.6毫秒降至114.4毫秒,DSA和KDA运行时间分别减少55.1%和73.6%,MLA接近峰值TFLOPS。该表现与ClaudeFable5持平,显著优于ClaudeOpus4.8、GPT-5.6Sol和GPT-5.5。
需注意的是,测试环境同时覆盖了NVIDIAH200与来自其他供应商的GPGPU,意味着KimiK3的部署能力已不局限于英伟达生态。
报告还显示,KimiK3自主开发了名为MiniTriton的紧凑型GPU编译器,从Python前端到PTX代码生成全链路均由模型完成,在NVIDIAL20上性能超越PyTorcheager、torch.compile和标准Triton实现。

作为早期的概念验证,技术报告披露KimiK3在48小时自主运行中,基于开源EDA工具和Nangate45nm工艺库,完成一款推理芯片原型的设计、优化与验证。该芯片面积仅4平方毫米,集成146万个标准单元、0.277MBSRAM及带融合去量化的INT4MAC阵列,是一款由模型设计、为模型服务的芯片,标志着AI已具备从算法到硬件的全栈自主工程能力。
与模型权重同步开源的还有三项基础设施技术:MoonEP是为超大规模MoE设计的高性能专家并行通信库,可实现完美负载均衡;FlashKDA是KDA注意力机制的高性能算子,在英伟达H20上预填充速度相比基线提升1.72至2.22倍;AgentEnv是与KVCache.ai合作开发的智能体沙箱系统,支持快速快照、恢复与Fork,用于大规模Agent训练环境。
月之暗面表示,此次开源旨在加速前沿智能的部署与普及,促进AGI研究。随着KimiK3完整权重、技术报告及核心Infra技术的同步开放,开源大模型正式迈入2.8万亿参数阶段。
本文内容由互联网用户自发贡献,该文观点仅代表作者本人。如发现本站有涉嫌抄袭侵权/违法违规的内容,请发送邮件至 203304862@qq.com
本文链接:https://jinnalai.com/jiaodian/845272.html
