Kimi K3:基於2.8兆參數混合專家架構的前沿開源大模型
Kimi Team 發布 Kimi K3,一款 2.8 兆總參數的混合專家(MoE)大模型,激活參數達 1040 億,原生支援視覺能力與百萬級 token 上下文視窗。模型引入 Kimi Delta Attention 與 Attention Residuals 以優化長序列及深度網路中的資訊流動,配合 Stable LatentMoE 技術,在每 token 僅激活 16/896 個專家的情況下,實現較 K2 約 2.5 倍的縮放效率提升。訓練階段融合通用、智能體與程式設計三大領域的強化學習,支援多級推理努力,顯著提升組合泛化與長程執行能力。評估結果顯示,Kimi K3 在長程程式設計、智能體、知識推理、邏輯推理及視覺理解等任務上均達到前沿水準,雖略遜於 Claude Fable 5 與 GPT-5.6 Sol 等閉源旗艦模型,但全面超越其餘開源及競品。團隊已開源全量權重,致力於推動前沿智能的廣泛部署與開放研究。
本研究的核心贡献在于推出 Kimi K3,一个旨在缩小开源与闭源前沿模型性能差距的超大规模混合专家模型。面对当前大语言模型在上下文长度、多模态理解及复杂任务执行上的瓶颈,Kimi K3 通过架构创新与训练策略优化,实现了显著的突破。该模型不仅拥有 2.8 万亿的总参数规模,更通过高效的稀疏激活机制,使得每次推理仅需调用 1040 亿参数,从而在保持高性能的同时大幅降低计算成本。其最引人注目的特性之一是原生支持的百万 token 上下文窗口,这使其能够处理超长文档、代码库及多轮对话历史,解决了传统模型在处理长程依赖时的信息丢失问题。此外,Kimi K3 还集成了原生视觉能力,使其能够直接理解图像内容,而无需依赖外部插件或复杂的后处理流程。这一系列设计使得 Kimi K3 成为一个全能型的基础模型,旨在为开发者提供一个既强大又高效的开源替代方案,特别是在需要长上下文理解和多模态交互的高价值场景中。
通过开源全量权重,Kimi Team 期望降低前沿 AI 技术的访问门槛,促进学术界和工业界在智能体开发、自动化编程等领域的创新探索,推动整个社区向更开放、更透明的方向发展。在技术实现层面,Kimi K3 依赖于几项关键的底层架构创新,这些创新共同构成了其高性能的基础。首先是 Kimi Delta Attention 机制与 Attention Residuals 的结合。传统的注意力机制在处理超长序列时,往往面临计算复杂度随序列长度平方增长的问题,且信息在深层网络中容易衰减。Kimi K3 通过引入 Delta Attention,优化了注意力权重的计算方式,使得模型能够更高效地捕捉长距离依赖关系。同时,Attention Residuals 的引入进一步改善了信息在模型深度方向上的流动,确保浅层语义信息能够无损地传递到深层,从而提升了模型对细微语义变化的敏感度。
其次是 Stable LatentMoE 架构。该架构将传统的 MoE 设计进行了优化,将专家数量扩展至 896 个,但通过智能的路由策略,每个 token 仅激活其中的 16 个专家。这种极致的稀疏性不仅大幅降低了推理时的内存占用和计算延迟,还通过增加专家总数提升了模型的容量和多样性。为了支撑这一庞大的模型规模,Kimi K3 还采用了算法与系统协同设计的方法,实现了专家并行训练的完美平衡,并引入了高效的内存管理策略,确保了训练过程的稳定性和可扩展性。这些技术细节共同作用,使得 Kimi K3 在保持高吞吐量的同时,实现了比前代模型 K2 约 2.5 倍的缩放效率提升。实验评估部分,Kimi K3 在多个权威基准测试中展示了其卓越的性能。
评估范围涵盖了长程编程、智能体任务、知识问答、逻辑推理以及视觉理解等多个维度。在长程编程任务中,得益于百万 token 的上下文窗口,Kimi K3 能够理解并生成基于整个代码库的复杂修改建议,显著优于仅能处理局部代码的竞品模型。在智能体任务方面,模型展现了强大的长程执行能力,能够在多步交互中保持目标一致性,有效完成需要长时间规划的任务。知识推理和视觉任务同样表现出色,模型能够准确提取长文档中的关键信息并进行逻辑推导,同时也能对复杂图像进行细致的语义分析。值得注意的是,尽管 Kimi K3 的整体性能目前仍略逊于 Claude Fable 5 和 GPT-5.6 Sol 等最新闭源旗舰模型,但在大多数评估指标上,它全面超越了其他开源模型及部分闭源模型,证明了其在开源领域的领先地位。消融实验进一步验证了 Kimi Delta Attention 和 Stable LatentMoE 的有效性,移除这些组件会导致性能显著下降。
此外,训练数据的质量和多样性对最终效果影响巨大,精心设计的训练配方使得模型在泛化能力上有了质的飞跃。这些结果不仅验证了 Kimi K3 的技术先进性,也为后续大模型架构设计提供了宝贵的参考依据。从行业影响来看,Kimi K3 的开源对于推动前沿人工智能技术的普及具有深远意义。首先,它为研究人员和开发者提供了一个接近闭源最强水平的基线模型,降低了前沿技术的研究门槛。特别是在智能体(Agentic AI)领域,Kimi K3 的长程执行能力和多模态理解能力,为构建复杂自动化工作流提供了强大的底层支持。其次,其高效的缩放效率意味着企业可以在更低的成本下部署高性能模型,加速 AI 在垂直行业的落地应用,如法律文档分析、代码辅助生成、医疗影像解读等。此外,Kimi K3 在算法与系统协同设计方面的经验,也为大模型基础设施的优化提供了新的思路,有助于推动整个 AI 工程生态的进步。最后,通过公开模型权重和训练细节,Kimi Team 促进了学术界的透明度和可复现性,鼓励更多创新者在此基础上进行改进和扩展。这种开放共享的精神,有望加速 AI 技术的迭代速度,推动人类社会向更加智能化、自动化的未来迈进,同时也为制定更合理的 AI 伦理和安全标准提供了实践基础。