Kimi K3 开源:2.8万亿参数MoE架构重塑大模型效率与能力边界

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Kimi Team 正式发布 Kimi K3,一款总参数量达 2.8 万亿、激活参数为 1040 亿的混合专家(MoE)大模型。该模型原生支持视觉理解与百万级 Token 上下文窗口,通过引入 Kimi Delta Attention、Attention Residuals 及 Stable LatentMoE 技术,在仅激活 16/896 个专家的情况下,实现了较前代 K2 约 2.5 倍的缩放效率提升。训练阶段融合通用、智能体与编程三大领域的强化学习,支持多级推理努力,显著增强了组合泛化与长程执行能力。评估显示,Kimi K3 在长程编程、智能体、知识推理及视觉理解等任务上均达到前沿水平,虽略逊于 Claude Fable 5 和 GPT-5.6 Sol 等闭源旗舰,但全面超越其余开源及竞品。团队已开源全量权重,致力于推动前沿智能的广泛部署与开放研究。

本研究的核心贡献在于推出 Kimi K3,一个旨在缩小开源与闭源前沿模型性能差距的超大规模混合专家模型。面对当前大语言模型在上下文长度、多模态理解及复杂任务执行上的瓶颈,Kimi K3 通过架构创新与训练策略优化,实现了显著的突破。该模型不仅拥有 2.8 万亿的总参数规模,更通过高效的稀疏激活机制,使得每次推理仅需调用 1040 亿参数,从而在保持高性能的同时大幅降低计算成本。其最引人注目的特性之一是原生支持的百万 token 上下文窗口,这使其能够处理超长文档、代码库及多轮对话历史,解决了传统模型在处理长程依赖时的信息丢失问题。此外,Kimi K3 还集成了原生视觉能力,使其能够直接理解图像内容,而无需依赖外部插件或复杂的后处理流程。这一系列设计使得 Kimi K3 成为一个全能型的基础模型,旨在为开发者提供一个既强大又高效的开源替代方案,特别是在需要长上下文理解和多模态交互的高价值场景中。

通过开源全量权重,Kimi Team 期望降低前沿 AI 技术的访问门槛,促进学术界和工业界在智能体开发、自动化编程等领域的创新探索,推动整个社区向更开放、更透明的方向发展。在技术实现层面,Kimi K3 依赖于几项关键的底层架构创新,这些创新共同构成了其高性能的基础。首先是 Kimi Delta Attention 机制与 Attention Residuals 的结合。传统的注意力机制在处理超长序列时,往往面临计算复杂度随序列长度平方增长的问题,且信息在深层网络中容易衰减。Kimi K3 通过引入 Delta Attention,优化了注意力权重的计算方式,使得模型能够更高效地捕捉长距离依赖关系。同时,Attention Residuals 的引入进一步改善了信息在模型深度方向上的流动,确保浅层语义信息能够无损地传递到深层,从而提升了模型对细微语义变化的敏感度。

其次是 Stable LatentMoE 架构。该架构将传统的 MoE 设计进行了优化,将专家数量扩展至 896 个,但通过智能的路由策略,每个 token 仅激活其中的 16 个专家。这种极致的稀疏性不仅大幅降低了推理时的内存占用和计算延迟,还通过增加专家总数提升了模型的容量和多样性。为了支撑这一庞大的模型规模,Kimi K3 还采用了算法与系统协同设计的方法,实现了专家并行训练的完美平衡,并引入了高效的内存管理策略,确保了训练过程的稳定性和可扩展性。这些技术细节共同作用,使得 Kimi K3 在保持高吞吐量的同时,实现了比前代模型 K2 约 2.5 倍的缩放效率提升。实验评估部分,Kimi K3 在多个权威基准测试中展示了其卓越的性能。

评估范围涵盖了长程编程、智能体任务、知识问答、逻辑推理以及视觉理解等多个维度。在长程编程任务中,得益于百万 token 的上下文窗口,Kimi K3 能够理解并生成基于整个代码库的复杂修改建议,显著优于仅能处理局部代码的竞品模型。在智能体任务方面,模型展现了强大的长程执行能力,能够在多步交互中保持目标一致性,有效完成需要长时间规划的任务。知识推理和视觉任务同样表现出色,模型能够准确提取长文档中的关键信息并进行逻辑推导,同时也能对复杂图像进行细致的语义分析。值得注意的是,尽管 Kimi K3 的整体性能目前仍略逊于 Claude Fable 5 和 GPT-5.6 Sol 等最新闭源旗舰模型,但在大多数评估指标上,它全面超越了其他开源模型及部分闭源模型,证明了其在开源领域的领先地位。消融实验进一步验证了 Kimi Delta Attention 和 Stable LatentMoE 的有效性,移除这些组件会导致性能显著下降。

此外,训练数据的质量和多样性对最终效果影响巨大,精心设计的训练配方使得模型在泛化能力上有了质的飞跃。这些结果不仅验证了 Kimi K3 的技术先进性,也为后续大模型架构设计提供了宝贵的参考依据。从行业影响来看,Kimi K3 的开源对于推动前沿人工智能技术的普及具有深远意义。首先,它为研究人员和开发者提供了一个接近闭源最强水平的基线模型,降低了前沿技术的研究门槛。特别是在智能体(Agentic AI)领域,Kimi K3 的长程执行能力和多模态理解能力,为构建复杂自动化工作流提供了强大的底层支持。其次,其高效的缩放效率意味着企业可以在更低的成本下部署高性能模型,加速 AI 在垂直行业的落地应用,如法律文档分析、代码辅助生成、医疗影像解读等。此外,Kimi K3 在算法与系统协同设计方面的经验,也为大模型基础设施的优化提供了新的思路,有助于推动整个 AI 工程生态的进步。最后,通过公开模型权重和训练细节,Kimi Team 促进了学术界的透明度和可复现性,鼓励更多创新者在此基础上进行改进和扩展。这种开放共享的精神,有望加速 AI 技术的迭代速度,推动人类社会向更加智能化、自动化的未来迈进,同时也为制定更合理的 AI 伦理和安全标准提供了实践基础。

Sources

FAQ

Kimi K3 是什么?

Kimi Team 开源的 MoE 大模型,总参数 2.8 万亿、激活参数 1040 亿,原生支持百万 token 上下文窗口和视觉理解能力。

为什么 Kimi K3 值得关注?

通过 Kimi Delta Attention 和 Stable LatentMoE 技术,其缩放效率较 K2 提升约 2.5 倍,在长程编程、智能体等任务上接近闭源旗舰水平。

Kimi K3 开源对行业有什么影响?

提供接近最强闭源模型的开源基线,降低 AI 研发门槛,有望加速智能体、代码辅助等场景的落地应用。