论文介绍Kimi K3,一款拥有2.8万亿总参数、每个token激活1040亿参数的混合专家模型,原生支持视觉和100万token上下文。模型采用Kimi Delta Attention、Attention Residuals与Stable LatentMoE,并结合通用、智能体和代码强化学习。论文称其相较Kimi K2实现约2.5倍整体扩展效率提升,并发布完整模型权重。
最近 24 小时暂无可用热度快照。