洱海新闻

Kimi K3开源:海外热议,华为阿里等国产算力已适配

来源:洱海新闻 分类:科技
Kimi K3开源:海外热议,华为阿里等国产算力已适配

7月27日深夜,月之暗面(Moonshot AI)将Kimi K3模型的权重正式开源,同步发布技术报告,连同支撑模型训练的三项关键基础设施技术——MoonEP、FlashKDA和AgentEnv一同放出。这款总参数量达2.8万亿的混合专家(MoE)模型,开创了全球首个开源的3万亿级别模型先河,同时也是至今参数规模最大的开源模型。

K3模型的开放在全球开发者社区引发热烈反响。Hugging Face CEO Clem Delangue发文称,Kimi K3发布后仅仅30分钟便收获超过4000个点赞,迅速登顶平台Trending榜首,创下平台迄今为止最快的发布增长纪录。上线前半小时,已有近3700名开发者排队等待下载。

北美AI基础设施公司OsmanticAI的创始人兼CEO Ahmad将Kimi K3比作“本地版Fable 5”,强烈建议大家下载体验,表示这样“他们永远也夺不走我的Fable 5”了。美国AI企业Cognition宣布Kimi K3接入Devin桌面客户端与命令行工具,并提到:“在FrontierCode 1.1评测基准上,Kimi K3是我们检测过性能逼近前沿水准的开源模型。”

Kimi K3模型的开放

Kimi K3模型的开放后,国产算力迅速展开适配工作。

华为计算表明,Kimi K3一经开源公布,昇腾便达成0day兼容:在训练端,依托MindSpeed MM在Atlas 800 A3、Atlas 900 A3 SuperPoD上实现训练复现,于算子、并行加速、显存优化方面进行专项改善;在推理端,通过vLLM Ascend与 SGLang开源推理引擎进行快速部署,并且,昇腾950超节点支援FP8、MXFP8、MXFP4等全套数值精度格式,原生支持Kimi K3的mxFP4量化权重。

阿里云也发布消息,称其真武M890超节点实例已完成Day0适配Kimi K3,指出这是国内首个成功运行近3万亿参数模型的超节点。千问AI平台和阿里云百炼也将提供Kimi K3的模型API。

Kimi K3是业界参数规模最大的模型之一,要让这一规模的模型顺利运行,需将参数分散到几十张乃至上百张高速互联的GPU卡上,让万亿参数“又稳又快”。但普通AI集群由于通信带宽的限制,难满足高吞吐、低延迟、高并发的需求。

阿里云透露,为提高Kimi K3的运作效率,阿里云、平头哥与Kimi团队在软件栈、算子等层面进行了深度联合适配。比如,真武M890对Kimi K3模型架构的核心算子进行了优化,大幅提升推理的算力及带宽利用率,能够稳定支持最长1M上下文,轻松应对长文档解析、复杂推理等情境。测试数据表明,适配后的模型首Token时延削减约35%,单卡解码吞吐增长1.8倍。

华为超节点

Kimi K3专为长程编程、知识作业和推理等尖端智能应用场景而建造。模型以KDA混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉解析,并具有100万token上下文窗口,在维持顶尖性能的同时,把KV Cache压缩75%,使长上下文解码速度最高加快6.3倍,显著改善了训练与推理的效能及成本。

海外AI基础设施供应商同样快速响应。Nebius、Baseten、Fireworks等供应商随即宣布Day 0适配Kimi K3。Nebius评价:“Kimi K3是首个达到前沿性能的开放权重模型,标志着开放模型发展历程的一次重大进步。”

Modal、Together

相关推荐