2026年4月24日,寒武纪宣布第一时间完成对DeepSeek-V4系列285B与1.6T版本的Day0适配,代码已开源。此次合作结合寒武纪NeuWare生态和芯片设计优势,实现快速迁移与极致性能优化,大幅提升推理效率。此举标志国产模芯软硬件协同创新再突破,为大模型部署提供更高效方案。
|
今日上午,DeepSeek-V4 终于正式登场,而第一时间,寒武纪便给予 vLLM 推理框架,完成了对 285B DeepSeek-V4-flash 和 1.6T DeepSeek-V4-pro 两个版本的 Day0 适配,适配代码已开源到 GitHub 社区。
这并非一日之功。背后是寒武纪长期积累的自研 NeuWare 软件生态与芯片设计能力,也是公司持续推动“芯片+算法”联合创新的又一次落地。 此前,寒武纪已对 DeepSeek 系列模型进行了深入的软硬件协同性能优化,在算力利用率上达到业界领先水平。本次围绕 DeepSeek-V4 的适配工作,主要从“快速模型迁移”和“极致性能优化”两个维度展开。 快速迁移,实现Day 0首发 在软件生态层面,寒武纪 NeuWare 全面拥抱开源社区,原生支持 PyTorch、vLLM、Diffusers 等主流 AI 框架,新模型可快速迁移至寒武纪平台。 同时,公司与众智FlagOS生态持续深度合作,解耦模型与不同芯片架构之间的生态壁垒,进一步降低适配成本。 算子开发方面,寒武纪借助Triton良好的兼容性与易用性进行快速算子开发,缩短功能适配周期。此外,团队自研了代码生成智能体CNAgent,实现了算子生成与模型迁移的全流程加速。 硬件层面,寒武纪芯片原生支持主流低精度数据格式,无需额外转换即可完成功能适配与精度验证。软硬件协同之下,模型在发布当日即实现稳定运行,真正做到Day 0适配。
性能优化,释放推理潜能 针对DeepSeek-V4的新结构,寒武纪通过自研高性能融合算子库Torch-MLU-Ops,对Compressor、mHC等模块进行专项加速;并利用BangC高性能编程语言,编写稀疏/压缩Attention、GroupGemm等热点算子的极致优化Kernel,充分释放底层硬件性能。 在推理框架层面,寒武纪在vLLM中全面支持TP/PP/SP/DP/EP 5D混合并行、通信计算并行、低精度量化以及PD分离部署等优化技术。通过策略优化,在满足延时约束的同时达到最佳词元吞吐量,显著提升端到端推理效率。 硬件特性也被深度挖掘:利用MLU的访存与排序加速能力,有效加速稀疏Attention、Indexer等模块;借助高互联带宽与低通信延迟,将Prefill和Decode两种负载场景下的通信占比降至最低,最大化分布式推理利用率。 正是这种软硬件一体化的设计思路,让寒武纪能够在大模型部署中持续降低算力成本、提升性能上限。未来,寒武纪将继续深耕大模型软硬件协同生态,为开发者与客户提供更快、更省、更高效的大模型部署方案。 |
IT百科
热门搜索
网友评论
甄选好物


