与 BAAI 合作,在沐曦 C550 8 节点 64 卡上完成 Qwen3-0.6B、Qwen3.5-35B-A3B、Qwen3.6-35B-A3B、Qwen3.6-27B-Dense、DeepSeek-V3-16B-A3B、
DeepSeek-V4-flash-243b 在训练框架上的适配与优化工作,修复代码经甲方审核,PR 合并至 FlagOS 开源社区(4k+ stars)
设计并实现 Chunk-CE、Chunk-Linear 等显存优化算子,降低激活峰值、提升算力利用率,在 Qwen3.5-35B-A3B 上将单卡吞吐提升+71%;复现
并改进前沿工作中的 bubble-hiding 重计算、ViT 跨 PP stage 非均匀分区、FA 长序列分组负载均衡等优化思路,为 GDN、ViT 等异构模块建立统
一的 Packing time-cost model,据此设计 Packing 调度策略和蛇形发牌,实现端到端训练吞吐提升,预计 10 月投稿 Mlsys27,本人为共同一作
点击空白处退出提示









评论