当前多模态大模型训练面临显存瓶颈与并行效率低的问题,传统单卡或简单数据并行难以支撑超大参数量与视觉编码器的协同训练。本项目旨在解决多模态训练中视觉 Encoder 与语言模型并行策略不匹配、CP分片下视觉特征映射错乱等工程痛点。
点击空白处退出提示
当前多模态大模型训练面临显存瓶颈与并行效率低的问题,传统单卡或简单数据并行难以支撑超大参数量与视觉编码器的协同训练。本项目旨在解决多模态训练中视觉 Encoder 与语言模型并行策略不匹配、CP分片下视觉特征映射错乱等工程痛点。
多模态分布式训练模块:负责 Qwen3-VL-MoE 模型的训练接入,支持视觉 Encoder 独立 DP/CP 并行配置,实现模型构建、并行策略配置、训练样例生成及保存恢复流程。同时改造视觉塔与 DeepStack 特征处理逻辑,修复 CP 分片下的视觉特征映射问题。实现视觉 Encoder 独立并行配置,支持多种 CP 路径,提升多模态训练稳定性。
负责 Qwen3-VL-MoE 训练接入,完成模型构建、并行策略配置、训练样例与保存恢复流程。
实现视觉 Encoder 独立 DP/CP 并行配置,支持 PureColossal、PureUlysses 与异步 CP 路径。
改造 Qwen3-VL 视觉塔与 DeepStack 特征处理逻辑,修复 CP 分片下视觉特征映射问题。



评论