大模型推动算力需求激增,单一架构已难支撑。算力供给加速异构化:NVIDIA GPU 仍主导,昇腾、寒武纪等国产芯片快速崛起,在信创与供应链安全驱动下,"GPU + 国产 NPU"混合部署成为常态。而传统 HPC 调度体系(Slurm、PBS、LSF)面向 CPU 同质集群设计,对异构算力统一纳管、分布式训练弹性调度与碎片化处理支持不足,导致算力孤岛林立、资源利用率普遍偏低。行业正从"堆算力"转向"异构融合调度",核心命题是屏蔽硬件差异、实现跨架构统一调度与资源提效。
点击空白处退出提示
大模型推动算力需求激增,单一架构已难支撑。算力供给加速异构化:NVIDIA GPU 仍主导,昇腾、寒武纪等国产芯片快速崛起,在信创与供应链安全驱动下,"GPU + 国产 NPU"混合部署成为常态。而传统 HPC 调度体系(Slurm、PBS、LSF)面向 CPU 同质集群设计,对异构算力统一纳管、分布式训练弹性调度与碎片化处理支持不足,导致算力孤岛林立、资源利用率普遍偏低。行业正从"堆算力"转向"异构融合调度",核心命题是屏蔽硬件差异、实现跨架构统一调度与资源提效。
面向异构 AI 算力的统一计算管控平台,将 NVIDIA GPU 与国产昇腾 NPU(910B4)混合集群纳入统一管理,支撑上层 AI 训练 / 推理任务。 架构:Docker / K8s 容器化部署,Python + Django(ASGI)后端,uwsgi(HTTP)与 daphne(WebSocket)双通道进程级隔离,保障高并发下实时推送稳定性 可观测:基于 Prometheus + InfluxDB 构建覆盖 GPU / NPU / 节点的多维指标采集与时序存储体系 工程化:.pyc 字节码部署 + pythonpath 模块管理,兼顾源码保护与启动效率 成果:
职责:负责平台整体架构设计及开发,带 12 人研发团队协同交付。
技术栈与架构:Docker/K8s 容器化部署,Python + Django(ASGI)后端;uwsgi(2345)承载 HTTP、daphne(9100)专司 WebSocket;Prometheus 采集 + InfluxDB 时序存储;.pyc 字节码部署并显式配置 pythonpath;fcp_token Cookie 鉴权。集群统一纳管 NVIDIA GPU 与昇腾 NPU(910B4)混合算力。
亮点:HTTP 与 WebSocket 进程级隔离,规避长连接拖垮短请求链路;采集与存储分离的可观测体系;字节码部署兼顾源码保护与启动效率。
难点:异构算力指标体系统一。



评论