硬件研发集群云化升级项目产品系统

我要开发同款
阿灿2026年07月30日
6阅读

技术信息

语言技术
Linux
系统类型
Linux
行业分类
云计算

作品详情

行业场景

芯片/硬件研发是典型的“重算力、重协同”场景:几十名研发、上百个工程并行跑仿真与综合,底层高度依赖一整套集群基础服务——

NIS(网络信息服务,统一账号与主机名解析)
NFS/LIC(共享存储与工具 license 授权)
LSF(作业调度,队列如 normal / sim / bk)
这些服务只要有一个停摆,整条研发链路就断。

公司现存环境过度依赖A这一台物理服务器:NIS、NFS、LIC、APP 四大关键服务全部由它承担,同时它还对外提供 VNC 登录。随着研发人员和工程数量持续增长,这套“四合一”架构暴露出几个硬伤:

硬件过保: A保修已逾期,单点宕机即全局不可用。
无高可用:NIS / APP / LIC 同机单 master,任一服务故障 → 整个集群瘫痪,直接影响开发进度。
VNC 抢占致服务被杀:该机同时跑 VNC,内存过高时系统 OOM 可能误杀 NIS / APP / LIC,同样导致全集群失效。
CentOS 会话数限制:会话超上限必须重启清缓存,会话过多还会排队,拉低研发效率。

将核心服务从“单机裸金属”迁移到“云主机 + 专业存储”,是硬件研发基础设施的主流演进方向——用虚拟化层的冗余与弹性,消除单点故障、平滑扩容,并把 CAPEX(物理服务器采购)转为更可控的 OPEX。本项目即在此背景下立项。

功能介绍

1、关键服务双活 NIS、LIC 采用双活云主机,故障自动切换,可靠性显著提升
2、弹性登录节点 登录节点由 5 台扩展为 7 台,分摊会话压力,降低 dbus 会话总线瓶颈
3、APP 与存储解耦 APP 工具不再落盘于物理机,改由专业存储提供,工具可用性不再受主机故障牵连
4、宿主机故障迁移 云主机所在宿主机性能达阈值时,自动漂移至健康物理服务器,业务无感
5、快照秒级恢复 云主机具备快照机制,数据安全增强,故障时可在极短时间内恢复业务
6、降本增效 减少物理服务器资金投入,集群可扩展性大幅增强

项目实现

阶段一:准备登录环境
1.1 登录环境 ,包含 .ssh、.cshrc、user.cshrc、.vnc 等初始化文件。
1.2 NIS / LIC 关键服务双活部署。
1.3 APP 工具经存储访问,已完成稳定性测试与验证。
1.4 已提前将测试1、测试2机器 切换至新环境,研发实测一周以上,问题全部闭环。
阶段二:旧环境登录机停服
2.1关停旧机器退出登录服务。

阶段三:计算节点停机迁移(全量操作)
3.1 存储数据挂载:切换计算节点,执行新挂载点访问新存储。
3.2 NIS 环境迁移:将旧 NIS 并入新 NIS 环境。
3.3 LSF 服务配置:安装配置新 LSF,含 normal / sim / bk 等队列。
3.4 堡垒机切换:原堡垒机(测试机 2.62)切换为新环境服务器 2.62 并完成配置。
3.5 下架四合一机器:192.168.0.60~192.168.0.67(2 台 Dell 四合一)退役。

回退预案(四步)
若云化方案无法满足使用或出现无法解决的技术问题,可回退至旧环境:
存储数据挂载回退:home 数据挂回原位置。
NIS 环境回退:NIS 配置恢复至旧环境设置。
LSF 服务回退:卸载新环境 LSF,重装并配置旧环境 LSF。
堡垒机保持不变:堡垒机仅为跳板,无需回退。
##注意事项
home 下的个人数据不会自动拷贝至新环境。
旧环境的个人工程 / 作业数据,需在新环境手动迁移或重新创建。

示例图片

声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!
下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态

评论