本项目在 Space Robotics Bench(SRB)与 Isaac Sim 之上,基于 NVIDIA GR00T N1.6-3B,
实现了面向空间碎片捕获的视觉—语言—动作(VLA)全链路系统,另含一条移动强化学习副线。
系统功能自下而上分四层。仿真环境层自研 OrbitalManipulationEnv,组合 SRB 的轨道与操作
环境,定义场景、事件与任务配置,生成带卫星角速度与视觉扰动的碎片捕获任务。数据层由三
千余行的专家控制器构成,以分阶段状态机驱动阻尼最小二乘微分逆运动学,在基座对准、接近、
下降与夹爪闭合各阶段间切换,并引入直接关节写入规避初始位形卡死,最终采集出 199 条轨迹、
83599 条对齐样本,逐帧保留位姿、关节与控制器阶段上下文。
模型层定义 55 维可观测状态与 18 维混合动作之间的接口契约:状态涵盖卫星与末端的位姿速度、
七关节及夹爪状态;动作涵盖末端增量、夹爪与角速度指令、七关节增量及写入开关。契约由单一
模块承载,并对三份行为脚本记录哈希校验值。运行时模块负责状态抽取与动作映射,把 18 维
逻辑动作落到 SRB 原生 27 维执行层,并完成微调训练、ZMQ 推理服务与闭环 rollout;推理与
仿真进程分离,通过本地 Socket 交换观测与动作。
工程层提供四级验收:训练前自检校验数据加载器、处理器、掩码与检查点覆盖;检查点离线校验;
专家适配器回放验证;以及回合级验收与发布闸门。
工程实现上,端到端闭环运行时错误为零,末端执行器定位误差稳定在毫米量级,数据加载吞吐
相对理论峰值从 48% 提升到 91%。通过离线评估与数据分布统计的交叉验证,也明确了下一阶段
的改进方向:调整输入视角、补入控制器阶段标志与历史时序特征,并将稀疏二值动作信号拆为
独立监督分支。
点击空白处退出提示









评论