multi-view object motion capture pipeline产品系统Vibe Coding

我要开发同款
JasonFeiii2026年10月09日
1阅读

技术信息

语言技术
Torch
系统类型
算法模型、Linux、Web
行业分类
人工智能、机器人

作品详情

行业场景

目前具身智能行业对于动作捕捉数据的需求量很高,传统采集方法常常依赖于昂贵的硬件和低效的采集方式. 因此一套高效率与全自动的动作捕捉系统是很有价值的,可以降低采集成本并实现批量mocap数据重建. 我这个项目硬件层面是一个多目相机采集系统,可以采集手物交互视频. 算法层面: 我自研的算法可以实现高精度的每帧人手3d 关键点和mano mesh重建,和高精度的物体的重建与位姿追踪.

功能介绍

1:标准尺度物体重建: depths anything v3 输入多目相机外参可以生成metric depths, 然后多目图片通过sam3语义分割再通过mvsam3d可以重建出物体,再通过metric depths point clould即可缩放到正确的尺度.
2: hand shape and pose recon: 先对采集者做人手标定得到准确的betas, 之后针对每一个数采case, 用wilor进行2d kpts 提取并进行ransac 三角化得到3d kpts.然后用标定好的手进行mano fitting得到手的pose。
3:object pose : foundationpose 的多目改编版(充分利用有效的多目信息来实现occlusion robust tracking )

项目实现

我负责的是整个multi-view videos to hand mano params, object mesh 和 object 6d pose 的算法管线.
1:标准尺度物体重建: depths anything v3 输入多目相机外参可以生成metric depths, 然后多目图片通过sam3语义分割再通过mvsam3d可以重建出物体,再通过metric depths point clould即可缩放到正确的尺度.
2: hand shape and pose recon: 先对采集者做人手标定得到准确的betas, 之后针对每一个数采case, 用wilor进行2d kpts 提取并进行ransac 三角化得到3d kpts.然后用标定好的手进行mano fitting得到手的pose。
3:object pose : foundationpose 的多目改编版(充分利用有效的多目信息来实现occlusion robust tracking )
4: 人手和物体位姿的联合优化: 通过mv metric depths 获得的每一帧点云来共同优化手和物体的spatial interaction.

示例图片

声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!
下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态

评论