T2S-MotionTok是一个基于离散动作标记的文本生成手语项目,主要用于将德语文本自动转换为三维手语动作序列。项目采用“文本输入、手语词汇序列生成、动作标记预测、三维姿态解码”的处理流程,结合深度学习和人体动作建模技术,实现从自然语言到连续手语骨架动作的转换,为智能手语生成、无障碍交流和人体动作合成提供技术支持。
项目的核心功能是手语动作生成与重建。系统首先将德语文本转换为手语词汇标注序列(Gloss),再利用动作生成模型预测对应的离散动作标记,最终解码生成连续的三维人体姿态序列。在动作编码方面,项目采用残差向量量化(RVQ)技术,通过训练动作分词器,将复杂的三维人体运动压缩为离散标记,实现动作信息的高效表示与重建。在动作预测方面,系统引入对齐感知的动作先验模型,建立手语词汇与动作序列之间的对应关系,并结合粗粒度动作预测和细节动作预测机制,提高生成动作的完整性与细节表现能力。
项目还具备动作时长控制与校准功能,可结合预测的手语词汇时长统计信息调整动作序列长度,改善动作节奏和连续性。同时支持三维姿态序列解码、骨架数据导出、动作可视化、姿态对比GIF生成以及典型样本筛选,便于观察和分析生成效果。此外,项目提供模型评估与实验分析工具,支持生成结果对比、消融实验、动作时长参数分析和运动质量诊断,并可导出CSV、Markdown格式的实验报告。项目基于Python和PyTorch开发,主要面向手语生成与三维动作建模研究。
点击空白处退出提示









评论