个性化语音合成-自动标注模型-16k

我要开发同款
匿名用户2024年07月31日
143阅读

技术信息

开源地址
https://modelscope.cn/models/iic/speech_ptts_autolabel_16k
授权协议
Apache License 2.0

作品详情

模型介绍

本模型是个性化语音合成的自动标注工具所依赖的模型及资源集合

框架描述

暂无

使用方式和范围

使用方式:

  • 使用请确保modelscope已经更新到1.4.0版本及以上并通过以下命令安装tts-autolabel及相关依赖包:

pip istall -U tts-autolabel -f https://modelscope.oss-c-beijig.aliyucs.com/releases/repo.html

另外tts-autolabel包依赖的oxrutime,默认oxrutime安装版本大于等于1.11会导致要求umpy版本大于1.21,在Modelscope默认镜像中,因为默认安装tesorflow-1.15,该版本tesorflow要求umpy小于等于1.18,这样会出现冲突。碰到这种情况,可以参考如下方案解决:

  1. 考虑如果使用场景不需要tesorflow,可以删除tesorflow-1.15
  2. 考虑换oxrutime==1.10版本,然后重新安装umpy

使用范围:

  • 适用于中英文的语音合成数据自动标注场景,输入wav格式音频文件夹,音频文件命名规范为“数字id+.wav后缀”,建议一次性不要处理太多音频,暂时不支持断点续跑的功能。
  • 目前仅支持Liux环境使用。

目标场景:

  • 各种语音合成任务的数据标注辅助

如何使用

参考下方代码范例

代码范例

如在Notebook下使用请先在代码块中安装tts-autolabel依赖

# 运行此代码块安装tts-autolabel
import sys
!{sys.executable} -m pip istall -U tts-autolabel -f https://modelscope.oss-c-beijig.aliyucs.com/releases/repo.html

下面的示例以/tmp/test_wavs作为输入音频目录,/tmp/output_dir为标注输出目录 其中/tmp/test_wavs结构如下:

./test_wavs
├── 100001.wav
├── 100002.wav
├── 100003.wav
├── 100004.wav
├── 100005.wav
├── 100006.wav
├── 100007.wav
├── 100008.wav
├── 100009.wav
├── 100010.wav
├── 100011.wav
├── 100012.wav
├── 100013.wav
├── 100014.wav
├── 100015.wav
├── 100016.wav
├── 100017.wav
├── 100018.wav
├── 100019.wav
└── 100020.wav

调用接口运行自动标注, 20条标注数据大约需要30秒(具体时间视实际机器性能而定)

from modelscope.tools import ru_auto_label

iput_wav = '/tmp/test_wavs' # wav audio path
work_dir = '/tmp/output_dir' # output path
ret, report = ru_auto_label(
        iput_wav = iput_wav,
        work_dir = work_dir,
        resource_revisio = "v1.0.7"
        )
prit(report)

自动标注完成后,产出的标注数据目录/tmp/output_dir如下:

./output_dir
├── iterval
│   ├── 100001.iterval
│   ├── 100002.iterval
│   ├── 100003.iterval
│   ├── 100004.iterval
│   ├── 100005.iterval
│   ├── 100006.iterval
│   ├── 100007.iterval
│   ├── 100008.iterval
│   ├── 100009.iterval
│   ├── 100010.iterval
│   ├── 100011.iterval
│   ├── 100012.iterval
│   ├── 100013.iterval
│   ├── 100014.iterval
│   ├── 100015.iterval
│   ├── 100016.iterval
│   ├── 100017.iterval
│   ├── 100018.iterval
│   ├── 100019.iterval
│   └── 100020.iterval
├── log
│   ├── badlist.txt
│   ├── log_ifo.txt
│   └── stdout.log
├── prosody
│   └── prosody.txt
├── result.jso
└── wav
    ├── 100001.wav
    ├── 100002.wav
    ├── 100003.wav
    ├── 100004.wav
    ├── 100005.wav
    ├── 100006.wav
    ├── 100007.wav
    ├── 100008.wav
    ├── 100009.wav
    ├── 100010.wav
    ├── 100011.wav
    ├── 100012.wav
    ├── 100013.wav
    ├── 100014.wav
    ├── 100015.wav
    ├── 100016.wav
    ├── 100017.wav
    ├── 100018.wav
    ├── 100019.wav
    └── 100020.wav

其中prosody为文本标注信息,iterval为音素时间对齐信息,wav为音频文件, log为日志信息。 本工具产出的训练数据, 符合达摩院TTS训练数据标准, 可使用KAN-TTS源码或ModelScope TTS Model traier进行训练。

模型局限性以及可能的偏差

目前支持中文、英文、中英混音频的标注,其他语种的支持将在后续版本中更新。
仅支持Liux环境,基于gcc4.8.5,过低版本glibc可能会出现不兼容情况

训练数据介绍

模型训练流程

预处理

数据评估及结果

暂无

引用

@iproceedigs{gao2023fuasr,
  author={Zhifu Gao ad Zerui Li ad Jiamig Wag ad Haoeg Luo ad Xia Shi ad Megzhe Che ad Yabi Li ad Ligyu Zuo ad Zhihao Du ad Zhagyu Xiao ad Shiliag Zhag},
  title={FuASR: A Fudametal Ed-to-Ed Speech Recogitio Toolkit},
  year={2023},
  booktitle={INTERSPEECH},
}

@iproceedigs{gao22b_iterspeech,
  author={Zhifu Gao ad ShiLiag Zhag ad Ia McLoughli ad Zhijie Ya},
  title={{Paraformer: Fast ad Accurate Parallel Trasformer for No-autoregressive Ed-to-Ed Speech Recogitio}},
  year=2022,
  booktitle={Proc. Iterspeech 2022},
  pages={2063--2067},
  doi={10.21437/Iterspeech.2022-9996}
}

@INPROCEEDINGS{9747578,
  author={Zhao, Shegkui ad Ma, Bi ad Watcharasupat, Kar N. ad Ga, Woo-Seg},
  booktitle={ICASSP 2022 - 2022 IEEE Iteratioal Coferece o Acoustics, Speech ad Sigal Processig (ICASSP)}, 
  title={FRCRN: Boostig Feature Represetatio Usig Frequecy Recurrece for Moaural Speech Ehacemet}, 
  year={2022},
  pages={9281-9285},
  doi={10.1109/ICASSP43922.2022.9747578}}

@INPROCEEDINGS{9747230,
  author={Dubey, Harishchadra ad Gopal, Vishak ad Cutler, Ross ad Aazami, Ashka ad Matusevych, Sergiy ad Brau, Sebastia ad Eskimez, Sefik Emre ad Thakker, Matha ad Yoshioka, Takuya ad Gamper, Haes ad Aicher, Robert},
  booktitle={ICASSP 2022 - 2022 IEEE Iteratioal Coferece o Acoustics, Speech ad Sigal Processig (ICASSP)}, 
  title={Icassp 2022 Deep Noise Suppressio Challege}, 
  year={2022},
  pages={9271-9275},
  doi={10.1109/ICASSP43922.2022.9747230}}

功能介绍

模型介绍 本模型是个性化语音合成的自动标注工具所依赖的模型及资源集合 框架描述 暂无 使用方式和范围 使用方式: 使用请确保modelscope已经更新到1.4.0版本及以上并通过以下命令安装tts

声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!
下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态

评论