本模型是个性化语音合成的自动标注工具所依赖的模型及资源集合 暂无 使用方式: pip istall -U tts-autolabel -f https://modelscope.oss-c-beijig.aliyucs.com/releases/repo.html 另外tts-autolabel包依赖的oxrutime,默认oxrutime安装版本大于等于1.11会导致要求umpy版本大于1.21,在Modelscope默认镜像中,因为默认安装tesorflow-1.15,该版本tesorflow要求umpy小于等于1.18,这样会出现冲突。碰到这种情况,可以参考如下方案解决: 使用范围: 目标场景: 参考下方代码范例 如在Notebook下使用请先在代码块中安装 下面的示例以 调用接口运行自动标注, 20条标注数据大约需要30秒(具体时间视实际机器性能而定) 自动标注完成后,产出的标注数据目录 其中模型介绍
框架描述
使用方式和范围
如何使用
代码范例
tts-autolabel依赖,# 运行此代码块安装tts-autolabel
import sys
!{sys.executable} -m pip istall -U tts-autolabel -f https://modelscope.oss-c-beijig.aliyucs.com/releases/repo.html
/tmp/test_wavs作为输入音频目录,/tmp/output_dir为标注输出目录
其中/tmp/test_wavs结构如下:./test_wavs
├── 100001.wav
├── 100002.wav
├── 100003.wav
├── 100004.wav
├── 100005.wav
├── 100006.wav
├── 100007.wav
├── 100008.wav
├── 100009.wav
├── 100010.wav
├── 100011.wav
├── 100012.wav
├── 100013.wav
├── 100014.wav
├── 100015.wav
├── 100016.wav
├── 100017.wav
├── 100018.wav
├── 100019.wav
└── 100020.wav
from modelscope.tools import ru_auto_label
iput_wav = '/tmp/test_wavs' # wav audio path
work_dir = '/tmp/output_dir' # output path
ret, report = ru_auto_label(
iput_wav = iput_wav,
work_dir = work_dir,
resource_revisio = "v1.0.7"
)
prit(report)
/tmp/output_dir如下:./output_dir
├── iterval
│ ├── 100001.iterval
│ ├── 100002.iterval
│ ├── 100003.iterval
│ ├── 100004.iterval
│ ├── 100005.iterval
│ ├── 100006.iterval
│ ├── 100007.iterval
│ ├── 100008.iterval
│ ├── 100009.iterval
│ ├── 100010.iterval
│ ├── 100011.iterval
│ ├── 100012.iterval
│ ├── 100013.iterval
│ ├── 100014.iterval
│ ├── 100015.iterval
│ ├── 100016.iterval
│ ├── 100017.iterval
│ ├── 100018.iterval
│ ├── 100019.iterval
│ └── 100020.iterval
├── log
│ ├── badlist.txt
│ ├── log_ifo.txt
│ └── stdout.log
├── prosody
│ └── prosody.txt
├── result.jso
└── wav
├── 100001.wav
├── 100002.wav
├── 100003.wav
├── 100004.wav
├── 100005.wav
├── 100006.wav
├── 100007.wav
├── 100008.wav
├── 100009.wav
├── 100010.wav
├── 100011.wav
├── 100012.wav
├── 100013.wav
├── 100014.wav
├── 100015.wav
├── 100016.wav
├── 100017.wav
├── 100018.wav
├── 100019.wav
└── 100020.wav
prosody为文本标注信息,iterval为音素时间对齐信息,wav为音频文件, log为日志信息。
本工具产出的训练数据, 符合达摩院TTS训练数据标准, 可使用KAN-TTS源码或ModelScope TTS Model traier进行训练。模型局限性以及可能的偏差
目前支持中文、英文、中英混音频的标注,其他语种的支持将在后续版本中更新。
仅支持Liux环境,基于gcc4.8.5,过低版本glibc可能会出现不兼容情况
训练数据介绍
无
模型训练流程
无
预处理
无
数据评估及结果
暂无
引用
@iproceedigs{gao2023fuasr,
author={Zhifu Gao ad Zerui Li ad Jiamig Wag ad Haoeg Luo ad Xia Shi ad Megzhe Che ad Yabi Li ad Ligyu Zuo ad Zhihao Du ad Zhagyu Xiao ad Shiliag Zhag},
title={FuASR: A Fudametal Ed-to-Ed Speech Recogitio Toolkit},
year={2023},
booktitle={INTERSPEECH},
}
@iproceedigs{gao22b_iterspeech,
author={Zhifu Gao ad ShiLiag Zhag ad Ia McLoughli ad Zhijie Ya},
title={{Paraformer: Fast ad Accurate Parallel Trasformer for No-autoregressive Ed-to-Ed Speech Recogitio}},
year=2022,
booktitle={Proc. Iterspeech 2022},
pages={2063--2067},
doi={10.21437/Iterspeech.2022-9996}
}
@INPROCEEDINGS{9747578,
author={Zhao, Shegkui ad Ma, Bi ad Watcharasupat, Kar N. ad Ga, Woo-Seg},
booktitle={ICASSP 2022 - 2022 IEEE Iteratioal Coferece o Acoustics, Speech ad Sigal Processig (ICASSP)},
title={FRCRN: Boostig Feature Represetatio Usig Frequecy Recurrece for Moaural Speech Ehacemet},
year={2022},
pages={9281-9285},
doi={10.1109/ICASSP43922.2022.9747578}}
@INPROCEEDINGS{9747230,
author={Dubey, Harishchadra ad Gopal, Vishak ad Cutler, Ross ad Aazami, Ashka ad Matusevych, Sergiy ad Brau, Sebastia ad Eskimez, Sefik Emre ad Thakker, Matha ad Yoshioka, Takuya ad Gamper, Haes ad Aicher, Robert},
booktitle={ICASSP 2022 - 2022 IEEE Iteratioal Coferece o Acoustics, Speech ad Sigal Processig (ICASSP)},
title={Icassp 2022 Deep Noise Suppressio Challege},
year={2022},
pages={9271-9275},
doi={10.1109/ICASSP43922.2022.9747230}}
点击空白处退出提示







评论