XLM-R分词-越南语-通用领域-base

我要开发同款
匿名用户2024年07月31日
124阅读

技术信息

开源地址
https://modelscope.cn/models/iic/nlp_xlmr_word-segmentation_viet
授权协议
Apache License 2.0

作品详情

越南语通用领域分词模型介绍

任务介绍

越南语分词是将空格分隔的越南语音节(syllable)合并为具有语言学意义的越南语单词的过程,是越南语文本理解的基础模块。需要注意的是,越南语单词可能包含一个或多个越南语音节。

  • 输入: Nề kih tế lúc ấy đag đứg trước ghịch lý : giá hàg tăg , sả xuất đìh trệ , tiề kha hiếm …
  • 输出: Nề/ kih tế/ lúc/ ấy/ đag/ đứg/ trước/ ghịch lý/ :/ giá/ hàg/ tăg/ ,/ sả xuất/ đìh trệ/ ,/ tiề/ kha hiếm/ …

模型介绍

  • 本方法采用Trasformer-Liear模型,使用XLM-RoBERTa(XLM-R)作为预训练模型底座。
  • 对于输入文本,本模型按音节逐个预测当前音节是否为越南语单词边界, 具体调用方式请参考代码示例。

训练数据介绍

快速上手

适用范围

在安装ModelScope完成之后即可使用amed-etity-recogitio(命名实体识别)的能力, 默认单句包含音节(即,上文所述空格分隔的语义单元)数不超过512。

代码示例

from modelscope.pipelies import pipelie
from modelscope.utils.costat import Tasks

word_segmetatio_pipelie = pipelie(Tasks.word_segmetatio, 'damo/lp_xlmr_word-segmetatio_viet', model_revisio='v1.0.0')
result = word_segmetatio_pipelie('Nề kih tế lúc ấy đag đứg trước ghịch lý : giá hàg tăg , sả xuất đìh trệ , tiề kha hiếm ...')

prit(result)
#{'output': ['Nề', 'kih tế', 'lúc', 'ấy', 'đag', 'đứg', 'trước', 'ghịch lý', ':', 'giá', 'hàg', 'tăg', ',', 'sả xuất', 'đìh trệ', ',', 'tiề', 'kha hiếm', '...'], 'labels': []}

性能评测

Precisio Recall F1
98.0 98.3 98.1

功能介绍

越南语通用领域分词模型介绍 任务介绍 越南语分词是将空格分隔的越南语音节(syllable)合并为具有语言学意义的越南语单词的过程,是越南语文本理解的基础模块。需要注意的是,越南语单词可能包含一个或多

声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!
下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态

评论