分词

越南语通用领域分词模型介绍 任务介绍 越南语分词是将空格分隔的越南语音节(syllable)合并为具有语言学意义的越南语单词的过程,是越南语文本理解的基础模块。需要注意的是,越南语单词可能包含一个或多
1240pytorchnlp
泰语通用领域分词模型介绍 任务介绍 泰语分词目的是将连续的泰语字符分隔成具有语言学意义的泰语单词,是泰语文本理解的基础模块。 输入: …รถคันเก่าก็ยังเก็บเอาไว้ยังไม่ไ
990pytorchnlp
该项目用于收集docker输出的日志,对日志进行分词索引和存储,最后使用API提供接口,让前端页面展示,方便开发人员查询。 该项目分为前端和后端两个模块,我主要负责后端API的设计和开发,后端使用golang语言,使用blevesearch来对日志文本构建分词索引,使用leveldb来进行数据存储,前端使用vue框架; 由于日志流是从logspout处使用tcp裸流方式接收,遇到了tcp的粘包问题,最后配置了logspout的输出格式,在每条消息末尾增加了分隔符,解决了粘包问题。
2900leveldb
技术选型:Maven+SpringMVC+Spring+Mybatis 开发工具:idea+Maven+MySQL++Solr+Git+JDK1.8 项目描述: 随着公司线上业务的不断发展,系统承载的搜索业务也来越多,如搜索菜场商品、家乐福商品、预售商品等,随之伴随的召回逻辑技术支持问题也愈发明显,如要快速定位生产遇到搜索问题,就需要借助全链路体检功能。本系统搜索体检功能,解决生产技术支持90%以上的问题,使搜索系统排查问题时极大减少人力耗时,快速定位生产召回逻辑,为排查问题提供便利。 责任描述: (1)对于关键字体检、零售云搜索体检等功能的功能需求文档编写、页面设计以及后端功能开发 (2)负责该系统的部署上线、后期维护以及二次开发 技术亮点: (1)对于读多写少的查询数据(如系统目录)存储于Redis中,以提升数据读取效率 (2)使用Nginx反向代理服务器作负载均衡,提升了系统可用性以及负载能力 (3)开启Nginx静态化配置,缓存CSS、JS等静态资源,提升了页面访问效率 (4)针对敏感词检测功能,使用Trie字典树消除对于敏感词字符串穿插伪装,提高检测质量
2840Solr
项目职责:独立完成项目从0-1的设计工业级的中英文分词系统 算法筛选:深入分析项目难点,针对英文不能使用常规方法切分及新登陆词识别问题,提出采用制定提取模版、利用HMM模型和CRF模型进行序列标注的方式实现分词规范化,同时融入新词发现模型和NER词典,提升新登录词发现能力。 策划优化:通过CRF、BiLSTM_CRF等解码状态设置,降低计算难度,采用前缀词增加等方式,避免不必要搜索,提升运行速度。 词图构建:合理进行优先级布局,加入复合词典,由正则词典、专业领域词典、实体识别模型、序列标注模型、核心通用词典等,完成词图基础构建,基于此计算最佳路径,从根本解决问题
3800自然语言
当前共5个项目more
×
寻找源码
源码描述
联系方式
提交