项目应用于大型调查数据处理场景。调查对象填写的职业名称及工作内容通常为非结构化文本,存在表达方式不统一、用词模糊及职业含义相近等问题,需要工作人员逐项判断并转换为标准职业分类代码,处理量大且容易出现不一致。
点击空白处退出提示
项目应用于大型调查数据处理场景。调查对象填写的职业名称及工作内容通常为非结构化文本,存在表达方式不统一、用词模糊及职业含义相近等问题,需要工作人员逐项判断并转换为标准职业分类代码,处理量大且容易出现不一致。
系统提供职业描述输入、文本预处理、语义识别、标准职业代码匹配、候选结果推荐及人工复核等功能。AI模型能够理解用户填写的职业名称和工作内容,并自动推荐相应的标准职业分类代码。系统将模型预测结果与业务流程结合,在保持人工复核能力的同时,大幅减少重复分类工作,并提升数据处理速度及编码一致性。
我负责端到端业务流程、系统架构、模型应用方案及部署机制设计。项目采用Python、PyTorch及BERT构建自然语言处理模型,并利用约500万条历史调查数据进行模型微调和验证;前端采用Vue.js展示输入内容、推荐代码及复核结果。经测试,自动分类准确率达到99%。主要难点是处理自由文本中的歧义、简称及相近职业描述,并将模型推理稳定地整合至实际业务流程。



评论