面向高校、集团企业和数据治理团队,解决机构名称存在中英文混用、缩写变体、层级代码嵌套以及原始工作簿结构不统一的问题。项目需要把参考字典与待处理名单进行对应,将机构信息按一级、二级、三级层级安全拆分并导出为可继续入库的标准Excel,减少人工逐行核对和复制错误。
点击空白处退出提示
面向高校、集团企业和数据治理团队,解决机构名称存在中英文混用、缩写变体、层级代码嵌套以及原始工作簿结构不统一的问题。项目需要把参考字典与待处理名单进行对应,将机构信息按一级、二级、三级层级安全拆分并导出为可继续入库的标准Excel,减少人工逐行核对和复制错误。
系统支持读取和检查多份XLSX工作簿、识别表头与有效区域、分析英文全称及常见缩写、依据机构代码推导层级、合并中英文名称映射、生成唯一记录ID、按固定12列结构导出结果,并自动渲染首部、中部和尾部预览用于复核。最终生成902条分层记录,同时执行必填字段、ID格式、重复ID、层级计算和输出行数校验。
我负责源表结构审计、匹配规则设计、转换脚本开发、工作簿生成和结果验证。项目使用Node.js脚本处理Excel文件,结合PowerShell完成格式转换与环境衔接;通过机构代码长度计算层级,对英文名称缩写和同义写法建立一对多映射,再按目标字段顺序生成标准工作簿。实现中特别保留文本格式,避免长编码被Excel转为科学计数法;验证脚本确认902条记录中无重复ID、无必填字段缺失、无非法层级。



评论