招投标业务中,同一项目会先后产生招标预告、招标公告、中标通知、合同公告等十余种生命周期公告,散落在不同数据源,且项目名称、招标人、编号等字段录入不规范,导致同一项目难以稳定关联。本项目从某头部运营商 22 亿+ 条历史标讯数据出发,建立一套稳定的生命周期串联分组机制,为同一项目所有公告统一打标项目组编号,支撑中标概率分析、份额统计等业务。
点击空白处退出提示
招投标业务中,同一项目会先后产生招标预告、招标公告、中标通知、合同公告等十余种生命周期公告,散落在不同数据源,且项目名称、招标人、编号等字段录入不规范,导致同一项目难以稳定关联。本项目从某头部运营商 22 亿+ 条历史标讯数据出发,建立一套稳定的生命周期串联分组机制,为同一项目所有公告统一打标项目组编号,支撑中标概率分析、份额统计等业务。
① 数据质检与标准化:对 22 亿+ 条标讯排查字段缺失与异常,制定项目名称/招标单位清洗规则,剔除生命周期冗余词并独立提取期数、批数字段;② 三步分组归集:按"招标公告基准归集→全量招标数据归集→中标及后续数据归集"层层复用,生成唯一 fam_id,并处理编号复用、招标人缺失等兜底场景;③ 状态打标与溯源:四种归集方式自动识别 + 三类生命周期形态标签,支持全链路溯源;④ 每日增量更新:未完结项目基线筛选与 1 年/180 天差异化阈值,避免全量重跑。
我负责算法模型的方案设计与落地。基于 PySpark 构建清洗管道,以"标准化项目名称+信用编码+省份+年份"拼接字段做第一层精确归集,再用 MinHash/LSH 文本相似度近似匹配兜底,配合项目编号+招标单位、中标金额等规则做组间校准。核心难点是 22 亿+ 规模下的去重精度与性能平衡、以及"宁可少归不可错归"的召回/准确率取舍,最终实现高串联率 + 可维护的增量更新。



评论