1

百亿级招投标数据生命周期串联与分组模型产品系统

我要开发同款
DataMiner_Tian2026年08月31日
4阅读

技术信息

语言技术
PythonMySQLSQLServer
系统类型
算法模型
行业分类
人工智能企业服务

作品详情

行业场景

招投标业务中,同一项目会先后产生招标预告、招标公告、中标通知、合同公告等十余种生命周期公告,散落在不同数据源,且项目名称、招标人、编号等字段录入不规范,导致同一项目难以稳定关联。本项目从某头部运营商 22 亿+ 条历史标讯数据出发,建立一套稳定的生命周期串联分组机制,为同一项目所有公告统一打标项目组编号,支撑中标概率分析、份额统计等业务。

功能介绍

① 数据质检与标准化:对 22 亿+ 条标讯排查字段缺失与异常,制定项目名称/招标单位清洗规则,剔除生命周期冗余词并独立提取期数、批数字段;② 三步分组归集:按"招标公告基准归集→全量招标数据归集→中标及后续数据归集"层层复用,生成唯一 fam_id,并处理编号复用、招标人缺失等兜底场景;③ 状态打标与溯源:四种归集方式自动识别 + 三类生命周期形态标签,支持全链路溯源;④ 每日增量更新:未完结项目基线筛选与 1 年/180 天差异化阈值,避免全量重跑。

项目实现

我负责算法模型的方案设计与落地。基于 PySpark 构建清洗管道,以"标准化项目名称+信用编码+省份+年份"拼接字段做第一层精确归集,再用 MinHash/LSH 文本相似度近似匹配兜底,配合项目编号+招标单位、中标金额等规则做组间校准。核心难点是 22 亿+ 规模下的去重精度与性能平衡、以及"宁可少归不可错归"的召回/准确率取舍,最终实现高串联率 + 可维护的增量更新。

示例图片

声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!
下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态

评论