基于公开数据源,为B2B企业提供自动化客户挖掘与智能触达服务。通过分布式爬虫集群采集企业公开信息,结合AI生成个性化话术,实现从线索发现到初步触达的全流程自动化,降低人工获客成本。
点击空白处退出提示
基于公开数据源,为B2B企业提供自动化客户挖掘与智能触达服务。通过分布式爬虫集群采集企业公开信息,结合AI生成个性化话术,实现从线索发现到初步触达的全流程自动化,降低人工获客成本。
基于公开数据源搜索企业认证用户,获取公开主页信息,支持关键词与过滤规则的自定义配置。
根据配置信息调用 AI 动态生成个性化打招呼话术。
支持多用户体系,每个用户独立注册爬虫节点,仅可访问和操作自身数据,满足客户一人一账号的业务场景。
爬虫端需通过授权码激活使用,后台支持授权码的生成、分发、状态管理与到期控制。
后台实时展示爬虫集群进度、节点状态等可视化信息。
登录、权限控制、数据 CRUD 等通用后台功能。
本项目为独立开发项目
该项目比较有代表性,本身就是高频系统,实际部署中客户的爬虫集群规模超出预计(从40-100台 -> 500+台)
架构说明:
系统由核心API服务器与多个爬虫服务器构成分布式集群。核心API服务器负责统一数据入库与接口服务;每个爬虫服务器启动时自动注册为FRP节点,通过FRP隧道与远程浏览器通信,接收爬取数据后批量提交至核心服务器。
客户端设计:
采用 WinForm + WebView2 作为主体框架,浏览器本身为爬虫场景定制开发,支持通过启动参数灵活控制行为;内置 Socks5 代理支持(含密码认证),客户端本身不承载爬虫逻辑,仅作为远程浏览器连接的中继节点。
技术栈:
服务端:Java(自研平台,非Spring)+ MySQL + Redis + FRP,通讯协议 HTTP/TCP。
客户端:WinForm + WebView2(C#/.NET),通过FRP与服务端通信。
挑战与方案:
数据库常年在千万级数据量,每次请求携带数十至数百条数据,去重与写入操作需在毫秒级完成。迭代中通过引入Redis作为数据库旁路缓存,将高频读取请求转移至缓存层,并配合后台线程异步合并SQL进行批量同步写入,有效缓解了数据库峰值压力,保障了集群稳定运行。
FRP服务稳定性处理:
生产环境发现FRP服务端存在4-6小时周期性崩溃的偶发性缺陷。由于该问题属于第三方工具底层实现,我的处理方式是:建立主动健康检查机制,配合定时重启策略,保障了集群的长期稳定运行。
架构决策理由:
采用服务端控制、客户端仅作中继节点的分层架构,核心原因是客户要求防止破解、确保代码不泄露和防止未经授权的使用。




评论