当前各类垂直平台数据封闭,用户获取信息效率极低,传统爬虫极易被封控,且获取的数据是非结构化的“脏数据”,无法直接用于商业决策。本项目旨在利用多智能体协同与边云架构,打造一个突破反爬限制、全自动完成“数据精准嗅探、AI大模型数据清洗重构、RAG结构化知识入库”的全链路 AI 自动化工作流系统,极大降低企业获取与处理核心数据的运营成本。
点击空白处退出提示
当前各类垂直平台数据封闭,用户获取信息效率极低,传统爬虫极易被封控,且获取的数据是非结构化的“脏数据”,无法直接用于商业决策。本项目旨在利用多智能体协同与边云架构,打造一个突破反爬限制、全自动完成“数据精准嗅探、AI大模型数据清洗重构、RAG结构化知识入库”的全链路 AI 自动化工作流系统,极大降低企业获取与处理核心数据的运营成本。
多智能体协同主控模块:构建主控大脑动态路由,利用意图矩阵精准区分不同业务场景,维持上下文全局记忆级联;
边云协同 RPA 引擎:通过 Xvfb 虚拟显示与 DrissionPage 技术,完美绕过复杂的 Headless 浏览器反爬检测,实现高成功率的数据采集;
AI 智能重构专家:结合 RAG 向量数据库与混元大模型,将采集到的非结构化原始数据进行三级降噪提纯,并按指定商业规则自动重写与结构化;
身份迁移与高可用模块:实现 Windows 预登录至 Linux 注入的 Cookie 身份无损迁移,支持长达 720 小时的无人值守连续运行。
在本项目中,我作为核心开发者负责了从底层架构设计到 AI 算法集成的全栈研发工作。
我独立设计并落地了“边云协同架构”,通过 Python 编写底层引擎,利用 Xvfb 虚拟帧缓冲技术成功规避了目标网站针对 Headless Chrome 的封控策略,使采集存活率提升至 95% 以上。
在 AI 对接层面,我设计了基于混元大模型与 RAG(检索增强生成)的微服务接口。攻克了非结构化脏数据清洗的难题,实现了三级降噪提纯算法,将 Token 消耗降低 60% 的同时保障了数据输出的结构化质量。
我攻克了核心难点——基于 DrissionPage 的身份态迁移,成功实现了 Windows 与 Linux 跨环境的 Cookie 无损级联注入,保障了系统的 24 小时高可用性。





评论