面向某行业舆情监控、竞品分析和政策信息采集场景,构建一套分布式采集 → 数据清洗 → AI 分析 → 可视化 → 异常告警的一体化平台。
系统支持多站点、多栏目、多格式数据采集,具备反爬对抗、增量采集、分布式去重、AI 摘要分类、自动报告、数据大屏和 RAG 检索能力。客户可通过 Django 管理后台可视化配置采集规则,无需编写代码即可完成日常采集任务。
点击空白处退出提示
面向某行业舆情监控、竞品分析和政策信息采集场景,构建一套分布式采集 → 数据清洗 → AI 分析 → 可视化 → 异常告警的一体化平台。
系统支持多站点、多栏目、多格式数据采集,具备反爬对抗、增量采集、分布式去重、AI 摘要分类、自动报告、数据大屏和 RAG 检索能力。客户可通过 Django 管理后台可视化配置采集规则,无需编写代码即可完成日常采集任务。
1. 采集调度:可视化配置目标站点、CSS/XPath 规则、采集频率、优先级、定时任务。
2. 分布式采集:Scrapy-Redis 多节点协作,支持断点续爬、失败重试、增量采集。
3. 反爬对抗:代理池、UA 池、Cookie 管理、验证码对接、请求限速、自动重试。
4. 数据清洗:编码检测、空值/乱码过滤、SimHash 去重、结构化入库、质量评分。
5. AI 分析:LLM 自动摘要、关键词提取、分类打标、情感/舆情判断、自动报告生成。
6. 数据看板:Vue3 + ECharts 展示采集量、7 日趋势、分类占比、AI 处理队列、异常监控。
7. 告警系统:采集失败率、任务积压、Token 成本超支自动告警。
8. API/RAG:FastAPI 提供检索接口,pgvector 支持语义搜索,可作为企业知识库数据源。
9. 一键部署:Docker Compose 编排 Scrapy + Redis + Django + PostgreSQL + Celery + Vue。
我的职责
· 负责整体架构设计,确定 Scrapy-Redis + Celery + Django + Vue3 的技术方案。
· 独立开发分布式爬虫、反爬模块、数据清洗管道和增量去重逻辑。
· 开发 Django 管理后台,实现采集规则配置、任务调度、数据管理和权限控制。
· 集成 LangChain + DeepSeek,实现文章摘要、关键词、分类和自动报告。
· 开发 FastAPI 检索接口和 pgvector 语义搜索,支持后续 RAG 知识库。
· 完成 Docker 化部署、Nginx/Gunicorn 配置、监控告警和交付文档。
· 编写使用手册、API 文档和培训视频,确保客户可自运维。



评论