AI 资讯自动采集与智能内容生成产品系统

我要开发同款
小周科技2026年09月09日
7阅读

技术信息

语言技术
PythonMySQLTorch
系统类型
Linux
行业分类
人工智能开发工具

作品详情

行业场景

AI 行业媒体、企业情报监控、政策监测、行业日报、公众号/自媒体内容运营、研究院信息简报等需要持续跟踪多源资讯并自动生成内容的场景。

功能介绍

开发 AI 行业资讯自动化采集与内容生成系统,每日从多个新闻与政策数据源采集 AI 相关资讯,通过 Embedding 和大模型完成去重、分类、评分、正文抓取、摘要生成与质量审核,并生成适合微信公众号发布的结构化内容。具体如下:
支持 API、RSS、普通网页和动态搜索接口等多种资讯采集方式。
按照时间窗口过滤最新资讯,并通过 Embedding 相似度进行语义去重。
调用大模型完成新闻分类、重要性/增长影响/内容质量等维度评分。
自动抓取原始正文并清洗站点噪声,生成中文标题与指定长度摘要。
加入来源校验、字数硬门、LLM 二次去重等多阶段验证流程。
对接微信公众号接口,完成封面、正文结构化及后续自动发布链路。

项目实现

实现方法如下:
采集层针对不同来源分别实现 HTTPS API、RSS、Requests/BeautifulSoup 和 Playwright 动态采集,并统一转换为标准 JSON 数据结构。
第一阶段对候选资讯进行 24 小时时间过滤和 Embedding 语义去重,降低相同事件在多个来源重复出现的问题。
第二阶段将 title + content 发送给大模型,输出预定义类别及重要性、长期影响、质量等评分,用于候选内容排序与筛选。
第三阶段按排序结果抓取原始正文,优先使用 JSON-LD articleBody,其次尝试 article、main、body 等结构,并针对不同站点进行噪声清洗。
大模型根据正文生成中文标题和摘要,并通过长度阈值、来源审核、大模型重复性判断等规则进行多阶段质量验证。
最终将通过验证的内容整理为统一 JSON/Markdown/公众号正文结构,为每日自动运行和自动发布提供完整数据链路。

亮点如下:
实现多源采集、语义去重、大模型打分、正文抓取、摘要生成和发布的端到端自动化链路。
使用 Embedding 解决跨站点标题不同但事件相同的语义重复问题。
将大模型能力拆分为分类评分、摘要生成、重复审核等多个阶段,避免单次调用承担全部业务逻辑。
通过规则硬门与大模型审核组合控制内容质量,适合稳定的日常自动化运行。

示例图片

声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!
下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态

评论