AI 行业媒体、企业情报监控、政策监测、行业日报、公众号/自媒体内容运营、研究院信息简报等需要持续跟踪多源资讯并自动生成内容的场景。
点击空白处退出提示
AI 行业媒体、企业情报监控、政策监测、行业日报、公众号/自媒体内容运营、研究院信息简报等需要持续跟踪多源资讯并自动生成内容的场景。
开发 AI 行业资讯自动化采集与内容生成系统,每日从多个新闻与政策数据源采集 AI 相关资讯,通过 Embedding 和大模型完成去重、分类、评分、正文抓取、摘要生成与质量审核,并生成适合微信公众号发布的结构化内容。具体如下:
支持 API、RSS、普通网页和动态搜索接口等多种资讯采集方式。
按照时间窗口过滤最新资讯,并通过 Embedding 相似度进行语义去重。
调用大模型完成新闻分类、重要性/增长影响/内容质量等维度评分。
自动抓取原始正文并清洗站点噪声,生成中文标题与指定长度摘要。
加入来源校验、字数硬门、LLM 二次去重等多阶段验证流程。
对接微信公众号接口,完成封面、正文结构化及后续自动发布链路。
实现方法如下:
采集层针对不同来源分别实现 HTTPS API、RSS、Requests/BeautifulSoup 和 Playwright 动态采集,并统一转换为标准 JSON 数据结构。
第一阶段对候选资讯进行 24 小时时间过滤和 Embedding 语义去重,降低相同事件在多个来源重复出现的问题。
第二阶段将 title + content 发送给大模型,输出预定义类别及重要性、长期影响、质量等评分,用于候选内容排序与筛选。
第三阶段按排序结果抓取原始正文,优先使用 JSON-LD articleBody,其次尝试 article、main、body 等结构,并针对不同站点进行噪声清洗。
大模型根据正文生成中文标题和摘要,并通过长度阈值、来源审核、大模型重复性判断等规则进行多阶段质量验证。
最终将通过验证的内容整理为统一 JSON/Markdown/公众号正文结构,为每日自动运行和自动发布提供完整数据链路。
亮点如下:
实现多源采集、语义去重、大模型打分、正文抓取、摘要生成和发布的端到端自动化链路。
使用 Embedding 解决跨站点标题不同但事件相同的语义重复问题。
将大模型能力拆分为分类评分、摘要生成、重复审核等多个阶段,避免单次调用承担全部业务逻辑。
通过规则硬门与大模型审核组合控制内容质量,适合稳定的日常自动化运行。



评论