行业痛点:传统有声书生产高度依赖人工,面临源文本格式混乱、错别字/多音字频发、人工校对成本高昂且耗时过长等行业共性问题,严重制约了音频内容的规模化产出。
业务背景:为突破产能瓶颈,本项目旨在打造一个集“文本预处理、AI生成、智能校对、人工审核”于一体的全链路自动化生产平台。通过引入AI能力辅助人工,将传统纯人工的线性生产模式升级为“机器预处理+人工复核”的标准化流水线,旨在大幅降低人力成本,提升音频内容的产出效率与质量一致性。
点击空白处退出提示
行业痛点:传统有声书生产高度依赖人工,面临源文本格式混乱、错别字/多音字频发、人工校对成本高昂且耗时过长等行业共性问题,严重制约了音频内容的规模化产出。
业务背景:为突破产能瓶颈,本项目旨在打造一个集“文本预处理、AI生成、智能校对、人工审核”于一体的全链路自动化生产平台。通过引入AI能力辅助人工,将传统纯人工的线性生产模式升级为“机器预处理+人工复核”的标准化流水线,旨在大幅降低人力成本,提升音频内容的产出效率与质量一致性。
1.多源文本清洗与标准化模块:针对多源书籍数据格式不一的问题,建立文本清洗与格式化规则引擎。自动剔除冗余字符、规范段落排版,并结合多源书籍比对功能进行交叉验证,从源头大幅提升输入数据的准确率与规范性。
2.AI辅助校对与质检模块:创新性引入ASR(自动语音识别)技术辅助校对,通过“文本-TTS-ASR”闭环比对,自动定位发音错误与错别字;同时内置常见Badcase替换词表与敏感词库,实现高频错误的自动化拦截与修正,显著降低人工审听疲劳度。
3.TTS音频生成与人工审核工作台:集成主流TTS API,支持文本一键转语音;为人工审核团队提供可视化操作台,支持音频与文本的逐句对照、快捷修改与重新合成,实现生产过程的无缝流转。
4.生产数据看板与权限管理模块:搭建基于角色的用户权限体系,保障生产数据安全;提供生产全链路的数据统计看板,实时追踪各环节耗时、产出量及错误率,为后续的流程优化与效能评估提供量化数据支撑。
个人核心职责:1.全链路产品设计与架构规划:作为项目Owner,独立负责从0到1的业务流程梳理与产品架构设计。主导输出核心业务PRD及高保真原型,规划了“文本预处理-AI生成-智能校对-人工审核”的标准化数据生产流水线。2.Vibe Coding与全栈敏捷开发:采用前沿的 Vibe Coding(AI辅助编程)模式进行整体开发,极大缩短了从需求到代码的转化周期。全程主导前后端核心代码编写、功能测试及性能调优,确保单体应用的高效交付与稳定运行。
技术栈与系统架构:前端架构:基于 React 18 + TypeScript 构建,采用 Vite 作为构建工具以实现极速冷启动与热更新;UI层深度集成 Ant Design 5 组件库,快速搭建了响应式、高可用的人工审核工作台与数据看板。后端架构:采用 Python FastAPI 构建高性能异步API服务,完美契合TTS/ASR等AI接口的并发调用需求;使用 SQLAlchemy 作为ORM层,搭配轻量级 SQLite 数据库,在保证数据关系完整性的同时,实现了单体应用的极简部署与低运维成本。
项目亮点与技术难点攻克:
AI闭环校验机制(亮点):针对有声书校对痛点,设计了“TTS生成 -> ASR识别 -> 文本比对”的自动化质检链路。通过引入常见Badcase替换词表,将传统纯人工审听升级为“机器初筛+人工复核”,大幅降低了人工纠错成本。
复杂数据清洗引擎(难点):面对多源书籍数据格式混乱的问题,独立设计并实现了文本清洗与格式化规则引擎。通过正则匹配与多源比对算法,自动剔除冗余字符并规范段落排版,从源头保障了输入数据的标准化与高准确率。



评论