在本地知识库、个人RAG、笔记管理场景中,用户经常需要将PDF、文档转换为Markdown格式。现有工具要么仅支持命令行操作上手门槛高,要么是在线转换工具存在文件隐私泄露风险,部分工具转换完成排版混乱,缺少任务容错重试能力。本项目面向科研学生、知识内容创作者、本地AI爱好者,打造本地优先、带Web可视化界面的文档转换工具,解决普通用户文档转Markdown操作复杂、文件隐私得不到保障、批量任务容易中断失败的痛点。
点击空白处退出提示
在本地知识库、个人RAG、笔记管理场景中,用户经常需要将PDF、文档转换为Markdown格式。现有工具要么仅支持命令行操作上手门槛高,要么是在线转换工具存在文件隐私泄露风险,部分工具转换完成排版混乱,缺少任务容错重试能力。本项目面向科研学生、知识内容创作者、本地AI爱好者,打造本地优先、带Web可视化界面的文档转换工具,解决普通用户文档转Markdown操作复杂、文件隐私得不到保障、批量任务容易中断失败的痛点。
项目提供网页可视化操作界面,集成多解析后端,支持PyMuPDF4LLM、Marker、MarkItDown多种文档解析引擎,支持PDF、DOCX等文档批量转换。具备任务队列、断点续跑、检查点重试能力,内置Markdown文本清洗流水线,可对转换结果做排版清理。同时提供可选AI校对模块,兼容各类OpenAI‑Compatible大模型接口,输出结果可适配Obsidian、Joplin等本地知识库,全部核心转换能力支持离线本地运行。
本人独立完成项目整体需求设计、后端业务逻辑开发、WebUI界面开发与项目打包部署全流程。项目采用Python后端+Web前端的B/S架构,整合PyMuPDF4LLM、Marker、MarkItDown多个开源解析库作为转换后端。实现任务队列持久化、断点续跑、失败重试机制,完成Markdown清洗流水线与兼容OpenAI协议的AI校对模块。实现难点在于多后端统一抽象封装、大文档任务状态持久化,解决不同解析库输出格式不一致、长时间批量任务中断丢失进度的问题,同时做到API密钥本地存储,保障用户数据隐私安全。



评论