面向 AI Agent 场景的文档预处理工具skill,可对接各类 Agent 框架如hermes ,open claw ,opencode等,将 PDF 快速转换为结构化 Markdown 格式,优化大模型读取效率,显著降低 Token 消耗。
点击空白处退出提示
面向 AI Agent 场景的文档预处理工具skill,可对接各类 Agent 框架如hermes ,open claw ,opencode等,将 PDF 快速转换为结构化 Markdown 格式,优化大模型读取效率,显著降低 Token 消耗。
核心功能模块:包含单文件转换、文件夹批量转换、图片提取保存、表格结构化识别、标题层级自动识别、页眉页脚智能过滤、YAML 元数据生成七大核心能力
双模式调用:既支持命令行 CLI 直接调用(支持 8 种自定义参数),也支持作为 Python 包导入到业务代码中集成使用
AI 适配优化:转换后的 Markdown 完整保留原文档层级结构,专门适配大模型输入格式,有效降低 AI 解析成本与 Token 浪费
本人独立完成整个工具的需求设计、架构搭建与全部代码开发
采用分层模块化架构,拆分解析层、转换编排层、格式化层、CLI 接口层,模块解耦性强便于后续扩展
基于 Python + pdfplumber 技术栈实现,解决了 PDF 标题层级精准识别、表格结构化转换等难点,完美支持全中文文档与批量处理



评论