面向长视频、本地媒体处理和字幕本地化场景,解决音频提取、语音转录、人工复核、字幕翻译与成果发布分散在多个工具中的问题。目标是在可审计、可恢复的工作流中完成从视频文件到双语SRT的端到端处理。
点击空白处退出提示
语言技术
React、TypeScript系统类型
Windows、MacOS行业分类
人工智能
面向长视频、本地媒体处理和字幕本地化场景,解决音频提取、语音转录、人工复核、字幕翻译与成果发布分散在多个工具中的问题。目标是在可审计、可恢复的工作流中完成从视频文件到双语SRT的端到端处理。
系统支持视频转录翻译与已有SRT直接翻译两条流程;可批量处理文件并展示实时进度和结构化日志。Agent流程包含音频提取、三家语音转录服务适配、转录审核、分段翻译、翻译审核、失败重试与回放、记忆沉淀、结果发布。网络失败自动指数退避,失败任务保留中间产物,已审核转录无需重复执行。桌面端支持Windows、macOS和Linux。
我独立完成需求、架构、前后端与测试。前端采用React 19、TypeScript、TanStack Router、Tailwind和Tauri 2/Rust;后端采用Python、LangGraph、Gemini/OpenAI兼容接口、PostgreSQL/pgvector,并集成AssemblyAI、Speechmatics和Deepgram。工程亮点包括确定性状态机、人工审核节点、SQLite/PostgreSQL双运行模式、全局并发与背压、可恢复失败清单、结构化产物目录,以及覆盖工作流、适配器和回归场景的自动化测试。



评论