实时语音 AI 助手产品系统Vibe Coding

我要开发同款
ChaogeAI2026年10月01日
3阅读

技术信息

语言技术
Python、HTTP、JavaScript、React、NLP
系统类型
Windows、Android应用、Linux
行业分类
人工智能、音视频多媒体

作品详情

行业场景

客服、助手、内部工具等场景需要「开口就能说」的语音交互,但常见做法延迟高、不能插话、绑死一家模型,换厂商就要改业务。项目面向消费级硬件(如 RTX 3060 6GB)与云边混合部署:既要实时对话体验,又要可控成本与可交接工程,而不是只能演示的 Demo。同时支持 PC、服务器容器化部署与 Android 端,便于嵌进真实产品。

功能介绍

全链路实时语音:麦克风 WebRTC 采集 → Silero VAD(含 500ms 预回填,降低开口丢字)→ 流式 STT → LLM 流式生成 → 流式 TTS → Web Audio 播放;说话即打断(barge-in),用户插话立即停生成、停发声并重新监听,无需等 AI 说完。
Provider 中立:STT/LLM/TTS 统一接口,12 类内置适配(云端优质优先,本地 Ollama / Faster-Whisper 兜底),已对接 DeepSeek、SiliconFlow、智谱、月之暗面等 OpenAI 兼容接口;配置热更新,换模型不改核心代码。
可靠性:超时、幂等重试、熔断(closed/open/half-open)、降级与 last-known-good。
Agent 委托:可将复杂任务异步委派外部编码 Agent,支持只读/建议/执行三级权限、工作区白名单、危险操作确认、任务可取消、进度旁路播报。
记忆(M2):工作/长期/会话三层,会话后提取偏好与决策,相关记忆注入提示词。外部工具调用与大型任务执行:可将复杂、耗时任务异步委派给外部编码 Agent / 工具链,而不是只能闲聊。支持三种权限模式(只读 / 建议 / 执行)、工作区白名单、危险操作人工确认、任务可取消;执行过程通过旁路音频实时播报进度,完成后回收结果。
这样语音助手不止「回答」,还能驱动工作流、跑长任务,同时把越权和误操作关在闸门里。
工程配套:一键启动脚本、设置面板、310 个测试用例、性能 p95 与问题复盘文档。开源精简版(MIT)可学习与二开。

项目实现

本人独立负责整体架构与交付:Python 服务端(FastAPI + LiveKit Agents / aiortc)、Web 对话 UI、PC/服务器/Android 三端目标目录分离(targets/{server,pc,android},环境差异用 profile 配置隔离)。
亮点:状态机(IDLE→LISTENING→THINKING→SPEAKING→INTERRUPTED)驱动打断;业务只依赖 STT/LLM/TTS 抽象,不绑厂商 SDK;错误统一归一后由路由层切换;显存受限下采取「云端优先 + 本地 fallback」而非强行全本地,保证实时体验。
难点:barge-in 时序与异步生命周期(曾出现旁路播报不响,根因是非阻塞任务被过早 cancel);云上 LiveKit 反代的鉴权与 URL 基址陷阱;健康检查需避开 ASR 预热期误判;工具结果区分「给用户」与「给模型」,避免重复播报。
部署含 Docker Compose 双容器(媒体与 Agent)、Caddy HTTPS、可选决策模型接入评估。
大型任务:会话内短交互与会话外长任务拆分,生命周期独立管理,避免「任务跑一半没人知道」;工具结果区分展示层与模型上下文,保证长链路可观察、可取消、可交付。

示例图片

声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!
下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态

评论