Amadeus —— 实时语音对话 AI 角色桌面应用产品系统Vibe Coding

我要开发同款
Arkham2026年10月04日
5阅读

技术信息

语言技术
Python、SQL Server、HTTP、CSS、JavaScript
系统类型
Windows
行业分类
人工智能、游戏

作品详情

行业场景

AI 陪伴类桌面应用此前普遍存在三个问题:语音对话首字延迟高(实测基线 5946ms)导致"不像在说话";单一模型后端一旦故障或额度耗尽即完全不可用;角色人格一致性依赖提示词,无法量化验证。本项目以 Windows 桌面端为载体,把"用户说话、角色即时回应"做成可测量的工程指标,面向个人自用的实时语音交互场景,同时验证多模型后端热切换与人格一致性 A/B 评测的可行性。

功能介绍

六大功能模块:①语音交互链路——VAD 静音检测、SenseVoice 语音识别、TTS 合成,全本地运行;②对话大脑——可插拔 Provider 接口,支持云端多后端与本地离线模型一键切换;③记忆系统——跨会话长期记忆与召回;④人格锚点系统——角色性格以数据文件驱动,非硬编码;⑤表现层——2D 立绘差分、口型同步、表情切换、场景渲染;⑥世界线机制——按对话内容触发隐藏彩蛋。工程侧含 18 个测试文件与 8 套基准脚本。

项目实现

独立负责全部架构设计与开发:Electron + Web 前端与 Python 服务分离、WebSocket 通信协议(9 类消息契约)、多 Provider 抽象层、流式响应解析器、记忆与人格锚点系统、基准测试与 A/B 评测体系。亮点:建立可复现的延迟基准测试矩阵,通过流式输出改造将首字延迟 P50 从 5946ms 降至 2428ms(降幅 59.2%),达成 P50 ≤2.5s 承诺门;并引入独立审计代理机制,15 次审计中 1 次判定 reject 并返工。难点:流式分片下的 JSON 解析与状态一致性、多后端契约兼容、6GB 显存约束下的多模型调度。

示例图片

声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!
下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态

评论