AI 陪伴类桌面应用此前普遍存在三个问题:语音对话首字延迟高(实测基线 5946ms)导致"不像在说话";单一模型后端一旦故障或额度耗尽即完全不可用;角色人格一致性依赖提示词,无法量化验证。本项目以 Windows 桌面端为载体,把"用户说话、角色即时回应"做成可测量的工程指标,面向个人自用的实时语音交互场景,同时验证多模型后端热切换与人格一致性 A/B 评测的可行性。
点击空白处退出提示
语言技术
Python、SQL Server、HTTP、CSS、JavaScript系统类型
Windows行业分类
人工智能、游戏
AI 陪伴类桌面应用此前普遍存在三个问题:语音对话首字延迟高(实测基线 5946ms)导致"不像在说话";单一模型后端一旦故障或额度耗尽即完全不可用;角色人格一致性依赖提示词,无法量化验证。本项目以 Windows 桌面端为载体,把"用户说话、角色即时回应"做成可测量的工程指标,面向个人自用的实时语音交互场景,同时验证多模型后端热切换与人格一致性 A/B 评测的可行性。
六大功能模块:①语音交互链路——VAD 静音检测、SenseVoice 语音识别、TTS 合成,全本地运行;②对话大脑——可插拔 Provider 接口,支持云端多后端与本地离线模型一键切换;③记忆系统——跨会话长期记忆与召回;④人格锚点系统——角色性格以数据文件驱动,非硬编码;⑤表现层——2D 立绘差分、口型同步、表情切换、场景渲染;⑥世界线机制——按对话内容触发隐藏彩蛋。工程侧含 18 个测试文件与 8 套基准脚本。
独立负责全部架构设计与开发:Electron + Web 前端与 Python 服务分离、WebSocket 通信协议(9 类消息契约)、多 Provider 抽象层、流式响应解析器、记忆与人格锚点系统、基准测试与 A/B 评测体系。亮点:建立可复现的延迟基准测试矩阵,通过流式输出改造将首字延迟 P50 从 5946ms 降至 2428ms(降幅 59.2%),达成 P50 ≤2.5s 承诺门;并引入独立审计代理机制,15 次审计中 1 次判定 reject 并返工。难点:流式分片下的 JSON 解析与状态一致性、多后端契约兼容、6GB 显存约束下的多模型调度。



评论