面对面沟通辅助场景:销售、导购、客服在和客户当面交流时,经常遇到答不上来的专业问题。这个 App 让手机持续收听对方说话,自动识别成文字后交给大模型生成建议回答,再通过蓝牙耳机悄悄念给使用者听,使用者可以直接照着回答,不用低头看手机。
点击空白处退出提示
面对面沟通辅助场景:销售、导购、客服在和客户当面交流时,经常遇到答不上来的专业问题。这个 App 让手机持续收听对方说话,自动识别成文字后交给大模型生成建议回答,再通过蓝牙耳机悄悄念给使用者听,使用者可以直接照着回答,不用低头看手机。
1. 持续收音:手机麦克风实时采集,基于自适应噪声底的能量检测自动断句,对方停顿 0.8 秒即判定一句话说完,句首预留 300 毫秒避免吞字;2. 语音识别:整句音频送 OpenAI 兼容的 /audio/transcriptions 接口;3. 大模型回答:流式调用 /chat/completions,保留最近 6 轮上下文,可自定义角色设定;4. 实时播报:回答边生成边按句切分,用系统语音合成从蓝牙耳机逐句播放,第一句生成完就开始念;5. 防回声:播报期间自动暂停收音;6. 状态显示:音量电平、当前播报设备(蓝牙/有线/外放)、识别耗时、首字耗时、全程耗时;7. 设置:接口地址、Key、模型、语速、断句停顿时长、灵敏度;8. 示例音频:不用说话即可演示完整流程。
独立完成全部开发。Android 原生 Java,不依赖第三方 SDK:AudioRecord 16kHz 采集 + 自研 VAD,HttpURLConnection 手写 multipart 上传和 SSE 流式解析,TextToSpeech 走媒体通道自动路由到蓝牙 A2DP。接口按 OpenAI 兼容格式设计,硅基流动、DeepSeek、通义等都能直接接入。构建不用 Gradle,用 aapt2、javac、d8、apksigner 命令行打包,APK 只有 336KB。在模拟器上搭了假接口服务端,跑通了「识别 → 流式回答 → 播报」全链路联调。



评论