痛点
目前YOYO设备控制类指令完整流程:
DSP采集音频→NPU做语音识别输出文本→文本传给CPU,送入大模型服务→生成自然语言文本回复→再提取控制意图→调用系统API。
中间多次传输完整文本字符串,产生数据拷贝与解析开销,造成语音控制指令存在可感知延迟。
功能构想
利用NPU算力,部署语音语义编译器模块,专门处理设备控制类语音指令:
1. DSP完成收音、降噪、唤醒之后,音频特征送入NPU;
2. NPU内部完成ASR识别+语义编译,直接输出系统可识别的轻量结构化控制指令包,不再输出完整自然语言文本;
3. 将精简指令包交付给CPU;CPU完成权限校验,直接调用系统API执行操作;
4. 闲聊、问答类场景不进入该加速通路,保留原有对话逻辑。
注:不会生成CPU裸机器码,所有操作依然经过系统权限沙盒校验,保障系统安全。
容错兜底机制
当语音识别置信度不足、用户指令模糊,语义编译器自动降级,退回原有对话流程,向用户确认意图,避免误操作。
方案优势
1. 把意图解析编译工作放在NPU侧,减少NPU与CPU之间大段文本的传输、序列化开销;
18 人已参与
支持
反对