贾扬清作为人工智能领域的顶尖专家(阿里巴巴前技术副总裁、Lepton AI创始人),对AI的发展方向有着深刻洞察。当谈到“智能语音设备”这一具体方向时,他认为需要从人工智能的根本问题出发来审视。
一、人工智能的三大重要问题
贾扬清多次强调,当前AI的核心挑战可以归结为三点:
- 算力与效率的平衡:模型越来越大,但部署成本、能耗和响应速度是绕不开的瓶颈。语音设备是典型的端侧场景,不能完全依赖云端。
- 数据与泛化能力:语音交互面临口音、噪声、多语种混说等长尾问题。模型必须在少样本甚至零样本下保持鲁棒。
- 从感知到认知的跃迁:语音设备不能只做“听写”,而要理解意图、上下文和情感,实现真正的对话智能。
二、智能语音设备的现状与瓶颈
贾扬清指出,智能语音设备(智能音箱、语音助手、车载语音等)在过去几年进步显著,但仍有明显短板:
- 交互不自然:响应延迟高、不能随时打断、多轮对话容易“失忆”。
- 场景局限:在安静近场表现好,但在远场、噪声、多人说话时准确率骤降。
- 隐私与成本:始终在线的麦克风引发隐私担忧,而端侧算力又限制了模型大小。
- 生态割裂:不同设备、不同厂商之间无法无缝协同。
三、贾扬清给出的解题思路
- 端云协同的推理架构:将轻量模型放在设备端做唤醒和初步识别,复杂理解交给云端。关键是要统一训练和部署框架(如他主导过的MNN、TensorRT等思路)。
- 以数据为中心:与其盲目加大模型,不如系统性地收集和标注真实场景的语音数据,特别是带噪声、多说话人、口音的“难样本”。
- 多模态融合:语音设备应结合视觉(摄像头)、传感器(加速度计、距离感应)甚至环境上下文,来提升意图理解的准确率。
- 隐私优先设计:本地处理敏感语音,只上传脱敏后的特征或意图,而非原始音频。
四、未来展望
贾扬清认为,智能语音设备的终极形态不是“能听会说的音箱”,而是无处不在的环境智能——你不需要刻意唤醒某个设备,房间、汽车、耳机都能自然理解你的需求,并且彼此协作。这需要:
- 更高效的端侧模型(如1B参数以下但性能接近大模型)
- 标准化的语音交互协议
- 对“对话状态追踪”和“长期记忆”的突破
##
贾扬清的视角提醒我们:智能语音设备的问题,本质上是人工智能在效率、泛化、认知三个维度上的缩影。只盯着语音识别准确率是远远不够的。只有把算法、算力、数据、隐私和用户体验统筹考虑,语音设备才能真正从“工具”进化为“伙伴”。