你对着智能助手说“把上周买的那瓶红酒热一下”,它大概率会搜本周在售的红酒,完全忽略“上周”的时间限定——这不是它没听懂单个词汇,是它的上下文层漏了关键信息,整个服务流程直接断裂。
这些高管的判断,核心是一个对比
这些科技行业的高管,为什么敢说语音AI还没到ChatGPT时刻?本质是拿两者的上下文处理能力做对比。ChatGPT的爆发,很大程度上是因为它能承接多轮对话的上下文,哪怕你绕着弯说话,它也能把前后的逻辑串起来,形成完整的交互闭环。但现在的语音AI,连最基础的跨句关联都做不好,用户的需求没法被完整承接,整个交互流程到一半就卡住,自然没法复制ChatGPT那样的普及度。
上下文层,是语音AI的硬伤
具体来说,语音交互的上下文和文字不一样,它自带时间、场景的关联——比如前一句是“我上周订的那家餐厅位置偏吗”,后一句接着“帮我再订一桌”,这里的“订一桌”,关联的肯定是上周那家餐厅,不是随便一家。但现在的语音AI,大多只能识别当前这句话的字面意思,没法把前后语境串联起来。结果要么答非所问,要么没法完成操作,整个服务流程直接断裂。
这对行业意味着什么?
现在的语音AI产品,不管是车载助手还是家用音箱,都还停留在“指令式”阶段——你说一句,它做一件,没法成为真正能跟人对话的伙伴。这些高管的判断也点出了行业的痛点:只有补上上下文层的短板,让语音AI能听懂人的对话逻辑,整个服务流程才能跑通,才会迎来属于它的爆发时刻。
现在的语音AI,就像记不住前半句的聊天对象,没法形成有意义的连续对话。那要补上这个上下文的缺口,是靠优化模型的对话衔接机制,还是换一种更贴合语音的交互引导方式?
素材来源:TechCrunch AI · AI情报、大模型、科研前沿
查看报道原文

发表第一条评论吧