7月17日,2026年世界人工智能大会首日,千问正式宣布将AI眼镜升级为智能体眼镜。据悉,本次升级后,千问 AI眼镜将可通过智能体强化服务与决策能力,并能按需调用第三方Skill和Agent。同时,千问还推出全双工语音、眼动追踪、体征监测、Always-on 视觉感知系统、3DOF 显示等一系列全新硬件及软件技术,全方位提升智能体眼镜对物理世界的感知、理解与交互能力。

对于带显示类的AI眼镜这样一个全新的产品品类,接下去的产品迭代方向一直都是厂商们在思考的问题。昨天,千问团队在WAIC上给出了他们的答案,其核心主线依然是围绕着为AI的需求去研发和设计硬件,而不是在硬件的基础上叠加AI。
发布现场,千问AI硬件产品总经理吴建军开宗明义:“AI时代的智能体眼镜,在于智能体对用户与环境的完整理解,没有硬件的智能体,无法触达现实,没有智能体的硬件,只是工具。所以,我们希望用最好的硬件,加上最好的智能体,为用户打造最好的AI助手。”

千问团队正在通过不断的提升产品体验,让AI眼镜成为真正的智能助理,从可用走向真正的好用,常用。这次更新里,我们看到了不少行业创新方案,也代表了接下去AI 眼镜的发展方向,且让我们逐个剖析一下。
软硬件一体方案让智能体眼镜听得清
要让AI有更好的表现,不只是如何让AI大模型变得更加智能,首先应该做的是让“输入”变得更加精准。Prompt需求错了,纵使AI再聪明,给出的回答也永远是南辕北辙,答非所问。
对于 AI眼镜这种以语音对话为主要交互方式的硬件,那首先应该做的就是如何让AI听得清楚。
不知道大家有没有这样的经历:有的AI眼镜,会偶现唤醒失效的情况;而当你不得不再呼唤一次的时候,它却听成了别的;反复几次的答非所问,让你非常的抓狂直到失去耐心——而这种糟糕的体验正是由于“听不清楚”造成的。
用户所处的环境复杂多样,可能是在静谧的自然环境里,也可能是在嘈杂的地铁上,或者酒吧聚会里,甚至风燥很大的摩托车上...这些错综复杂的环境,都对AI眼镜的体验提出了极大的挑战。
让AI 能够听得清楚,这已成为行业共识。为此,苹果专门花了140亿人民币收购以色列一家做无声语音识别的公司,当然这一黑科技距离真正规模化落地还有一定的距离。而千问 AI眼镜则给出了更为现实可行的软硬件一体的解法:一方面是在硬件端采用了五麦克风阵列配合骨传导麦克风,这可以说是目前 AI眼镜的最高配了。另外一方面,千问AI眼镜还在算法和软件层面做了大量的工作,通过端云协同的全链路语音增强系统,分离出人声和噪音,确保用户的人声即便是在嘈杂的环境下能够听得清楚,从而给出最精准的答复。

全双工模式的持续聆听
听得清楚之后,我们在智能体对话的过程中还存在另外一个问题:目前和AI的对话就是一问一答,让人感觉特别的人机。你得完整说完,AI才会启动思考并播报;另外,你还得耐心等待AI执行完成当前问题的回答,再进行下一个提问;这个也就是所谓的“半双工”模式。
而我们现实生活中人与人之间的真实对话,往往是你说完我再说,大家自然地对话、随时打断、边听边回应。为此,千问团队专门带来了一套全双工语音语言模型架构,通过流式AudioLLM预训练与全双工后训练,让智能体具备边听边说的实时决策能力。

所谓的全双工模式,指的就是模型边听、边思考、边说话,两条并行音用户输入流及AI 输出流两个音频流,共享同一时间轴,支持重叠发言、中途打断、附和语气词(嗯、对、没错)、预判用户下半句,这样的对话体验就更像与真人聊天。
这一模型架构带来的具象化的三⼤体验质变为:
第⼀,精准区分"对我说话"还是"旁⼈聊天",复杂环境下误触发和误打断率较传统模型降低90%。
第⼆,容忍思考停顿⽽不抢答,表达完毕瞬间实现毫秒级响应,完美还原⾃然对话节奏。
第三,实时意图监管——当⽤户说"暂停""稍等"时,模型快速终⽌播报、静默聆听,⽆缝承 接后续交互。
依托眼镜持续佩戴的特点,智能体将真正实现全天候观察与聆听,始终保持⾃然在线。AI眼镜的体验已经进入了深水区,以上就是千问团队在“听得清楚”方面所下的功夫。
眼动追踪带来全新交互体验
除了听之外,千问团队另外一个非常重要的努力就是在视觉感知上,引入眼动追踪和Always-on视觉感知系统。
眼动追踪,在MR中已经是非常成熟的技术,已逐步成为新一代MR设备的标配。对于庞大笨重的MR设备而言,眼动模组的体积和功耗都不是问题,Apple Vision Pro、vivo Vision Pro、三星Galaxy MR设备等新一代的XR眼镜均采用了眼动结合手势实现裸手交互,让用户摆脱了手柄的束缚,“看那点哪”的自然交互体验让用户直呼神奇。
然而,这项神奇的技术应用到主打轻量化、对于功耗有着极高要求的AI眼镜则是很大的挑战。迄今为止,市面上还没有真正实现量产的、搭载眼动追踪系统的轻量化AI眼镜。
而千问团队这次带来了行业创新的、更适合AI眼镜的⾼精度眼动追踪系统,它集成了极致⼩巧的摄像头和单灯设计,不影响外观与佩戴舒适性。算法上,千问团队基于大量真实数据做训练,配合⾼效校准机制,确保不同个体和环境下都能精准追踪——中⼼区域精度⼩于1度。

眼动追踪在AI眼镜中有着有诸多应用场景,其中最为核心的是带来交互效率的提升。相比于拍摄类 AI 眼镜,带显示类AI眼镜交互相对复杂,眼动追踪系统则可以基于视线视线追踪的直觉交互方式,将⽤户视线的轨迹直接转化为交互指令,不再需要物理触控镜腿或者语⾳唤醒,这样自然的交互方式⼤幅降低⽤户的认知负荷,并能更好适配解放双手的场景。
另外,千问团队还为VQA、Live Talk 等核⼼视觉任务提供了⽤户注意⼒信息,使智能体在视觉语义解析上真正对⻬了⼈的主观注意⼒,更加贴近真实意图。⽤户的视觉对话从"看⻅眼前景物"升级为"精准锁定⽬标"——眼神,成了最⾃然的准星。举个例子,用户在用AI识别场景的图片和实况对话的时候,不再需要全面的介绍图片或者视频流中出现的所有内容,而是重点去介绍用户的眼神看到的区域,这样可以大幅的节约算力。

除了以上提到的应用场景,眼动追踪一个广泛且成熟的应用场景就是身份核验与虹膜支付。
目前AI眼镜支付,为确保支付安全性,还需要进行身份核验,目前普遍采用的做法是通过声纹进行核验。而虹膜作为唯⼀性最⾼、稳定性最强的⽣物标识之⼀,具备极⾼的安全优势,非常适合用于身份核验,这对于AI眼镜这样的私密性高的个人终端会非常有价值。
千问的高精度眼动系统采用实时流式多帧特征⾃适应加权融合技术,结合双眼空间位姿动态算法,确保在复杂条件下依然保持稳定的精度,误识率⼩于百万分之⼀,这相较于传统声纹识别提升了两个数量级。
另外,千问和蚂蚁集团深度合作,实现了⾼安全等级的"虹膜核身",让智能体⼀眼认出你是谁,并打造了新⼀代AI⽀付场景——虹膜⽀付。以后用户就可以直接用虹膜进行核验身份,无需再尴尬的用语音来做最后的“确定”了,这对于I人来说绝对非常的实用。相信这一功能的接入,也将会大幅提升 AI眼镜端支付功能的使用率。
全天候视觉感知:环境与⽤户同在理解⽤户,还需要理解⽤户的环境。我们不会每⼀刻都在跟眼镜交互。当你低头⾛路、和朋友聊天、或者只是发呆的时候,你周围的世界依然在变化,⼀个真正随身在线的智能体,不应该只在你看它的时候才"保持清醒"。所以千问在⾏业创新推出了 Always-on 视觉感知系统。在传统拍摄链路之外,千问另辟蹊径,设计了⼀套端到端的低功耗视觉感知链路。
这套新链路的核⼼,是量身定制了⼀套视觉识别的算法模型,部署在端侧⼀颗新增的低功耗视觉感知芯⽚上,配合前端的极简的像素帧采集,以及分级视觉唤醒的处理机制,实现了持续的场景监测——运⾏功耗仅 5 毫瓦。正是这 5 毫瓦,让智能体的视觉感知可以保持实时在线。整套系统有效突破了轻薄硬件形态下持续视觉感知与超⻓续航体验难以兼顾的⾏业瓶颈。
体征监测,成为健康好搭子
作为全天候佩戴的可穿戴式设备,AI眼镜天然就是很好的健康监测载体。千问团队这次在AI眼镜上实现了行业创新的用户体征实时监测,通过内置PPG和温度传感器,可测量心率、血氧、HRV等数据,可为用户提供个性化的AI健康解读报告,还能使智能体对用户形成专属的健康记忆,使相关问答和服务更具针对性,这也进一步提高了产品的实用性,有望成为 AI 眼镜杀手级的应用场景之一。

通过更丰富的真实世界感知信息,千问智能体眼镜将成为用户真正的随身AI助手。例如,长时间办公或阅读时,千问可结合用户的视线变化、眨眼频率和身体状态,判断是否出现用眼疲劳,并在合适的时机提醒用户休息、眺望远处或调整坐姿;长期使用后,还能结合健康数据变化提供解读和改善建议,形成从监测、提醒到分析建议的主动健康服务。
首发轻量化 3DOF 空间显示
指的一提的是,在空间体验上,3D空间显示与3D空间音频也迎来全面升级。在显示侧,3D 感来⾃硬件的双光机⽅案,实现双⽬⽴体视差,还原物体深度信息。空间感基于姿态传感器实现画⾯悬停,让渲染内容锚定在物理空间中,不随头部姿态漂移。
这里特别指的一提的是 3DOF显示,这应该是首款实现 3DOF显示的轻量化AI眼镜。目前,绝大部分带显示类的AI眼镜都仅支持 0DOF,也就是画面显示会跟着头动,这对于一些运动中的场景就不太适合,会让用户感觉画面很晃,视觉对焦会很麻烦。而实现了3DOF,则可以让显示画面固定在空间显示,更类似于现实空间中观看电视等静态显示屏幕画面的效果。

在⾳频侧,采⽤ 7.1 虚拟声道技术重建声场,还原声⾳的层次与空间感。同样基于姿态传感器进⾏声源追踪,确保声源⽅位始终固定,不因姿态变化⽽偏移。
更多新 AI 硬件
据介绍,上述硬件技术将在年内应用于千问AI智能体眼镜;已发售的千问AI眼镜S1、G1也将通过OTA引入Agent能力,进一步提升个性化任务理解和办事能力。今年以来,千问持续推进AI硬件布局,千问的首款AI智能体耳机也在WAIC现场正式亮相。

据悉,这款智能体耳机由千问与Bose联合打造,Bose资深声学团队提供调音支持,实现高保真音质平衡,兼顾开放式耳夹的佩戴舒适性与声音表现。耳机采用可全天候佩戴的耳夹式设计,融入了千问AI助手的核心能力,支持同声传译、会议纪要、健康记录等功能,能带来更自然、无感的AI交互体验。
END