
作者|苏涵
「今天最聪明的人工智能,可能从来没有真正『活』过!」
这是 2026 世界人工智能大会(WAIC)上,腾讯首席科学家、腾讯 Robotics X 实验室、福田实验室主任张正友抛出的一个判断。
在他看来,今天的大模型可以写诗、编程、通过专业考试,也能够完成复杂推理、理解图片和生成视频,但它始终生活在数字世界,从来没有真正进入现实,更没有真正与物理世界建立持续交互。
因此,他将这种状态形象地称为「缸中之脑」。
这并不是一句刻意制造争议的判断,而是点出了 AI 发展的一个关键拐点。
过去几年,大模型竞争主要围绕语言理解、知识推理和内容生成展开,模型越来越聪明、参数越来越大,但当 AI 开始走出屏幕,进入机器人、工厂、家庭,人们逐渐发现,一个真正的智能系统不仅需要会说、会看、会思考,更需要理解空间、环境变化,并能够在行动中不断接收反馈,修正决策。
也正是在这样的背景下,7 月 18 日,腾讯 Robotics X 实验室、福田实验室联合腾讯混元,一次性发布了 Hy-Embodied-VLM-1.0、Hy-Embodied-RxBrain-1.0、Hy-Embodied-VLA-0.5 三个具身智能基座模型,以及具身智能体 Apexio、TairosAgent,并同步升级 Tairos 具身智能开放平台。
从模型、智能体到开放生态,腾讯首次完整地展示了其在具身智能领域的整体技术布局。
如果把这次发布仅仅理解为「腾讯又发布了几个具身智能模型」,或许会低估它真正想表达的意义。
相比让 AI 拥有更多知识、更强推理能力,腾讯 Robotics X 实验室更希望回答的是另一个问题:
当人工智能开始进入物理世界,它应该如何真正理解现实世界,并与现实世界持续交互?从某种程度上说,这也是具身智能进入下一阶段后,整个行业共同面对的一道新命题。
从「缸中之脑」到「具身原生智能」,腾讯为什么重新定义具身智能?
过去几年,大模型的发展几乎都围绕着同一个方向展开:让 AI 变得更聪明。
从 GPT 掀起生成式 AI 浪潮,到多模态模型能够同时理解文字、图片、视频,再到 Agent 开始具备调用工具、执行任务的能力,人工智能不断突破人们对于「认知能力」的想象。
衡量模型强弱的标准,也大多集中在推理能力、知识储备、数学成绩以及代码生成等指标上。
但这些能力有一个共同特点:它们几乎都发生在数字世界。
例如,AI 可以回答「杯子为什么会掉到地上」,却不知道眼前这个杯子有多重;AI 可以识别一张桌子的图片,却不知道桌子是否能够承受一台机器人的重量;AI 可以规划完成一项任务的步骤,却无法在真实环境中根据突发变化随时调整自己的动作。
换句话说,它拥有丰富的知识,却缺乏与现实世界持续交互的经验。
这也是张正友提出「缸中之脑」的原因。
事实上,这一概念源于哲学中的经典思想实验:如果一个人的大脑始终浸泡在培养液里,并不断接受外部输入的各种信息,它是否能够真正理解世界?
今天的大模型某种程度上正处于类似状态。它们学习了海量互联网数据,却几乎没有真正经历过现实世界,因此很难建立起人与物、空间、动作和反馈之间完整的因果关系。而这,恰恰也是具身智能出现的重要背景。
过去,人们普遍认为,只要把一个足够强大的通用大模型装进机器人,机器人自然就会变得更聪明。
但随着越来越多机器人开始进入工厂、仓库、家庭等真实场景,行业逐渐意识到,这种思路并没有想象中那么简单。
真实世界远比数字世界复杂得多。
机器人面对的不只是静态的数据,而是不断变化的人、物、环境和任务目标。
一个看似简单的抓取动作,背后需要同时判断物体材质、重量、空间位置、抓取力度以及周围环境是否发生变化;完成一项任务之后,还需要根据新的反馈重新规划下一步行动。
这意味着,真正的智能不仅需要「知道」,还需要「做到」,更需要在一次次行动中不断学习和修正。
也正因为如此,腾讯提出了一个新的概念——「具身原生智能」。相比过去将通用大模型能力迁移到机器人身上,腾讯更希望从模型设计之初,就围绕机器人在物理世界中的需求构建能力体系。
在其提出的架构中,「左右脑」「大脑」「小脑」和身体并不是彼此独立的模块,而是共同组成一个持续循环的智能系统:视觉负责理解空间与场景,世界模型负责认知、规划与预测未来状态,动作模型负责执行任务,而身体则不断与环境交互,将新的反馈重新送回模型,形成持续进化的闭环。
这说明具身智能的发展逻辑正在发生变化。
如果说过去行业更关注的是,如何让机器人拥有 AI;而未来更值得关注的问题,或许是如何让 AI 从诞生开始,就具备生活在物理世界里的能力。
从「缸中之脑」到「具身原生智能」,腾讯重新定义的并不仅仅是一套技术架构,更是在重新定义下一阶段人工智能的发展方向。
当 AI 开始真正进入现实世界,决定模型能力上限的,或许不再只是参数规模和推理速度,而是它能否像人一样,在行动中理解世界,并在世界中不断成长。
3 个模型+2 个智能体,腾讯正在搭建具身智能的完整闭环
如果说「具身原生智能」回答的是为什么要重新定义 AI,那么腾讯此次发布的三个基座模型和两个智能体,则回答了另一个问题:
下一代具身智能,到底应该如何构建?
过去一段时间,行业对于具身智能的讨论,大多聚焦于机器人本体。
有人比拼运动控制能力,有人比拼灵巧手操作精度,也有人不断刷新机器人奔跑、跳跃、翻跟头等性能纪录。
但随着越来越多机器人开始进入真实场景,一个新的共识正在形成:
机器人真正的竞争力,越来越不取决于某一项单点能力,而取决于是否拥有一套能够持续理解环境、规划任务、执行动作并不断进化的完整智能体系。
从这个角度来看,腾讯此次同时发布 Hy-Embodied-VLM、Hy-Embodied-RxBrain 和 Hy-Embodied-VLA 三个基座模型,本身就具有一定的行业信号。
三者并不是三个彼此独立的模型,而是分别对应机器人智能形成过程中的不同环节。
其中,VLM 负责让机器人理解物理世界,看懂物体、空间以及场景之间的关系;
RxBrain 承担世界模型的角色,让机器人能够理解任务目标,并预测行动之后世界将发生怎样的变化;
VLA 则进一步将这些理解和规划转化为连续、稳定的动作执行能力。
相比过去依靠大量规则和模块拼接完成任务,这套架构更接近人类从观察、思考到行动的自然过程。其中,最值得关注的,或许是腾讯首次提出的 RxBrain。
过去,行业对于世界模型的理解,更多停留在预测未来状态,或者生成未来画面。但张正友认为,仅仅能够预测,还不足以支撑机器人完成复杂任务。
真正困难的是,机器人需要同时知道「下一步应该做什么」,以及「做完之后,世界应该变成什么样」。
因此,RxBrain 最大的特点,并不是单纯进行语言推理,也不是单纯生成未来图像,而是第一次把两种能力结合在一起。
面对一个复杂任务,它会先利用语言拆解任务步骤和约束条件,同时生成每一个子任务完成后的目标状态图像。
机器人执行过程中,不仅能够依据文字理解任务,还能够实时将当前画面与目标图像进行对比,判断任务是否完成、哪里出现偏差,并据此重新规划下一步行动。
用张正友的话来说,这个具身「大脑」不是直接告诉机器人答案,而是先为机器人想象一个明确的目标世界。
这一点,也是腾讯此次最具差异化的地方。张正友透露,过去团队做长程任务规划时,主要依赖文本描述,每完成一个子任务,再进入下一步。而今年最大的变化,就是让「左右脑」之间的信息传递,不再只有语言,而是加入了图像。
换句话说,机器人不仅能够读懂任务,还能够提前看到任务完成后的样子。对于人来说,这种能力再自然不过。
我们收拾餐桌、摆放餐具时,脑海里往往已经提前形成了最终完成后的画面,再一步步把现实调整到目标状态。而腾讯希望赋予机器人的,正是这种先想象、再行动、再校正的能力。
与此同时,腾讯发布的 Apexio 和 TairosAgent,则进一步补上了模型之外的最后一块「拼图」。过去很多智能体,本质上仍然是「问一句、答一句,动一下、停一下」的响应式系统。
但物理世界不会等待机器人思考。人在移动,环境在变化,机器人自身也需要持续保持平衡、安全和状态管理。
为此,Apexio 的 Always-On 架构,试图让机器人始终保持在线感知和即时响应,更接近一个能够持续工作的智能生命体;而 TairosAgent 则进一步承担起能力调度和复用的角色,让不同模型、不同机器人能够共享技能、快速迁移能力,降低具身智能落地过程中的开发成本。
从三个模型到两个智能体,腾讯真正想搭建的,并不是几个单独的 AI 产品,而是一套完整的具身智能技术体系。
未来具身智能的竞争,或许也将逐渐告别单纯比拼模型参数、机器人性能的阶段,而是谁能够建立起连接模型、智能体、机器人本体以及应用场景的完整闭环。
对于正在加速走向产业化的具身智能来说,这种系统能力,很可能比任何一项单点技术都更具长期价值。
不造机器人,腾讯想成为具身智能时代的「钛螺丝」
纵观这一轮具身智能浪潮,大多数企业都在围绕机器人本体展开竞争。
有人做人形机器人,有人做四足机器人,也有人专注灵巧手、关节、电机等核心零部件,希望打造一款更先进的机器人产品。
因此,也有不少媒体在关注腾讯对于机器人的布局和看法。对此,张正友给出了一个明确回应:「中国在机器人本体上的能力,已经是世界领先,腾讯没有必要再去重复造一个机器人。」
事实上,腾讯几乎没有强调要打造自己的机器人品牌,而是将更多精力放在模型、智能体以及开放平台建设上。
这种选择并非偶然,而是基于腾讯对于具身智能产业的一种判断:未来机器人形态可能会越来越丰富,不同行业、不同场景都会出现适合自己的机器人产品,但真正决定机器人智能水平和迭代效率的,很可能是底层的软件能力,而不是某一种固定的硬件形态。
换句话说,今天机器人之间竞争的是本体,未来竞争的可能是「智能底座」。
也正是在这样的背景下,今年 WAIC 上,除了三个模型、两个智能体之外,腾讯还宣布升级 Tairos 具身智能开放平台。
那么,Tairos 是什么?
它能够给行业带来什么作用?张正友用了一个大家都熟悉的例子来解释。
在他看来,未来机器人产业很可能会像智能手机一样,逐渐形成两条不同的发展路径。
一种是类似苹果,从硬件、本体到软件全部由一家企业完成,形成高度垂直整合;另一种则更接近 Android 生态,由不同厂商分别负责机器人本体、智能平台和行业应用,再共同组成开放生态。
腾讯显然选择了后者。「Tairos 要赋能不同机器人本体厂家。」张正友表示,腾讯更希望发挥自己在人工智能、云计算以及连接生态上的优势,为机器人企业提供具身智能能力。这一定位,也决定了 Tairos 并不是一个只服务腾讯自己的平台。
过去一年,腾讯已经与宇树、越疆、智元等机器人企业展开合作,并率先围绕导览导购、工业制造等场景进行落地。
张正友提到,之所以优先选择这些头部企业,并不是为了追求合作数量,而是因为成熟稳定的机器人本体能够帮助团队更快验证具身智能能力,再通过生态伙伴进一步向更多行业复制。他举了一个例子。
去年,为了让 Tairos 适配合作伙伴的机器人,团队花了数个月时间共同打磨;而平台成熟之后,新的机器人接入速度已经明显提升。最近完成越疆机器狗适配,仅用了一天时间。
这背后依赖的,正是 Tairos 建立的一套统一硬件抽象层和标准化接口,让不同机器人能够快速接入同一套具身智能能力。这也是腾讯反复强调平台价值的原因。
这种思路,与很多具身智能企业正在尝试打造「机器人全栈能力」的路径形成了鲜明对比。
在不少创业公司看来,从本体到模型全部自己掌握,可以实现最高程度的软硬件协同;而腾讯则更像是在构建一套开放的基础设施,让机器人厂商专注机器人本体,让应用开发者专注行业场景,而具身智能能力则由 Tairos 统一提供。
正因如此,Tairos 这个名字里,才有了一个特殊的「钛」字。
正如张正友所说:「我们希望做具身智能行业的一颗『钛螺丝』。它也许不是舞台上最显眼的部分,却能够可靠地连接模型、本体、工具与应用,支撑整个生态共同运转。」这句话,也揭示了腾讯对于具身智能最真实的期待。
它并不执着于成为那个站在聚光灯下制造机器人的企业,而更希望成为整个产业背后的连接者。
毕竟,再聪明的 AI,如果始终只是一个停留在数字世界里的「缸中之脑」,终究无法真正改变现实世界。
从这个意义上看,腾讯此次发布的产品,更像是在为这些原本生活在「缸里的 AI」,推开那扇通往现实世界的大门。门外,没有标准答案,却有真正的成长。