一年时间,大晓跑出物理AI的中国速度

【导读】从原生统一架构、四榜领先,到125毫秒端侧推理与真机反思闭环,大晓正在把世界模型从“研究对象”变成机器人的行动中枢。

如果说过去两年,世界模型还是具身智能里最性感、也最容易停留在概念层的技术名词,那么到了WRC 2026,行业迎来了一次真正的分水岭:世界模型不能只负责“想象世界”,它必须开始真正驱动机器人行动。2026世界机器人大会把“人机共生,产需共融”放在舞台中央,背后其实只有一个问题——再好的模型,能不能从论文、视频和榜单里走出来,在真实世界中实时决策、持续执行,并承担行动后果?

大晓机器人 WRC 2026 展台

大晓机器人用不到一年的时间,把这个问题推到了一个更激进的位置。Kairos开悟世界模型从“理解—生成—预测”原生统一架构出发,持续向“理解—推演—执行—反思”的完整行动闭环演进;Kairos相关模型在RoboTwin 2.0、LIBERO-Plus、WorldModelBench Robot、DreamGen等四项代表性评测中取得领先成绩;Kairos 3.1进一步把8B世界模型压到NVIDIA Jetson Thor端侧,实现125毫秒级实时推理。对一家成立约一年的公司而言,这不是简单的版本迭代,而是在极短时间内把一条原本需要“论文—工程—端侧—真机”多年串行验证的路线,压缩成了并行推进的系统工程。

大晓世界模型这一年,称得上“中国速度”。

第一性原理先行:大晓不是先做模型,

而是先回答“机器人为什么需要世界模型”

大晓对世界模型的判断,从一开始就不是“生成得够不够逼真”,而是“能不能降低行动代价”。在数字世界里,模型生成错一张图,最多重新生成;在物理世界里,机器人一次错误判断可能意味着掉落、碰撞、损坏,甚至安全风险。也因此,大晓在WAIC 2026提出具身世界模型的第一性原理:从海量、冗余、多模态的信息中提取真正影响行动结果的关键信息,锚定控制充分状态,让机器人在充满不确定性的真实环境中,以更低试错成本完成行动。换句话说,世界模型不是为了更好地“描述世界”,而是为了更可靠地“介入世界”。

这个判断直接决定了技术路线。当前世界模型大致可分为表征式、生成式、交互式,以及理解—生成—预测一体化等方向。前三类往往各自解决一个局部问题:有人擅长表征,有人擅长生成,有人擅长与环境交互。但机器人面对真实任务时,不会把世界切成三个独立模块:它必须在同一个时刻理解场景、预测动作后果、选择策略,并根据执行结果重新判断。因此,大晓没有选择在现有视频生成模型上“外挂”更多能力,而是从底层统一世界状态表征,让理解、生成、预测天然共享同一套内部世界。

2025年底,大晓发布原生“多模态理解—生成—预测”一体化架构;到Kairos 3.1,这条路线进一步进入行动闭环。视觉观测、语言指令、力触状态、策略轨迹等多维具身信号被压缩到统一隐空间,世界理解负责判断“现在发生了什么”,物理生成负责推演“接下来可能发生什么”,动作预测则回答“应该怎样做”。更重要的是,执行结果还会重新反馈给模型,形成反思与再规划。原本割裂的感知、推演、执行,被压成一条连续的智能链路。

随后NVIDIA Cosmos 3.0也进一步强化理解、生成、预测统一的方向。与其把这种趋同解释为“谁验证了谁”,不如说它说明具身世界模型的行业坐标正在快速收敛:下一阶段真正有价值的世界模型,不会长期停留在“生成未来画面”,而是要建立统一的物理世界表征,并最终进入行动决策。大晓更值得强调的地方,是它在一家年轻公司的组织尺度上,很早就做出了这条高成本路线的判断,并迅速完成工程兑现。

图片

真正的分水岭:不是“世界模型有多大”,

而是“能不能塞进机器人、实时驱动本体”

世界模型过去最大的工程悖论是:能力越强,模型往往越大;模型越大,推理越慢;但机器人恰恰需要连续、实时、低延迟的反馈。一个云端世界模型即使能生成极其逼真的未来,如果每一步都需要等待数秒,它依然无法参与真实控制。机器人不会等模型“想完”再开门,移动中的物体也不会因为推理延迟而停下来。世界模型能否进入端侧,本质上决定了它究竟是研究工具,还是机器人的“大脑”。

大晓在这条线上推进得非常快。材料显示,Kairos 3.0已在今年3月实现端侧部署并控制实体机器人;不到四个月,Kairos 3.1进一步将8B模型在Jetson Thor平台上的推理延迟压到125毫秒,并通过自研KairosRT高性能计算引擎实现端侧实时运行。更重要的是,大晓不是把一个轻量策略头塞到端侧,而是试图把理解、生成、预测、反思这一整套能力一起放到机器人身上。世界模型第一次不只是“给机器人建议”,而是直接进入行动回路。

开冰箱的演示非常能说明问题:三指操作失败后,系统并没有机械重复原动作,而是识别到执行结果与预期不一致,重新判断失败原因,在平行空间推演多种后续策略,并最终切换为四指方案完成开门。真正值得传播的,不是“四指比三指更有力”,而是机器人开始具备一套此前很难在单一策略模型中完整呈现的能力链:它知道自己失败了,能定位为什么失败,能在执行前重新模拟,并用新的动作方案修正现实。失败不再只是一次终止,而成为下一次行动的输入。

这也是大晓对“开悟世界模型”的核心定义:它不是一个更大的预测器,而是一个能够把“想象”转化为“行动”的物理智能中枢。VLA更像在回答“下一步怎么动”,而世界模型进一步回答“为什么这样动、这样动会发生什么、失败后还能怎么办”。当机器人开始在行动前推演、行动后反思,世界模型才真正从视频生成技术跨进Physical AI。

图片

四榜领先只是证明题,

真机闭环才是“大晓速度”的主战场

榜单仍然是技术路线最直接的外部坐标。大晓公开材料显示,Kairos在RoboTwin 2.0中以96.1%的平均成功率取得领先,在LIBERO-Plus上取得89.0分;Kairos-4B在WorldModelBench Robot中以4B参数规模超过更大参数模型,DreamGen视频生成评测同样取得领先。四项结果覆盖机器人操作泛化、真实扰动适应、机器人世界模型与视频生成等不同维度,至少说明一件事:大晓并不是用单一能力换取单一榜单,而是在验证统一架构能否同时覆盖理解、生成和行动相关能力。

但在大晓看来,榜单永远只是“证明题”,不是“终局题”。具身智能真正的价值,不取决于实验室里的最好一次成绩,而取决于同一套模型能否跨视角、跨环境、跨任务长期工作,能否在算力受限的本体上实时运行,能否在异常发生时自己恢复。也因此,大晓从一开始就没有把技术节奏拆成“先论文、再产品、最后落地”,而是评测、端侧、真机和真实场景并行推进:模型一旦突破,就尽快装进机器人;机器人一旦暴露问题,就尽快回流到模型与数据端。

这正是“大晓速度”最有力量的地方:不是每隔几个月发布一次新版本,而是把每一次技术突破到真实世界验证之间的距离不断缩短。行业常说具身智能需要数据飞轮,大晓更进一步做的是“系统飞轮”——模型、端侧、本体、数据、场景同时转动,任何一条链路的进步都会加速下一条链路。速度因此不再是一次性领先,而开始沉淀为组织能力。

WRC 2026后世界模型进入工程化淘汰赛:

谁能真正驱动机器人,谁才有资格定义下一代Physical AI

WRC 2026将“产需共融”写进主题,并设置发布、采购、开发者等不同主题日,本身就是行业从“秀技术”走向“验技术”的标志。过去大家争论哪条世界模型路线更先进,接下来真正决定胜负的,会是更直接的问题:模型能不能装进机器人?能不能低延迟运行?能不能跨本体复用?能不能在真实场景里持续工作?能不能把一次失败变成下一次更好的决策?

也就是说,世界模型正在从“模型竞赛”进入“系统竞赛”。未来最强的玩家,未必是参数最多的公司,而是能同时打通数据生产、模型训练、端侧推理、本体控制和场景闭环的公司。大晓过去一年做的,恰恰是把这些环节提前拉到同一个战场:Kairos负责世界模型,ACE负责高信息密度数据,KairosRT解决端侧,真实行业方案负责把智能送进物理世界。

大晓成立约一年就把世界模型推进到这一阶段,并不意味着终局已经到来;相反,它说明真正的竞争才刚刚开始。所谓具身智能的“ChatGPT时刻”,不会只由某一个更大的模型触发,它更可能发生在某一天:世界模型终于能够以足够低的成本、足够高的可靠性,成为不同机器人本体的通用智能底座。那一刻,行业会突然从“每个机器人都要单独教”跨入“机器开始共享世界经验”的新阶段。

如果几年后再回看这一轮Physical AI浪潮,行业或许不会只记住谁发过最大的模型、谁做过最炫的Demo,而会记住谁最早把世界模型真正送进机器人,让“理解世界、推演未来、自主行动、失败反思”成为同一套系统的日常能力。

世界模型的“ChatGPT时刻或许尚需时日,

但大晓正在用中国速度证明:

这个时刻,可能不会太远。

END

声明:本文为维科号作者发布,不代表维科号立场。如有侵权或其他问题,请及时联系我们举报。