
编者按:本文整理自大晓机器人开悟世界模型研发负责人王飞在星河频率线上沙龙中的分享,内容经星河频率编辑。
作者|钱增婕
过去半年,具身智能圈最热的关键词,非「世界模型」莫属。从年初少数公司押注,到如今几乎每家企业都在讲述世界模型的故事,共识与分化在同步发生。
这股热潮并非凭空而起。2026 年上半年,具身智能赛道一级市场融资总额高达 460 亿元,资本用真金白银投下信任票。
驱动这轮热潮的核心逻辑在于,行业正在完成一次根本性的认知升级——大语言模型让机器学会「谈论」世界,而世界模型要让机器学会「理解」并「作用于」物理世界。
目前,大晓机器人开悟世界模型(Kairos)在四大国际权威评测中均位列第一,在多项核心能力维度上达到了全球顶尖水平,对此,大晓机器人无疑具备发言权。

世界模型≠视频生成,「开悟」契合物理 AGI 五层结构
行业对于世界模型一个普遍的误区是,世界模型可以直接与视频生成画等号。
因此行业内大多数世界模型走的是一条拼接式路径——用通用视频生成模型作为基底,再叠加机器人数据做下游续训。这种方案的天然缺陷在于,视频生成与动作控制是两套独立系统。
正确的做法是,世界模型不仅要生成视频,更要生成策略,即驱动机器人执行任务的控制信号。
开悟的核心架构由此被设计为「理解—生成—预测」一体化:
理解模块通过思维链拆解任务、分析环境,生成模块与预测模块共享状态信号与视频信号,同步输出策略轨迹。
在这里,生成模块的真正作用并非炫技式的画面输出,而是对策略推演进行可视化验证。这也是世界模型区别于 VLA 的关键所在。理解、生成、预测三者构成闭环,模型才能在「脑海」中推演多条路径,选出最优解再交由现实执行。
正是在这一闭环之上,开悟世界模型的核心逻辑才得以展开:
世界生成:在生成层严格约束物理一致性,比如物体不能穿模,抛起来要受重力落下,确保物体交互符合真实物理规律,而非仅追求画面美观。
物理认知:在静态层面量化质量、速度与守恒定律,在动态层面建模运动时序与交互力的大小,做到物理属性显式化。
交互与反馈闭环:针对模型没有「成功/失败」的判断能力,在执行完动作后,用视频生成分支回放策略推演,让理解模块判断成败,形成闭环。
自我进化:输入指令后,生成 10 条甚至 100 条轨迹,每条对应一个「策略推演视频」,由理解模块判断每条的成败及原因,迭代优化后选出最优轨迹执行。
多机协同:让不同构型的机器人(轮式双臂、人形、灵巧手、单臂)共享同一套虚拟时空表达和全局状态表征,从单机智能走向规模化群体协作。
开悟世界模型的核心逻辑,是一套严格契合物理 AGI 五层结构的逐级能力递进。
从物理一致的世界生成、到显式量化的物理认知、到成败闭环的交互反馈、到策略迭代的自我进化,最终走向多构型机器人的规模化群体协作。
炼出「好世界模型」关键标尺:精度与效率
当各家纷纷亮出自己的世界模型,一个更实际的问题随之浮出水面,如何判断优劣?
关键词是:精度与效率。
其中,精度是前提,没有精度就谈不上效率。而提升精度的核心路径,是验证世界模型的「尺度定律」。
围绕这一方向,开悟世界模型提出了一个「统一世界理解框架」,将世界分为三层进行学习:
第一层是物理世界层:学习客观物理规律,让模型生成的内容符合真实物理法则。早期通过收集约 700 万小时的互联网视频数据,训练底层 Kairos-4B 基模型。
第二层则是以人为中心的交互层:收集大量包含第三视角(观察全身动作,服务于小脑)和第一视角(观察精细操作,服务于大脑)的人类交互数据。这一层的核心挑战在于学习方法。隐空间学习与显示的手部关节点学习二者缺一不可,隐空间学习成本更低,而两者配合能大幅提升下游真机任务成功率。
第三层才是真机数据层,少量真机数据用于将能力迁移到特定机器人本体。
而在后训练阶段,具身数据可以分为三类:成功数据、失败数据、失败后再成功的数据,其信息密度依次递增。
成功轨迹的多样性有限,而失败轨迹千千万,因此失败数据的利用效率远高于重复采集成功数据。
开悟在后训练阶段引入强化学习,利用大量失败数据以及失败后重试成功的数据进行训练,让模型学会分辨成败并自我纠正,从而显著提升了下游真机操作的能力。
用强化学习挖掘失败数据的价值,这也是开悟区别于多数玩家的核心策略。
最后一步是部署态。
世界模型要走向商业落地,不仅要具备强大的「大脑」,还必须达到与物理世界实时交互的节拍效率。这要求必须自主设计基模型,并做大量高性能计算与量化工作。
开悟的 Kairos-4B 模型部署在英伟达 Thor 及部分国产芯片上,已能达到每秒 10-15 赫兹的推理速度,实现了丝滑的端侧交互体验。
好的世界模型,本质上是精度与效率的平衡。精度端,通过三层数据框架验证尺度定律,并利用强化学习把失败数据「变废为宝」;效率端,通过自研模型与端侧部署优化,实现实时直驱本体的推理能力。两者兼备,才是通往物理 AGI 的可行路径。
从数据生成到具身大脑,世界模型未来不可或缺
世界模型是链接数字世界与物理世界的关键桥梁,而它的具体应用,对应着三种能力层级。
第一层是数据生成。
行业当前的核心瓶颈已从「模型怎么训」转向「高质量数据从哪来」。真机采集成本高、场景覆盖窄,合成数据是唯一可规模化的解法。但普通视频生成模型缺乏物理一致性,产出的数据「不能用」。世界模型生成的合成数据,严格遵循物理规律,能直接用于下游 VLA 和操作模型训练,这是数据侧正在发生的质变。
第二层是环境代理。
可以理解为「虚拟训练场」。机器人的数字孪生体可以在其中进行实时交互与大规模试错,成千上百条策略轨迹在虚拟环境中完成训练,筛选出最优策略后再迁移到真机。这种方式大幅降低了真机训练的时间成本和硬件损耗,尤其适用于操作模型的训练与小脑运动控制能力的迭代。环境代理本质上是世界模型从「看世界」迈向「模拟世界」的关键一步。
第三层是具身大脑。
这是世界模型的终极应用形态。具身大脑不仅要驱动本体与物理世界实时交互,还要能获取环境反馈并判断任务成败,进而启动自我反思与迭代优化。
简单来说,世界模型作为具身大脑,需要赋予机器人「推演、预测与规划」的能力。
三个应用串联起来,数据生成器解决「没数据练」的问题,环境代理解决「没地方试」的问题,具身大脑解决「没脑子想」的问题。
世界模型不只是一个技术模块,它是通向物理 AGI 的底层操作系统。
沿着这套底层操作系统的逻辑继续追问:如果世界模型是物理 AGI 的最佳路径,那当前行业热议的 VLA 又处于什么位置?
王飞的判断是,二者大概率不会走向二选一,而更可能形成一种互补共生的关系。
VLA 的长板在于语言与视觉的跨模态理解,能够快速响应人类指令;世界模型的长板在于物理推演与策略验证,能够预判「这么做会怎样」。
一个负责「听懂」,一个负责「想通」。两者的融合,有望构建出既能理解人类指令、又能遵循物理规律的完整具身大脑。
总之,世界模型与数据闭环、机器人本体共同构成了一个持续旋转的飞轮。每一次任务的执行都产生数据,数据又反哺模型,模型升级后再驱动本体去执行更复杂的任务,循环往复,能力逐级跃升。
当这个飞轮开始自驱转动,机器人就不再是被编程的提线木偶,而是能在真实世界中持续学习、不断进化的自主智能体。