机器人不需要看电影——WAIC「世界模型六小龙」同席论道,给物理AI换了一把标尺

「像素复刻是给人看的,物理推演是给机器人用的——这是两件事。」

在WAIC 2026世界模型「六小龙」巅峰论坛的压轴环节,大晓机器人首席科学家、澳大利亚科学院院士陶大程教授的这句开场白,为这场备受期待的圆桌定下了基调。

蚂蚁灵波首席科学家沈宇军、极佳视界首席科学家朱政、无界动力联合创始人兼CTO夏中谱、智元机器人AI算法总监任广辉、自变量机器人CTO王昊——五位嘉宾加上主持人陶大程,几乎凑齐了当前国内世界模型最主流的技术路线:

从头预训练的物理原生派、视频生成派、潜空间加强化学习派、policy与simulator双轮派、端到端统一模型派。

用陶大程的话说:「今天这张圆桌,就是中国世界模型研究的一个缩影。」

而这场对话最难得的地方在于——六家公司路线各异,却没有回避分歧,反而把分歧摆上了桌面。

时空穿梭机:两年后回望,什么做对了,什么做错了?

圆桌的第一个问题就够尖锐:假设有时空穿梭机,两年后回头看今天的世界模型,什么最可能被证明做对了,什么做错了?

沈宇军的回答直指行业的一个普遍误区:大家混淆了「模型的能力」和「模型展现出来的能力」。

推理效率、可交互性是前者,画质、观感是后者。「所有为模型架构本身积累的能力,应该都是做对的;但过于追求模型呈现出来的能力,不好说。」

朱政则抛出了一个悬念式的追问。

他类比语言模型的发展史:

在Codex出现之前,OpenAI做过AI for Science、情感陪护等诸多探索,国内厂商春节还在发红包拉新——直到Codex出现,游戏规则一夜改写,技术随之收敛。「我非常想知道,对于世界模型而言,我们的Codex产品究竟是什么。」

任广辉把矛头指向了数据与架构的「娱乐化基因」:

当前大量视频数据为内容创作而生,运镜、剪辑刻意制造超现实效果,并不符合真实物理规律;而主流视频生成架构追求的是画面精致,「这些画面对动作生成到底有多大帮助,不一定」。他的结论是,世界模型必须走向数据原生与架构原生。

王昊给出了全场置信度最高的一个判断:

「用纯视频的方式构建对物理世界的理解,可能有很大问题——我的置信度在90%左右。」没有更多物理信息的输入,路走不通。

陶大程总结:

「我们做对的,是终于让AI从数字世界的旁观者变成了物理世界的参与者;做错的,可能是把太多算力用在了让世界看起来像,而不是让行动做得成上。我们拿着一把给人看的标尺,去量一件给机器人用的事情。」

最缺的一块拼图:数据、触觉,还是闭环?

世界模型很热,但离基础设施还有距离——距离在哪里?

朱政的担忧非常现实:当前视频生成基模均为数字世界设计,且正在走向闭源。「如果不尽早从头训练自己的物理世界基模,后面会面临无基模可用的局面。」

夏中谱点出了模态的结构性缺失:

力觉、触觉数据几乎空白;而Transformer架构脱胎于信息密度极高的语言,面对信息密度极低的图像与触觉,如何在隐空间提取有效表征,仍是未解之题。他还补了一刀:模仿学习只能复刻人类、无法超越人类,训练范式本身也需要变革。

王昊则把问题拉回商业与技术的交界处——数据闭环。「谁率先在真实场景实现大规模部署,谁的技术迭代就更快,因为这符合具身智能从交互中学习的本质。」

任广辉的答案最简洁也最扎心:数据标准。「世界模型到底需要哪些模态、这些模态怎么对齐,行业至今没有定出标准。定不出标准,就没办法scale up。」

画面满分,物理零分:评测的标尺该怎么换?

第三个议题是全场交锋最密集的部分。

陶大程先讲了自己的困惑:机器人端着水杯运动,动作明显不稳,生成的水面却纹丝不动——画面满分,物理零分。如果榜单还在用视频生成时代的画质、时长、一致性打分,行业就会持续优化错误的目标。

他请每位嘉宾只留三个指标。答案各有侧重,却暗暗指向同一处:

夏中谱:泛化性(是否真正掌握因果)、预测精度、决策有效性;

任广辉:物理与多视角一致性、表征是否可用于规划、对最终policy的提升;

王昊:反事实预测能力(以「当前状态+动作」预测未来,才能证明真的理解世界)、恒常性记忆、推理时效性——「长程预测对具身世界模型是伪需求,我们需要的是快速rollout、快速反馈」;

沈宇军:动作准确性、物理合理性而非准确性(「模型只需要知道铁比棉花掉得快,不需要算出9.8」)、时效性;

朱政:few-shot设置下多任务的真机成功率。

陶大程把这些指标收进一个统一框架——世界模型的评测,本质是在度量三种智能:

生成智能是入场券,看能否构建视觉连贯的世界;认知智能看因果对不对,物体消失会不会凭空出现;物理智能最关键,看预测能否转化为可靠行动,「从像到想,从想的对到做的成」。

这也正是当天大晓联合行业发布Physical IQ物智统一评测平台的深意:

「不是给模型排座次,而是给行业换一把标尺——把问题从生成的像不像,换成能不能支撑真实的行动。一个领域优化什么,就会得到什么。」

收敛点在哪里:统一表征、触觉,还是评测标准?

短期分化、长期收敛,是圆桌上的普遍预期。但收敛点在哪里,五位嘉宾押了不同的注。

任广辉和夏中谱押统一表征——前者强调表征之外还必须加上「物理环境的闭环」,训练之后要像Agent一样在交互中涌现主动智能;

后者用开车做类比:「视觉看到的大部分信息是无效的,有效决策需要找到与决策强关联的表征,在其上建立因果,推演才会越来越准。」

王昊则预言了一次「取长补短」式的架构融合:

视频生成路线中「对未来的预测」会留下,像素级渲染的权重会被越降越低直至剔除主干;潜空间表示会承担推理,显式3D建模会被淘汰、但可能以「空间记忆」的形式存活。「离那天并不远。」

沈宇军独押触觉:「触觉一旦突破,物理世界的模型和视频生成就直接从模态上区分开了——它将是机器人不可或缺的模态。」

朱政则选择了标准化评测,呼应了当天Physical IQ的发布:「评测正在从实验室走向in the wild,标准化评测给模型提供真实反馈,也为优化指明方向。」

面对五个不同答案,陶大程反而松了口气:「如果今天大家观点都一样,我反而担忧。」

他的判断是:

短期的收敛不会发生在某条路线的胜出上,而会发生在衡量标尺的统一上——就像深度学习的收敛不是CNN打败了RNN,而是ImageNet让所有路线在同一把尺子下度量。「路线的分歧不是行业的问题,而是行业的红利——前提是有统一的标尺。」

从Demo到Deployment:Demo看最好的一次,工厂看最差的一次

最后一个议题落地:

Demo的标尺是最好的一次有多好,Deployment的标尺是最差的一次有多差。各位踩过的最深的坑是什么?

王昊把账算得最直白:

部署成本上存在明显的Scaling Law——从0%到90%靠模型能力,从90%到99%的成本与前者相当,从99%到99.9%又要翻一番。「部署阶段不是由学术idea多惊艳决定的,而是由成本能不能cover决定的。」

沈宇军讲了两个日常场景:

展台上所有Demo都靠工作人员复位,而观众的互动需求千奇百怪;去盒马找一种菜,可能被顾客随手放进了牛奶柜——「看起来很突发的情况,却是生活中的日常。」

朱政分享了「最惨痛的教训」:曾动员研发人员下工厂谈需求、对接场景,最终发现落地不了的本质是模型能力不够,于是收缩战线,回头死磕模型上限。

夏中谱指出Demo只是能力上限,部署要系统性考虑持续性、稳定性与异常处理;

任广辉则用工厂七天连续直播的经历补充

:产线不能停,算法要快速部署、快速适配新工件,「Demo可以是一次性的,部署要的是一个工厂一个工厂地复制」。

陶大程最后补上一个容易被忽略的维度——成本与延时。

机器人在产线上做决策,留给它的时间只有一百多毫秒甚至几十毫秒,不能指望网络永远在线。「一个任务导向、紧凑的、跑在端侧直驱本体的世界模型,产业价值很可能远大于跑在云端的大脑。」

他把世界模型的产业闭环归纳为四个角色:训练时是数据引擎,评估时是考官,规划时是沙盘,部署时是本能——缺哪一个,就断在哪里。

结语:产业为「稳定的聪明」买单

圆桌尾声,陶大程说出了这场对话中传播度最高的一句话:

「最难的不是让模型变聪明,而是让聪明变得便宜、高效、可靠。产业不会为聪明买单,但会为稳定的聪明买单。」

大屏幕上,六家公司的共识被凝练成一句话打出——本质上,是给这个领域换了一把标尺:从生成的「像不像」,换成执行的「可靠不可靠」。

分歧是论文的素材,共识是产业的地基。

当六条技术路线愿意坐在同一张桌前、接受同一把尺子的度量,物理AI从理解到执行的开悟时刻,或许真的不远了。

声明:本文为维科号作者发布,不代表维科号立场。如有侵权或其他问题,请及时联系我们举报。