告别榜单内卷:星尘智能首个家庭型隐空间世界动作模型发布,具身智能迎来真机大考

作者|毛心如

如何判断一个模型的好坏?

这个问题放在当下的具身智能领域,答案像薛定谔的猫:在真正落地之前,模型能力既可能成立,也可能只是叙事。

长久以来,行业惯于依赖模型叙事:论文指标、参数规模、训练策略、架构设计,这些构建了一套看似严谨的评价体系,却往往难以在短期内被现实证伪。

于是,榜单与测评应运而生,试图通过标准化测试集赋予模型能力以客观量化。

但当大量玩家涌入,评测体系开始异化,榜单被针对性优化,测试集偏离真实场景,甚至出现专为刷分而训练的评测特供模型。

悖论由此显现:榜单上的优胜者,未必最适应真实世界的复杂性。

这正是行业当下的核心张力:机器人界信奉 Show,not tell(重展示),而模型领域却滑向 Tell,not show(重叙述)。

评价体系正在背离初衷。

因此,一个更本质的问题浮出水面:模型能力的真正试金石,可能不在分数,而在于它解决了什么实际问题、提出了何种新理解、是否在真实世界中产生可验证的效果。

换言之,行业正经历从看分数到看改变的评价范式转移。

在此背景下,具身智能也迎来技术分水岭。继 VLA 成为阶段性共识后,世界模型成为今年焦点。

但技术路径迅速分化:多数玩家沿袭逐像素重建的视频生成路线;另一条更激进的思路则试图绕开无关像素信息,直击“操作的本质”来建模。

星尘智能给出的答案,是第二代基座模型 Lumo2——业界首个家庭隐式世界动作模型(Latent Action World Models),从海量数据中汲取物理规律,用最小计算获取最大世界模型效果。

它在 Show and tell(叙事与行动并重)之间寻找平衡,用可落地的技术回应行业长期存在的验证困境。

破局四大行业瓶颈,Lumo-2 重构具身智能底层推理逻辑

过去两年,VLA 一度被视为具身智能的标准答案。

谷歌 DeepMind 的 RT-2 论文刚出来时,分析师们连夜改报告,把商业化时间表往前挪了三年。

这套打法的核心逻辑是:先用互联网图文数据对齐视觉和语言,再接入机器人动作数据进行端到端微调。

但问题在于,互联网数据教会了模型苹果是红色的圆形物体,却没教会它苹果被施加 10N 的力会发生形变并可能滚开。

即便把模型规模再扩大十倍、灌入更多网络图片,它对物理交互的预测能力也几乎是一条平直的线,互联网数据和物理世界之间,存在一道模型自身无法跨越的鸿沟。

VLA 本质上解决的是看到什么、说什么的问题,而非这个世界将如何演化。

当机器人真正从实验室走进家庭、商业和工业等开放环境,这道鸿沟以四个具体挑战的形式暴露出来:

机器人只能预测下一步动作,却无法解释为什么要做这个动作,动作会如何改变世界

复杂技能学习高度依赖机器人示范数据,成本高昂

难以充分利用互联网视频、人类操作等海量非机器人数据持续成长

模型规模不断增大,推高了部署成本和端侧算力要求

Lumo-2 的核心转向,是从预测下一步动作的传统 VLA 范式,升级为先推演未来世界状态,再基于推演结果生成动作的全新范式。

它思考具身原生的路径:让基座模型以动作为中心设计,把机器人动作视为模型第一公民模态(first-class modality),不做视觉或语言模型的附属输出。

以终为始,用物理执行这个最终目标反推模型架构,而不是简单迭代 Lumo-1,或适配现有视频生成模型或 VLA。

围绕这一转向,Lumo-2 完成了三项根本性迭代。

首先是世界预测能力的引入。

传统 VLA 模型关注像素级变化,而 Lumo-2 不是去花费大算力去合成未来视频,而是以动作为中心,在轻量、基于物理的潜在空间(Latent Space)里先预测物体状态、运动趋势和交互关系,让决策更接近人类直觉,以最小计算成本实现类世界模型的高高推理性能。

其次是跨模态对齐的创新。

Lumo-2 采用三阶段渐进式预训练:第一阶段对齐动作与世界动态,建立物理约束;第二阶段注入视觉和语言语义;第三阶段在多源数据上固化预测-执行的因果推理链条。

这种物理优先于语义的顺序设计,充分考虑了物理规律在不同场景中的不变性,不仅加快收敛,还提升了在未见物体和指令下的泛化表现。

第三是多源数据扩展。

Lumo-2 突破了传统模型对机器人示范数据的依赖,能够同时学习第一视角人类视频、多模态互联网数据以及不同平台机器人数据。

这让机器人像人类一样通过观察世界持续进化,大幅降低数据采集成本,并实现跨本体和人机技能的自然迁移,无需额外专门算法。

这些迭代带来了实实在在的效果。

真实世界复杂操作中Lumo-2模型表现

在具身理解、跨域迁移、真实复杂操作等权威基准测试中,Lumo-2 多项指标位居前列。

实际部署中,模型在单张 RTX 5090 上实现了约 100ms 的推理速度,并通过分块自回归等优化达成 2.71 倍端到端加速,支持闭环实时控制。

跨本体、人机技能迁移无需专门算法,新场景、新平台的适配成本被大幅降低。

Lumo-2 的意义不仅在于变得更强,更在于真正变得可用。

22 项家庭自主任务实证,最强家庭隐式世界模型的落地力

对行业而言,技术理论再亮眼,终究只是能力上限,真实场景的落地表现才是检验实力的唯一标准。

多数模型都逃不开实验室惊艳、真实场景拉胯的困境,这正是 Tell not show 的写照。

Lumo-2 发布的同时,星尘智能一次性公开了 22 项家庭自主任务演示,覆盖了多机器人协同、物理规律理解、超长流程任务、亚毫米级精细柔性操作四大最具挑战性的能力维度,多项为行业首次公开

为什么是这四类任务?

因为它们分别指向 Lumo-2 区别于传统 VLA 的最核心能力:对物理世界的推演、对长流程的记忆、对柔性物体的精细操控、对多智能体协同的调度。

多机器人协同的代表是双机交替叠纸盒

此前行业中类似演示一般为单机完成,而双机协同要求机器人之间进行时序判断、状态同步和精细操作配合,考验的是 Lumo-2 在多智能体场景下的调度与执行稳定性。

在物理规律理解层面,Lumo-2 跳出传统模型视觉识别、机械复刻的浅层能力,实现了对物理世界的深度领悟。

执行煎蛋、清洗咖啡碗、给小米称重等任务时,机器人需要实时理解重力、碰撞和摩擦力,锅的倾斜角度、鸡蛋的落点预测,每一个环节都依赖隐空间世界动力学对物理规律的准确推演。

高空接球则是另一个极端:球从高处掉落,机器人要在极短时间内预测落点并完成抓取,考验的是模型对动态物理过程的实时响应能力。

长流程复合任务验证的是时间维度上的能力。

完整做咖啡从取杯、磨豆、萃取到清洗涉及十余个步骤;调酒则叠加了摇酒的高动态动作;打包行李箱更是将收衣服、根据空位摆放物品、拉拉链串联成一个完整流程。

任何一个环节失误都会导致整体失败,考验的是 Lumo-2 在长时间序列中的记忆保持和推理连贯性。

最能体现技术壁垒的,是亚毫米级柔性精细操作。

最有含金量的是全网首次展示的礼品丝带打结,丝带在拉紧中产生复杂的摩擦与扭转,机器人需要两手实时协同调整间距与拉力,才能打出紧实对称的结。

这背后是对拓扑变化的动态理解:AI 要能实时应对物体连接关系、结构形状、空间连通性的连续改变。

给书包拉上拉链(临时还加件衣服)、熨烫到晾晒衣物、相同颜色笔盖装配,每一项都是行业公认的难点。

这些任务的共同特点在于,它们不是精心布置的展示型任务,而是真正接近家庭环境的复杂操作。

所有流程由机器人自主完成,没有人工分步干预,模型不仅能做,还能在动态、杂乱、不可预测的环境中持续做对。

Lumo-2 通过系统性的任务验证,证明隐空间世界模型不仅在理论上成立,也具备实际落地的可能性。

这正是 Show and tell 的真正含义:不仅解释模型为何有效,更在现实世界中证明它确实有效。

Agent Philia:易被忽视、具身智能缺失的操作系统层

模型再强,也只能解决怎么做的问题。

但当机器人进入家庭、长期与用户共处时,它还需要回答另外三个问题:记得什么、理解谁、协调谁。

单纯基座模型只能完成单次操作指令,缺少长期记忆、用户理解、多机调度、低门槛交互能力,无法实现陪伴式的个人机器人。

这也是星尘智能此次同步发布物理 AI 共生智能体 Agent Philia 的原因。

对于普通用户,Philia 提供了真正低门槛的交互方式。

用户通过飞书等日常应用,用文字或语音向机器人下达任务,无需学习新的控制方式。

机器人还能结合历史上下文持续理解用户需求,记住杯子放哪、喜欢什么水温并主动反馈执行状态。

对于企业客户,Philia 支持多机器人协同管理,将不同机器人统一纳入同一智能体进行任务调度。

集中式任务编排+分布式执行智能的混合架构下,Philia 在上层判断哪个机器人在线、空闲、能力匹配、安全状态更好,具体到每台机器人,局部导航、避障、抓取等则各自分布式执行。

对于开发者,Agent 能力与机器人本体能力相互解耦,可持续升级模型、扩展机器人平台或新增交互方式,而无需重新开发整个系统。

Philia 与 Lumo-2 的分工边界非常清晰:

OS 层负责用户语义解析、长期记忆检索、任务拆解、多机统筹和安全监督,输出结构化任务合约

模型层接收标准化输入,完成隐空间世界预测与实时闭环控制。

Philia 不进入硬实时控制环,Lumo-2 也不直接管理长期用户关系和多机器人编排,二者各守边界,通过清晰接口完成从用户意图到物理动作的完整转化。

Philia 的长期记忆采用分层架构,包括用户画像记忆、情景记忆、技能记忆和世界记忆。

算法结合结构化存储、向量检索、时间衰减和任务相关性过滤,确保喂给 Agent 的不是全部记忆,而是经过检索压缩后的高相关上下文。

有了 Philia,机器人第一次拥有了会服务的能力,而这恰恰是此前行业讨论中最容易被忽视的一环。

Physical AI 进入「AI-OS-本体」三位一体全栈竞争时代

过去两年,行业围绕 VLA 模型和硬件本体快速迭代,但一个共识正在形成:单点技术路线已触及天花板。

无论是单纯强调模型还是专注硬件,都无法独立解决家庭场景中的系统性问题。

行业竞争正在从参数规模转向系统能力。

星尘智能的「AI-OS-本体」三位一体架构,就是对这一趋势的回应:

AI 模型负责思考,理解世界、学习技能

具身 OS 负责服务,长期陪伴、管理记忆、协调智能体

绳驱本体负责行动,安全、高效地与物理世界交互

三者分别解决会思考、会服务、会行动,缺一不可。

更重要的是三者之间的关系。

星尘智能认为,AI-OS-本体是强耦合的协同进化关系:

AI 能力的提升持续推动本体形态与传感方式的重新定义;

强本体作为 AI 数据的基础支撑,不断被赋予新的结构与感知要求;

OS 作为连接 AI 与机器人的桥梁,既支持 AI 快速部署,也保障持续的数据交互与回流。

三者形成定义-部署-反馈-再定义的闭环进化机制。

从 DuoCore 快慢系统框架到 Lumo-1 再到 Lumo-2,同步迭代 Philia OS,再到真机落地,「AI-OS-本体」三位一体,是星尘智能一直坚持的全栈战略。

只有同时具备持续学习、陪伴和行动能力,机器人才能真正成为开放世界中的个人机器人。

在即将举行的 WAIC 上,星尘智能也将展出智慧药房、智慧零售、智慧交互等三位一体落地方案,推动 Physical AI 的规模化应用。

回到开头的问题:怎么判断一个模型好不好?

Lumo-2 提供了一个参考答案,不是看它登上了多少榜单,而是看它解决了什么问题、提出了什么观点、在真实世界中做到了什么。

它没有在逐像素重建的视频生成路线上卷算力,而是用隐空间世界模型直指物理本质;它没有停留在论文和榜单里自证,而是用 22 项家庭自主任务、多项全网首次展示,并在真实世界中完成了验证。

Physical AI 的上半场或许属于资本与叙事的喧嚣,但它的下一站,必然属于那些能够同时把思考、服务、行动三件事都做好、做扎实的体系化玩家。

声明:本文为维科号作者发布,不代表维科号立场。如有侵权或其他问题,请及时联系我们举报。