星源智孙振国:具身大脑是一场物理表征与语义意图的对齐革命 | 智潮No.03

2026年,具身智能产业正迎来范式跃迁的关键拐点。上半年国内具身智能赛道超600亿元融资中,过半数资金押注“具身大脑”。

行业共识已然清晰,人形机器人的下半场竞争在“大脑”,但虚实鸿沟、Demo级鲁棒性等痛点,正成为制约具身大脑商业化的“阿喀琉斯之踵”。

如今,资本用真金白银的投票,逼迫具身大脑加速跨越“虚实鸿沟”,走向规模化交付深水区。本次专访星源智联合创始人&智源研究院具身交互世界模型研究中心负责人孙振国,直击模型底层技术架构,深度拆解跨越Sim-to-Real鸿沟的破局之道,为下一代通用具身大脑写下时代的注脚。

跳出对立:路线博弈的核心

底层表征对齐才是关键

回溯2025年至今的具身智能产业演进,具身大脑的底层范式正迎来关键分野。但长期以来,VLA与世界模型的技术路线博弈始终未休。

星源智另辟蹊径,提出“融合式分层闭环架构”:以ω-EVA世界交互动作模型主导“认知推演”,以DECO底座负责“决策执行”。这种将博弈化为合力的破局思路,不仅实现了两大技术路线的优势互补,更成为星源智死磕产业化的技术底色。

面对产业技术路径分歧,孙振国一针见血地指出:通用具身大脑无需在两条路线间二选一,核心破局思路在于搭建一个“统一分层闭环”系统,将“语义驱动的动作生成”与“物理后果的显式验证”纳入同一决策体系统筹,这意味着,机器人不仅要“会做”,还能“自证对错”。

基于此,星源智确立了“双线并举”的技术布局:一是以交互世界模型ω-EVA为抓手,构建系统的物理认知与场景预测能力;二是持续深耕VLA与多模态策略DECO等研究工作,强化机器人的感知与执行控制。二者共同构成融合互补架构的两大支柱。

他认为,真正的“通用大脑”本质上是一个分层闭环:上层具备想象、预测和校验能力,下层能够结构化接入真实的多模态物理信号。

具体来说,ω-EVA重构世界模型定位,打破其仅作为训练辅助模块的传统作用,让模型在推理阶段主动承担验证职能——先输出候选动作,再通过动作条件化隐空间推演动作执行后的物理结果,结合环境现状、未来预测对动作方案进行动态修正。

但上层策略能力再强,若视觉、本体、触觉多模态信号未结构化融合,双臂实操稳定性便无从谈起,而VLA与多模态策略的DECO则补齐了底层感知短板。

且在孙振国看来,如果两者最终走向融合的最大难点并非token表征形式差异,而是底层统一表征能否同时承载多重信息维度,如高层语义意图、三维空间几何、物体接触力学、时序连续演化,以及适配不同机器人本体的动作可行性等。

深入底层逻辑,VLA 擅长将语言意图压缩为动作分布,却把接触动力学、任务失败逻辑隐藏在模型参数中;世界模型虽能完整刻画连续状态演变,却无法天然保证隐空间表征与语言目标、动作可执行性自洽。

ω-EVA的核心价值是把action-conditioned future latent(动作条件化的未来隐空间表征)拉进了动作决策回路,而DECO 进一步说明真实任务成败高度依赖对 proprioception (本体觉)和 tactile(触觉) 这类底层物理信号的单独建模。

换言之,融合的关键不是简单把两个模块拼起来,而是让语义 latent(隐空间) 与物理 latent (隐空间)在控制层面上真正互通互用。

务实机制:三重闭环击穿虚实鸿沟

杜绝Demo伪泛化

当前,虚实鸿沟、真实交互数据稀缺、跨场景泛化不足是全行业共性瓶颈。那具身智能如何跨越虚实鸿沟?

孙振国给出的答案是“三重工程化闭环”。他透露,星源智已基于DECO与ω-EVA两项前沿技术,打造了“数据、表征、验证”三重闭环体系。它以可量化的工程指标替代传统演示效果,建立了可交付的鲁棒性证据链,为产业的规模化应用提供了坚实的工程底座。

在具身智能数据闭环的构建上,我并不否认仿真合成的价值,而是更推崇“真机优先”的务实路线——当模型架构具备足够的高效性,极少量高质量的真机数据即可驱动强大的泛化能力时,真机遥操作采集方案反而是整体边际成本最低的方案。

基于这一考量,DECO深耕双臂遥操作的数据沉淀。它的创新在于多模态融合的“解耦”设计:既有效规避了不同模态间的信号相互串扰,更支持以极低成本和增量扩展的方式,在既有策略模型中,无缝接入业内最稀缺的“触觉感知信号”,一举补齐了机器人复杂精细操作的“最后一块数据拼图”。

这种架构设计不仅兼顾了理论深度,更在实际效能中展现出显著的价值。引入触觉适配器后,仅需调整不到10% 的参数量,就能为全任务平均性能上带来10.25% 的额外提升;在高难度的复杂接触任务中,性能提升更是高达约 20%,极大提升算法在算力受限场景下的落地可行性。

其更在验证层面,将评估标准具象化为平均成功率、基线提升幅度及触觉增益等硬核工程指标,这也是我们衡量技术的唯一标尺。

同时,为确保实验的“验证确定性”,星源智依托真实双臂遥操作构建了 DECO-50 数据集。它不仅涵盖了 28 个细分任务、500 万帧高质量数据,更经历了 2000 余次高强度的真机闭环测试。

ω-EVA则在执行层上,提供了“机制型鲁棒性”——在动作执行前预判视觉干扰或接触不确定性等后果并实时轨迹修正,实现“谋定而后动”。 虽然现阶段它不如DECO数据充分,但它将是星源智后续探索和验证的重要演进方向之一。

孙振国表示,相比于仅仅展示几个“高光时刻”的Demo,这套严谨的“数据闭环+实证”体系,才真正符合产业界对于“可规模化交付”的评估口径。他补充道,星源智的长远使命,正是跨越从代码到实体的鸿沟,将前瞻性的算法机制,转化为真实物理世界中可信赖的生产力。

定义大脑:下一代通用具身大脑

自主纠偏为核心

具身大脑的每一次跃迁,本质上都是在重新定义“机器人与物理世界的交互法则”。

下一代通用具身大脑的核心能力究竟该押注常识推理、空间认知还是自主纠偏呢?孙振国给出了直击本质的清晰方向:通用具身大脑绝非单点智能的堆砌,而是要构建“理解-预测-执行-纠偏”的长期物理闭环逻辑,并在真实物理世界中持续自我校正。

因此,自主纠偏是通用具身大脑最核心的闭环能力,空间认知是几何底座,常识推理为任务先验层。

他指出,真正决定机器人能否在开放环境里完成任务的,不仅是它能否给出正确解释,而是它能否在行动过程中持续发现、理解并修正偏差。

ω-EVA 的重要出发点和最有代表性的地方,在于它把“先提案、再看后果、再修动作”做成了显式机制,证明了通用大脑不能只会“出动作”,更得具备“看后果”的能力。同时,也揭示了其真正的门槛——如何把语义意图和连续物理后果统一到一个可用于控制的latent interface中。

当然,空间认知也非常重要。尤其在真实操作任务中,如果没有视觉、本体感觉、触觉的结构化融合,空间认知很难真正转化成稳定的接触控制能力。

这表明具身大脑不能仅靠“视觉”打天下,还需真正理解“身体、接触与触觉”。因此DECO研究的真正挑战在于如何获取海量、真实且可复用的多模态交互数据,尤其是触觉与接触相关数据。

进一步看,还有两个绕不开的约束:一是世界模型推理成本与闭环实时性之间的平衡,二是在不同embodiment、不同场景、不同物体分布下保持稳定泛化。

基于上述逻辑,衡量具身大脑的终极标尺论,不应只是一个静态benchmark分数,而至少应涵盖四个维度:开放场景持续任务完成率、外部扰动下任务恢复率、跨场景跨任务迁移效率、实时闭环约束下的数据与算力成本。

孙振国在访谈最后研判:真正的通用具身大脑,必将诞生于VLA与世界模型的深度交叉融合地带。这不仅是架构层面的创新,更是一场底层物理表征与高层语义意图深度对齐的革命。它将在开放世界的持续交互与自我校准闭环中,完成从‘理解世界’到‘影响世界’的关键跨越。

*编者申明:原创不易,请尊重作者;如需转载,请与我们联系。

声明:本文为维科号作者发布,不代表维科号立场。如有侵权或其他问题,请及时联系我们举报。