未来的十年AI应该是空间智能。
9月9日至11日,由中国国际光电博览会(CIOE中国光博会)和深圳国际VR/AR博览会(SIVA)联合主办,深圳协伴展览有限公司、深圳市增强现实技术应用协会、追焦XR协办的SIVA 2026(2026深圳国际VR/AR博览会)在深圳(宝安)国际会展中心重磅启幕。作为AR/VR领域全产业链核心盛会,今年主要议题涵盖空间计算、光学、AI&AR眼镜产业、沉浸大空间的四场论坛峰会与闭门会、SIVA Awards颁奖典礼也同步举行。
在9月9日下午举办的全球空间计算产业发展论坛上,影溯科技首席运营官梁浩辉,以“世界模型:从空间计算到空间智能”为主题发表了演讲。

全球空间计算产业于2026年迎来新的发展阶段,单眼 4K、手势交互、轻薄分体式形态成为新的发展趋势,终端售价格降低的同时,产品体验大幅提升。另一方面,以轻量化眼镜形态为主的空间计算设备开始走向市场,系统、内容生态、应用场景、AI 融合稳步发展。2026年空间计算产业与物理AI、世界模型等加速融合发展,带来全新的景象。
当AI从处理文本走向与物理世界交互,三维空间的理解、生成和预测能力正变得更加重要。“未来的十年AI应该是空间智能。”梁浩辉表示。影溯希望构建空间智能基座模型,为具身智能、可穿戴设备、游戏和自动驾驶等应用提供基础能力。
围绕这一方向,影溯科技通过Topos-Lite、InSpatio-World等技术,将图像和视频转化为三维场景,并进一步探索物体补全、交互与仿真训练。针对机器人训练素材不足、跨场景泛化能力受限的问题,尝试把互联网中的2D数据转化为3D训练素材,同时在统一三维空间中研究状态与动作变化,为机器人的预测和规划提供支持。

以下为演讲实录(有删减):
各位好,我是Kevin。先介绍一下影溯科技,我们成立大概一年左右,专注空间智能。我们的愿景是构建一个空间智能的基座模型。未来十年,AI应该是空间智能。以前有大量文本训练GPT等模型,但未来AI要跟空间交互。
无论是机器智能、自动驾驶、可穿戴设备,包括XR/AR,还是游戏,都需要3D交互能力。训练基座模型的素材,就不能只是文本,还需要3D训练材料。以后不同的应用可以基于这个模型,再做后训练适配。
从我们的理解来讲,从空间计算到空间智能分了三部分,第一个是重建,然后是生成,最后是预测。我们先做重建。大家如果说做过VR或者之前做过AR,都知道就是要把整个场景拍一圈,然后把3D重建出来。

以前做3D重建,通过 3D 公式去计算,时间很长。最近两年,3D重建有了很大突破,这就是feed forward regression,通过 Transformer 推理一次就能,提效达到百倍。
这是我们的Topos-Lite,拍几张图片,就可以自动生成场景。它跟苹果的SHARP有什么区别?SHARP只能用一张照片,所以很多拍不到的地方有缺失,而Topos-Lite通过几张照片,3D 重建比较完整。这个的项目已经开源,叫QuerySplat。

重建需要把场景拍一圈,再把场景还原出来。生成则是有些东西没看见,也能“脑补”。我们的生成能力有几个方面。能拍一张照片,就可以把整个360 度场景脑补全出来。这是我们的 Topos-Pro。
这个可以做(出完整场景)也可以,就是有很多场景。然后第二个是单体化,就是说你拍一个照片以后,所有场景你点击的话,你都可以把它弄出来。你看到比方说这个饮水机,它的后面我们没拍到的,它也可以生成出来。每一个物体都有它的物理特性在里面,有重量、有摩擦力。
做完这些demo,当然可以用来做游戏,但我们更关注下一个场景,具身智能仿真器,也就是Real2Sim2Real。拍一个场景,把里面的物体和交互建立起来,就能在仿真环境中进行交互和训练。也有3D游戏,拍一个场景就可以玩。这类UGC游戏大家可能见过,我就不多说了。
生成里面,我们也发布了一个模型,叫InSpatio-World。我们可以给它一段视频,生成之后你可以在里面漫游。其实这个我们半年前已经发布、已经开源了。最近李飞飞他们发布了一个叫Atlas的(模型),这个Atlas的话,也是说你可以在这个视频里面漫游,但他们用的技术可能需要多个不同相机拍;我们是一个视频,就已经可以在里面漫游了。
我们可以给它一个video,单一视角的video,然后可以生成一个4D的场景出来,也可以生成mesh。这些都是我们给它单一视角的video,也可以生成3DGS场景出来。
最后讲预测。预测非常重要。比如这个杯子下一秒会掉到什么地方、碎片会散到哪里,对具身智能很重要,对游戏也很重要。这部分比较复杂,涉及几何表征。
我大概说一下,世界模型领域最厉害或者融资最多的有两家,一家是李飞飞的World Labs,另一家是杨立昆的AMI。
杨立昆的方向是JEPA,我们也在这个方向上探索,希望在潜空间里学习动作表征。基于JEPA,我们把耗时降至原来的1/300。论文发布后,我们在X上分享,杨立昆也点赞了我们的研究。因为对3D理解比较深,我们在机器人方面能做很多事,比如物体被遮挡时,机械臂也可以把它抓出来,成功率比SOTA高2倍。
我们正在做一个数据闭环,去解决模型泛化性差,缺乏 3D 数据的问题。比如在工厂里的 A 生产线能打螺母,换一条生产线打不了。其中一个原因是现有3D训练材料还不够。我们希望把互联网上的2D数据,通过Topos和InSpatio-World升维为3D数据,再用于训练,将 3D 数据也变成为互联网级别的规模。