SIVA2026|小派科技孔华威:从沉浸交互走向具身智能接口

9月9日至11日,由中国国际光电博览会(CIOE中国光博会)和深圳国际VR/AR博览会(SIVA)联合主办,深圳协伴展览有限公司、深圳市增强现实技术应用协会、追焦XR协办的SIVA 2026(2026深圳国际VR/AR博览会)在深圳(宝安)国际会展中心重磅启幕。作为AR/VR领域全产业链核心盛会,今年主要议题涵盖空间计算、光学、AI&AR眼镜产业、沉浸大空间的四场论峰会与闭门会、SIVA Awards颁奖典礼也同步举行。

在9 月 9 日下午举办的全球空间计算产业发展论坛上,⼩派科技首席战略官孔华威以“Beyond VR”为主题发表了演讲。

全球空间计算产业于 2026 年迎来新的发展阶段,单眼 4K、手势交互、轻薄分体式形态成为新的发展趋势,终端售价格降低的同时,产品体验大幅提升。另一方面,以轻量化眼镜形态为主的空间计算设备开始走向市场,系统、内容生态、应用场景、AI 融合稳步发展。2026年空间计算产业与物理AI、世界模型等加速融合发展,带来全新的景象。

孔华威从小派多年来“高端XR头显”的产品定位讲起,介绍XR在显示、空间感知、手势识别及同步传输方面的积累。他将这些能力放到具身智能需求中重新审视,讨论机器人数采如何为XR带来新的应用机会。

围绕数据质量、时空对齐与采集成本,孔华威分享小派探索第一视角采集、利用用户设备计算资源的创新思路,并进一步讨论视觉、动作与触觉的双向交互。他将XR看作“世界模型跟现实生活之间的一个界面”,希望在保持原有产品优势的同时,拓展与具身智能结合的空间。

以下为演讲实录(有删减):

我(张江科投)在2019年就投资了小派科技,过了很多年,今年开始准备IPO了。这个时候很多投资人问,为什么还在做XR?早就应该转去做AI了。一家头部的机器人公司说要投我们,顺势而为,Pimax转到了、不如说撞上了刚才大家都在说的具身智能。所以我的题目叫"Beyond VR"。

20260915-173438

小派在国内销量不多,主要在国外销售,而且卖得比较贵,2300多美元一台,用户基本都是极客。小派是Kickstarter上起家的,当时(2018年)募集的资金比后来被meta收购的Oculus还多一倍。这是它的发展历程。目前我们70%以上的设备都在美国和欧洲销售,用户主要是玩DCS、微软飞行模拟器这类游戏的玩家。

就像遭遇当年"元宇宙",现在遭遇到了具身智能,这对我们来说是一个机会。小派科技本身的定位,就像刚才张总说到的,一般是按照高FOV、高PPD的逻辑,从显示角度做到极致。你看它主要的显示参数,包括FOV的上下、左右,都在这方面做得比较领先。从这个角度看,我们跟其他VR/XR设备有一定不同,我们主要往游戏方向走,不像原先以观影为主的被动体验。Vision Pro基本上都是以观看为核心。

PimaxI主要是为密集交互服务的,比如刚才讲的DCS战斗游戏、飞行模拟游戏这一类。所以这个时候对显示参数的要求会更高。这就是我们之前在VR/XR领域的整体定位。今年这个会议给我们颁了一个奖,获奖的设备叫Dream Air,这款设备主要在国外销售比较多,也是在游戏领域用得比较多。

20260915-173420

这里是我们原来的一些主要参数。刚才张航总也说到,好像来的不是一拨人。大家可以看一下,XR领域这么多年一直在各种"卷"参数,要轻、要FOV高、刷新率怎么样。刷新率是很重要的概念,比如90Hz是防晕的最低线,而不是最高线,还有更高的。屏幕、显示怎么样,各种各样的参数,XR领域之前比较多的PK说法。这些是我们工作的基础,但不见得具身智能一定要顺着这个思路走。

20260915-17344220260915-173447

刚才说到,在具身智能这个领域里,我们pimax有很好的基础和机会。原来在很多领域的数采领域玩的,,没想到XR领域里有这些技术积累。所以这也是刚才说的“碰上的”,我有时候觉得很多机会都是碰上的。你看这里以前的积累,包括刚才讲到的很多显示技术。这些原来在XR领域特别重要的技术,在具身智能里可能不一定作为特别核心的卖点了。但空间光学和空间感知,可能是具身智能数采领域里特别重要的两个点。

这包括实时的AI视觉,比如现在裸手交互,会计算21个关节的抓取状态。这就是原来在游戏领域本来就需要的手势识别,包括环境理解。一会儿有个小视频可以看,我们有一个叫Simulation Chair的东西,模拟座椅、模拟舱,要把你现实生活中所有的物理场景,以及除身体以外的其他参数都加进去。

XR领域做得比较多的,还有空间感知,刚才讲到的SLAM技术,包括眼动追踪。现在很多AR眼镜,包括一些做防近视的AR眼镜,都需要眼动追踪。眼动追踪原来也是为了让大家在玩游戏时有更好的体验。

那么眼动追踪在具身智能里有什么用?现在把这个问题交给具身智能领域,。这两天在具身智能公司讨论,眼动能不能进一步跟机器人智能结合。机器人原来的摄像头没有眼动这个说法。现在具身智能比XR还“卷”,而XR在某种意义上已经“卷”出了很高的技术门槛。空间感知、显示这些能力,原来具身智能领域一般不太考虑,这是两个领域交界处的大机会。拿无线传输举例,,

无线传输这个问题,原来在数采领域就存在。比如是用无线传输,还是用光纤直接连?包括以前的Tracker,很多时候用无线传输,但会断连。你想,如果Tracker里的数据本身就会断,那还怎么同步?所以这个问题在小派科技之前做模拟舱的过程中就已经被挑战过了。比如我们开飞机降落在航空母舰上,这个过程中不能断,断一下就肯定撞上去了。所以对用户体验的要求是必须同步、不能掉线。所以有时候尽管有红外数据传输,我们还是建议用户用有线的方式。

刚才PICO张总也提到,很多数采数据需要大量处理。这种处理除了同步处理很重要之外,还有刚才说的裸手识别和3D环境理解。这些理解本身原来在XR领域是干嘛的?XR领域里,你玩游戏的时候需要知道你的手势动作预测是什么样的。我们Pimax卖出去高端设备,就会出现有意思的新市场。

甚至跟PICO也可以合作。我们卖出去的设备,用户基本上都配套使用RTX 5090/4090显卡,到现在为止,我们在国外大概有六万多个节点,每个用户基本都自带4090/5090的设备,所以我们有时候叫PC VR。

往前延申,现在也在考虑是不是能够成为世界模型或其他领域生成的一个节点,这时候就会产生新的商业模式。大家都在讲AI的历史,不用讲60年、70年,直接从2022年开始就能看到,2025年开始出现了数字智能体,2026年开始我们讲具身智能。这条线应该是连续的,核心就是从原来的数字智能体,到现在agent变成了具身智能体,物理智能体。所以你可以把机器人就当一个agent来考虑。

我认为是具身智能本体跟大模型在互相碰撞,而不是单方面的。包括刚才看到的李飞飞、ChatGPT,他们从模型角度"入侵"到具身智能领域;另一方面,尤其是中国的具身智能巨头公司,做好了本体以后,往往从大模型或者说世界模型的角度去冲击。这两个的冲击点在哪里?结合点现在比较共识的是数据,反正两个都要数据。包括大模型本身往前走的3D,以及具身智能要把自己的大脑变得聪明,最后的结果都是数据。这是XR的新机遇。

大家看世界模型,光"世界模型"这四个字就很卷,大家已经看到有很多了。就像当年的大语言模型。现在具身智能、世界模型也卷得很厉害。网上看到,中国上半年具身智能公司只有二十多家,基本上拿到了差不多几百亿的投资。前面几位演讲者提到的英伟达、李飞飞、OpenAI,有很多试用demo,可以感觉确实让人很惊艳。

数采中标注这件事。现在用ChatGPT Astra来标注,精确度非常高,原来用CNN等方法做的标注,精度可能还没有它高。刚才张总讲了XR领域的6个重要优势,但大模型也很厉害,也在推动我们往前走。原先Transformer架构的LLM在数学、3D和空间理解,已经超越了原来的语言概念,也超越了video,甚至有可能超越action。

这个领域里,数据当然是最明显的缺口。现在大家都在提,大模型你做的话,100万小时肯定是不够的,所以有人继续提"我的大脑是1000万小时"。但最近各家公布的信息非常嘈杂,有人说已经有1000万了然后就没下文了。但我们知道的几家头部公司,1000万还是有一定难度的,都在冲击百万级。另外,所谓百万级小时的数据,可用性是多少我们都很难说,按照估计一般按20%来算,而且每个模型不一样。

比较难的遥操和部署,实际上遥操作上面还有一个叫现场调试的环节,现场就得调试。包括智元在南昌的工厂,派上40个人在那边待半个月,主要干的是部署。,这张表,自上而下,部署、遥操、仿真、UMI、Ego两层,再加上互联网video,7层,XR在具身领域嵌入得比较深的话,就可以把这些事情打通,可以合并分层,也不要分那么多层了。

甚至更开放一点,PICO给我们领了个头,往前变成一个平台基础设施,把所有的XR设备都接进来?这也是一个非常好的可能模式。我们特别希望这样,因为我们海外有这么多用户,他们自己有4090/5090显卡,可以接进来,也可以赚钱,不单单玩游戏,边玩游戏边赚钱,这是一个非常好的商业模式。我认为有基础设施宏大想法的人,可以建设一个联盟来干这件事。现在在这个具身智能里,XR变成了叫数采头显,1万、2万,还有整个系统报价5万、10万的,这都是大家的机会。

Pimax最近在做的这些事情, 还有Tracker相关。Tracker方面最大的难度,刚才说的是随着个数的增加,对齐怎么做好,现在都有人直接做芯片,用芯片做硬件对齐,否则光对齐这件事就够你受的。而且如果你以卖数据为主,没对齐的数据可能是100块钱1小时,对齐以后的数据可能是800块钱1小时,现在比较好的数据做到800块钱1小时。但如果只是视觉采集,现在已经降到60到80块钱1小时,已经没得赚了,大概毛利只有8%,据说是8%,我觉得已经很难赚钱了。

当然,数据处理也会对我们这些原来从事XR的人构成挑战。你要非常熟悉AI的数据处理,知道模型在做什么。如果不熟悉模型,又怎么知道什么样的数据才能被它用起来?这一点很重要。

所以现在一个策略是大家都采raw data。所谓raw data就是把所有的数据全部采下来,刚才说连FOV做到360度,全采,身后也采,甚至把每个手上的、还有触觉都采下来,这是一个方式。这个方式基本也是因为大模型,包括具身智能本身的模型还没有稳定收敛,到现在都没收敛,尽管已经有人上市了,但确实还没收敛。所以这个领域里,对小派自己来说,等于说我先守基本盘。

然后在具身智能领域,我们要进入egocentric领域。我们甚至会进入另外一个方向,就是AI眼镜。我看一下在座各位有没有戴眼镜的,好像没有,就我一个,很可惜,不知道为什么这么多人都不戴。上次我参加一个活动,主持人在讨论AI眼镜的时候,五个panel的发言人没一个戴的,让我比较吃惊。比如我这个眼镜,现在是一个采集摄像头,,如果放2到3个摄像头进去,实际上可以采集很多东西,只是涉及隐私等问题。

作为模型的上下文采集跟具身的数据采集是一个道理,所有的raw data,所谓对物理世界场景的采集,最原始的数据是最有用的。那原始数据从哪来?

我们每个人戴的眼镜,可能就是最完整的和最方面的采集终端。尤其是近视的人,已经习惯戴眼镜了,如果每天戴着眼镜还能赚钱,我觉得是个好事。接下来放三个视频,帮大家打开一下思路。

VRchat的数据采集有5个level,手的动作也得采集下来,当然脚、手还有接下来我们在这里面加的。这个视频(模拟椅子)还不错,椅子不贵,整套也就八万多,又撞上了是吧?这个降落,大概总共训练了20个小时才能做到降落到航空母舰上。

修图美颜活动照 (19)

这些视频,给大家提供了另外一个思考,XR基本上是把人的所有human data放到虚拟世界去,现在倒过来,把虚拟世界里的振动、包括动作又传到人身上来,这两个是相互的。所以我们自己觉得,眼镜/XR这件事本身,是世界模型跟现实生活之间的一个界面。大家可以从学术上思考,这确实很有意思,变成了你是把自己的体感输到虚拟世界去,还是虚拟世界的感觉传回来,这是两个不同的事情。

最近日本有一家公司做了一个用超声波模拟触觉的设备,在虚拟世界里别人模拟摸的时候,你也能感觉到。如果在第一个VRChat里实施了,会引发更大的体验。在VRChat里,很多二次元玩家玩得比较疯。为具身智能服务以外,再加上我们有很多传感器,包括我们的娱乐的感觉和体验,可以进一步反过来牵引整个具身智能往那个方向走。

这就是我PPT最后一张,来自电影《失控玩家》就是要你皮肤能感知到,你在现实世界中能感知到皮肤,同时也能在虚拟世界中感知到,这就是我刚才提到的两个方向,而中间就是那副眼镜。

在李飞飞的世界模型里,她希望生成所有的感觉。但现在只能生成与镜头camera相关的视觉,什么时候能够生成其他的?现在在具身领域里,已经开始输入触觉了。触觉,等等数据可能是一个新的课题,也许是下一届我们这个会可能会讨论的问题。谢谢大家。

声明:本文为维科号作者发布,不代表维科号立场。如有侵权或其他问题,请及时联系我们举报。