黄青虬谈具身泡沫:落地价值远跟不上估值,但早期泡沫有正向作用
财经
财经 > 财经原创 > 正文

黄青虬谈具身泡沫:落地价值远跟不上估值,但早期泡沫有正向作用

作者 | 王迪

来源 | 凤凰《AI研究院》

2026世界机器人大会于8月19日-23日在北京举行,作为本届大会的战略合作媒体凤凰网财经全程报道。

黄青虬的AI启蒙,始于一个被业界称为“AI界亚洲黄埔军校”的地方——香港中文大学多媒体实验室(MMLab)。在那四年里,他与顶尖的老师和同学反复碰撞,从零开始搭建对AI的认知框架,也第一次触到了多模态数据处理的门槛。

正是这段“黄埔”岁月,为他后来投身智驾、再转向具身智能埋下了伏笔。

从AI界亚洲黄埔军校到具身智能战场,站在2026年世界机器人大会的展馆里,黄青虬清晰地感受到了行业的呼吸在变快。他对比去年和今年,发现了两个肉眼可见的变化。

第一个变化,是机器人的“工种”变了。去年的展会上,跳舞类机器人的比例明显压过干活类机器人,更像一场科技秀。但今年,无论是在WRC还是在WAIC的展台上,干活类机器人的身影越来越多,这说明机器人的“大脑”真的往前迈了一步。

第二个变化,是机器人的“活儿”变复杂了。他说,以前各家展示的大多是单个动作:抓一下、放一下、走两步。但今年,很多机器人开始展示长程任务,一连串动作组合下来,完成一个完整的作业流程。这意味着,算法在可靠性和稳定性上都上了新台阶。

(墨奇智能联合创始人兼CTO黄青虬)

(墨奇智能联合创始人兼CTO黄青虬)

不过,黄青虬也承认,行业的飞速进步和公众的感知之间,还有一道落差。普通人看机器人,还是觉得它们“比较笨”。这种落差不难理解,机器人的能力距离真正的人类水平,确实还有距离。

但黄青虬看到的是加速度。按照目前的迭代速度,他判断,再过两三年,机器人应该在部分行业里能够达到接近人的水平,逐步实现落地。至于C端家庭场景,他判断周期会更长,家里要面对的是千变万化的任意情况,安全和隐私问题也绕不开,不像B端很多场景人少甚至无人,不需要背那么多顾虑。家庭,是机器人的最终考场,而不是第一站。

此外,黄青虬还指出,当前具身行业确实存在一定泡沫,落地产生的价值还远跟不上估值,但在具身大赛道长周期的行业,早期有一定泡沫是正常现象,也有正向作用,能加速行业迭代发展。

回到估值本身,他表示投资的本质上是投人。技术路径会持续迭代,今天选择的技术路线随着行业演进一定会动态调整,从投资人角度更多是投团队以及这群人在核心事情上的思考。

他明确表示,估值不是投给他一个人,而是投给整个团队,投资人认可的是团队的技术思路和商业演进路径。

针对国家出台的银发经济和社区养老政策,黄青虬的看法是,墨奇本质上做的是家庭服务机器人,酒店、餐厅、养老院都是希望有人做家务的场景。他的判断是,需要跟人接触、有安全性风险的,发展会更靠后。前期墨奇更专注在跟物体接触这件事上,未来才有可能去跟人做接触。

大会期间,墨奇智能联合创始人兼CTO黄青虬就具身泡沫、数据瓶颈、终局形态、场景选择、产品形态、行业竞争及商业化路径等热点话题回应了凤凰《AI研究院》等媒体的提问。

以下为凤凰《AI研究院》整理的黄青虬其他核心观点:

01 具身智能的终局是人形,但短期要在人形基础上做裁剪

关于具身智能的产品形态选择,黄青虬坚定认为终局形态是人形。理由是物理世界是为人类打造的,人形能够最大程度适配物理环境。不做人形就要改造物理世界,但基建改造周期特别长,相比之下单体智能提升是更靠谱的路径。

但在实现终局的过程中需要做取舍。他提出,可以在人形基础上做裁剪。比如,现阶段不想解决双足稳定性问题,先用底盘;不想解决五指灵巧手的高自由度控制问题,先用夹爪干60%-70%的工作。

但他明确反对做“异形”产品,比如,三头六臂的机器人。原因是人形基础上做裁剪,数据是可复用的,采集全人形数据后做裁剪,就可以用于轮式或夹爪机器人。而做异形根本采集不到这样的数据,因为数据是靠模仿人采集的。

02 行业竞争:百团大战后大浪淘沙,差异化才能推动进步

对于当前大厂和大模型公司纷纷涌入具身赛道带来的竞争,黄青虬认为这是行业高速发展期的正常现象。

黄青虬指出,无论是自动驾驶还是大模型,都会经历最初的百团大战、逐步大浪淘沙、最后向头部收拢的过程。有一定竞争是好事,但更重要的是要有自己的坚持、做差异化竞争而非同质化竞争,才能推动行业更好发展。

他同时指出,具身行业相对开放透明,有些公司公开发布技术报告、开源模型,墨奇未来也会这样做。大家一起推动行业前进,如果都在做同质化竞争,对行业的促进意义就不大。

03 ChatGPT时刻:规模化落地约三年,泛化能力约五年

对于具身智能ChatGPT时刻何时到来,黄青虬认为,目前存在两种有意义的定义:

第一种是规模化进入行业。比如,有1000台机器进入物流、零售等场景真实作业,他认为这个突破点未来三年之内可以实现。

第二种是从能力角度定义。机器人能进入80%左右的陌生场景、自主完成约80%的任务,这描述的其实是具身大脑的泛化性,从这个定义出发至少需要5年时间。

04 具身与智驾的差异:数据冷启动是最大鸿沟

从智驾转入具身的黄青虬,对两个行业的数据闭环差异有直接观察。

他认为,拿新能源汽车类比具身并不完全恰当,新能源汽车出现前传统汽车工业已非常成熟,是构筑在成熟供应链之上的新形态。而机器人从硬件到算法几乎是全新的领域。两者最大的本质差别在于数据采集环节:智驾领域车卖出去后车上装了传感器,人开车就把数据捕捉回来,获取数据成本极低。但具身面临先有鸡还是先有蛋的问题。

黄青虬指出,机器人能自主工作之前,没有人会去“开”机器人,只能自己采集数据做冷启动,所以,数据获取成本更高,采集方式也需要精细设计,大家在寻找的是成本和质量可控之间的甜点。

05 数据短缺下的算法迭代:沉淀Infra与人才比结论更重要

面对当前具身领域数据普遍短缺的现状,以及在这种短缺下算法迭代能发挥多大作用的问题,黄青虬认为,在数据量不足的情况下,通过先导性实验能够得出一些结论,对下一阶段数据量上来后有指导意义。但数据量增长后,部分结论会被验证,部分也会被推翻。算法架构从VLA到世界模型持续更新迭代,这是行业早期发展的正常现象。

那么如何才能真正沉淀下来?他认为有两个核心资产。第一是Infra。模型训练和数据采集的基础设施,它决定了当新技术范式出现时能否快速跟上、快速迭代。第二是人才。具身行业很新,团队需要在这一过程中持续积累能力。实验结果可能有部分留下来有用,有部分被推倒重来,但人才和Infra会真正沉淀下来。

06 场景即数据:选什么场景,决定训练出什么模型

市面上具身智能企业场景选择参差不齐,墨奇选择了家庭及类家庭场景(也包括酒店和商务公寓)。

对此,黄青虬的解释是,选什么场景,就意味着能拿到什么样的数据;能拿到什么样的数据,就意味着能训练出什么样的模型。

在黄青虬看来,具身智能的目标是通用基础模型,通用能力要足够强,必须建立在很强的泛化性之上,而泛化性来自数据。只有选择足够复杂的场景,才能回流多种多样的数据,在此基础上训练出的基础模型能力才会足够强。有了足够强的基础模型,经过简单微调再去落地物流、工业等垂直领域就没有问题。但前提是,你先选了一个有泛化性、多样、有挑战性的场景。

07 数据采集卡点:系统性工程,单点突破无法解决

具身智能行业面临数据瓶颈,高质量真实物理交互数据不足。对此,黄青虬阐述了数据作为系统性工程面临的多个卡点:采集环节就存在设备定位精度与便携性的天然矛盾,精度高就不便携,便携精度就不够高,两者之间的权衡是当前数据难点,行业尚未形成共识,所以才出现了真机遥操、UMI、人类第一视角数据、肌电手环等各种数据范式。

此外,黄青虬指出,数据采集回来之后,生产什么标签对模型训练有促进作用是语言标签、深度图还是视频切分,行业内也未形成共识。从采集到门禁、挖掘、自动标注、送进模型训练,卡点散落在每一个环节,而非某个单点突破就能彻底解决。

不过,他观察到整体趋势是往可规模化的方向发展。从最不可规模化的遥操到稍微可规模化的UMI,再到现在最便携的头环或帽上相机,趋势是把处理难度留给算法,但具体方式尚未收敛。

在数据标准尚未统一的行业现状下,黄青虬认为数据采集应该做到“三个真实”,处理做到模型可学习的自动标注,分阶段喂给模型,让模型从易到难逐步吸收。

第一个标准是采集端的“三个真实”:真实的人,在真实的环境,干真实的活。他举例区分了摆拍数据和真实数据的差异。数采场地里采集1万小时数据,可能有9000小时是重复的,增加的时长未必给模型带来更多变化;而保洁人员擦桌子,目标是擦干净,会观察污渍、根据实际情况调整方向力度和次数,没擦干净还会再来一次,这种数据才真正有价值。

第二个标准是后端的系统性数据处理链路。采回来的数据要做严格的质量筛选、分类,保证海量数据中能精准检索到训练所需的数据。比如,今天要十万个叠衣服的,明天要一百万个放杯子的,必须有数据挖掘系统打上标签、随时挖掘。之后做自动标注(AutoLabel),给所有数据打上训练需要的真值,最后用来训练模型。