王晓刚回应“机器人大脑原地踏步”论:恰恰相反,它正进入最快演进通道
财经
财经 > 财经原创 > 正文

王晓刚回应“机器人大脑原地踏步”论:恰恰相反,它正进入最快演进通道

作者 | 王迪

来源 | 凤凰《AI研究院》

2026世界机器人大会于8月19日-23日在北京举行,作为本届大会的战略合作媒体凤凰网财经全程报道。

大会期间,大晓机器人董事长、商汤科技联合创始人王晓刚就具身智能“大脑”发展、产业未来突破及通用理想形态等话题,回应了凤凰《AI研究院》的提问。

以下为凤凰《AI研究院》整理的王晓刚核心观点:

01 大脑不是原地踏步,而是进入快速演进通道

针对业内“机器人技能进步神速,但大脑能力仍在原地踏步”的普遍质疑,王晓刚对凤凰《AI研究院》明确表示,大脑能力并非停滞,而是已进入快速演进阶段。过去依赖传统算法和实验室真机采集的数据基础线正被打破,如今数据采集全面转向真实生产生活场景,量级积累正在带动模型智能跃升。

他透露,未来半年左右,世界模型与具身智能的实际逻辑将迎来显著突破,这种变化将伴随长期产业化进程同步发生。

02 世界模型的技术路线正加速迭代

谈及未来三年具身智能产业可能的最大突破,王晓刚认为有两个关键方向:

其一,世界模型的技术路线正加速迭代,谁能率先拿到具备泛化能力的有效模型,谁就能占据先发优势。其二,模型架构本身的创新将决定最终性能。

他特别介绍了大晓机器人去年12月提出的“理解-生成-预测”一体化框架:所谓“理解”,指模型对物理世界的认知能力,包括对复杂任务的分解,以及对动作执行状态(成功、失败、完成度)的判断;所谓“生成”,是对未来世界演变状态的预测。这三种能力必须结合,才能实现具身智能的自我反思与自我规划。

他强调,由于模型结构更简洁高效,其处理效率比Cosmos快七十多倍,而当前许多方案仅是基于开源视频生成模型加上控制模块,并非原生设计,推进效率和最终性能均有较大损失。他判断,“理解-生成-预测”一体化正逐渐成为行业共识。

对于通用具身智能最理想的状态,王晓刚向凤凰《AI研究院》描绘了这样一个图景:三种能力深度融合,模型像人一样对物理世界拥有直觉般的理解力,能够自主规划、执行、反思,并且架构足够高效,能快速适应千变万化的现实环境。届时,具身智能将不再只是执行固定任务的工具,而是真正能与世界交互、持续进化的智能体。

03 具身智能ChatGPT时刻有两个前提

针对此次机器人大会火热的“具身智能ChatGPT时刻”概念,王晓刚重申了他在今年4月博鳌论坛提到的观点,即具身智能真正出现智能涌现、具备更好泛化能力。在他看来,这一时刻的到来需要有两个前提:

第一是数据量。王晓刚指出,大晓目标是到明年年底达到千万小时量级(去年行业整体约10万小时量级)。第二是模型,要通过世界模型从海量数据中真正学到物理规律和因果逻辑。但他同时表示,ChatGPT时刻只是一个新起点,大语言模型从2022年出现到产生较高生产力价值,经历了三到四年持续演进,具身智能同样如此,即便观察到智能涌现,到机器人真正进入各种场景、形成明显生产力变化,还需要一定时间。

04 从To B到To C,家庭场景是终局但不是起点

针对目前具身智能世界模型与VLA两条路线的差异,王晓刚指出,VLA针对特定任务学习,本质上偏模仿学习范式,对相对静态场景有一定应对能力。但真实世界是动态变化的,世界模型最大的特点是能够持续生成和预测未来状态,判断采取某种动作策略后几秒钟可能发生什么。

谈及机器人进入家庭这一最大想象空间,王晓刚表达了审慎判断。

在他看来,家庭场景想象空间和市场空间最大,但面对完全不受控的环境,对安全性和可靠性要求极高,近距离接触老人和孩子,任何失误都可能带来伤害。

与此同时,隐私问题使远程监管难以在家庭中适用。因此,他透露,大晓的路径是先To B、后To C,先在可控的生产和服务场景持续验证,等软硬件成熟度、安全性和可靠性建立足够信心后,再逐步进入家庭。

05 落地场景选择特点:可复制性、业务上限与信息密度

在具身智能现阶段场景选择上,王晓刚提出三个考量维度:

第一是可复制性。只有可复制才有机会规模化,才能把硬件成本摊薄。比如即时零售,运营方半年到一年左右能回本,这对硬件成本提出了严格要求。

第二是业务方向的上限,即时零售看似具体,里面却有几十项任务、不同难度等级,随着机器人能完成的任务增多,可解锁的业务范围会不断扩大。

第三是场景里的信息密度和智能密度,场景过于单一难以支撑通用泛化能力,而即时零售和酒店任务种类丰富,且与未来家庭场景有较强关联。目前大晓重点推进零售、酒店、仓储、物流及部分工业场景,在这些可复制场景中验证技术和商业闭环,也为未来进入家庭打下基础。

06 开源世界模型能降低门槛、加速产业闭环

关于开源与闭源的策略,王晓刚表示,世界模型与大语言模型的使用方式不同。大语言模型面向To C,不开源也能获得大量用户反馈。世界模型需要部署到机器人端侧且当前主要面向To B,完全闭源会使真正接触和使用的人较少,难以从社区获得足够反馈。

因此,他表示,大晓的开源不只是开放模型参数,还会提供一整套让开源模型部署到机器人端侧GPU并接入运控的能力。有了比较好的基础模型,再叠加以人为中心的环境式素材和模型能力,面对新硬件型号或新任务时,后训练只需采集少量真机数据即可学习新任务,从而降低社区使用门槛,方便更多本体和场景接入。

07 谁能在竞争中跑出来?研发范式与场景落地双线竞赛

王晓刚认为,未来具身智能行业拉开差距的关键有两点:

第一,具身智能的ChatGPT时刻尚未真正到来,谁能找到正确的研发范式、在快速迭代中率先实现智能涌现,至关重要。

第二,场景的规模化落地。去年很多具身智能公司对真实场景落地还比较谨慎,今天市场期待越来越聚焦于规模化和真实场景落地。谁能在模型能力提升和场景规模化铺开两个方向同时建立优势,谁就会有更大机会。

大语言模型已在数字世界取得巨大成功,下一步是让AI从数字世界走向物理世界,与真实世界发生交互,这个过程必须通过机器人操作工具、完成真实任务,同样有机会带来新一轮生产力提升。物理AI的核心在于把空间智能、物理属性、物体属性、空间记忆等物理智能,与大模型已具备的认知和推理能力结合。

据他判断,未来半年左右,当世界模型开始出现比较明显的智能涌现时,大家会在机器人执行过程中看到更多“惊喜”,一些没有专门教过的东西,机器人也能通过基础能力和对世界的理解去完成。到明年,他希望看到更强的场景泛化、新的技能涌现,同时可能有几千台机器人在即时零售、酒店等场景常态化运营。