A | Some Western countries aiming to decouple from China's supply chains may face staggering costs: an extra $23.6 trillion by 2050, according to estimates. World Bank data shows that China's manufacturing value added accounts for nearly 30% of the global total, ranking first for 16 consecutive years. In new energy, 80% of key materials are tied to Chinese, production, making it difficult to bypass. As European and U.S. automakers build plants in Morocco and Mexico, Chinese suppliers follow right behind. Observers note supply chains are like rivers — barriers can be built, but its underlying course cannot easily be changed. Instead of focusing on decouple, countries should consider how to achieve mutual benefit.
。
文 | 财经思享汇,作者 | 王南舒,编辑 | 管东生2026世界机器人大会上,机器人依然是最容易聚拢人群的展品:行走、搬运、抓取,各类动作被不断搬到展台前。但在这些直观的展示之外,关于机器人下一阶段竞争的讨论,已经开始从“身体”转向“大脑”。大会期间,一场主题为“世界模型到服务人类的现实距离”的圆桌展开。之江实验室主任、阿里云创始人王坚开场便把问题抛向了世界模型本身:它与其他模型究竟有什么不同,又有哪些值得关注的技术路线?随后,讨论很快落到一个更现实的问题——如果世界模型最终要服务人类,它究竟需要具备什么能力,现在距离这一目标还有多远?这也是当前机器人产业正在面对的一道分界线。

B | 过去几年,机器人的运动能力快速提升。奥比中光创始人、董事长黄源浩在回答提问时把这种变化概括得更直接:机器人的移动能力已经做得不错,真正困难的是“操作”。

C | 从A点移动到B点,与拧开一个瓶盖、处理复杂物体,并不是同一类问题。在他看来,后者最终依赖“手、眼、脑”的协同——手需要灵巧和触觉,眼负责感知,脑则依赖模型与数据持续迭代。当机器人从“会动”走向“干活”,产业竞争也开始从单纯的本体能力,进入对智能能力的争夺。世界模型正是在这样的背景下被推到前台。

D | 从“会做”到“理解为什么这么做”今天的机器人可以被训练完成越来越多任务,但“技能增加”并不天然等于“更智能”。智澄AI创始人、CEO胡鲁辉在回答时将当前物理智能面对的问题拆成了几个层面:首先是泛化能力——环境或任务改变以后,机器人还能不能完成同一件事;其次是对物理规律的理解;进一步,则是机器人能否理解任务本身。

E | 在过去依靠规则、固定路径或者模仿学习的系统中,交互对象和任务边界相对确定。一旦环境稍有变化,甚至只是更换本体,原来的能力就可能失效。圆桌上,无界动力创始人张玉峰也提到,VLA等以模仿学习为基础的范式,很大程度上依赖足够的数据量和数据分布形成类似“肌肉记忆”的能力,而对于物理世界底层逻辑的理解,以及由此产生的泛化,仍面临挑战。世界模型重新受到重视,一个重要原因正是行业希望突破这一限制。胡鲁辉更看重的也是“理解”。他表示,世界模型真正需要解决的“不光是泛化性”,还包括对物理世界本身的理解,“就像人一样,人不是说我会做点事情,而是以理解的方式去做事情”。

F | 这一判断也对应着智澄AI自身选择的位置。胡鲁辉将世界模型视为物理智能的核心技术之一,并将机器人看作人工智能进入物理世界的重要闭环场景。

(图:智澄AI展会现场)如果说过去机器人企业争夺的是一台机器能掌握多少动作,那么世界模型押注的,是另一种能力:机器人不仅知道“怎么做”,还要知道自己的动作会怎样改变环境,并据此决定下一步。

G | 这意味着,下一阶段的竞争未必只是技能数量的增加。一个只能在训练环境中完成固定任务的机器人,即使掌握更多动作,也不意味着它已经获得通用能力。但问题也紧随起来,如果机器人真的要理解物理世界,它依靠什么学习?从卖“眼睛”到争夺数据入口黄源浩把这个问题指向了数据。与大语言模型可以直接利用互联网积累的大量文本不同,具身智能的数据必须从真实物理交互中产生。机器人拧一个瓶盖,需要记录的可能不只是视频:手在三维空间中的位置、物体状态如何变化、接触时产生怎样的力,以及视觉和触觉能否在时间上准确对应,都会影响模型最终学到什么。不同本体又让问题更加复杂。黄源浩举例称,不同机器人使用的相机视场角、帧率、触觉设备并不相同。如果A机器人采集的数据不能被B机器人使用,每家公司都必须围绕自己的设备重复采集和训练,数据规模扩大并不必然带来成本下降。

H | 因此,在他的判断中,具身智能当前缺的不只是更多数据,还有标准化、可迁移的数据。

I | 黄源浩提出,希望将3D空间、时间序列以及触觉、力等信息以统一方式记录,并实现足够精确的同步,让部分数据能够跨本体、跨模型使用,“不然每家的数据成本都非常高”。这一判断也正在改变奥比中光对自身商业位置的设想。作为一家长期以3D视觉感知为主要业务的企业,奥比中光此次谈论的不再只是“让机器人看见”。在谈到此次发布的相关相机产品时,黄源浩反复强调3D视觉、手部姿态、物体状态以及与触觉设备同步的重要性,并将公司希望进入的位置称为具身智能的“数据基础设施”。他的设想是,从视觉供应商进一步向数据采集硬件平台延伸。

(图:奥比中光展会现场)这背后是一种更值得关注的产业变化:当感知硬件本身逐渐成为机器人基础能力,产业链上的企业开始向数据入口延伸。卖一颗传感器,收入来自硬件;如果进一步进入数据采集、接口和标准环节,企业试图建立的则是与模型、本体和训练体系之间更长期的连接。黄源浩也直言,如果只是硬件,产品更容易被替代,而一旦进入数据层,业务黏性可能发生变化。

J | 世界模型的竞争,因此并不只发生在模型公司之间。谁能提供数据、谁能定义数据格式、数据能否在不同机器人之间流通,都可能影响模型训练的效率。资本已经升温,商业账还没有完全算过来这种对未来机器人“大脑”和数据入口的争夺,也正在被资本市场提前关注。胡鲁辉在采访中将世界模型描述为一个已经获得学术界、工业界和资本市场共同关注的方向。黄源浩则从自己的产业观察出发提到,当前具身智能领域从模型、仿真、数据采集、本体到行业落地,已经聚集了大量创业企业,一些年轻企业也获得了较高融资和估值。但资本热度并不等同于商业模式已经得到验证。黄源浩同时承认,目前不少机器人应用的ROI“还算不太过来”。换句话说,在一些任务上,直接使用人工仍然更加经济。最先可能跑通的,因而不是所有场景,而是危险、重复以及人不愿意长期从事的工作。按照他的逻辑,机器人先进入这些场景,产生真实运行数据;数据回流推动模型继续迭代、泛化能力提升;能力提升后,机器人才能进入更多场景,并进一步改善ROI。这里构成了当前具身智能商业化最关键、也最难打通的循环:模型需要真实场景产生数据,但真实场景又需要足够成熟的模型和能够算得过来的成本,才愿意大规模部署机器人。资本市场可以提前为未来定价,但最终决定世界模型能否从一个热门技术概念转化为产业价值的,仍然是这个闭环能不能运转起来。行业已经开始讨论属于具身智能的“GPT时刻”。

K | 黄源浩提到,不同模型公司对此有从较为乐观到数年的不同判断。

L | 但与其寻找一个确定的年份,更值得观察的或许是:模型、数据和真实场景什么时候第一次形成持续的正向循环。从两家公司的位置看,智澄AI押注的是机器人“大脑”能力的提升,奥比中光则试图从视觉硬件进一步进入数据基础设施。

M | 前者解决“机器人如何理解世界”,后者解决“机器人靠什么学习世界”,两家公司实际上处在具身智能产业链的不同环节。而在资本热度之外,这两条路径最终仍要接受同一个现实检验:机器人能否在真实场景中持续、稳定、经济地完成任务。从展台上完成一次漂亮的动作,到换一个环境、面对变化、长时间把事情做好,中间隔着的不只是一个更强的模型,也包括数据能否复用、成本能否下降,以及真实客户是否愿意为它买单。这或许才是世界模型距离“真正干活”最现实的距离。