消费 正文
世界模型离服务人类还有多远?八位顶尖专家在WRC2026上的激辩
来源: 中国工业新闻网 2026-08-24 13:24
分享到:

中国工业报王珊珊

2026年8月21日下午,北人亦创国际会展中心,一场关于“世界模型到服务人类的现实距离”的对话,成为当届世界机器人大会最受瞩目的思想交锋点。

就在这场对话开始前,中国电子学会世界模型专家委员会正式宣告成立,之江实验室主任、阿里云创始人王坚受聘为主任委员。他随即主持了这场汇聚八位委员的圆桌讨论——大晓机器人董事长、商汤科技联合创始人王晓刚,奥比中光创始人黄源浩,无界动力CEO张玉峰,跨维智能创始人贾奎,智澄AI创始人胡鲁辉,飞渡科技联合创始人宋彬,蚂蚁灵波科技首席科学家沈宇军,极佳视界联合创始人朱政。

从“诗和远方”到“脏活累活”

“大语言模型只能解决诗和远方,世界模型是能让机器人真正干活的。”黄源浩的开场白直击本质。在他看来,GPT让人机对话成为现实,但世界模型要解决的是80亿人的劳动力问题——让人从重复劳动中解放出来,去“风花雪月”。

这一判断获得了在场嘉宾的广泛共鸣。胡鲁辉从更根本的层面指出,世界模型要解决的是人工智能最核心的命题——“理解物理世界”。如果说多模态大模型停留在感知层面,世界模型则要迈入因果推理与决策的深水区。

贾奎的表述更具野心:世界模型是“生成式AI皇冠上的明珠”,也是“AI大一统的终局”。它不仅能驱动机器人干活,还能生成三维物理几何绝对正确的内容——前者解放体力,后者满足人类对情绪价值的需求。

但理想与现实之间的鸿沟,远比想象中宽阔。

VLA的瓶颈与世界模型的破局

王晓刚回顾了世界模型的演进路径:最初用于数据增强“举一反三”,随后发展为模拟仿真器,如今正走向直接部署在机器人终端、实时驱动本体的第三阶段。在他看来,此前的VLA(视觉-语言-动作)模型本质上属于模仿学习,擅长处理静态场景,但当环境在交互中持续演化时便力不从心。

“世界模型需要对未来状态进行生成和预测,并在一套模型里同时具备理解、生成、预测三种能力。”王晓刚说。

张玉峰补充道:他的联合创始人2011年在中科院读博时就在研究基于模型的强化学习,彼时比AlphaGo击败李世石还早了五年。“那时候同学们还在愁强化学习怎么找工作。”如今,这一方向成了最炙手可热的赛道。

但他同时指出,VLA范式的根本局限在于追求“数据量足够大的概率分布和肌肉记忆”,却始终未能产生真正的“涌现”——模型并未真正理解物理世界的底层逻辑。这正是世界模型被寄予厚望的原因。

物理智能:最急缺的那块拼图

当王坚问及“世界模型要服务人类还缺什么”时,嘉宾们的回答出奇一致:物理智能。

王晓刚将其拆解为三大能力——生成智能(推演与预测)、物理智能(空间认知与物理规律)和认知智能(长程任务分解与状态判断)。“当前最急缺的是物理智能。漂亮的视频生成不等于学到了物理规律,我们真正需要的是第一视角交互视频、相机位姿、几何信息、物理属性、多视角数据的综合。”

黄源浩判断:“数据、模型、本体执行,三者都得到位。可以先从人类最不愿意干的场景落地,再逐步渗透。”

张玉峰则提出了“用工业练技能、商业练泛化、家庭是终极挑战”的分层落地策略。他特别强调,在“人机共生”成为大会主旋律的背景下,安全性绝非锦上添花——“仅靠大模型而没有额外的安全冗余机制,远远不够。”

数据的困境:比想象中更严峻

高质量数据从何而来?会不会成为创新企业“不可逾越的成本障碍”?

王晓刚坦言,具身数据与大语言模型数据有本质差异——后者可从互联网公开获取,前者“历史上积累是零”。更关键的是,实验室里雇人按剧本采集的数据“训练效果非常有限”,真正需要的是“inthewild”的真实场景数据。他观察到,随着真实数据规模的增长,ScalingLaw正在显现——基模型越来越强,对真机数据的依赖反而在减小。

黄源浩则直指行业“标准缺失”的痛点。他举例说,触觉手套采集的数据与视觉数据相差15毫秒就无法复用,“数据很重要,数据标准更重要”。他当场向王坚喊话,希望专家委员会能牵头制定数据标准。

贾奎认为,以通用物理AI为目标,任务无穷无尽,真机采集的效率与成本根本无法支撑规模化。“一个人一天只能采500到1000条数据,这远远不够。”他的解决方案是:预训练阶段用裸手Ego方式以最低成本获取人类经验,后训练阶段用生成式仿真合成数据来解决物理泛化问题。“如果靠大量采数据才能让机器人工作,那一定是亏钱的——第一性原理决定了我们必须追求最高效的数据方式。”

宋彬补充道,面向物理AI的数据采集应以“物理常识导向”和“空间约束导向”来治理,并将相关性转化为因果性。他透露,飞渡科技参与的“十四五”课题将于年底开放一批城市级科学数据集。

朱政则提醒:按当前训练成本推算,如果数据量增长到千万甚至上亿小时,模型参数量再增长十倍百倍,训练成本可能高达上千亿。他呼吁在扩大数据规模的同时必须同步提升样本利用效率,“否则从商业角度看,这条路走不通”。

三到五年,还是遥遥无期?

对于“距离目标还有多远”这个问题,黄源浩认为“具身智能的GPT时刻可能很快到来”;朱政以自身公司估值为例——一年涨了50倍——折射出资本对世界模型的强烈预期。

宋彬则表示,工业级客户要的是“可确定性、可靠性、准确率、长时序稳定性”,而当前世界模型在开放环境下的表现仍有较大距离。“昨天看到一个机器人跑直线撞墙了——说明对空间结构和时空拓扑的理解能力依然不足。”但他也指出,AI带来的效率提升是指数级的,“过去一个问题要3年,现在有可能倍增,三到五年有望突破”。

沈宇军表示,机器人不能像车一样边跑边发电,“一边追求智能上限,一边保持低功耗,这是根本性的矛盾”。胡鲁辉认为,当世界模型真正走向“理解”层面,对数据的依赖反而可能下降——“人学东西通过理解,不需要海量数据”。

世界模型到服务人类的距离,或许正比任何人想象的都要近,也比任何人想象的都要远。唯一确定的是,这场比赛已经鸣枪。

【编辑:龚忻】