page contents
跨境关条
Ctrl + D 收藏本站
当前位置:首页 » AI学习圈 » AI通识

WAIC释放关键信号:AI竞争正在告别参数崇拜

mogoec 2026-07-20 16

当AI离开聊天框:真正决定它能否落地的,不只是聪明

过去几年,我们判断一个AI厉不厉害,最常用的标准是:它能不能答对问题、写好文章、生成代码,或者在某个基准测试中拿到更高分。

但在梳理2026世界人工智能大会,也就是WAIC 2026的论坛内容时,我越来越强烈地感受到,这套评价方法正在失效。

原因并不复杂:AI正在离开聊天框。

当AI只是生成一段文字时,回答不准确,我们可以重新提问;当AI开始控制机器人、驾驶车辆、管理能源系统、操作工业设备时,一次错误就可能造成设备损坏、生产中断,甚至影响人的安全。

因此,未来评价AI,不能只看它“有多聪明”,还要看四件事:

它是否理解真实世界,能否可靠完成任务,需要付出多大代价,以及社会是否有能力约束和承接它。

这四个问题,正在成为AI从演示走向产品、从数字世界进入物理世界的四张考卷。

一、什么是物理智能?

我理解的物理智能,是AI感知真实环境、预测物体变化,并通过行动改变环境的能力。

它与大语言模型最大的区别,不是模型参数更多,也不只是多装了几台摄像头,而是它的判断会被真实世界直接检验。

文字可以模棱两可,重力却不会配合AI圆谎。

2026年7月17日,复旦大学通用物理智能研究院首任院长苏昊在WAIC主论坛发表了《物理智能:从幻觉到现实》的演讲。他提出,物理知识可以分为六个层次:物体、状态、动力学、功能、目标和行为。前三层描述客观世界,后三层则把行动主体纳入其中。

这套框架,是我目前看到的、最适合普通人理解物理智能的方法之一。

第一层:物体知识——世界里有什么

假设一个球滚进了沙发底下,机器人暂时看不见它。

机器人首先要理解:球并没有因为离开摄像头视野而消失。它仍然是一个独立存在的物体,只是暂时被遮挡了。

人类觉得这是常识,是因为我们从小就在真实世界中生活。但对只依赖图像帧和语言数据的模型来说,“看不见但仍然存在”并不是天然具备的能力。

第二层:状态知识——它现在怎么样

识别出“这是一个球”还不够。

机器人还要判断球的位置、大小、重量、软硬程度,以及球和沙发、地板、其他障碍物之间的关系。

现实任务通常不只需要识别物体类别,还需要估计物体当前的具体状态。

同样是一只杯子,空杯子、装满热水的杯子和放在桌边即将掉落的杯子,对机器人的操作要求完全不同。

第三层:动力学知识——接下来会发生什么

机器人伸手碰球后,球会向哪个方向滚动?

如果地面铺着地毯,它会不会被摩擦力挡住?如果用力过大,它会不会被推到沙发更深处?

这就是动力学知识:AI不仅要知道世界现在是什么样,还要预测在施加动作以后,世界会如何变化。

语言模型可能读过大量关于摩擦力、惯性和重力的文字,但“知道一个物理定律”与“在复杂环境中正确使用它”并不是一回事。

第四层:功能知识——这个东西对我有什么用

从第四层开始,世界里出现了行动主体。

一把椅子,对人来说可以坐;对搬运机器人来说,可能是需要移动的障碍物;对维修机器人来说,则可能是一个需要检查的产品。

功能并不完全写在物体本身,它取决于物体与行动者之间的关系。

这也是为什么机器人不能只学习“物体是什么”,还要学习“物体可以被怎样使用”。

第五层:目标知识——我希望世界变成什么样

球现在位于沙发底下,这是状态。

我希望球回到手里,这是目标。

目标把AI从观察者变成了行动者。它不再只是描述环境,而是要比较“现实状态”和“期望状态”之间的差距,并决定接下来应该做什么。

第六层:行为知识——怎样真正把事情做成

知道“把球拿出来”与真的完成这个动作,中间仍然隔着很远。

机器人要选择从哪个角度伸手,控制肩膀和手臂的位置,调整手指张开的幅度,还要避免把球推远或者捏坏。

叠衣服也是如此。

识别衣服并不难,理解“把衣服叠整齐”也不难。真正困难的是如何捏住柔软的衣角,怎样抖开、对齐、折叠和压平。

这些知识往往没有完整地写在书里,而是隐藏在人类长期操作形成的手感、力度和动作节奏中。

苏昊将这六层知识比作一条阶梯。他认为,语言模型主要学习的是人类记录下来的知识,而力觉、触觉和操作经验却很少被系统记录。物理智能要取得突破,需要把互联网视频、物理方程、真机数据、触觉信息和人类操作经验聚合起来。

从这个角度看,我们不是简单地给机器人安装一个“大脑”,而是在给它补上一段缺失的童年。

人类儿童会摸、会抓、会摔,也会在一次次失败中认识物体。模型没有经历这些过程,只能通过数据、仿真、机器人训练和真实交互重新学习。

二、从“会做一次”到“每次都能做”:可靠性才是产品起点

机器人演示最容易制造的错觉是:只要成功完成过一次任务,就意味着它已经掌握了这项能力。

实际上,演示和产品之间最大的差距,往往不是模型能力,而是可靠性。

苏昊在演讲中提到,工程系统常用“几个九”描述可靠性。从99%提高到99.9%,看起来只增加了0.9个百分点,实际难度却可能成倍上升。一个系统偶尔成功,可以录成视频;一个系统长期稳定运行,才有资格进入工厂、医院和家庭。

聚变等离子体控制,就是一个极端案例。

托卡马克装置需要利用强磁场约束高温等离子体。等离子体具有高度动态和不稳定的特征,控制系统必须持续监测状态,并及时预测和处理可能发生的异常。

中国科学院相关团队正在研究利用AI进行等离子体状态预测和实时控制。WAIC 2026公开报道显示,相关系统的大破裂预测精度已经达到约98%。这是非常高的实验指标,但在高风险系统中,98%仍不意味着问题已经解决。

原因是,“准确率”本身并不能完整描述系统是否安全。

我们还要知道:漏掉一次真正的异常会造成什么后果?系统是否会频繁误报?换一套设备或运行参数后,模型还能否保持性能?传感器失效时有没有备用控制机制?AI无法判断时,是否会主动降级或者交还给人类?

美国国家标准与技术研究院的AI风险管理框架也强调,可信AI不仅要有效和可靠,还需要具备安全性、韧性、透明度、可解释性和明确的问责机制。具体指标和阈值必须根据AI的实际使用场景确定。

因此,我以后看机器人演示,不会只问“它能不能完成任务”,而会继续追问:

它在多少种环境中测试过?连续运行多久?失败率是多少?环境变化后能否重新规划?失败以后会不会造成不可逆的后果?

能力决定AI能不能做,可靠性决定我们敢不敢把事情交给它。

三、单次调用很省电,不代表整个AI系统成本很低

AI进入现实世界以后,除了受到重力和事故的约束,还要面对能源、芯片、网络、维护和资金成本。

在WAIC 2026的实体世界智能科学论坛上,图灵奖得主David Patterson讨论了AI环境影响中的统计口径问题。他提醒,人们不能把不同模型、不同数据中心和不同计算任务的数据简单混在一起比较,也不能只依靠模糊的碳抵消声明判断一个AI系统是否环保。

这个问题特别容易走向两个极端。

一种说法是,每问AI一个问题都会消耗大量能源和水,因此普通人使用几次AI就会严重破坏环境。

另一种说法是,单次文字生成耗电很少,所以AI的能源问题完全不值得关注。

这两种说法都不够准确。

Patterson参与的一项Google生产环境研究显示,在其特定测量方法和基础设施条件下,Gemini应用一次中位数文本提示的能耗约为0.24瓦时,用水量约为0.26毫升。研究同时指出,过去一年中,软硬件和数据中心效率提升显著降低了单次任务的环境成本。

但这个数字不能直接代表所有模型和所有AI任务。

文字问答、深度推理、视频生成、智能体连续操作以及大模型训练的计算量可能相差几个数量级。国际能源署指出,近年来单个AI任务的能源效率快速提高,但视频生成、复杂推理和智能体任务可能比简单文本生成消耗高出数百倍甚至数千倍。

更重要的是,单次任务越来越省电,不代表总用电量一定下降。

国际能源署2026年的数据显示,全球数据中心用电量在2025年增长了17%,其中以AI为重点的数据中心用电量增长约50%。其基准情景预计,全球数据中心用电量可能从2025年的约485太瓦时增长至2030年的约950太瓦时。

这就是典型的规模效应:

每一次调用变便宜了,但调用数量、模型规模和任务复杂度增长得更快。

所以评价一个AI项目的成本,不能只看模型API的单次价格,还要计算推理频率、芯片折旧、网络延迟、数据存储、人工监督、异常处理、能源消耗和系统停机风险。

对企业来说,真正重要的不是“模型调用一次多少钱”,而是“稳定完成一个业务结果需要多少钱”。

四、技术跑得快,不代表一个国家或企业真的具备AI能力

当AI开始进入医疗、交通、金融、能源和公共服务,技术能力就不能与治理能力分开讨论。

2026年7月18日,清华大学人工智能国际治理研究院在WAIC发布了《世界人工智能能力指数报告(征求意见稿)》。公开报道显示,这份报告分析了92个国家,并将AI能力拆分为“发展能力”和“治理能力”两个维度。报告认为,不少发展中国家同时面临基础设施不足和治理制度不足的问题,全球AI治理鸿沟存在继续扩大的风险。

我认为,这个划分非常重要。

发展能力主要回答三个问题:能不能产生新的AI知识,能不能把技术扩散到真实场景,以及能不能形成持续的经济和社会价值。

治理能力则回答另外一些问题:有没有风险分析和规划能力,有没有数据保护、标准体系和法律规则,系统出现问题后能否及时学习和修正。

只看用户数量,可能把大量免费使用误认为成熟的商业价值;只看收入,又可能低估技术扩散产生的长期影响。

同样,只看模型性能,可能高估一个国家的AI实力;如果缺少算力基础设施、产业应用、人才体系、数据保护和事故责任机制,再先进的模型也很难稳定转化成社会能力。

需要特别说明的是,WAIC 2026还发布了由复旦大学全球人工智能创新治理中心组织研究的《全球人工智能治理指数(2026)》。这是一份不同的报告,主要从能力、责任、普惠和持续等维度研究AI治理,不应与清华大学发布的《世界人工智能能力指数报告(征求意见稿)》混为一谈。

这套思路同样适用于企业。

很多企业已经购买模型、组织AI培训、接入智能助手,看起来非常积极。但真正的企业AI能力,不是员工注册了多少个账号,而是AI有没有进入核心业务流程,是否带来了可以持续测量的价值,发生错误后由谁发现、谁处理、谁承担责任。

五、评价真实世界AI,我会看四张考卷

把物理智能、聚变控制、环境成本和全球治理放在一起,我看到的是同一个趋势:

AI竞争正在从“模型能力竞赛”,转向“复杂系统能力竞赛”。

第一张考卷是世界理解。

AI能否识别物体、估计状态、预测变化,并理解自己的行动会对环境产生什么影响?

第二张考卷是任务可靠性。

它是偶尔完成一次,还是能够在不同环境、长期运行和异常条件下稳定完成?失败以后是否能够安全退出?

第三张考卷是全生命周期成本。

除了模型调用费用,它需要多少芯片、电力、水、存储、维护和人工监督?规模扩大以后,成本是下降还是失控?

第四张考卷是社会治理。

系统由谁开发、谁部署、谁监督?出现损失后由谁承担责任?数据如何使用?安全边界在哪里?普通人能否理解并质疑它的决定?

这四张考卷缺一不可。

一个机器人可能动作非常灵活,却无法适应陌生环境;一个AI系统可能准确率很高,却没有故障保护机制;一种模型可能单次推理成本很低,却在大规模部署后带来巨大的能源和基础设施压力;一个产品可能增长很快,却没有解决隐私、责任和监管问题。

它们都可以被称为“先进技术”,但还不能被称为成熟的真实世界智能。

六、这轮AI机会,可能不只属于模型公司

当我们把AI落地拆成这四张考卷,就会发现,未来的产业机会远不只是训练更大的基础模型。

在世界理解层,需要摄像头、力传感器、触觉皮肤、世界模型、仿真环境和高质量物理数据。

在任务执行层,需要灵巧手、关节模组、运动控制、机器人训练平台和安全系统。

在可靠性层,需要测试评估、异常检测、数字孪生、故障恢复、冗余设计和人机协作机制。

在成本层,需要高效芯片、模型压缩、边缘计算、能源管理和更高效的数据中心。

在治理层,则需要审计工具、权限管理、数据合规、模型评测、风险预警和责任追踪系统。

所以,物理智能不会只由一家拥有最大模型的公司完成。

它更像一次漫长的基础设施建设:模型、数据、硬件、能源、标准、供应链和社会信任需要同时成熟。

寄语:现实世界不会给AI“重新生成一次”的机会

在聊天框里,AI回答得足够流畅,就容易让人觉得它很聪明。

但在现实世界中,流畅并不等于理解,成功一次也不等于可靠,单次成本低也不等于总体可持续,技术领先更不等于社会已经准备好。

现实世界有自己的考官。

重力会检查AI是否真的理解物体,事故会检查它是否足够可靠,水表和电表会核算它的真实成本,法律与制度则会追问它的责任边界。

答错一道文字题,可以重新生成。

推倒一台设备、误操作一辆汽车或者错过一次关键预警,却未必有重新生成的机会。

因此,以后再判断一个AI系统是不是真的厉害,我会少问一句“它有多像人”,多问四个问题:

它懂不懂真实世界?

它能不能稳定把事情做完?

它的全部代价算不算得清?

我们是否敢把它交给社会?

当这四个问题都有了可靠答案,AI才算真正离开聊天框,进入现实世界。

关注本站,每天分享跨境电商前沿资讯( Ctrl + D 收藏本站/收藏为书签 )

相关推荐

评论 ( 0 )

扫码关注

qrcode

联系我们

qrcode

回顶部