page contents
跨境关条
Ctrl + D 收藏本站
当前位置:首页 » AI学习圈 » AI通识

为什么机器人越强,反而越觉得“通用机器人”还很远?

mogoec 2026-08-29 13

机器人真正难的,不是跑过博尔特,而是走进一个陌生房间

这几天看完北京两场机器人活动,我脑子里一直有一个非常强烈的反差。

一边,是机器人已经开始在跑道上“羞辱”人类纪录。

另一边,是同一批机器人走进卧室、药房、商店之后,面对一个杯子、一件衣服、一个没有按照训练时位置摆放的纸箱,突然又显得没那么聪明了。

这可能是今天理解人形机器人最重要的一件事:

机器人真正难的,从来不是把一个动作练到极致,而是在一个它从没见过的世界里,把事情做对。

01

机器人已经跑得比博尔特快了

2026年8月,北京连续举行了两个很容易被混在一起的活动。

一个是8月19日至23日在北京亦庄举行的2026世界机器人大会;另一个是8月22日至26日在国家速滑馆“冰丝带”举行的第二届世界人形机器人运动会。后者一共设置了51个项目、1301场比赛,吸引来自16个国家的666支队伍和2056台机器人参加。

如果只看体育项目,人形机器人的进步已经快到有点不真实。

去年,天工Ultra完成100米还需要21.50秒。

今年开幕式预赛,百米成绩很快被推进到9.39秒、9.34秒和9.32秒。

到了复赛,天工Ultra又跑出8.86秒。

最终决赛,成绩定格在:

8.64秒。

这已经明显快于尤塞恩·博尔特2009年创造的9.58秒人类男子百米世界纪录。

而且不只是100米。

公开数据显示,这一届机器人400米成绩已经达到38秒15左右,1500米跑到2分21秒64,原地跳高达到3.4米,一系列项目都突破了对应的人类纪录。

宇树科技在大会前后发布的新机器人“超人”,官方公布的极限速度达到12.66米/秒,原地跳高2米。

如果单独剪这些视频,你很容易产生一种感觉:

机器人时代是不是突然就到了?

我倒觉得,事情恰恰应该反过来看。

因为就在这些机器人疯狂刷新体育纪录的时候,另一条新闻线也越来越清楚。

机器人会跑,和机器人会工作,根本不是同一道题。


02

为什么跑100米,可能比端一杯水更容易?

这件事听起来非常反常识。

对人来说,百米跑当然比端水难。

你让我现在去跑100米,我大概率跑完以后只想找个地方躺着。但让我把桌上的水端到另外一张桌子上,几乎不需要思考。

机器人正好相反。

原因就在于,100米比赛实际上是一个高度结构化的世界。

起点固定。

终点固定。

地面平整。

跑道宽度固定。

规则提前知道。

比赛的时候不会突然有人把第60米处的跑道向左挪30厘米,也不会突然从旁边冲出来一只猫。

对于强化学习和运动控制算法来说,这种环境非常友好。

机器人可以在仿真器里反复训练。

失败一万次,再来一万次。

调整关节扭矩、步频、重心、落脚点,再继续训练。

训练成本主要是算力和时间。

所以一个动作一旦被定义得足够明确,机器完全可能通过高频训练把它推向人类身体无法达到的极限。

但“端一杯水”完全不是这样。

杯子可能是玻璃的、塑料的、陶瓷的。

可能是空杯。

也可能装了八成满的热水。

桌子可能80厘米高,也可能95厘米高。

杯柄可能朝左,也可能朝右。

光线可能突然变暗。

有人可能从旁边经过。

杯子底下甚至可能有一摊水。

机器人刚伸手过去,旁边的孩子突然碰了一下桌子。

这时候,机器人面对的就不再是一道固定题目。

它进入了一个开放世界(Open World)

而开放世界最大的特点,就是你永远无法提前穷举所有情况。

这才是人形机器人真正困难的地方。


03

机器人现在最大的短板,有一个专业名字:泛化

机器人行业最近反复出现一个词:

泛化能力(generalization)。

所谓泛化,简单说就是:

训练的时候没见过,真正干活的时候还能不能做对。

这件事甚至比“完成任务”本身更加重要。

比如一个机器人经过几万次训练,已经学会从货架A拿起矿泉水放进纸箱B。

成功率99%。

看起来已经可以上班了。

但如果第二天货架换了颜色,矿泉水换了包装,纸箱向右移动20厘米,成功率突然掉到60%。

那它依然很难进入真正的商业环境。

因为现实世界不会为了机器人保持不变。

今年世界机器人大会上,宇树科技创始人王兴兴也直接把“泛化能力不足”称为当前机器人落地的核心瓶颈之一:

在固定场景、数据和训练都充分的情况下,机器人任务成功率可以接近100%;一旦操作环境发生变化,成功率就可能明显下降。

这也是为什么我现在看机器人演示,越来越少看“它能不能完成”,而更关心另外三个问题:

环境是不是固定的?

任务是不是提前训练过的?

换一个东西以后,它还能不能完成?

这三个问题,比一次成功的视频重要得多。


04

语言模型吃的是互联网,机器人吃的是真实世界

为什么泛化这么难?

一个最核心的原因是:

数据。

大语言模型过去几年的快速发展,很大程度上建立在人类已经积累几十年的数字世界之上。

网页、书籍、论文、论坛、代码库、图片、视频……

这些东西天然就是数字化的。

AI可以在数据中心里读取。

但是机器人需要的不是“世界长什么样”的数据。

它需要的是:

我做了这个动作以后,世界发生了什么。

这叫物理交互数据。

比如抓杯子。

摄像头看到了什么?

机械臂移动了多少厘米?

手指用了多少牛顿的力?

杯子有没有滑?

杯子重量是多少?

重心怎么变化?

如果滑了,应该往哪个方向补偿?

这些数据必须发生在真实世界里。

人民网在2026世界机器人大会期间援引的一组行业数据非常值得注意:

目前国内真实物理交互场景的合规数据约为50万小时,而机器人走向规模化商业落地被认为需要达到数千万小时级别,两者仍存在超过99%的量级缺口。

这个数字当然不是一个已经被全球学术界统一确认的“绝对门槛”,更准确地说,它代表的是当前国内产业界对于数据缺口规模的一种判断。

但方向非常明确。

机器人真的非常缺数据。

早在Open X-Embodiment项目里,Google DeepMind联合20多家研究机构,把22种机器人、500多项技能以及超过100万条episode的数据整合起来,就是希望不同机器人之间能够共享经验。

实验结果也显示,更丰富、跨机器人平台的数据确实能够显著改善泛化表现。

到了2026年,Google DeepMind发布Gemini Robotics 2时,依然把“适应不可预测环境”“长任务自我纠错”“跨机器人迁移”和“多机器人协作”作为关键突破方向。

你会发现,整个机器人行业其实正在重复大模型当年的故事。

只不过大模型的问题是:

怎样让机器读更多世界。

机器人的问题是:

怎样让机器真正经历更多世界。

这两个问题的成本完全不同。


05

最难的数据,可能藏在最后几毫米里

我觉得人类很容易低估机器人操作物体到底有多难。

因为我们做得实在太自然了。

你伸手拿一个杯子的时候,并不会先计算:

距离杯子还有23毫米。

手指闭合速度是多少。

杯壁摩擦系数是多少。

应该施加多少牛顿压力。

实际上,你的视觉、触觉、本体感觉一直在进行高速闭环控制。

手刚接触杯子的时候,如果发现杯壁比预期更滑,你会瞬间增加一点力。

如果杯子很薄,你又会自动减小压力。

杯子稍微歪了,手腕会立刻补偿。

整个过程几乎没有进入意识。

机器人却必须把这一切重新学一遍。

尤其到了真正接触物体的最后几厘米,视觉信息开始变得不够用了。

这时候,力、摩擦、形变、滑动趋势和触觉反馈会变得非常重要。

2026年最新的一批机器人研究也在集中补这个缺口。

例如RCT触觉数据集专门研究机器人面对从没见过的材料时,触觉模型还能否准确判断物体属性。研究发现,一旦真正把训练材料和测试材料隔离开,模型性能会明显下降,说明“陌生材料泛化”仍然是实际部署中的核心难题。

另一项2026年的研究则直接指出,对于精细操作和接触密集型任务,触觉能够提供视觉无法稳定推断的力反馈,而现有机器人触觉数据仍然存在规模小、接触场景有限的问题。

所以很多时候,机器人并不是不会“伸手”。

真正困难的是最后那一下。

差3毫米。

力大了一点。

摩擦系数猜错了一点。

一个杯子就可能掉下来。

这也是为什么我越来越觉得,未来机器人真正的进步,并不一定都会表现成翻跟斗这种令人惊呼的视频。

有时候最重要的突破可能非常无聊:

以前拿杯子成功率86%。

今年变成93%。

明年95%。

再过几年99.99%。

商业化真正需要的,恰恰是后面那几个小数点。


06

“两个80%”,可能比任何机器人表演都重要

今年世界机器人大会有一个特别有意思的背景。

8月19日,宇树科技正式登陆上交所科创板。

上市首日开盘价1100元,相比150.80元发行价上涨629.44%,开盘总市值一度达到4449亿元。

第二天,王兴兴出现在世界机器人大会。

如果换成普通上市公司,这可能是最适合讲增长、市场和未来故事的时候。

但他讲的恰恰是机器人现在还做不到什么。

他说,目前机器人进入工厂仍然难以大规模推广,一个重要原因就是效率和泛化能力仍然不够。

对于行业经常讨论的“具身智能ChatGPT时刻”,他的判断是:

快的话可能还需要2到3年。

慢的话可能需要5到10年。

更重要的是,他提出了一个非常具体的判断标准:

机器人能够进入80%左右的陌生环境,仅凭语言指令完成80%左右的日常任务。

我觉得这个标准特别重要。

注意,它其实包含两个80%。

第一个80%,考的是:

环境泛化。

换一个从没去过的房子,它还能不能工作。

第二个80%,考的是:

任务泛化。

到了这个陌生房子以后,你让它做一件没专门训练过的事,它还能不能完成。

只有两个80%同时成立,机器人才能真正从“设备”变成某种意义上的“通用劳动力”。

而且即使达到80%,距离工业级可靠性仍然很远。

流水线不可能接受一个每天做100次操作错20次的员工。

医院、实验室、食品生产、电力巡检这些高风险场景更不可能。

所以“ChatGPT时刻”不是终点。

它只是机器人真正进入规模化应用的起跑线。


07

真正可能最先赚钱的机器人,反而不一定最像人

这也是我看今年世界机器人大会最大的一个感受。

以前我们总希望机器人越来越像人。

两条腿。

两只手。

五根手指。

会聊天。

会做饭。

会叠衣服。

最好什么都会。

但商业世界的逻辑可能恰恰相反:

与其让机器人适应整个世界,不如先把它要解决的世界缩小。

酒店送餐机器人就是最典型的例子。

它长得一点也不像人。

基本就是一个会移动的柜子。

能力也非常有限:

接任务。

坐电梯。

到房间。

开舱门。

然后回去。

但正因为它只解决这么一个极窄的问题,才更容易建立可靠的商业闭环。

现在,机器人研究进一步开始解决多机器人协作问题。

比如同一个空间里有多台机器人,它们需要根据位置、电量、任务状态和环境信息动态协调任务。

这已经不再是“机器人会不会走路”的问题,而是:

这一单到底应该让谁去。

Google DeepMind在2026年发布的Gemini Robotics 2,也已经把multi-robot collaboration——多机器人协作——作为明确能力方向之一,让不同形态的机器人共同完成一个单机无法高效完成的工作流。

这件事看起来没有机器人空翻刺激。

但可能更加接近真正的生产力。


08

我反而很看好那些“不聪明”的机器人

这也是为什么,我特别喜欢今年世界机器人大会上一种看起来没那么“AI”的产品。

机器马。

大咖机器人展示的骐骥X1是一台可以载人的四足机器人,整机约300公斤,最高时速约7—10公里,动态负载能力约300公斤,主要瞄准碎石、泥泞、坡地等轮式设备不方便通行的非铺装环境。

它并没有假装自己是一个“什么都会的通用机器人”。

它解决的问题很具体:

轮子过不去的地方,我用四条腿过去。

这其实是一条非常现实的机器人商业化路线。

不要一开始就试图解决“替代一个完整的人”。

先解决:

替代一种移动方式。

替代一种搬运。

替代一种巡检。

替代一种危险操作。

替代一个仓库里的固定步骤。

只要那个小世界足够稳定,机器人就可能提前进入商业化。

所以未来几年,我判断机器人行业可能会同时出现两条路线。

一条继续冲击通用人形机器人。

想办法把视觉、语言、动作、触觉、世界模型和长期规划全部连接起来,让机器人真正进入陌生家庭。

另一条则不断缩小任务边界。

仓库机器人只做好仓库。

送餐机器人只做好酒店。

机器马只解决复杂地形。

工业机械臂只解决一种装配。

后者看起来没那么性感,却可能更早挣钱。


09

所以,机器人真正的“ChatGPT时刻”到底是什么?

如果有一天,一个机器人走进我家。

我没有提前扫描房间。

没有给家具贴二维码。

没有告诉它杯子在哪里。

也没有训练过“帮我把桌上的水杯拿到书房”这个动作。

我只是随口说一句:

“把客厅那个杯子拿给我。”

它环顾房间。

发现桌子。

识别杯子。

规划路径。

绕过地上的鞋。

判断杯子里还有水。

调整手指力度。

拿起来。

中途有人经过,它停一下。

发现杯子开始滑,重新调整握力。

走到书房。

递给我。

整个过程没有工程师躲在旁边操作。

没有重新训练。

没有重新标定。

第二天我把杯子换掉,它还是会。

第三天搬了家,它还是会。

到了那个时候,我才会认为,人形机器人真正跨过了一条线。

因为机器人最重要的能力,从来不是跑得有多快,也不是能跳多高。

真正决定它能否进入人类社会的是:

离开训练场以后,它还能不能工作。

跑道是确定的。

工厂稍微复杂一点。

家庭更复杂。

街道更复杂。

整个现实世界,则几乎由无穷无尽的例外组成。

AI过去十年的进步,本质上是在数字世界里不断扩张自己的边界。

而机器人接下来真正要面对的问题是:

怎么把这种智能,从屏幕里面搬出来。

进入一个没有标准答案、没有重置按钮、每一秒都可能发生变化的物理世界。

跑过博尔特,也许只是工程问题。

走进一个陌生房间,还能把事情做好,才是真正的智能问题。


关注本站,每天分享跨境电商前沿资讯( Ctrl + D 收藏本站/收藏为书签 )

相关推荐

评论 ( 0 )

扫码关注

qrcode

联系我们

qrcode

回顶部