具身智能:人形机器人到底难在哪里 书架

第 03 章 / 共 10 章

第三章 · 手比脑更难

如果只看演示视频,人形机器人最吸引人的常常是走路。但真正让工程师头疼的,往往是手。走路至少有一个清楚目标:别摔,往前。手的目标却五花八门:拿、推、拧、掰、插、撕、折、擦,每个动作都要和物体发生接触。

自由度就是一个机构能独立运动的方向数量。人的手腕、手掌和手指加起来有很多自由度,所以能用同一只手拿硬币、握锤子、捏葡萄、拧瓶盖。自由度多,能力强;但自由度多也意味着控制空间爆炸。你不是控制“一只手”,你是在控制一支小乐队。

接触让问题变硬

机器人手还没碰到杯子时,问题主要是几何:从哪里过去,别撞到障碍。碰到杯子以后,问题变成力学:多大力会滑,多大力会捏碎,手指和杯壁的摩擦够不够,杯子里如果有水,重心会不会变。

这就是接触动力学:物体接触后,力、运动和摩擦一起决定结果。大白话说,两个东西一碰上,世界就不再像动画关键帧那样听话。你推桌上的书,书可能滑,也可能不动;你拿一块布,布会变形;你夹一个纸杯,纸杯会瘪。

抓取不是“手到那里,合上手指”。抓取更像跟物体谈判:你给它一点力,它用摩擦、重量和形变回答你,然后你再调整。

为什么软东西特别难

硬杯子的形状基本固定,机器人还能预先估计抓哪里。衣服、毛巾、塑料袋这类东西叫可变形物体,意思是它们的形状会随着受力改变。你今天看到的形状,不代表下一秒还在那里。拿起一角,其他地方会垂下去;折一下,新的皱褶会挡住旧特征。

人叠衣服看似轻松,是因为手、眼、经验在高速配合。我们会摸到布料厚薄,会用小动作抖开,会根据皱褶猜边界。机器人如果没有触觉,只靠视觉,很容易把一团布看成没有规则的彩色云。

触觉传感就是让机器人知道自己摸到了什么、用了多大力、接触点是否在滑。它相当于给机器手装上皮肤。没有触觉也能抓一些规则物体,但要做灵巧操作,就像戴着厚手套穿针。

灵巧不是炫技,是泛化能力

有些工业机械手很强,能在流水线上每天重复同一个动作几十万次。但它们通常依赖夹具、定位和规则物料。一旦物体换了形状,环境换了高度,动作就要重新调。人形机器人想进入人的环境,就不能每个杯子都配一个专用夹具。

泛化是指系统能把学过的能力迁移到没见过但相似的新情况。会拿一个马克杯,不等于会拿所有杯子;会开一个抽屉,不等于会开所有柜子。手的灵巧性决定了泛化的底线:如果硬件只能做两三种夹取姿势,再聪明的算法也会被卡住。

机器人手的难,不在“会不会弯手指”,而在“能不能用不完美的感知和不确定的力,把脆弱、多样、会变形的东西处理好”。

所以,手比脑更难这句话不是贬低智能,而是在提醒我们:真实动作的很多知识不在语言里,而在接触里。一个机器人可以读完所有烹饪书,却仍然不知道怎样把一颗番茄捏得刚刚好。

下一章会把“看见”和“碰到”连起来:机器人怎样从一句命令出发,生成可执行动作,并在反馈里不断修正。

具身智能:人形机器人到底难在哪里 · 王建硕
费曼式写法 · 由多个 AI 代理撰写与互相审校