如果机器人每个动作都靠工程师手写规则,它永远学不会世界的长尾。你可以写“看到杯子就抓”,但杯子有高矮胖瘦、把手方向、材质反光、里面是否有水。规则越写越多,最后像一张补丁摞补丁的网。
机器人学习就是让系统从数据和试错里获得动作能力。大白话说,不把每个动作都手工刻进去,而是让机器人看别人怎么做、自己试着做、失败后调整。问题是,真实世界的试错很贵:摔一次可能坏关节,夹错一次可能伤人,跑一天数据还不够训练一个稳定策略。
仿真:便宜,但不完全真实
仿真是在电脑里搭一个物理世界,让机器人先在虚拟环境中练习。它的好处明显:快、便宜、安全。虚拟机器人摔一万次不会赔钱,也不会砸坏实验室地板。强化学习尤其喜欢仿真,因为它需要大量试错。
麻烦在于仿真到现实差距,常被叫作 sim-to-real gap。电脑里的摩擦、弹性、传感器噪声、电机延迟都只是近似。虚拟世界里学会的动作,搬到真实机器上可能立刻变形。就像你在赛车游戏里练得很好,第一次开真车仍然会被离合、路感和恐惧教育。
仿真不是假,它是便宜的近似。用得好能省大量时间;用得不好,机器人只是在一个过于干净的梦里变强。
模仿学习:先学人怎么做
模仿学习是让机器人从示范中学习。示范可以来自人类遥操作,也可以来自视频、动作捕捉或另一台机器人。它像教孩子系鞋带:先别讲力学方程,先让他看一遍、跟一遍。
模仿学习的优点是效率高,因为人类示范里已经包含了很多隐性经验。比如拿盘子时略微倾斜手腕,避开桌沿,从重心下方托住。这些细节很难写成规则,但可以从示范轨迹里学到。
它的缺点也明显:示范覆盖不到的情况,机器人可能不会处理。人示范了一百种开门方式,第 101 种坏门把手仍可能难住它。更麻烦的是,人类身体和机器人身体不一样。人的手指柔软、有皮肤、有指甲,机器人复制人的动作时,不一定能得到同样结果。
强化学习:让失败变成老师
强化学习是让系统通过奖励和惩罚学策略。机器人做对了得分,做错了扣分,反复试以后找到更好的动作。它适合学走路、平衡、抓取这类很难手写规则的问题。
但奖励设计很微妙。你奖励“速度快”,机器人可能学会危险动作;你奖励“杯子拿起来”,它可能用奇怪姿势硬夹;你奖励太稀疏,它半天不知道自己哪里做对。强化学习像训练一个特别会钻规则空子的学生,题目出得不严谨,它就会找到让你尴尬的解法。
真实数据才是硬通货
今天大模型的进步很大程度来自互联网规模的数据。具身智能没有这么幸运。互联网上有海量文字和图片,却没有同等规模、带有力、触觉、关节角度和失败记录的机器人动作数据。视频能告诉你人做了什么,却不告诉你手指用了多大力。
所以许多公司都在追求数据飞轮:机器人部署越多,收集到的真实任务数据越多;数据越多,模型越好;模型越好,能部署的场景越多。这个飞轮一旦转起来,会很强。但启动很难,因为早期机器人贵、慢、容易失败,数据采集本身就是成本。
具身智能的学习,不是选一个算法名字下注,而是在“便宜仿真、昂贵现实、人类示范、机器试错”之间做工程配比。
下一章讲人形。既然学习这么难,为什么大家还执着于做成人的形状?答案既有合理的部分,也有容易被营销放大的部分。