具身智能:人形机器人到底难在哪里 书架

第 04 章 / 共 10 章

第四章 · 从命令到动作

人对机器人说:“把桌子收拾一下。”这句话听起来像一个命令,其实里面藏着很多层。机器人要判断桌上有哪些东西,哪些算垃圾,哪些该归位,先拿哪个,路径怎么走,手怎么抓,抓失败了怎么办。语言只打开了门,后面是一整套动作系统。

任务规划就是把目标拆成步骤。大白话说,它回答“先做什么、后做什么”。比如收拾桌子可以拆成识别物品、拿起空杯、放到水槽、拿纸团、丢进垃圾桶。大模型在这一层很有用,因为它懂常识和语义:纸团更可能是垃圾,笔记本电脑不该进水槽。

计划不是动作

但计划到这里还只是文字版菜谱。下一层是运动规划,它回答“身体怎样从这里到那里”。手臂要绕过台灯,手腕要避开杯沿,身体重心不能失稳。如果路径算得很好看,却让手肘撞到墙,它就是坏计划。

再往下是控制,它回答“每个关节此刻该出多少力、转到什么角度”。控制层的时间尺度很短,常常以几十到上千赫兹更新。它没有时间写小作文,只能快速根据传感器反馈微调。

可以把机器人动作想成公司协作:高层定目标,中层拆项目,基层每秒处理现场细节。高层说“拿杯子”没错,但杯子真正能不能拿起来,取决于最底层的连续调整。

开环为什么不够

开环控制是指系统按预先安排好的动作执行,不根据结果修正。它像录好的舞蹈:地面、鞋子、音乐都不变时很好看,条件一变就容易出错。很多机器人演示之所以稳定,是因为环境被精心布置过。

闭环控制则会不断看结果。手伸出去偏了,就改方向;夹住杯子发现滑了,就增加力;脚落地感觉不稳,就调整躯干。闭环不是高级装饰,而是物理世界里的基本生存方式。

难点在于反馈也有延迟和噪声。相机图像处理要时间,力传感器有误差,电机响应不可能瞬间完成。控制系统如果太迟钝,动作笨;如果太激进,可能震荡。调控制器有点像调淋浴水温:拧慢了半天不热,拧猛了又烫。

为什么分层会裂开

传统机器人系统常把任务规划、运动规划和控制分开。这有好处:模块清楚,容易调试,也符合工程习惯。但真实任务里,层与层之间会互相打架。任务规划说“拿杯子”,运动规划发现路径被挡住,控制层发现杯子太滑。上层如果不知道下层失败的原因,就会重复发同一个无效命令。

这也是近年端到端策略受关注的原因。它试图让模型直接从感知输入生成动作,少一些人工分层。大白话说,不再把“看、想、动”切得太碎,而是让系统从大量示范里学一条更直接的映射。

但端到端不是灵丹妙药。它可能更灵活,也更难解释;它依赖大量数据,出了错不容易定位;安全场景下,人们仍然希望知道系统为什么这么动。未来很可能不是纯分层或纯端到端二选一,而是把语言常识、几何约束、学习策略和底层控制拼成能互相纠错的结构。

一句话变成动作,中间至少要穿过四道门:懂目标、拆步骤、找路径、控身体。任何一道门卡住,机器人都会从“聪明”变回“笨重”。

下一章讲学习。因为这些门如果全靠工程师手写规则,机器人永远只能在少数场景里工作。它必须从仿真、示范和真实失败中学会更多动作。

具身智能:人形机器人到底难在哪里 · 王建硕
费曼式写法 · 由多个 AI 代理撰写与互相审校