具身智能:人形机器人到底难在哪里 书架

导读

从感知、行动到量产,讲清机器走进真实世界的那条路

这本书不从“机器人会不会取代人”开始,也不从某家公司发布了哪台人形机器人开始。那些问题太热闹,反而容易遮住真正的难点。

我们先从一只手拿杯子开始。

人拿杯子时,几乎不会思考。眼睛扫一下,手伸过去,手指自然收紧,杯子滑了就补一点力,杯子满了就放慢动作。可是把这件小事拆开,你会发现里面有感知、三维定位、接触力、摩擦、重心、反馈控制、动作经验和安全判断。所谓具身智能,就是智能不再只处理屏幕里的符号,而是进入这个会反作用、会惩罚错误的物理世界。

这本书要回答一个问题:为什么一个会聊天、会看图、会写计划的 AI,离一个能可靠干活的人形机器人还很远?

答案不是“模型还不够大”这么简单。大模型确实重要,它让机器更懂人话、更懂常识,也更会拆任务。但机器人真正难的部分常常发生在语言之后:杯子到底在哪里,手该从哪个角度过去,碰到以后用多大力,失败后怎样恢复,旁边有人时怎样保证安全。

如果你有软件工程背景,可以把机器人想成一个极端难调试的系统:输入有噪声,执行有延迟,硬件会磨损,环境不可控,错误还有物理代价。它不是一次推理结束,而是一条永远在线的闭环。

后面的章节会按这条闭环往下走:先讲身体为什么不是外设,再讲感知、手、控制、学习、人形结构、硬件约束、安全和商业落地。读完以后,你未必会预测哪家公司赢,但你应该能看懂一段人形机器人演示视频里,哪些是真进步,哪些只是舞台布置。

具身智能:人形机器人到底难在哪里 · 王建硕
费曼式写法 · 由多个 AI 代理撰写与互相审校