具身智能:人形机器人到底难在哪里 书架

第 10 章 / 共 10 章

第十章 · 通往通用机器人的窄门

讨论具身智能,很容易落入两个极端。一个极端说“明年每家都有机器人管家”,另一个极端说“机器人永远做不好家务”。这两种说法都太省事。真正值得看的,不是某个时间点会不会突然变天,而是几条曲线是否同时变好。

通用机器人不是无所不能的机器,而是在足够多的真实任务里能可靠工作、还能通过数据继续变强的系统。大白话说,它不必像人一样会所有事,但要比专用机器更能换任务,比玩具演示更能长期工作。

第一条曲线:数据

前面说过,具身智能缺的不是文字数据,而是动作数据。真正有价值的数据包括视觉、深度、触觉、关节状态、力、任务结果和失败原因。没有这些,模型很难知道“看起来一样”的动作为什么一个成功、一个失败。

数据飞轮一旦建立,会让领先者更领先。部署更多机器人,收集更多真实任务;真实任务改进模型;模型提升后进入更多场景。但飞轮也可能卡住:机器人太贵导致部署少,部署少导致数据少,数据少导致能力提升慢,能力慢又更难卖。

具身智能的竞争,不只是模型竞赛,也是谁能让足够多的机器在真实世界里安全地干活,并把每次干活变成训练材料。

第二条曲线:成本

机器人要普及,成本必须下降,而且不是只下降购买价。关节寿命、维修速度、电池更换、现场部署、远程运维、软件更新都要规模化。一个机器人如果买来不贵,但三天两头停机,实际成本仍然很高。

这里会出现类似汽车和手机产业的供应链效应。产量上来以后,电机、传感器、控制板、结构件会更便宜;标准化以后,维修和备件也会更成熟。但人形机器人比手机难,因为它会摔、会撞、会和环境接触,机械磨损不能靠软件更新消掉。

第三条曲线:安全和信任

机器人越接近人,社会越会要求它可靠、可控、可追责。一次事故可能抵消很多次成功演示。安全标准、保险、责任划分、现场培训和监管都会影响扩散速度。

社会接受度不是大家觉得机器人酷不酷,而是人们愿不愿意让它进入工作流和生活空间。员工是否愿意和它同场工作?老人是否愿意让它靠近?企业法务是否敢批准?这些问题没有算法那么耀眼,却决定了商业速度。

我们应该怎样看演示

看一段人形机器人视频,可以问几个朴素问题:环境是否被精心布置?任务失败率是多少?有没有剪辑?是否能处理没见过的物体?连续运行多久?人离它多近?摔倒后怎么办?这个任务如果换成轮式底盘或专用机械臂,会不会更便宜?

这些问题不是泼冷水,而是把注意力从“像不像人”拉回“能不能可靠创造价值”。真正的进步经得起这些追问:感知更稳,动作更自然,失败能恢复,成本在下降,场景边界说得清楚。

人形机器人最有希望的未来,不是突然出现一个钢铁仆人,而是一批笨活、累活、危险活先被稳定接过去;机器在这些窄门里积累身体经验,再慢慢扩展边界。

回到开头的问题:为什么不能把 ChatGPT 装进机器人就完事?因为语言理解只是具身智能的一部分。真正的机器人要在身体里思考,在接触里学习,在失败里变稳,在成本和安全约束下工作。

如果未来十年人形机器人真的走进日常,它看起来也许不会像科幻片那样突然。它更可能先出现在仓库夜班、工厂角落、医院走廊、养老机构的辅助岗位里。等我们习惯它们做一些小事,它们才有机会做更多事。通用机器人的路不是一扇大门,而是一道很窄的门缝:挤过去的,是那些同时懂 AI、懂身体、懂工程账、也懂真实世界脾气的系统。

具身智能:人形机器人到底难在哪里 · 王建硕
费曼式写法 · 由多个 AI 代理撰写与互相审校