来源:未来机器人网
在人形机器人行业,后空翻、高速奔跑、花式打乒乓球早已不算新鲜看点。各大厂商演示视频里,炫酷动作层出不穷。
但近期 Figure AI 创始人 Brett Adcock 在 X 平台放出的一段视频,却在行业内部引发不少讨论:Figure 03 人形机器人,完成无遥控、无预设脚本、全自主攀爬工业金属梯子。
没有华丽特效,没有高难度杂技,只是爬上一架普通工业梯,为什么这件事被行业这么看重?

一、爬梯子这件事,难在哪里?
先看这个动作本身。视频里的 Figure 03 面对的是一架镂空工业金属梯,踏板面积狭小,扶手位置不确定,需要手抓握、脚踩踏、身体平衡三者实时耦合 —— 也就是行业所说的移动操作耦合。
机器人一边用手抓住横杆借力,一边脚下寻找落脚点,视觉实时修正位置,一旦手抓偏、脚踩歪,就会直接摔倒。
过往很多机器人爬梯,要么人工遥控,要么提前录入脚本、标记好每一个落脚点。Figure 03 则是看到陌生梯子,现场理解、现场规划、现场执行,没有提前写死动作序列。
这意味着什么?过去行业的演示,大多是能力割裂:有的机器人擅长跑跳,但不会用手;有的机器人抓取灵巧,却只能站在平地上原地操作。爬梯子这个动作,强制要求手、眼、腿三者同时闭环工作。
放到产业现实层面,这意味着人形机器人具备进入高空、检修、运维场景的基础能力。工厂设备检修、仓储高位作业,人类需要爬梯完成的岗位,机器人终于拥有了物理条件。
当然客观来说,目前公开的只有演示视频,官方并未对外公布爬梯成功率、容错边界,实验室理想环境的表现,距离复杂多变的真实工厂,依旧还有距离。
二、Helix 三层架构,看懂 Figure 的核心技术路线
能完成这个动作,靠的是 Figure 独树一帜的全栈技术路线。
市面上不少人形机器人采用模块化方案:感知一套系统、规划一套系统、运动控制一套系统,分开写代码拼接在一起。而 Figure 走的是端到端神经网络全身控制路线,自研 Helix 系统分为三层 System 0—System 1—System 2,三层各司其职,协同完成复杂物理任务。
System 2(1 赫兹)高层语义理解
接收语言指令,把 "爬上这架梯子" 这种人类指令,拆解成一套任务目标,不负责具体动作,只定义要完成什么事。
System 1(200 赫兹)视觉运动映射
融合头部双目相机、掌心相机、指尖触觉传感器、全身本体感知,理解眼前环境,识别梯子扶手、踏杆位置,输出视觉空间信息。
System 0(1000 赫兹)全身运动控制器
本次爬梯子的核心升级点,千万参数神经网络模型,替代过去 10.9 万行手写 C++ 控制代码,处理平衡、接触、四肢协同,仿真环境大量随机地形训练,仿真到现实零样本迁移,不需要针对每一把梯子单独调参标定。
这次爬工业金属梯子,System 0 的升级是关键。视觉信息直接接入全身控制器,机器人不再依赖预先标定的环境坐标,而是 "看到什么就适应什么"。
三、从软件创业者到押注人形:Figure AI 的发展历程
想要理解 Figure 为什么能走到这一步,需要回看这家公司的成长路径。
Figure AI 诞生于 2022 年 5 月,创始人 Brett Adcock 本身是连续创业者,此前创办过招聘平台 Vettery,被巨头收购;之后又创办电动飞行器企业 Archer Aviation,完成 SPAC 上市,拥有硬件创业与资本运作双重经验。离开航空赛道之后,他自掏 1 亿美元种子资金,All-in 通用人形机器人赛道,目标打造能够替代人类重复体力劳动的机器劳动力。
公司组建初期疯狂挖人,团队成员来自波士顿动力、特斯拉、谷歌 DeepMind、苹果等企业,集齐运动控制、灵巧操作、AI 感知各路人才。
2023 年
首款原型 Figure 01 对外亮相,完成 A 轮 7000 万美元融资,完成人形机器人基础行走、简单抓取能力验证,早期选择和 OpenAI 合作,借用大模型能力完成语义交互能力搭建。
2024 年
迭代 Figure 02,开启和宝马工厂试点合作,进入真实工业环境做分拣作业;同年宣布终止和 OpenAI 合作,下定决心自研机器人专属 AI 系统 Helix,不再依赖外部大模型 —— 这是这家公司最重要的路线转折点。
2025—2026 年
主力机型 Figure 03 登场,自建 BotQ 量产工厂,生产效率从每天 1 台提升到每小时 1 台,累计产出超 350 台样机,大规模部署采集真实物理世界数据;Helix 系统持续迭代,从单纯本体感知升级为视觉条件驱动的全身控制,最终完成全自主爬梯子演示。
和很多先做炫酷样机、再考虑落地的机器人公司不一样,Figure 从成立第一天,目标就瞄准工厂真实劳动场景,一切技术迭代,都围绕真实工况的数据反馈展开。
四、竞争对手们在走什么路?
Figure 不是唯一在冲刺的玩家。海外人形机器人赛道,已经形成几条清晰的技术路线分野。
特斯拉 Optimus依托 FSD 自动驾驶同源感知能力,优先打磨工厂内部搬运分拣,走的是 "自动驾驶技术降维到机器人" 的路线,优势在于海量视觉数据积累和供应链成本控制,马斯克的目标是把 Optimus 做到 2 万美元以内,优先服务特斯拉自家工厂。
波士顿动力则是运动控制的老牌王者,Atlas 液压驱动版本已经能完成跑酷、后空翻等高难度动作,但商业化路径一直偏慢,更多聚焦工业巡检和特种作业,近期也在转向电动版本和 AI 融合。
国内厂商方面,宇树、智元、傅利叶等各有侧重。宇树凭借四足机器人积累的运动控制能力,在人形机器人步态和成本控制上进展迅速;智元走 "三智一体" 路线,强调运动、作业、交互智能同时落地。
对比来看,Figure 选择的路径很明确:更早把视觉感知接入全身控制器,优先攻克移动操作耦合这类复合任务,不追求单一项的极致炫酷,而是瞄准真实工厂里 "手脚并用" 的劳动场景。
五、炫酷表演时代即将落幕,实用考核已经到来
Figure 03 爬梯子这件事,更大意义不在于 "机器人会爬梯子",而在于它释放出一个重要信号:具身智能的考核,已经从 "看能不能动起来",转向 "能不能完成真实世界的复合任务"。
未来两三年,我们会看到更多类似爬梯子这样看上去平淡、却直击产业痛点的演示。炫酷镜头会越来越少,解决真实问题的能力,才是决定一家企业能否跑出来的关键。
但样机演示不等于大规模商用,Figure 虽然已经在宝马工厂开展试点,做包裹分拣等简单任务,可爬梯子这类复杂任务,现阶段依旧停留在实验室验证。量产机型面对油污、震动、光线杂乱的工业现场,稳定性、故障率、运维成本,都是绕不开的考题。
具身智能的时代已经到来,但商业化的答卷,才刚刚开始书写。