
过去一年,具身智能的技术迭代明显加快。VLA、世界模型持续演进,强化学习重新成为机器人学习的重要技术路径,Sim2Real加速从仿真走向真机,全身控制能力也在快速突破。
机器人会做的事情也越来越多:能走、能跑、能抓、能导航,甚至可以完成越来越复杂的长程任务。
机器人“会做”一件事,和机器人能够在开放环境中长期、稳定、泛化地把事情做成,其实是两回事。
一个机器人能跨过固定高度的障碍,不意味着换一种障碍还能完成;能在一个房间里导航,不意味着换一个场景、换一种机器人本体仍然有效;正常状态下能稳定行走,也不意味着受到撞击、跌倒甚至关节损伤之后还能继续工作。
这也是为什么,随着具身智能从Demo走向真实世界,行业的评价标准正在发生变化。
如果说上一阶段关注的是机器人到底“会多少技能”,那么下一阶段更重要的问题是:这些能力能不能持续规模化扩展。
这里所说的Scaling,不只是模型参数量,也不只是机器人数据量,而是模型能否经历更多环境、覆盖更多任务、迁移到更多机器人本体,并在真正进入物理世界之后,继续适应那些训练阶段没有见过的状态。
LightParkour从简短的人类动作片段出发,通过物理仿真与课程学习扩展复杂接触技能;
Light REACT则面向外力扰动、跌倒和硬件损伤条件下的全身韧性控制,研究机器人如何依据自身交互历史调整运动方式。
亮源新创连续发布三项技术:LightParkour、LightNav-0和Light REACT
45厘米障碍物的初始动作出发,可以逐步生成覆盖至75厘米障碍的参考轨迹,对应90厘米高的Lightbot 0约83%的身高。
数据问题。语言模型拥有互联网级文本数据,但机器人没有天然存在的“机器人互联网”。如果所有导航经验都依靠真机遥操作采集,那么每增加一个环境、一个机器人本体,都意味着新的数据成本。
2,000+个互联网来源的真实场景转换为可复用仿线+小时视觉、语言和动作后训练经验。同一个场景可以产生不同目标、不同路线、不同视角和不同任务,摄像机几何也可以随训练变化,从而避免模型只适应某一种固定机器人视角。
这里有一个值得关注的实验结果。LightNav-0发现,在当前实验范围内,
例如,机器人接到“走到沙发右边”的指令,理解“沙发”并不困难。真正困难的是,它还需要判断沙发在哪里、右边在哪里、哪里可以通行,以及接下来应该生成怎样的运动轨迹。
。模型首先在图像空间预测目标点和可通行点,再生成后续动作token。推理过程因此从“视觉+语言直接生成动作”,变成“视觉语言理解→空间推理→动作生成”。在公开的8项消融评测中,引入Point CoT后,平均任务成功率提高8.4个百分点,SPL提高5.7个百分点。随后,LightNav-0通过RVQ动作编码器,将连续机器人轨迹压缩为3个动作token,使视觉、语言、空间位置和机器人动作能够进入统一的模型训练框架。
这实际上在做一件基础模型非常熟悉的事情:建立统一表示。只不过语言模型统一的是不同语言任务,而Physical AI需要进一步把视觉、语言、空间和动作统一起来。
在10个仿真设置中,LightNav-0覆盖指令跟随、目标导航和具身视觉跟踪等任务;在真实机器人部署中,同一个模型进一步零样本迁移到
等不同本体。官方同时发布了模型、代码和技术报告。这一验证重点考察模型在环境、任务和机器人本体变化条件下的零样本泛化能力。
LightParkour从一个动作示例出发,将其扩展为能够适应不同环境条件的技能分布,LightNav-0则把这种泛化进一步推到环境、任务和机器人本体。
但机器人进入真实世界以后,还有最后一个很难通过Benchmark提前解决的问题。世界会变化,机器人自己也会变化。
真正困难的是异常状态。人可能撞到机器人,机器人可能跌倒,执行器可能出现故障,关节可能锁死,环境也可能限制它原本的运动方式。
这类异常在单次实验中可能并不高频,但随着部署规模扩大,其绝对发生次数也会增加,对系统韧性、故障恢复能力和运维效率提出更高要求。
如果异常频繁导致任务中断,并且需要依赖人工恢复,部署规模扩大后,运维压力也会相应增加。
。Light REACT就是从这个问题出发。它的全称是REsilient humAnoid ConTrol(韧性人形机器人控制),目标不是让机器人永远保持一种标准步态,而是在身体条件发生变化之后,尽可能利用剩余的全身能力继续移动。
正常走可以,跛行可以,单腿跳可以;如果双腿已经无法维持直立运动,就让手臂参与支撑,切换到爬行。目标始终是同一个:在当前身体条件允许的范围内,继续完成运动。
今年8月,Skild AI发布S1。模型观看一次新任务的视频示范后,不修改模型权重,也不针对该任务重新进行后训练,就可以尝试直接执行。
在其公开的未见长程任务实验中,同样使用10万小时预训练数据时,视频上下文版本成功率达到66%,语言提示基线%。Skild AI将传统机器人面对新任务时仍需要“收集数据—微调模型”的方式,类比为机器人仍处在“BERT时代”。
Generalist AI随后发布的GEN-1.5同样展示了一次示范下的任务适应能力。模型通过3—12秒的单次示范,在不进行梯度更新的情况下,在10类短程任务中取得59%的平均成功率;使用每项任务约5分钟数据进行10步梯度更新后,平均成功率进一步提升至83%。Generalist AI将这种能力归因于大规模物理经验预训练之后形成的单次示范学习和少样本适应能力。
另一条线上,RoboTTT把机器人可以利用的历史信息进一步扩展到8K个时间步。同一模型使用8K上下文训练,相比1K版本闭环表现提升62%,论文由此将上下文长度(Context Length)提出为机器人基础模型一个新的Scaling维度。
这些工作的架构、数据和任务并不相同,也没有必要把它们归为同一条技术路线。
但它们都在触及一个共同问题:当机器人面对变化时,能否更多依靠模型已有能力和上下文完成适应,而不是每次都重新依赖人工采集数据、微调模型或编写规则。
Light REACT把这个问题进一步推进到了机器人自身的身体状态。S1和GEN-1.5使用的上下文,核心信息来自外部提供的任务示范,模型需要理解的是“这一次要做什么”;Light REACT使用的上下文,则来自机器人近期自身的交互历史,它试图判断的是“我现在的身体处于什么状态,接下来还能怎么动”。
严格来说,它们处理的并不是同一种上下文学习。S1和GEN-1.5更接近从上下文中获得新的任务条件;Light REACT则是在训练所覆盖的损伤分布内,通过时序交互信息推断当前身体与动力学条件。它们共享的是利用上下文减少显式人工适配的思路,而不是同一种能力。
但真实部署的问题在于,机器人不一定提前知道自己哪里出了问题。Light REACT因此将
作为核心机制。训练阶段,系统针对不同损伤状态建立多个教师策略,覆盖执行器失效、关节锁定和膝部折叠约束三类损伤。随后,通过多教师蒸馏,将不同教师策略的能力整合到一个可部署的学生策略中。
但到了部署阶段,一个关键的信息被拿掉了:模型不会获得故障标签。它只能看到自己的本体感知、动作指令以及过去一段时间内身体如何响应。这意味着机器人必须通过自己的交互历史判断身体状态发生了什么变化。
亮源新创比较了多层感知机(MLP)、循环神经网络(RNN)和Transformer三种策略结构。结果显示,使用64帧因果上下文窗口的Transformer,能够更充分地覆盖教师策略的行为能力。
模型已经会走、会跛行、会跳、会爬,但不一定知道什么时候应该调用哪一种能力。例如,机器人明明还能站立,却可能直接趴下开始爬行。从任务奖励看,这也许能够完成移动,但从真实部署看并不合理。
,对不同能力的调用方式进行进一步对齐。模型最终形成一个清晰的行为偏好:身体条件允许时优先保持直立运动,只有当直立运动无法继续时,再切换到爬行等替代方式。
经过这一阶段,公开实验中的直立行为比例从约42%提高到约76%,爬行行为从约45%下降至约16%。
这一步很像大模型对齐(Alignment)真正解决的问题。预训练决定模型“会什么”,对齐决定模型“什么时候应该怎么做”。
到了Physical AI,这种对齐进一步从语言偏好扩展到了空间、动作和身体状态。
LightParkour解决的是技能如何实现Scaling。一段人类动作不再对应一条固定机器人轨迹,而是通过强化学习和课程学习扩展为能够适应不同环境条件的技能分布,再通过多专家蒸馏进入一个统一策略。
LightNav-0解决的是经验和泛化如何实现Scaling。2,000+个线+小时视觉、语言和动作经验,模型进一步通过具身推理(ER)中期训练、具身监督微调(SFT)和在线强化学习(RL)获得跨场景、跨任务、跨本体的零样本导航能力。
Light REACT解决的是部署阶段的韧性问题。机器人不再假设自身始终处于训练时的正常状态,而是根据历史交互推断当前动力学条件,在扰动和硬件损伤后调整行为,为降低任务中断和人工介入提供技术基础。
;其中LightParkour和Light REACT还通过蒸馏将多项能力整合进统一策略。三段范式,开始从技术判断变成研发体系
规模化预训练解决的是基础能力如何建立。机器人不可能只依赖昂贵的真机遥操作数据,还需要进一步利用互联网视频、多模态数据以及更大规模的物理世界信息,通过规模化数据训练建立基础能力,为后续的能力对齐和真实部署提供基础。
规模化对齐解决的是如何在预训练基础上,通过强化学习等方式进一步提升模型能力。LightParkour从全身智能出发,将有限的人类动作示例扩展为可泛化的复杂全身运动能力;LightNav-0则通过具身推理(ER)中期训练、具身监督微调(SFT)和在线强化学习(RL),进一步提升模型在不同场景、任务和机器人本体上的导航泛化能力。
与通用导航两个方向,探索如何将基础模型能力进一步转化为物理世界中的行动能力。规模化部署解决的是模型进入真实机器人和真实环境后,如何持续、可靠地运行。Light REACT从控制层验证了其中一个关键问题:面对外力扰动、硬件状态变化以及训练阶段未穷举的情况,机器人能否利用近期交互历史推断当前身体与环境状态,并据此调整全身行为,为降低真实部署中的任务中断和人工介入提供技术基础。
而三段范式真正形成闭环的关键,在于真实世界数据能够持续回流到模型训练体系。模型通过规模化预训练建立基础能力,在规模化对齐阶段进一步提升面向物理世界的能力,随后进入真实环境部署。
部署过程中产生的成功、失败、异常状态、环境变化以及机器人交互数据,又可以成为后续预训练和对齐的数据来源,推动模型持续迭代。
随着部署范围扩大,模型能够接触到更多样化的环境、任务和交互状态;真实世界经验的持续积累,可以进一步拓展训练数据所覆盖的状态分布,为下一轮模型训练和能力提升提供新的数据基础。
随着模型能力提升,其能力又有机会进一步扩展到更多机器人本体、更多任务和更多真实环境。
由此,预训练、对齐和部署不再是彼此割裂的阶段,而是逐步形成一个由真实世界数据持续驱动的Physical AI学习闭环。
接下来更难的问题,是这些能力能不能被统一起来,并随着数据、训练和真实部署不断增长。
这也是为什么,只看一个机器人能不能跑酷、能不能导航,或者跌倒以后能不能爬起来,已经很难完整判断一家Physical AI公司的技术能力。真正需要观察的是这些能力背后的学习系统。
它能不能把一个样本扩展成一类技能,能不能把多个专家压缩成一个统一模型,能不能跨环境和跨本体泛化,能不能从自己的行为结果中继续学习,能不能在身体状态发生变化之后仍然完成任务,以及最终能不能把真实部署产生的经验重新送回训练体系。
从LightParkour到LightNav-0,再到Light REACT,亮源新创过去一个多月公开的三项技术成果,实际上沿着这条路线逐层展开。一个从全身运动开始,一个把能力扩展到通用空间智能,一个继续向真实世界中的韧性部署推进。
它们还不是Physical AI的终点,但已经让亮源新创的技术路线变得更加完整:不是围绕一个机器人产品不断增加功能,而是围绕具身智能基础模型建立从数据、训练、对齐到真实部署的完整能力栈。这也是三段范式真正想解决的问题。
而Physical AI的下一轮竞争,需要回答一个更难的问题:当模型真正拥有身体、进入现实世界之后,这套Scaling还能不能继续成立。