凯时AG

用天下模子给VLA当教练,,, ,原力灵机宣布DW0.5,,, ,把RL搬进虚拟天下

作者:刘建宇
宣布时间:2026-07-21 04:49:38
阅读量:6214

用天下模子给VLA当教练,,, ,原力灵机宣布DW0.5,,, ,把RL搬进虚拟天下

衡宇 发自 凹非寺量子位 | 公众号 QbitAI

代码Agent这两年为何前进飞快,,, ,成为AI界的宗门巨匠兄 ? ?

由于这玩意儿自己个儿就超!闭!环!的!

代码Agent可以自动执行、自动验证、自动反馈。。。写了代码跑一下就知道对差池,,, ,奖励信号很是清晰明确。。。

这给后训练(Post-training)阶段的自反馈闭环提供了完善条件。。。

同样是AI界大热门,,, ,具身智能现在就缺少这种“神助”。。。

它面临的物理天下比代码Agent面临的天下重大多了,,, ,并且很难获得马上验证。。。

它吸收的信号不像代码那样有一个编译器就能判断,,, ,它们模糊、腾贵,,, ,并且每一次真机试错都意味着真金白银的人力和硬件消耗。。。

VLA(视觉-语言-行动模子)是具身智能中最早受到关注的手艺蹊径。。。

但很快,,, ,各人发明这个手艺保存物理明确缺失、泛化能力极弱、长时序与妄想能力缺乏等等问题,,, ,做不到“一家独大”包打天下。。。

各人有点着急。。。厥后,,, ,天下模子又成了行业里的新骄子。。。

但天下模子似乎也不是灵丹妙药(至少现在来看是这样的)……

这也不可那也不可,,, ,具身智能,,, ,你究竟要怎样。。 ? ? ? ?

这个时间,,, ,原力灵机相关认真人站出来亮相:

我以为特殊愚蠢的一件事情是在「手艺蹊径」上给自己贴标签。。。这件事情是特殊蠢的。。。应该以目的导向。。。你要解决什么问题,,, ,挑选对应的要领去解决它,,, ,而不是说我是什么要领的、什么门户的,,, ,为此来证实只有我才是标新立异的。。。

他先容,,, ,约莫今年过年前,,, ,原力灵机意识到可将天下模子作为后训练的一部分。。。

一晃眼半年已往了。。。这个月,,, ,原力灵机宣布了旗下首款具身天下模子DW0.5,,, ,并将它接入天下模子驱动的具身智能后训练框架DFOL2.0。。。

“这套基模支持多模态输入,,, ,包括使命指令、图片和视频,,, ,还能选定机械人类型。。。我们可以依附历史行动,,, ,展望后续视频状态。。。”原力灵机联合首创人汪天才说。。。

他先容道,,, ,DW0.5用上万小时真机、多视角数据完成联合预训练,,, ,仿真能力很强,,, ,能天生种种画面。。。

不但能做出机械臂正常作业的视频,,, ,就算参考过失行动,,, ,也能还原使命失败的场景,,, ,以此支持DFOL2.0框架的在线强化学习训练。。。

DW0.5作为一个高保真仿真器,,, ,把强化学习搬进虚拟天下。。。

VLA先给出候选行动,,, ,DW0.5在虚拟情形中预演未来,,, ,判断乐成、失败与偏离风险,,, ,再把可用反馈送回强化学习。。。

按其披露的数据,,, ,这套流程可让后训练中真机数据需求骤降60%,,, ,整体训练本钱下降40%。。。

具身智能行业急需低本钱反馈闭环

想相识DW0.5,,, ,咱们先来看清它解决了什么样的行业问题。。。

具身智能属于物理AI,,, ,它的目的是让机械人在差别情形、差别物体和差别失败条件下一连变强。。。

惋惜后训练飞轮一直跑不起来。。。

真机一次rollout需要占用机械人、园地和人工,,, ,一次行动失败可能直接让使命中止;;;; ;;人工反馈虽然更靠近真实判断,,, ,但难以高频笼罩每其中心状态;;;; ;;仿真情形本钱确实低许多,,, ,但现实中的接触、遮挡、反光、形变和不确定性又很难被完整复刻。。。

基于这个现实,,, ,原力灵机从手艺侧提出了判断:VLA需要一个介于真机、人工反馈和古板仿真之间的训练情形。。。最好它足够自制、能支持高频探索,,, ,还更靠近真实操作历程。。。

然后新的步伐就被脑暴出来了。。。

用真实Rollout数据校准天下模子,,, ,天下模子支持低本钱大规模的情形与数据生产,,, ,新的policy再回到真真相形验证和网络数据。。。

DW0.5就肩负了原力灵机VLA模子(DM0.5)后训练中的Learned Environment的角色。。。

DW0.5三大专家 ? ?橹毓狗抡媛呒,,, ,全方位提升泛化能力

DW0.5能展望行动执行后的未来状态,,, ,甚至天生失败轨迹,,, ,并对使命进度打分。。。

详细而言,,, ,DW0.5以Video Expert、Action Expert、Value Expert三大专家 ? ?樽槌赡芰α绰。。。Video Expert与Action Expert配合服务行动效果预演,,, ,Value Expert认真价值评估与反馈结构。。。

这三个设计的思绪各有考究。。。

设计一:Action是强先验,,, ,而不是软提醒

在部分天下模子里,,, ,行动信息只是一个附带的条件输入。。。但DW0.5把行动当成结构性的强先验。。。

它必需知道“机械臂在往这个偏向移动”,,, ,才华展望出物理上合理的后续画面。。。

DW0.5把action看成视频天生的一等条件,,, ,通过结构化的帧级对齐强制绑定。。。

在MoT(Mixture of Tokens)注重力中,,, ,行动序列与视频序列拼接,,, ,并用group-diagonal attention mask切断视频帧与非对应行动之间的信息通路。。。

从结构上,,, ,执行向左推和向右推的行动,,, ,从一最先就走向完全差别的盘算路径。。。

讲原理,,, ,我们视察到近期学术界对这个手艺趋势有规模不小的探讨,,, ,即主流VLA不做视频展望,,, ,只做observation到action的映射。。。

DW0.5这类用视频展望作为辅助监视的模子,,, ,理论上能学到更强的因果动态明确。。。

设计二:能模拟失败,,, ,才配得上叫“仿真器”

只有乐成轨迹数据训练的模子容易形成过强的乐成偏置,,, ,这样的系统无法识别过失行动,,, ,更谈不上为强化学习提供处分信号。。。

同时,,, ,失败轨迹数据的价值对后训练来说挺珍贵的。。。

因此DW0.5被明确要求能够天生“做砸了”的视觉轨迹,,, ,让Value Expert可以比照乐成与失败的差别,,, ,给出有区分度的打分。。。

其数据战略围绕模拟失败设计,,, ,让模子既学习“应该怎么做”,,, ,也学习“做错了,,, ,天下会酿成什么样”。。。

团队体现,,, ,DW0.5有四类数据源:

具身果真数据与自采机械人数据(包括遮挡、接触、延迟等真机噪声)互联网视频数据(增补开放天下动态)Egocentric第一视角人类活动数据(迁徙真实物理交互效果)真机与仿真rollout数据(笼罩偏离、卡住、恢复等中心状态)设计三:Value Expert把未来酿成可训练的反馈

这是DW0.5从“视频天下模子”走向“训练情形”的要害一步。。。

Video Expert模拟行动效果,,, ,Value Expert把效果转成可优化信号,,, ,两者连系,,, ,才组成完整的RL训练闭环。。。

DW0.5引入Value Expert是为了把天生的未来转化为更麋集的价值信号。。。

详细讲,,, ,Value Expert它对目今状态、候选轨;;;; ;;蛘蝦ollout给出乐成概率或使命价值评估,,, ,将希罕的使命效果信号转化为可以在每一步使用的中心反馈。。。

在闭环系统中,,, ,Value Expert可以用于:

候选行动筛。。。憾远喔鰎ollout打分,,, ,让VLA选择更可能乐成的未来。。。RL后训练的reward信号:在天下模子情形中对VLA做战略优化,,, ,无需频仍占用真机。。。安排时的在线监测:发明目今状态偏离乐成路径,,, ,实时触发重新妄想或失败恢复。。。

数据显示,,, ,DW0.5的Value-Order Correlation抵达95%以上。。。

三个设计服务统一个闭环,,, ,让DW0.5在VLA的训练和安排中饰演离线数据增强与偏好结构、RL后训练情形、安排时妄想与清静评估三种角色。。。

依托DW0.5训练-调优-安排的全闭环赋能能力,,, ,模子在工程化泛化体现方面同样值得关注。。。

1)高阶指令与多步行动追随

模子不但能精准明确“Pick up the hammer, lift it into the air, and hold it steady(拿起铁锤、举至空中并坚持稳固)”等高难度多步长指令,,, ,还能丝滑实现跨构型的行动追随。。。

2)多维一连泛化

在面临重大长尾场景时,,, ,展现出了强盛的跨情形、跨使命、跨构型的泛化天生实力。。。

3)多视角强一致性

在模拟天生气械人前视、左腕、右腕等多相机流时,,, ,展现出完善的空间与时序一致性。。。

4)行动-视频天生高度一致性

能够直觉化地明确人类的双手操作视频,,, ,并将其丝滑且等效地天生为机械臂的操作轨迹。。。

让天下模子在具身智能工业大规模落地

说了这么多架构和原理,,, ,最终照旧要回到一个问题:

DW0.5究竟怎么用 ? ?

整体来看,,, ,DM0.5作为基础战略模子,,, ,DW0.5认真行动效果预演与价值反馈,,, ,RL将两者链接。。。

基座模子DM0.5先天生一批初始行动,,, ,推给天下模子DW0.5

—→DW0.5当仿真器,,, ,在虚拟情形里把这些行动会导向的未来“跑”出来,,, ,批量天生乐成和失败的轨迹

—→再由一个强化学习教练员CFG-RL,,, ,给每条轨迹的使命进度打分(乐成的价值一起走高,,, ,失败的价值断崖下跌)

—→打分和奖励实时回传,,, ,更新模子权重,,, ,喂出一个更强的DM0.5

这个循环里大部分数据由DW0.5在线天生,,, ,不必所有靠真机翻来覆去高成外地去试。。。

噫吁嚱!

具身智能的天下里,,, ,天下模子终于有了一个明确的、能规;;;; ;;τ迷诨等税才爬汤锏母谖唬

纸上谈兵终觉浅。。 ? ?梢钥吹,,, ,在打气球、晾衣服、叠纸盒等高难度重大使命中,,, ,接入DFOL 2.0的模子相比纯粹SFT(监视微调)基线,,, ,要害方法乐成率蓦地提升。。。

打气球使命:“给气球打气”这一步乐成率从10%升至90%;;;; ;;“气筒插入气球”乐成率从10%跃升至100%。。。晾衣服使命:“乐成挂上衣架”这一长时序操作的SFT乐成率仅50%,,, ,DFOL2.0加持下翻倍至100%;;;; ;;“衣架塞入衣服”的乐成率也从60%提升到了90%。。。叠纸盒使命:“叠右侧纸盒”和“叠左侧纸盒”两浩劫点方法,,, ,乐成率划分从35%拉升到了55%和50%。。。

评测集这边,,, ,DW0.5还在EWMBench、WorldArena等基准测试中横扫榜单,,, ,划分以4.73、73.54的分数,,, ,斩获全球SOTA(数据阻止7月9日)。。。

真实安排希望方面,,, ,原力灵机体现DW0.5已在内部跑通具死后训练闭环流程DFOL 2.0,,, ,最先肩负数据天生、价值评估和战略迭代事情。。。

同时,,, ,这套手艺能力已接入原力灵机推出的DexDev MaaS(Model As a Service)平台。。。

关于特定具身场景中零样本泛化能力缺乏的模子,,, ,可通事后训练补足能力,,, ,并接回平台服务。。。

值得强调的是,,, ,原力灵机再三对量子位强调并肯定了真实数据无可替换的价值。。。

“我们只是用天下模子降低本钱,,, ,真机数据照旧很主要的。。。在手艺演进上,,, ,天下模子现在仍需真机校准。。。”原力灵机联合首创人汪天才说。。。

我们问原力灵机,,, ,关于天下模子在具身智能领域的运用,,, ,尚有哪些其他想法 ? ?

获得的谜底是这样的——

随着视觉模子能力的一直提升,,, ,现场职员可以借助Ego相机收罗操作数据,,, ,镌汰对专业真机收罗和重大后训练团队的依赖,,, ,降低现场后训练的门槛。。。

那么,,, ,就让时间来磨练这个谜底吧~

GitHubhttps://github.com/dexmal/opendwHugging Facehttps://huggingface.co/Dexmal/DW05-Base

 

文章点评

未盘问到任何数据!

揭晓谈论

◎接待加入讨论,,, ,请在这里揭晓您的看法、交流您的看法。。。

最新文章

热门文章

随机推荐

【网站地图】