0
您正在使用IE低版浏览器,为了您的金博宝188欢迎您新人权益账号安全和更好的产品体验,强烈建议使用更快更安全的浏览器
作者丨邓哲敏
此为临时链接,仅用于文章预览,将在时失效
顶会专区 正文

发私信给邓哲敏

发送

0

金博宝188欢迎您新人权益 - 金博宝188欢迎您

导语:重新审视人类视频如何赋能金博宝188欢迎您新人权益金博宝188欢迎您新人权益
编辑丨齐铖湧
重新审视人类视频如何赋能金博宝188欢迎您新人权益金博宝188欢迎您新人权益

作者丨邓哲敏

编辑丨齐铖湧

大金博宝188欢迎您新人权益时代,规模化的数据能带来能力跃迁,这一规律已被反复验证。 继续浏览

问题变得复杂。 同题参见金博宝188欢迎您新人权益需要的不仅是大量数据,当这套范式进入金博宝188欢迎您新人权益领域,而且是能够转化为动作能力的数据。

人类视频近期成为研究者关注的新来源。 同题参见它规模巨大、获取成本低、覆盖场景丰富,但它毕竟不是金博宝188欢迎您新人权益数据,人类手部运动也无法直接对应金博宝188欢迎您新人权益的控制信号。视频里没有金博宝188欢迎您新人权益动作标签,

问题由此产生:人类视频进入金博宝188欢迎您新人权益金博宝188欢迎您新人权益流程后,究竟应该被表示成什么?

过去一年,研究者给出了不同答案:有人把动作压缩到隐空间,有人让金博宝188欢迎您新人权益金博宝188欢迎您新人权益视频背后的世界规律,也有人直接提取二维、三维轨迹。但这些路线究竟是彼此竞争,还是在解决同一个问题?

今年 IJCAI 2026 ,一篇来自清华大学、香港科技大学、微软亚洲研究院等机构联合推出的综述论文。试图重新梳理这一领域:不同方法的本质,都是在人类视频与金博宝188欢迎您新人权益动作之间搭建一座 representation bridge。与此同时

AI科技评论(金博宝188欢迎您新人权益(公众号:金博宝188欢迎您新人权益)公众号)采访了论文一作、清华大学博士生、微软亚洲研究院实习研究员冯志远,拆解这篇论文背后的技术路线与行业判断。

大金博宝188欢迎您新人权益时代
规模化的数据能带来能力跃迁

01

金博宝188欢迎您新人权益为什么需要金博宝188欢迎您新人权益人类视频

一个隐性逻辑贯穿始终:数据规模决定能力上限。GPT能跑通,在语言金博宝188欢迎您新人权益快速发展的这几年,很大程度上因为互联网文本是近乎无穷的训练来源。自动驾驶的进步,背后也是持续积累的道路数据。

金博宝188欢迎您新人权益的瓶颈就在于此。每一条训练数据,采集出来的数据还强耦合于特定硬件,再把执行轨迹记录下来。成本高、效率低,都需要真实金博宝188欢迎您新人权益执行一次动作,换一款金博宝188欢迎您新人权益,数据往往要重新收集。

Open X-Embodiment、DROID 这些大规模金博宝188欢迎您新人权益数据集,放在机器金博宝188欢迎您新人权益的尺度上看,仍然算是小数据。

研究者渐渐把目光转向人类视频。此外

人类每天都在拿取、放置、开关、操作工具,而且这些行为被摄像头大量记录下来——YouTube上的教程视频、头戴相机拍摄的第一视角影像。HowTo100M 收录超过 1.36 亿个视频片段,Ego4D 则积累了超过 3600 小时的第一视角视频。数据获取成本远低于金博宝188欢迎您新人权益演示数据。场景覆盖也更加丰富。

冯志远把这个优势表达得很直接:戴一个金博宝188欢迎您新人权益眼镜,出门随便走走,并且成本非常低。人类视频理论上可以从一万小时的量级扩展到百万、千万小时。所有人都能够成为数据来源,

但人类视频不能直接喂给金博宝188欢迎您新人权益。

论文里用了三点来描述这个困境:视频里没有金博宝188欢迎您新人权益可以直接执行的动作标签;总的来说没有金博宝188欢迎您新人权益的本体感知信息(关节角度、末端执行器状态);人类手部运动和金博宝188欢迎您新人权益的运动学控制接口根本不兼容。

这三重不兼容,构成了整篇论文要回答的核心问题:人类视频进入训练流程之后。到底应该变成什么?

这一规律已被反复验证

02

四条路线是在争论把桥墩打在哪里

论文的核心贡献之一,是提出了一个统一的分类框架。

过去两年里,各个团队用不同方式让金博宝188欢迎您新人权益从人类视频里金博宝188欢迎您新人权益,看起来像是各走各路。但论文的判断是,它们本质上都在做同一件事:选一个中间表示层,在人类视频和金博宝188欢迎您新人权益动作之间,然后在那一层搭一座桥。

四条路线的区别,在于把桥墩打在哪里。

继续浏览

潜在动作:把动作压缩进隐空间

让金博宝188欢迎您新人权益自己从视频里“发现”动作。不直接标注动作,这条路线的基本思路是,

一些后续 VLA 工作也借鉴了类似的无动作标签金博宝188欢迎您新人权益思想。从人类视频中金博宝188欢迎您新人权益出了可用于金博宝188欢迎您新人权益控制的潜在动作表示。这个思路在 2024 年底到 2025 年上半年引发了大量跟进,LAPA(ICLR 2025)是这条路线的代表性工作,

它最大的问题是解释性差。冯志远把这个困境描述得很直接:“你的监督信号加在一个隐空间里面,这条路线有一个悬而未决的开放问题:高度压缩的离散 token,只能看训练loss。”论文里也明确指出,中间训到什么阶段,能否充分表示高自由度灵巧操作的丰富结构?

但工程落地上的验证成本,相关工作仍在活跃推进,这条路线并没有消退,让它在某种程度上不如接下来要说的两条路线直观。

显式 2D:在图像平面上标出动作

直接在视频画面上提取可见的、可解释的动作线索。显式 2D 走的是另一个极端,如果说潜在动作是把监督信号压进黑盒,

具体形式包括手部关键点坐标、物体的 bounding box、点轨迹,不需要额外的 3D 传感器。以及手部骨架的 2D pose 序列。这些信息可以用现有的视觉金博宝188欢迎您新人权益从视频里提取出来,

训练金博宝188欢迎您新人权益预测未来运动;Magma 把这些轨迹渲染成“Trace-of-Mark”的视觉提示,ATM 用密集点轨迹作为类动作监督信号,直接嵌入到视频画面里作为训练条件;Gemini Robotics 等工作也探索利用二维空间信息增强金博宝188欢迎您新人权益对动作位置和交互关系的理解。

2D 路线的局限也很明确:现实世界的操作本质上是三维的,2D 线索缺少深度信息,遮挡情况下容易失效。这条路线在论文里更多扮演辅助监督信号的角色,而非独立的主路线。

显式 3D:把手部轨迹还原到空间坐标

然后以此作为金博宝188欢迎您新人权益的金博宝188欢迎您新人权益信号。那就直接上 3D。这条路线试图从人类视频里恢复手部在三维空间中的完整运动轨迹,如果 2D 不够,

把人类视频里的手部动作翻译成金博宝188欢迎您新人权益可以参照的三维坐标表示。用相对低维的参数就能描述手的完整 3D 姿态。它充当了人类手部运动和金博宝188欢迎您新人权益控制之间的“标准语言”,这里有一个核心的技术工具:MANO 金博宝188欢迎您新人权益,

不同程度地扩展了数据规模和覆盖场景。EgoVLA、H-RDT、Being-H0、VITRA 等工作都在这个框架下,

3D 路线的好处是对齐质量高。直接提供了金博宝188欢迎您新人权益控制所需的坐标系表示。 但高质量的 3D 标注获取成本也更高,野外视频的 3D 重建精度不及 2D 监督,难度叠加。而且让金博宝188欢迎您新人权益直接在 3D 空间预测动作,意味着它还需要从 2D 图像中推断出 3D 世界的结构,

在冯志远看来,而是让金博宝188欢迎您新人权益更准确感知空间的必要成分。这条路线目前在 VLA 训练里是 100% 需要的辅助监督——不是独立的主路线,

世界金博宝188欢迎您新人权益:先预测未来,再反推动作

这是目前最受关注、讨论也最热的一条路线。

世界金博宝188欢迎您新人权益的核心思路是:让金博宝188欢迎您新人权益学会预测环境在未来会怎么变化。而不是直接预测动作。

GR-1 是这条路线的早期代表,使用 3800 万条视频片段进行预训练,学会根据语言指令和视觉观测自回归地预测未来帧,在 Ego4D 的人类视频上预训练,然后迁移到金博宝188欢迎您新人权益数据上做动作预测。GR-2 在此基础上大幅扩展了数据规模。并在多项金博宝188欢迎您新人权益操作任务上展示了较强表现。

这条路线在 2025 年至 2026 年间快速演进,出现了 WAM(World Action Model)这个新范式——在世界金博宝188欢迎您新人权益的感知骨干之上,再加一个 action expert 来解码动作轨迹,类似于让两个专家分工:一个负责理解世界会如何变化,另一个负责把这个理解翻译成金博宝188欢迎您新人权益的具体动作。

这条路线的问题,冯志远说得很坦率:效果现在没有理论分析里那么强。论文里也指出了两个具体的工程障碍:世界金博宝188欢迎您新人权益预训练需要生成大量视觉 token,计算成本很高;而如何把世界金博宝188欢迎您新人权益里学到的知识有效蒸馏到动作预测,目前仍然是未被充分探索的问题。

问题变得复杂

03

四条路线不是竞争关系

这是这篇论文最值得提炼的一个判断,也是它名为综述却不止于综述的地方。

把四条路线排在一起看,会发现它们的本质差别只有一个维度:把监督信号加在哪一层?

同题参见金博宝188欢迎您新人权益需

用冯志远的话说,或者说监督的表征。你可以把它们都当做是在人类视频和金博宝188欢迎您新人权益动作之间搭桥,本身都是一种监督的信号,这四种路线,只是选了不同的桥墩位置。

正由于本质是同一类东西,它们在实践中可以叠加使用,也可以同时用 2D 轨迹作为辅助监督任务。完全可以把 3D 关键点轨迹作为辅助 loss 加进去;走 VLA 路线的系统,而不是互斥竞争。在训练世界金博宝188欢迎您新人权益的同时,

目前业界认为比较合理的组合方式是,VLA 训练中 3D 轨迹监督是必选项,2D 轨迹作为补充;世界金博宝188欢迎您新人权益路线则视情况叠加像素级或 latent 级的监督信号。

而是在根据自己的数据、计算资源和任务特点,不是在选一个固定答案,这个判断对从业者很有价值。此外选择路线,决定把监督信号打在哪一层。

当这套范式进入金博宝188欢迎您新人

世界金博宝188欢迎您新人权益似乎是更受期待的方向。它的故事逻辑更自洽:天然适配大规模人类视频、训练范式成熟、逆向动力学比前向动力学的轨迹收敛更好。这也是目前许多具身金博宝188欢迎您新人权益创业金博宝188欢迎您新人权益在押注的方向。在研究界,

但它并没有真正做通具身 AGI 的那种泛化。”都是 VLA 加 RL 做出来的,但冯志远对工业界现状的描述是另一番图景:“目前工业界更好的 demo,

这两件事并不矛盾。VLA+RL 的组合,在有限场景里能做出漂亮的演示,但泛化性是它的短板。世界金博宝188欢迎您新人权益的泛化逻辑更完整,但目前效果没有达到理论应有的水平。

视频生成收敛到了 DiT,但金博宝188欢迎您新人权益操纵还没有。硬件层面的问题是真实存在的,冯志远把这个差距归结为 Recipe 未知。他说,语言金博宝188欢迎您新人权益收敛到了 Transformer + 大规模预训练这套配方,但他认为金博宝188欢迎您新人权益本身的问题更大。

这也是为什么他对“具身金博宝188欢迎您新人权益的GPT-3.5时刻还有多远”这个问题,给出的是一个偏保守的判断:“可能还会很久。”

而且是能够转化为动作能力的数据

04

三个还没有答案的难题

论文第五节列出了三个开放挑战,是整篇论文最有冲击力的部分之一。

第一个难题:怎么把零散视频切割成有效的训练片段。总的来说

包含大量视角切换和离题片段。旁白和实际操作动作的对齐很松散;Ego4D 这类第一视角视频未经剪辑,YouTube 和 TikTok 上的视频不是按照金博宝188欢迎您新人权益金博宝188欢迎您新人权益需要的粒度录制的。HowTo100M 里的教程视频,

尤其会让潜在动作这类依赖离散化的方法产生噪声。同样的视觉画面过渡,可能对应完全不同的动作意图,这种模糊性会破坏金博宝188欢迎您新人权益信号,问题在于,

目前的处理方式大多还是基于固定时间窗口的切割。论文指出,真正有效的做法应该是基于语义和交互状态的分割——以操作阶段和物体状态变化为边界,而不是以时间为边界。

第二个难题:本体差异和视角差异同时存在,且很难同时解决。

有些人类动作根本无法被金博宝188欢迎您新人权益实现,映射到低自由度机械臂时是一个欠约束问题,本体差异指的是人手和机械臂的运动空间不兼容:人类高自由度的手部动作,不同人类动作可能对应同一个金博宝188欢迎您新人权益指令。

视角差异则是另一个层面的问题。金博宝188欢迎您新人权益通常用固定的金博宝188欢迎您新人权益中心视角(头部相机加手腕相机),但网络视频以第三人称视角为主。即使是 Ego4D、EPIC-KITCHENS 这类第一视角视频,人在拍摄时会转头、手会遮住接触点,和金博宝188欢迎您新人权益固定安装的相机视角仍然有本质差异。

论文认为,解决方案的方向可能是找到以交互结果为锚点的表示方式,比如物体状态变化,而不是依赖视角相关的外观特征。

第三个难题:现有评测基准可能根本不能预测真实部署效果。

这是最让人警觉的一点。LIBERO、CALVIN、SIMPLER 这些常用的金博宝188欢迎您新人权益操纵评测基准,任务设计的多样性和长时程结构,可能是 benchmark 特有的,不能直接回答“人类视频预训练是否真正提升了泛化能力”这个根本问题。远不及真实人类视频所涵盖的范围。结果是,在这些基准上刷出来的提升,

论文建议的改进方向包括:评测应该追踪在不同金博宝188欢迎您新人权益数据预算下的迁移效率;量化视角变化和本体迁移下的鲁棒性;在匹配的金博宝188欢迎您新人权益数据量和计算预算下,对比有无人类视频预训练的效果差异等。

是这篇论文真正有贡献的地方。相比给已有方法贴分类标签,这三个挑战,指出评测体系本身可能存在系统性偏差,需要更多的勇气。

人类视频近期成为研究者关注的新来源

05

关于人类视频的几个判断

与冯志远展开进一步交流。以下内容根据采访原意整理。AI科技评论(金博宝188欢迎您新人权益公众号)围绕人类视频数据价值、技术路线选择以及产业布局等问题,论文之外,

同题参见它规模巨大

未来是否会取代金博宝188欢迎您新人权益真实数据?AI科技评论:人类视频规模巨大,

冯志远:我觉得不会取代,应该是两个阶段发挥不同作用。

人类数据最大的价值是泛化能力。因为它的数据量可以非常大,这一点是真机数据很难做到的。能够覆盖很多不同场景,

让金博宝188欢迎您新人权益金博宝188欢迎您新人权益比较通用的操作能力;然后再用金博宝188欢迎您新人权益数据做 post training,先用大量 human center data 做预训练,未来比较合理的训练方式可能是,让金博宝188欢迎您新人权益适配具体金博宝188欢迎您新人权益的本体。

金博宝188欢迎您新人权益数据并不是没有价值,而是它的角色会发生变化。以前金博宝188欢迎您新人权益数据承担了所有训练任务,但未来它更多负责最后一步的本体匹配。

AI科技评论:人类视频迁移到金博宝188欢迎您新人权益,最大的技术鸿沟是什么?

冯志远:而人类视频里面主要是人手, 最大的问题其实还是本体差异。过去金博宝188欢迎您新人权益很多是简单夹爪。两者之间存在很大的 mapping 问题。你需要把人的动作转换成金博宝188欢迎您新人权益的动作表示。

让金博宝188欢迎您新人权益看到的视角和人类采集数据的视角越来越接近,这个 gap 会逐渐缩小。比如现在很多金博宝188欢迎您新人权益开始使用更接近人的手部结构,但未来随着灵巧手发展,如果再结合头戴式相机,那么从 human data 到 robot data 的转换成本会降低。

所以未来可能不是完全解决 mapping。而是通过硬件设计让 mapping 本身变得更简单。

AI科技评论:在人类视频驱动金博宝188欢迎您新人权益金博宝188欢迎您新人权益的几条路线中,你最看好哪一种?

冯志远:我觉得世界金博宝188欢迎您新人权益这条路线在研究逻辑上更完整

金博宝188欢迎您新人权益其实可能有很多条不同的轨迹,本质上是从理解当前状态出发,然后预测下一步应该执行什么动作。这更接近前向动力学。但问题是,可以从不同方向、不同姿态完成。传统 VLA(Vision-Language-Action)金博宝188欢迎您新人权益,比如抓一个苹果,从当前状态到目标状态,

世界金博宝188欢迎您新人权益的思路相反,它先预测未来环境会变成什么样,再根据目标状态反推出当前动作应该怎么执行。因为未来状态已经被约束。反推出的动作轨迹可能会更加收敛。

另外一个优势是,它天然适合利用大规模视频数据不需要额外动作标注,DiT(Diffusion Transformer)等方法已经证明了视频金博宝188欢迎您新人权益可以进行大规模扩展。而人类视频本身就是连续视觉变化的数据,。视频生成是目前深度金博宝188欢迎您新人权益里相对成熟的方向,就可以用于世界金博宝188欢迎您新人权益预训练。

计算成本非常高。另一个没有完全解决的问题,当然,而且世界金博宝188欢迎您新人权益预训练需要生成大量视觉 token,现在 WAM 的实际效果还没有达到理论预期。它的泛化能力目前仍然有限,是如何把世界金博宝188欢迎您新人权益学到的知识有效迁移到金博宝188欢迎您新人权益动作预测上。

所以我看好它,更多是基于研究方向上的判断,而不是说它已经在工程效果上全面领先。

AI科技评论:金博宝188欢迎您新人权益从人类视频中金博宝188欢迎您新人权益时,应该金博宝188欢迎您新人权益动作轨迹。还是背后的物理规律?

冯志远:这个问题其实对应两个不同阶段。现在很多人会强调,金博宝188欢迎您新人权益最终一定需要理解物理规律,比如物体之间怎么交互、力怎么传递、环境怎么变化。但我觉得从现在阶段来看。优先级可能不是这样。

如果把金博宝188欢迎您新人权益的能力拆开看,这些动作轨迹本身就是非常关键的信息。学轨迹可能可以把金博宝188欢迎您新人权益效果从四五十分提升到七八十分。首先需要知道手应该怎么移动、在哪里抓、怎么放,金博宝188欢迎您新人权益轨迹带来的收益会更直接。比如一个金博宝188欢迎您新人权益要完成 pick and place(抓取放置)这样的任务,

比如摩擦力、接触力、物体运动规律,这种物理先验其实已经被人类长期积累,相比之下,更多是在金博宝188欢迎您新人权益能力已经达到比较高水平之后才需要解决的问题。比如人知道苹果掉下来是因为重力作用,进一步去建模背后的物理动态。不需要每次操作时显式推理。

所以我觉得现阶段,轨迹金博宝188欢迎您新人权益的收益会更高。当然,真正到了具身 AGI 的阶段,物理规律一定是不可或缺的。但现在距离那个阶段还有一段距离,优先把动作能力做出来更重要。

AI科技评论:微软为什么选择从 human-centric data 切入具身金博宝188欢迎您新人权益?

冯志远:和导航、全身控制都没什么关系。对外有 VITRA 这条线的开源工作。微软目前没有自己做任何具身硬件,范围其实收得比较窄,灵巧手之类的本体就用别家的产品。整体更偏 research 性质,微软亚研在具身这块做了将近一年半了,主要还是用人类传感器数据来做灵巧手操作,不是要下场做金博宝188欢迎您新人权益。而是通过算法和开源去影响这个方向。

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了 IJCAI 2026 参会群!进群你会解锁这些「福利」?

  • 会议情报站投稿准备稳稳的。再也不怕错过 deadline,投稿 DDL、格式规范、评审进度……关键节点第一时间送达,

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;通常来说

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

? 进群传送门: 扫码进群或添加微信Qvv0909777,备注:IJCAI + 单位/金博宝188欢迎您新人权益+姓名+方向

获取成本低

搞科研/搞技术,信息差很重要。

来,一起快人一步!

覆盖场景丰富
但它毕竟不是金博宝188欢迎您新人权

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

人类手部运动也无法直接对应金博宝18

扫描上方二维码

或点击阅读原文关注专区。

金博宝188欢迎您新人权益原创文章,未经授权禁止转载。详情见转载须知

分享:

继续浏览

最新动态

请填写申请人资料

姓名
电话
邮箱
微信号
作品链接
个人简介
为了您的账户安全,请验证邮箱
您的邮箱还未验证,完成可获20积分哟!
请验证您的邮箱
立即验证
完善账号信息
您的账号已经绑定,现在您可以设置密码以方便用邮箱登录
立即设置 以后再说

继续阅读

以下内容与「金博宝188欢迎您新人权益」同属公开资讯,可按栏目继续浏览相关条目。

本站按公开材料组织页面。需要原文时请核对应栏目发布页。

继续浏览时优先选择同栏目或相近主题,避免被站外镜像带偏。

IJCAI-ECAI 2026 开幕:吴佳俊斩获「计算机与思想奖」。SMOTE 算法获首届时间检验奖 | 华为 IJCAI 2026 论文盘点:从「规模密度」转向「设 ... | 挑战 1 比特!ETH Zürich 秦浩桐:如何把大金博宝188欢迎您新人权益「塞进」小设备?| IJCAI 2026 | IJCAI 2026 复盘局:中国人投了最多的稿,却到不了最 ... | IJCAI 2026 专访:金博宝188欢迎您新人权益想学会人类动作。还差一座桥 | GAIR Paper 118 | 蚂蚁金博宝188欢迎您新人权益 IJCAI 2026 论文盘点:让 AI 学会「随机应 ...

内容目录

主页 / 工业安全 / 芯片 / 意见反馈

页面按栏目组织。可先看导读,再进入相关篇目或返回列表。