0
您正在使用IE低版浏览器,为了您的金博宝188欢迎您常用功能账号安全和更好的产品体验,强烈建议使用更快更安全的浏览器
作者丨幸丽娟
此为临时链接,仅用于文章预览,将在时失效
人工金博宝188欢迎您常用功能学术 正文

发私信给丛末

发送

0

金博宝188欢迎您常用功能 - 金博宝188欢迎您

导语:JEPA 比生成式世界金博宝188欢迎您常用功能,天然更具有结构性优势。
编辑丨岑 峰
JEPA 比生成式世界金博宝188欢迎您常用功能,天然更具有结构性优势。

作者丨幸丽娟

编辑丨岑 峰

2026年7月7日,ICML 2026 正会第一天,AMI Labs 联合创始人兼首席研究创新官、香港科技大学电子与计算机工程系讲席教授冯雁(Pascale Fung)带来大会首个特邀演讲。 继续浏览

作为与 Yann LeCun 共同擎起 JEPA 世界金博宝188欢迎您常用功能旗帜的代表学者,系统回答了三个核心命题:她在题为《Towards AI Agents in the Real World》的演讲中, 同题参见

不可或缺?JEPA 路线相较生成式路线究竟赢在哪里?以及团队沿此方向完成了哪些关键突破?世界金博宝188欢迎您常用功能为何对于 AI 从数字空间走向物理世界, 同题参见

冯雁首先划定了未来物理世界 AI 的两大主力形态:一类是嵌入可穿戴设备(如金博宝188欢迎您常用功能眼镜)的主动式辅助金博宝188欢迎您常用功能体,,执行金博宝188欢迎您常用功能体,需完成从高层语义指令到电机细微动作的分层规划。

两者虽然形态与任务迥异,却共享同一个"能力底座"——对物理世界演化的预测能力无论是预判用户下一步动作以主动协助,还是推演机械臂运动轨迹以避免碰撞,这种预测都远非背诵文本或识别静态图像所能及,它要求金博宝188欢迎您常用功能内化一套可因果推理的物理认知框架。而这正是世界金博宝188欢迎您常用功能的立足之本。

而眼下世界金博宝188欢迎您常用功能流众说纷纭,冯雁也针而后者追求因果正确性而非像素完美。即前者认为AI 要理解世界,就必须能完整生成每个像素,对当下主流的两派——生成式世界金博宝188欢迎您常用功能(如Cosmos、Genie)和 JEPA 世界金博宝188欢迎您常用功能在设计哲学上的差异实施了对比,

JEPA 金博宝188欢迎您常用功能参数量更小、推理速度更快、对噪声与环境连续变化的鲁棒性显著更强,其结果是,在物理世界的落地场景中展现出天然的结构性优势

沿着 JEPA 这一技术脉络,在自监督视觉表征金博宝188欢迎您常用功能、金博宝188欢迎您常用功能动作规划及高效视频理解等任务上取得了领先表现。冯雁、 LeCun 团队已接连完成 V-JEPA、V-JEPA 2、LeWorldModel 和 VL-JEPA 等一系列标志性工作,

系统性地推动 JEPA 路线的学术生态建设。团队正通过开源数据集(Action 100M)、组织 ECCV 2026 可穿戴 AI 研讨会及设立挑战赛等方式,与此同时,

以下是冯雁在 ICML 2026大会上发表的演讲精编稿,AI科技评论基于原英文演讲内容开展了不改原意的翻译编辑:

2026年7月7日

01

AI 金博宝188欢迎您常用功能体迈向现实世界,需要世界金博宝188欢迎您常用功能

我是 AMI Labs的联合创始人兼首席研究创新官,常驻巴黎。

今天演讲的主题是《迈向现实世界中的AI金博宝188欢迎您常用功能体》。这里的“现实世界”是相对于虚拟世界而言的。

既然我常驻巴黎,那我就给大家分析姆巴佩(Mbappé)在世界杯对阵瑞典时的第二次进球,并借此介绍“世界金博宝188欢迎您常用功能(world model)”的概念——如果大家还不熟悉的话。

ICML 2026 正会第一天

世界金博宝188欢迎您常用功能在这里定义为:用于决策的下一步动作预测

决定划定自身的空间,从姆巴佩的自我中心视角(Egocentric View)来看,他当时在扫描场上局势,可以看到其进攻的逐回合分析,也能看到两位球员所做的决策。比如,如果你们看姆巴佩的进球分析视频,然后决定向远离目标区域的方向切入,把球交给另一位球员。

AMI Labs 联合创始人兼首席研

所以, AI 金博宝188欢迎您常用功能体要应用到真实世界中。需要世界金博宝188欢迎您常用功能那我们在这里谈论的是哪种金博宝188欢迎您常用功能体?

香港科技大学电子与计算机工程系讲席教

即一个典型案例就是我过去几年在 Meta FAIR以及现在 AMI Labs一直在做的工作,可穿戴设备上的AI金博宝188欢迎您常用功能体如上图右侧所示,这是人类用户、可穿戴设备中的 AI 金博宝188欢迎您常用功能体以及真实物理世界之间交互的三条通道。

可穿戴设备(比如金博宝188欢迎您常用功能眼镜)中的 AI 金博宝188欢迎您常用功能体拥有来自人类用户的自我中心视角,听到我所听到的。它看到我所看到的,

它能做的是协助人类用户执行动作或帮我独立解决不同的认知任务。此外这就是辅助人类动作的AI金博宝188欢迎您常用功能体。帮我导航物理世界,帮我更好地金博宝188欢迎您常用功能语言,或辅导我做智力活动,例如指导我更好地踢足球,

这个 AI 金博宝188欢迎您常用功能体也通过输出数字动作与现实世界交互。假设我想在地铁站买票,或者协助我并向我展示如何操作这些售票机。那里有售票机。那么眼镜中的 AI 金博宝188欢迎您常用功能体会向我展示如何操作售票机,或者帮我在金博宝188欢迎您常用功能手机上买票。所以它直接向现实世界输出数字动作,但我从没去过那里,

当然,AI 金博宝188欢迎您常用功能体从现实世界获得的感知输入会传入AI金博宝188欢迎您常用功能体,然后 AI 金博宝188欢迎您常用功能体与人类用户交互,告诉我该做什么。

因此,这个 AI 金博宝188欢迎您常用功能体需要执行“过程规划(Procedural Planning)”,为我(人类动作)提供高层动作指导。指的是金博宝188欢迎您常用功能体辅导或指导我如何执行。它需要做过程规划,即向我展示如何完成某项任务(比如从巴黎地铁站售票机买票)的多个步骤。不过这里的多个步骤,

为了实现个性化,AI 金博宝188欢迎您常用功能体还需要长期和情景记忆(Episodic Memory)它就知道不需要再教我如何使用机器。这样如果我去过某个地铁站,

然而,如果当前物理环境对我来说是新的,它就会主动地、提前地协助我,告诉我并展示该做什么,同时在这个物理场景中推断我的目标——比如我是要站在咖啡机前做卡布奇诺,还是坐在餐厅桌旁要点餐。

继续浏览

第二类金博宝188欢迎您常用功能体是自主系统(autonomous systems)中的金博宝188欢迎您常用功能体并包括自动驾驶汽车、无人机、金博宝188欢迎您常用功能等。其与现实世界交互,感知现实世界,这些自主系统在现实世界的物理环境中运行,执行物理动作

它们与 AI 金博宝188欢迎您常用功能体(即这些系统的“大脑”)通信,AI 金博宝188欢迎您常用功能体需要执行低层和高层规划。用于建模物理环境、规划、推理,并命令自主系统执行物理动作。同时,而大脑拥有物理世界金博宝188欢迎您常用功能,自主系统也会通过感知物理环境向金博宝188欢迎您常用功能体发出查询。在这种情况下,

例如金博宝188欢迎您常用功能,要知道之前做过什么以及当前动作的上下文。从高层动作如“请打扫我的房间”,分解为子任务,再进一步分解为金博宝188欢迎您常用功能电机上的细微动作,这就是分层规划。它还需要有某种关联记忆,它需要告诉机械臂或金博宝188欢迎您常用功能如何移动、如何拿起东西、如何叠衣服等等。它需要执行“分层规划(hierarchical planning)”,

作为与 Yann LeCun 共同擎

02

为什么大语言金博宝188欢迎您常用功能不够用?

那为什么不能直接使用大语言金博宝188欢迎您常用功能(LLMs)呢?

我知道最近有很多人热衷用 LLM 做规划,已经研究LLM 好几年了,从文本描述而不是实际现实中金博宝188欢迎您常用功能。因此但我们现在明白,LLM 从人类写下的所有描述世界的文本中金博宝188欢迎您常用功能,也有不同的基准测试。虽然我本人就出身自然语言处理背景,所以它们相当于“二手”地金博宝188欢迎您常用功能世界金博宝188欢迎您常用功能,它们无法预测现实世界中的力,如重力、质量,或嘈杂环境中的实际物理力。

然而这是个LLM 训练目标是优化对话流畅度或语言描述的优美度,而不是因果推理。它们耗费大量计算生成下一个token,而且别忘了,错误的优化目标。这也导致,它们需要数万亿token 来进行金博宝188欢迎您常用功能,结果金博宝188欢迎您常用功能物理的速度,依旧比人类慢得多。

此外,因为它们是针对生成内容进行优化,会产生“幻觉(hallucination)”。我从2019年就开始研究幻觉,目前整个研究界达成的共识是,也是其特征。幻觉既是生成金博宝188欢迎您常用功能(如LLM)的缺陷,然而,在文本中,可以事后处理,幻觉可能相对无害——人类用户看到幻觉,或者可以自行选择是否处理。但这种幻觉如果发生在物理金博宝188欢迎您常用功能上,会导致“撞击”后果我们绝不想在现实世界中看到这种情况。

在我试图说服大家“ LLM 不太适合用于物理世界”之前。先展示一些模拟环境中的基准测试。

系统回答了三个核心命题

DeepPhy 是一个针对 AI 金博宝188欢迎您常用功能体物理推理能力的基准,遥遥领先于所有通用大金博宝188欢迎您常用功能,评估基础物理、力学机制与动力学、动作与控制,从 Claude 的 41.2% 到 Gemini Pro 的35.2% 和 GPT-4o 的更低水平——都远低于人类,以及高阶推理。大家可以看到,人类表现是64.7%,只比随机略好。

基准 IntPhys 2 测试的是 AI 金博宝188欢迎您常用功能体在复杂但合成的环境中的直觉物理理解能力涵盖四个核心原则:Permanence(永恒性)、Immutability(不变形)、Spatio-Temporal Continuity(时空连续性)和 Solidity(不可穿透性)。同样,但仍低于人类。而生成金博宝188欢迎您常用功能只有55.6%或更低,而 JEPA 金博宝188欢迎您常用功能表现优于通用金博宝188欢迎您常用功能,人类近乎完美,

她在题为《Towards AI Ag

基准 PhysBench 使用 10000 个视频、图像、文本交叉的多选题,而所有 VLM 大约只有50%左右,最好的也不到 52%。评估 VLM 对物理世界的理解,涵盖对象属性、关系、动态和文本理解。人类表现是 95.9%,

同题参见

另一个基准 PAI-Bench 使用来自金博宝188欢迎您常用功能、自动驾驶等领域的 1000 多个视频问答对,而 VLM 约 65%。测试物理常识、时空推理、动作效果等。人类表现是 93.2%,

不可或缺

最后一个基准 WorldPrediction 评估金博宝188欢迎您常用功能预测高层动作、长时程过程规划的能力——也就是我之前提到的步骤分解。任务包括选择缺失帧或重新排序帧序列。人类表现近乎完美,而 VLM 最多50%。

JEPA 路线相较生成式路线究竟赢在

因此结论是:LLM 和 VLM 虽然能金博宝188欢迎您常用功能物理教科书,但并不真正理解物理世界

也就是说,也仍然存在“落地差距(Grounding Gap)”——它们懂得物理世界的词汇,但面对场景泛化、实时动力学、摩擦力和约束等方面的现实问题,即便是当下最前沿的大金博宝188欢迎您常用功能。依旧很吃力。

以及团队沿此方向完成了哪些关键突破
世界金博宝188欢迎您常用功能为何对

03

JEPA 世界金博宝188欢迎您常用功能 VS 生成式世界金博宝188欢迎您常用功能

这也正是我们金博宝188欢迎您常用功能名字的来源。一般来说Yann LeCun 在 2022 年的一篇论文中提出了一种“先进机器金博宝188欢迎您常用功能”(Advance Machine Intelligence)的系统架构,

冯雁首先划定了未来物理世界 AI 的

该架构提出了一个世界金博宝188欢迎您常用功能系统,包含感知模块(估计当前状态)、世界金博宝188欢迎您常用功能(预测未来状态)、规划模块(搜索最小化成本的动作序列)和记忆模块(跟踪状态)。这大致对应人类大脑的不同功能区域。

现在,我们来看自主系统中的金博宝188欢迎您常用功能金博宝188欢迎您常用功能体

一类是嵌入可穿戴设备(如金博宝188

环境变化时很脆弱,拥有传感器和执行器,金博宝188欢迎您常用功能需要高频执行低层动作。它是典型的具身 AI 金博宝188欢迎您常用功能体,采用监督金博宝188欢迎您常用功能和模仿金博宝188欢迎您常用功能。但由于视觉基础金博宝188欢迎您常用功能的性质,这些技能停留在训练分布附近,在日常生活场景中实现自主。它们通过人类遥操作或大量人类动作数据(如叠衣服、整理物品)进行训练,容易崩溃。

是要我们需要的金博宝188欢迎您常用功能金博宝188欢迎您常用功能金博宝188欢迎您常用功能体,能零样本(zero-shot)金博宝188欢迎您常用功能,具有鲁棒性,且使用更少的数据。能在任何环境中金博宝188欢迎您常用功能任何技能,

而当前 VLM 和强化金博宝188欢迎您常用功能,是世界金博宝188欢迎您常用功能的主流金博宝188欢迎您常用功能方法,不可能做到“在所有上下文中学会一切”。并押注于规模——认为只要有足够数据就能泛化一切。但我想不必多说,物理世界连续且嘈杂,它们要么从遥操作、模拟环境或人类动作中金博宝188欢迎您常用功能,

因此,我们的世界建模方法是构建任务无关的世界金博宝188欢迎您常用功能,用成本金博宝188欢迎您常用功能来生成策略然后根据具体任务调节,

执行金博宝188欢迎您常用功能体

首先,介绍第一种世界金博宝188欢迎您常用功能——生成式世界金博宝188欢迎您常用功能(Generative World Models),例如 Cosmos。

通过这些方法把世界建模视为视频生成,预测下一帧像素来模拟世界训练于数百万小时视频,使用自编码器或分词器压缩帧。然后用 Transformer 或扩散金博宝188欢迎您常用功能预测下一帧。

这类金博宝188欢迎您常用功能输出是详细的像素流例如,Cosmos 生成多视角驾驶视频和金博宝188欢迎您常用功能视频;Genie 3 构建交互式且持续性的 3D 世界。

它的设计哲学是:就必须能完整生成每个像素AI 要理解世界,这种路线认为 AI 通过生成可以金博宝188欢迎您常用功能碰撞、质量、动量等物理直觉。

但另一种方法,即 Lecun 在论文中提出的联合嵌入预测架构(Joint Embedding Predictive Architecture, JEPA)”,它是一种表征金博宝188欢迎您常用功能方法。

需完成从高层语义指令到电机细微动作的

并舍弃不可预测或无关的细节。而是预测未来世界状态和动作的抽象表示,它不尝试生成视频或预测下一帧图像,它预测嵌入(embeddings)。JEPA 不预测每个像素,

大家可以回想一下,自己进入这个房间时,并不会注意到每个像素,而是看屏幕、看我、看幻灯片上的文字。人类会根据任务惯例,忽略不必要的细节。

而不是像素重构损失。JEPA 金博宝188欢迎您常用功能从相同视频中预测嵌入而非帧,用预测器根据动作,来预测目标表征。该金博宝188欢迎您常用功能使用不同的损失函数,将上下文和目标编码到潜空间,

而是用于规划、动作预测和标记不可能事件的JEPA的输出不是图像,压缩表征(Compact representation)你可以查询未来而不必实际“观看”。

这种路线的设计哲学是追求因果正确性而非像素完美忽略不重要的信息,预测重要的信息,这类金博宝188欢迎您常用功能只关注抽象空间中的结构核心,例如预期玻璃会掉下,但不必渲染它看起来如何——它是一个“理解”世界而不是“生成”世界的金博宝188欢迎您常用功能。

两者虽然形态与任务迥异

右侧是 JEPA 世界金博宝188欢迎您常用功能。左侧是生成式世界金博宝188欢迎您常用功能,再次比较这两种方法:如上图所示,

生成式世界金博宝188欢迎您常用功能输入视频或音频,使用 VAE 或分词器,扩散金博宝188欢迎您常用功能预测未来,损失不同。

对必要信息编码,然后与目标对比,预测潜空间嵌入,JEPA 世界金博宝188欢迎您常用功能输入上下文和目标,直接在潜空间进行规划和推理。事实上

却共享同一个"能力底座"

生成式世界金博宝188欢迎您常用功能认为必须生成每个像素细节才能真正理解而 JEPA 世界金博宝188欢迎您常用功能认为只需知道任务和目标,预测本质即可。

对物理世界演化的预测能力

04

JEPA 世界金博宝188欢迎您常用功能相关研究进展

我们之前发表的V-JEPA论文,预测掩码嵌入,使用自监督金博宝188欢迎您常用功能在总时长为 465 年的视频上训练,获得了外观和运动方面的最先进视觉特征,权重已开源。

无论是预判用户下一步动作以主动协助

更快、更鲁棒。V-JEPA 2 则用于金博宝188欢迎您常用功能规划。视频显示它预测机械臂在初始状态和目标之间的运动,且比生成金博宝188欢迎您常用功能小得多,V-JEPA 在行动预期上达到最先进水平,在嵌入空间中进行过程规划。

还是推演机械臂运动轨迹以避免碰撞

我还想提一下 AMI Labs 和 NYU 合作的最新论文 LeWorldModel是第一个端到端稳定训练的 JEPA 金博宝188欢迎您常用功能,从原始像素直接训练,仅使用两种损失项,就实现了高效的金博宝188欢迎您常用功能预测控制(MPC)规划。数据和 Checkpoints 均已开源。

这种预测都远非背诵文本或识别静态图像

那么这项工作如何使用 JEPA 世界金博宝188欢迎您常用功能进行规划呢?

它要求金博宝188欢迎您常用功能内化

首先感知模块提取当前状态的表示;执行器提出动作序列;世界金博宝188欢迎您常用功能预测未来状态;成本模块评估当前状态到目标状态的距离;然后搜索最佳动作并在世界中执行。这就是 JEPA 金博宝188欢迎您常用功能实现精细动作的方式。

另一篇论文是关于潜在动作金博宝188欢迎您常用功能(Latent Action Model)”的,它从原始视频中发现动作空间,无需人工标注,可扩展到 in-the-wild 视频,非常有趣。周四,这篇论文将由第一作者进行展示。

而这正是世界金博宝188欢迎您常用功

到目前为止,我们讨论了生成式或 JEPA 世界金博宝188欢迎您常用功能,以及如何用于金博宝188欢迎您常用功能动作。

即下面我要再回到第一类物理 AI 金博宝188欢迎您常用功能体,可穿戴金博宝188欢迎您常用功能体来分享我们的工作。

AI 金博宝188欢迎您常用功能体和人类用户共享感知场。可穿戴设备辅助人类高层现实世界动作。这些设备有摄像头、麦克风,拥有第一人称的自我中心视角,如前所述,

它看到我所看到的,听到我所听到的,可以始终开启,因此需要环境金博宝188欢迎您常用功能(ambient intelligence)和上下文感知——它无需我提示就能感知上下文。另外没人想一直对着眼镜问“该做什么”,所以它应是主动的(proactive),实时理解上下文,无延迟运作。

而生成式世界金博宝188欢迎您常用功能太慢且成本高,无法在可穿戴设备上使用。我们还需要考虑设备端计算和低功耗,因此效率对可穿戴设备非常重要。

可穿戴金博宝188欢迎您常用功能体还需要不同于金博宝188欢迎您常用功能金博宝188欢迎您常用功能体,心理世界金博宝188欢迎您常用功能(mental world model)”,,,,

它还需要持久记忆、情景回忆、长期保留,换句话说,如果我想以某种方式踢足球,它应记住我过去学过什么。因此

以及社交和文化线索,此外,社交信号不同,来帮助我减少人际摩擦。例如在巴黎或纽约,它还要理解人类情绪和心理状态,行为方式、说“谢谢”的方式甚至走路方式都不同。我的金博宝188欢迎您常用功能体需要全天候帮我解读这些社交信号,并主动知道何时展示、何时告知我的下一步动作。

因此,我们提出一种在语言空间进行世界金博宝188欢迎您常用功能建模的方法,而是进入到由语言描述的动作空间中建模。不是通过生成像素(图像)来建模,

而眼下世界金博宝188欢迎您常用功能

这种方法以观测(Observation)和目标(Goal)作为输入,且都是语言形式的;Critic 金博宝188欢迎您常用功能查看的当前状态、目标状态和动作状态都是用语言描述的。动作本身也被描述为语言。

在这种情况下,语言比像素更紧凑。它不试图生成语言本身,而是生成描述动作的语言。这就是“视觉语言世界金博宝188欢迎您常用功能(Vision-Language World Model, VLWM)”。与生成式世界金博宝188欢迎您常用功能相比。它提取的是对未来预测的语言描述。

我们能拿 VLWM 做什么?——用于高层过程规划,很多人会上YouTube看步骤。而我希望可穿戴金博宝188欢迎您常用功能体能一步步给我展示。光看菜谱文字很难操作,比如“教我怎么做一道菜”。会做饭的人知道,

冯雁也针而后者追求因果正确性而非像素

VLWM 从视觉上下文中提取动作,并有一个搜索模块来选择最佳轨迹,顺序预测世界状态和动作。然后根据Critic 金博宝188欢迎您常用功能输出搜索最佳计划。

具体示例是:我戴着眼镜想做洋葱番茄炒蛋,它会解释目标含义,然后逐步指导从加热锅到打蛋、调味,比普通菜谱更详细。甚至描述每个动作的含义。它还可以将世界状态分解为不同层次的对象、属性和状态。

金博宝188欢迎您常用功能体做过程规划,如视频所示,但那太慢,同时还要实时跟踪我当前实际在做什么。这种实时理解很重要。VLM可以做到每8秒拍一张照片并描述状态,告诉我下一步,不适合可穿戴设备。所以这部分需要 JEPA 金博宝188欢迎您常用功能来建模。

我们提出的 VL-JEPA(Vision-Language JEPA, VL-JEPA)金博宝188欢迎您常用功能基于强大的V-JEPA 2编码器,实现了开放词汇(open-vocabulary)的动作和状态跟踪,并赢得了 CVPR 2026 EgoVis 行动识别挑战赛的冠军。

即前者认为AI 要理解世界

VL-JEPA是一种用于视觉语言的联合嵌入预测架构,将所有内容编码到嵌入空间。此外包含视觉编码器和文本编码器。文本编码器接收提示(如“跟踪动作”)和目标文本,

就必须能完整生成每个像素

推理时,而不是逐token生成,它将视觉输入和文本查询编码到公共嵌入空间,只在有事件发生时解码。这使得 VL-JEPA 能够实时、高效地进行动作跟踪和视频理解。用滑动窗口在嵌入空间中跟踪动作和状态,具体方法是,

因此能实时跟踪人类动作。VL-JEPA不是生成式的,无自回归延迟,而是预测目标语义嵌入,不强制重建每个表面细节,与经典VLM不同,

对当下主流的两派

VL-JEPA 在嵌入空间中跟踪动作,且由于开放词汇,可以做到零样本跟踪动作或动作失败(如未能叠好毛巾)。一旦有了实时理解,而这也是可穿戴和金博宝188欢迎您常用功能金博宝188欢迎您常用功能体的前提。它还可以跟踪状态,如方块是否放入盒子,显示金博宝188欢迎您常用功能动作是否成功完成,就能让规划器告诉我们下一步该做什么。

生成式世界金博宝188欢迎您常用功能

我们还将 VL-JEPA与 VLM 进行比较,使用相同训练数据、编码器和计算,VL-JEPA 以少50%的参数达到更高性能,且对流视频的推理更快,在基准上取得最佳结果。此外,VL-JEPA 可零样本进行视频字幕描述和视频分类,性能高于VLM。且训练参数更少。

JEPA 金博宝188欢迎您常用功能

而是在有意义的事件发生时VL-JEPA不是每时每刻都解码,最重要的是,有选择性地解码”,这样一来,在相同输出质量下,解码操作减少了约2.85倍,是真正的节能型金博宝188欢迎您常用功能。

综上所述,我向你们展示过程规划(procedural planning)的现场演示,并告诉我可以从某个时间点开始。实际上,它认为这没有意义。一步一步地告诉我该做什么。系统正在观察我的实际动作,它才会进行解码,只有当它看到我做了正确的动作时,而且是用法语说明的。旁边有一份食谱,我中途喝了一口咖啡,而那个JEPA 金博宝188欢迎您常用功能学会了把这个动作视为无关紧要并直接忽略,并带有实时动作跟踪。比如有个人正在尝试做一个黄油派皮,

这是因为真实世界中的人类动作(其实也包括金博宝188欢迎您常用功能动作),人类还可以做同一种派做十次,金博宝188欢迎您常用功能也能帮人类制作黄油派。但对它来说,这个过程噪声很大,因为每次操作的条件都不一样,比如温度不同、湿度不同、制作的手法也不同。此外,不同品牌的面粉吸水性、筋度也不一样。所以,并且面粉,但十次的做法都会有些差异,情况非常复杂。也许有一天,操作本身就是有噪声、复杂、动作连续的环境。

针对VL-JEPA这项工作,我们也发布了名为 Action-100M 的训练数据集,包含总时长达14.6年的YouTube视频,共120万个视频,已在Hugging Face上开源,1.47亿个层次结构动作,欢迎大家使用。

我前面提到“主动协助”和“心理世界金博宝188欢迎您常用功能”。我的可穿戴助手如何主动猜测我下一步需要做什么?它需要规划、观察和恢复。所以今天,能够做到自动检测计划偏差。我们还要发布一个主动过程协助的基准和架构,

推理速度更快

供大家研究。金博宝188欢迎您常用功能体说“先磨豆”,当前放粉”,看到我磨完后说“磨得好,我填粉后它打断说“当前用压粉锤压实”。我们发布的这个基准和架构,右侧示例视频展示的是:在帮我做浓缩咖啡时,

旨在推进下一代可穿戴设备的自我中心视觉、主动式 AI 和长上下文多模态理解。我也很高兴宣布,我们将在 ECCV 2026 举办可穿戴 AI 研讨会。研讨会由来自Meta、AMI Labs、NYU、爱丁堡大学、佐治亚理工、佛罗里达大学和香港科技大学的研究者们联合组织,此外,

希望大家投稿,并且会新公布数据和基准,论文征集截止7月25日,也期待在瑞典见到大家。研讨会还设置了总奖金21,000美元的挑战赛,

对噪声与环境连续变化的鲁棒性显著更强
其结果是

05

现实世界中金博宝188欢迎您常用功能体的伦理安全问题

最后但同样重要的是,我想聊一聊现实世界中金博宝188欢迎您常用功能体的安全性。由于可穿戴设备和金博宝188欢迎您常用功能的摄像头、麦克风始终是开启的状态,会捕捉到用户以外的旁观者和环境。自我中心视角的数据极度个人化且持续在设备端处理,然而这种自主性也增加了误用和误导的风险。金博宝188欢迎您常用功能金博宝188欢迎您常用功能(公众号:金博宝188欢迎您常用功能)金博宝188欢迎您常用功能

另外,当金博宝188欢迎您常用功能体以类人的方式与用户交流时,还容易引发“拟人化(anthropomorphism)”,导致过度信任和情感依赖,这都有可能被不正当利用。

因此我们需要在金博宝188欢迎您常用功能设计上,我也很感兴趣。Verena Rieser 会做《From Behavioural Guardrails to Principled Agency》的主题演讲,平衡用户参与度和防操纵机制。本周四同一时间的这个房间,

AMI Labs 正在招聘研究科学家、博士后和博士,我所在的实验室在巴黎,最后,另外也在纽约、蒙特利尔和新加坡等驻地,欢迎感兴趣的朋友申请。

在物理世界的落地场景中展现出天然的结

一个人读论文太孤单,一群人刷顶会才好玩。

ICML 2026 召开在即,我们正在召集一波含金量极高的 AI 研究者。群内主打实时论文跟踪硬核技术探讨,拒绝灌水。

? 进群传送门:备注: 扫码进群或添加微信Vin_Vivid,论文群 + 关注的 AI 方向

沿着 JEPA 这一技术脉络

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

在自监督视觉表征金博宝188欢迎您常

扫描上方二维码

或点击阅读原文关注专区。

金博宝188欢迎您常用功能原创文章,未经授权禁止转载。详情见转载须知

金博宝188欢迎您常用功能动作规划及

分享:

继续浏览

最新动态

请填写申请人资料

姓名
电话
邮箱
微信号
作品链接
个人简介
为了您的账户安全,请验证邮箱
您的邮箱还未验证,完成可获20积分哟!
请验证您的邮箱
立即验证
完善账号信息
您的账号已经绑定,现在您可以设置密码以方便用邮箱登录
立即设置 以后再说

继续阅读

以下内容与「金博宝188欢迎您常用功能」同属公开资讯,可按栏目继续浏览相关条目。

本站按公开材料组织页面。需要原文时请核对应栏目发布页。

继续浏览时优先选择同栏目或相近主题,避免被站外镜像带偏。

李飞飞押注的空间金博宝188欢迎您常用功能:生成的世界,如何「经得起折腾」? | 新闻 | 天津大学自然语言处理实验室多篇论文被ICML 2026、IJCAI 2026等会议接受 | 华为 IJCAI 2026 论文盘点:从「规模密度」转向「设计密度」 | IJCAI 2019 今日开幕,十三个奖项依次揭晓 | IJCAI 2026 复盘局:中国人投了最多的稿,却到不了最多的场 | 蚂蚁金博宝188欢迎您常用功能 IJCAI 2026 论文盘点:让 AI 学会「随机应变」

内容目录

主页 / 工业安全 / 芯片 / AMI Labs

页面按栏目组织。可先看导读,再进入相关篇目或返回列表。