解读世界模型:多位专家的见解与展望

6565

在2026年,"世界模型"成为人工智能领域内一个极具争议的术语。不同的系统和应用均以此为名,包括能够连贯生成视频的技术、实时响应用户操作的数字环境、进行潜空间预测的系统,以及直接输出机器人行为策略的模型。这些技术虽然都在处理与现实世界的信息相关任务,但它们的能力和实现方式却相差甚远。例如,生成的视频效果可能非常真实,但并不符合物理规律;而某些机器人尽管可以完成抓取操作,却可能仅限于实验室环境中的特定物体与动作模式。如何精确评估这些模型到底学到了怎样的知识,特别是视觉关联、物理结构或是行为与结果之间的关系,单靠直观演示难以下定论。这种概念上的混淆使得技术评估变得复杂,画质、几何精度、预测能力和任务成功率混杂在一起,不同团队可能在表面竞争相同领域,实则针对着不同的问题。

因此,关于世界模型的研究重新聚焦于一个基本问题:一个有效的模型需要哪些能力,以便能够理解和改变现实世界。李飞飞和World Labs对世界模型进行了分类,分为渲染器、模拟器和规划器,分别对应输出像素、世界状态和动作。LeCun则提倡在抽象潜空间中学习可预测的世界结构,以便模型能够保留对理解、推理和规划有用的信息。清华大学的朱军提供了另一个视角,早在去年12月Motus发布之时,他就提出了“通用世界模型”的构想,并在今年3月强调其作为连接数字与物理世界的基础作用。在其后发表的论文《从第一性原理出发的通用世界模型》中,他进一步明确了这套框架的设计理念,并定义了模型的核心能力和五级进化路线图。论文指出,通用世界模型的基本能力涵盖理解、想象和行动。模型需要从历史观察中形成对当前世界的判断,推测不同选择可能导致的未来,采取相应行动,并根据新的观测结果不断自我修正。

在这一框架下,视频生成、实时互动、潜空间预测和机器人控制可看作是同一能力路径中的不同阶段。对于世界模型距离通用智能的距离,有几个关键问题值得关注:它能否生成一个连贯的世界?是否能够准确预测干预的结果?能否从真实反馈中学习?并最终形成更复杂目标并进行组织行动? 龙8国际登录

世界模型的根本原理可以借助学习骑自行车的过程来解释。起初,骑行者保持平衡相对困难。随着实践,身体会根据重心和车把的位置进行调整,初步修正以避免摔倒。久而久之,骑行者会逐渐学会预测动作带来的结果,正如1943年Kenneth Craik提出的那样,人们在脑海中会形成关于现实的"小规模模型",借此推演不同行为的潜在影响。强化学习中的POMDP进一步描述了这一过程,智能体通过局部观察评估世界状态,采取行动,并根据新的观测更新其判断。朱军的团队将这一定义概括为通用世界模型的三大核心能力,这三者相辅相成,构成持续更新的反馈回路:理解(Understanding)可以整合感官信息以推理当前状态;想象(Imagination)可以基于当前状态预测多个未来可能性,尤其是“如果我采取动作A而不是动作B,可能的结果如何”;行动(Action)则是将预测转变为对环境的实际介入,并通过新观察来验证和校正模型。

值得注意的是,视频生成并不能涵盖世界模型的全部含义。视频模型能预测接下来可能出现的画面,但要成为通用世界模型,它必须回答关于条件变动、物体移动或施加某种动作将如何改变世界的核心问题。这类包含行动条件的预测直接触及因果关系、反事实思维和可执行决策。

理解、想象与行动如何形成闭环?为此,朱军团队设计了五级能力路径:首先,从L1阶段的世界生成,到L2阶段的互动,再到L3阶段的行动,最终演化为L4阶段的自主智能体和L5阶段的世界组织者。以一只被推向桌边的玻璃杯为例,L1模型生成杯子掉落、撞击和破裂的连续画面;L2模型则在用户改变视角或推动方向后,继续演绎这个世界;到L3阶段,模型需判断杯子是否会掉落,预测伸手是否及时,并输出机器人实际可执行的抓取动作。只有在推动后,模型才能反馈自身对杯子的重量、摩擦力及抓取时机的判断是否正确。进一步地,L4阶段的智能体将能够主动识别风险、进行观察和信息补充,并在失败中调整策略。而L5阶段则要求其在多主体协作中作出决策,比如决定谁去抓杯子、谁避开障碍、谁来搭配工具。 龙8国际登录

进行短跑和力量训练,增强肌肉的瞬时发力能力。...

进行短跑和力量训练,增强肌肉的瞬时发力能力。...