昭擎收录网
  • 如何加入
  • 查询是否收录
  • 文章资讯
  • 人气排行榜人气排行榜
  • 点入排行榜点入排行榜
  • 自助发软文
  • 自助广告位
  • 会员登录会员登录
朱军等如何解读-李飞飞-世界模型到底是什么 (朱军被降为正部级原因)
  • 文章编号:1339 / 分类:互联网资讯 / 发布时间:2026-09-10T22:05:19 / 浏览:次
  • 编辑|杨文

    2026 年,「世界模型」是 AI 圈最没有共识的词之一。

    一段能够连续生成的视频,被叫作世界模型;一个随键鼠操作实时变化的数字环境,也被叫作世界模型;在潜空间预测未来状态的系统,以及直接输出机器人动作的策略,同样使用这个名字。

    这些模型都在处理世界的信息,能力边界却相去甚远。生成视频里的画面可以足够逼真,却违背真实的物理规律;机器人能够完成一次抓取,也可能只熟悉实验室里的物体、机位和动作轨迹。一个系统究竟学到了视觉相关性、物理结构,还是行动与结果之间的关系,仅靠 Demo 很难回答。

    概念混乱增加了技术判断的难度 。画质、几何精度、预测能力和任务成功率被混在一起比较,不同团队看似争夺同一赛道,实际回答的可能是不同问题。

    因此,世界模型研究开始回到一个基本问题,模型需要具备哪些能力,才能从生成内容走向理解并改变世界?

    李飞飞和 World Labs 按功能将世界模型分为渲染器、模拟器和规划器,分别输出像素、世界状态与动作。

    朱军等如何解读李飞飞到底是什么朱军被

    链接:

    LeCun 则主张在抽象潜空间中学习可预测的世界结构,让模型保留对理解、推理和规划有用的信息。

    朱军等如何解读李飞飞到底是什么朱军被

    链接:

    清华大学朱军给出了第三个角度。早在去年 12 月 Motus 发布时,他就公开阐述「通用世界模型」整体构想,今年 3 月,他又将其定位为连接数字世界与物理世界的基础。几个月后,朱军及团队在论文《General World Models from First-Principles》中进一步完善这套框架, 从第一性原理定义核心能力,并给出一张五级进化路线图

    朱军等如何解读李飞飞到底是什么朱军被

    论文将通用世界模型的核心能力归纳为 理解、想象和行动 。模型需要从历史观测中形成对当前世界的判断,推演不同选择可能产生的未来,采取行动,再用新观测修正自身。

    沿着这一框架,视频生成、实时交互、潜空间预测和机器人控制可被视为同一条能力路线上的不同阶段。

    世界模型距离通用智能还有多远,也被转化成更具体的问题 :它能否维持一个连贯的世界?能否预测干预带来的后果?能否从真实反馈中学习?又能否逐渐形成目标并组织更复杂的行动?

    世界模型的第一性原理

    很多人都有过学自行车的经验。

    刚开始时,身体总会摇摇晃晃。看到车把偏向一侧,感觉身体重心开始下沉,人会随即调整方向,再根据新的反馈继续修正。随着练习增加,大脑逐渐学会预判某个动作将带来什么结果。

    这正是世界模型最朴素的含义。

    1943 年,Kenneth Craik 提出,人类会在头脑中形成关于现实的「小尺度模型」,借此推演不同行动可能带来的结果。强化学习中的 POMDP 进一步描述了这个过程,智能体接收局部观测,估计世界状态,采取动作,再根据新观测更新判断。

    朱军团队将这一逻辑概括为通用世界模型的三项核心能力,它们相互衔接,构成持续更新的闭环:

    朱军等如何解读李飞飞到底是什么朱军被

    通用世界模型的三项核心能力形成一个闭环:理解负责推断当前状态,想象负责预测可能的未来,行动则改变世界,并为下一轮理解提供新的证据。

    这也是为什么,视频生成不等于世界模型的全部。

    视频模型可以回答接下来画面可能是什么样,但要走向通用世界模型,它还需要回答「如果我改变这个条件、移动这个物体、施加这个动作,世界会如何不同?」 这类带有行动条件的预测,才触及了因果、反事实和可执行决策。

    理解、想象、行动,如何形成闭环?

    为描述世界模型如何演进,朱军团队进一步提出五级路线,即从 L1 生成世界、L2 交互世界和 L3 在世界中行动,逐步走向 L4 自主世界智能体与 L5 世界组织者。

    朱军等如何解读李飞飞到底是什么朱军被

    用一只被推到桌边的玻璃杯来理解,会更直观。

    L1 的模型可以生成杯子滑落、撞击、碎裂的连续画面;L2 的模型可以在用户改了视角、改变推动方向后继续演化这个世界;到了 L3,模型需要判断杯子是否要掉落、预测伸手是否来得及,并输出机器人真正可以执行的抓取动作。只有行动后,它才会知道自己对杯子的重量、摩擦和抓取时机判断得是否正确。

    再往上,L4 不再只等人给指令,它要能发现风险、主动观察、补充信息,并在失败后修正策略。L5 则进一步面对多主体协作,比如谁去抓杯子、谁去避障、谁来调配工具,如何在环境变化后重排任务。

    这条路线的意义在于,它把「世界模型」从一个名词,变成了一组可以逐级检验的问题。

    L1 看生成轨迹是否连贯,L2 看世界能否持续响应,L3 看模型能否改变物理环境,L4 看系统能否主动探索和持续学习,L5 看它能否组织开放环境中的多主体协作。

    朱军等如何解读李飞飞到底是什么朱军被

    通用世界模型(GWM)五级路线图的形式化建模目标与习得能力。

    按照论文给出的判断, 现有系统已经触及前三个层级 ,L4 和 L5 仍是开放问题,主要缺口包括因果与物理接地、持久记忆、在线学习、高效部署和安全控制。评测也要比较预测与真实结果,考察模型在陌生任务、环境和本体上的迁移能力。

    从视频到具身,同一个假设的两次验证

    世界模型的难处,并不只在算法。

    互联网视频规模巨大,记录了广泛的物体、人物、场景和运动,模型可以从中学习空间结构、物体持续性、人类行为以及事件通常如何发展,但视频很少同步记录造成变化的动作、力量和意图。机器人轨迹能够连接观测、动作和结果,采集成本却更高,也容易绑定具体硬件和任务。

    朱军团队提出的路径,是把这两类数据放入一座由观察走向行动的数据金字塔。

    朱军等如何解读李飞飞到底是什么朱军被

    通用世界模型(GWM)的数据金字塔及其与五级能力路线图的关系。

    底层是互联网规模的视频,用来获得世界知识和动态先验,向上依次是领域视频、第一视角人类视频、带有动作记录的人类示范,顶层是真实机器人交互数据。越往上,数据越稀缺、成本越高,但动作、任务与机器人本体的对应关系也越清楚。

    这就解释了为什么生数科技会同时推进视频生成与具身智能: 视频提供世界知识的广度,机器人数据完成行动接地

    在数字世界一侧,Vidu 系列持续探索对视觉世界的生成与交互。视频不是世界模型的终点,却是重要的起点,它让模型在大规模时空变化中学习对象、场景、运动与事件如何演化。Vidu S1 则进一步把一次性生成推进到实时响应,让用户输入可以持续改变后续内容,测试模型是否能在交互过程中保持状态连续。

    在物理世界一侧,Motus 与 Motubrain 将环境理解、状态预测与机器人动作接入同一条链路。模型需要看清环境,预测干预的后果,再将判断转化为能够执行的动作,并接受真实结果的检验。

    朱军等如何解读李飞飞到底是什么朱军被

    实现 L1 至 L3 的现有代表性系统。

    两条产品线由此形成对同一个世界模型假设的两次验证。数字环境检验模型能否理解并想象世界,物理环境检验这些知识能否支持行动,并在反馈中得到修正。

    要让两类验证共享底层能力,图像、视频、语言和机器人动作需要围绕同一个世界状态协同计算,传统模块化系统逐级传递信息,容易在接口处损失几何、时间和不确定性信息。所有模态完全共享参数,也可能造成训练冲突,让海量视频数据压制稀缺的机器人信号。

    朱军团队提出的 MoT(Mixture-of-Transformers)架构 ,尝试在两者之间取得平衡。不同模态保留各自的专家参数,再通过共享注意力机制交换上下文。视觉告诉模型环境中发生了什么,语言提供目标和约束,动作带来对环境的干预,三类信息共同更新模型对世界的判断。

    MoT 提供了统一计算的基础,物理规律、跨本体迁移、实时推理和安全控制仍需依靠数据、训练与系统工程解决。其指向的目标十分明确,通用世界模型需要一个能被不同模态共同读写、持续更新的世界状态。

    Motus2:让机器人在动手之前,先在自己的世界里试一遍

    如果说 Motus 与 Motubrain 将生数的世界模型探索推进到 L3,使机器人能够根据环境理解和未来预测生成动作,那么近期提出的 Motus2 则进一步加入结果评估与策略反馈,尝试让行动闭环具备自我改进能力。

    朱军等如何解读李飞飞到底是什么朱军被 视频链接:

    Motus2 没有把动作生成、未来模拟和结果评估做成三套彼此独立的系统。相反,它以一套共享参数的视频 — 动作模型,暴露出三种控制接口:

    可以把它想成一次真正的「先心灵,再手巧」。

    机器人不再只是看到物体后直接给出一个动作,而是先提出几种候选方案,在模型中预演各自会带来的画面与任务进度,再选择更好的那一步。执行以后,成功、失败和不那么理想的结果也不再只是数据废料,而会成为下一轮动力学建模与价值学习的证据。

    动作、预测、评估、反馈和再行动由此进入同一个决策与学习回路,这也是 Motus2 所强调的闭环自进化。

    在数据侧,Motus2 采用分层训练路径,从单目第一视角视频扩展到同步双目第一视角数据,再通过机器人数据完成本体适配。其训练使用约 13 万小时的人类第一视角记录,以及超过 100 小时的机器人轨迹和人机对齐数据。

    这一路径是先让模型累积一份关于人如何与世界互动的共同经验,再让它通过机器人数据学习这具身体如何把理解变成动作。

    朱军等如何解读李飞飞到底是什么朱军被

    在执行侧,Motus2 还通过独立的轻量触觉专家,对即将执行的短动作进行细化,并预测接触后的力反馈。视觉擅长看清物体在哪里、世界大致如何变化,触觉则补上接触发生时最难的「最后一厘米」,让模型在「看得见」之外,对压、碰、抓、旋等细腻操作多一层即时校正。

    Motus2 仍处于从 L3 向 L4 延伸的阶段。当前验证主要集中在特定机器人和操作任务,自主目标形成、持久记忆、开放环境泛化、长期在线学习与安全控制仍有待探索。

    它的主要进展,是将策略生成、未来模拟、价值评估和触觉反馈放入同一套系统,让机器人能够在行动前预演后果,在行动后利用结果改进策略,为走向 L4 自主世界智能体提供一条可检验的路径。

    从概率学习到世界智能,一条中国技术路径

    通用世界模型的框架,也延续了朱军及清华 TSAIL 长期积累的研究方向。

    朱军教授长期研究贝叶斯方法、概率机器学习、生成模型与强化学习,分别处理不确定性、数据分布、未来生成和行动决策。

    TSAIL 也培养和影响了一批进入全球前沿团队的研究者。宋飏本科阶段曾与朱军合作贝叶斯学习研究,宋佳铭本科期间也参与相关工作,后来分别在得分生成模型和 DDIM 方向产生重要影响。

    从概率建模到生成与决策,这条学术脉络也映照出 AGI 发展的两类入口 。一类从语言出发,逐步增强推理、工具调用和任务执行能力;另一类从视觉与动态世界出发,继续走向实时交互和具身行动。

    放在中国 AGI 产业版图中,智谱与生数可以视两条路径的代表。智谱从语言模型出发,持续增强推理、Coding 和 agent 能力;生数则从视频生成出发,进一步进入实时交互、具身行动与策略优化。

    两条路线正在相互渗透。语言 Agent 需要视觉反馈和环境模型,世界模型也需要语言表达目标、规则与计划,不同入口最终都指向对语言、世界状态和行动的共同建模。

    结语

    世界模型的竞争,最终会从 Demo 的震撼程度,转向系统经受反馈的能力。

    画面可以制造可信的第一印象,几何和物理决定这个世界能否被反复使用,行动则把模型的判断带进现实。一次预测是否成立,要等干预发生后才能确认;一次任务是否成功,也要放到陌生场景、长期运行和持续变化中检验。

    朱军团队的论文没有替世界模型之争写下最后答案,却提供了一组可以继续检验的问题: 模型理解了什么,能够想象多远,行动之后能否修正自己

    过去十年,AI 最重要的进展来自学习语言和数据中的规律。下一阶段,模型还要面对持续变化的环境。当模型能够在这样的环境中不断形成判断、承担行动后果并持续学习,世界模型才会从一个拥挤的技术名词,逐渐成为通向通用智能的基础。

    相关标签: 多模态模型、 世界模型、 智能体、 李飞飞、 机器人、 朱军、 本文地址:https://w7k.5slw.cn/article/1339.html 下一篇:津门虎1津门虎14号是谁
  • 相关推荐
  • 瓦斯科认为里沙利松单方面解约非最佳方案-愿直接买断-记者 (瓦斯里江)

    瓦斯科认为里沙利松单方面解约非最佳方案-愿直接买断-记者 (瓦斯里江)

  • 随着中国女篮61 (中国女篮逆境中成长)

    随着中国女篮61 (中国女篮逆境中成长)

  • 帕普-迪马济奥 (帕马迪摩托多少钱)

    帕普-迪马济奥 (帕马迪摩托多少钱)

  • 6 (6英寸等于多少厘米)

    6 (6英寸等于多少厘米)

  • 首款自营羽绒服9月20日开售-东方甄选卖羽绒服了 (自营羽绒服建议简短)

    首款自营羽绒服9月20日开售-东方甄选卖羽绒服了 (自营羽绒服建议简短)

  • 三星疑似嘲讽iPhone-等你们热完我们的剩饭再说-Duo (三星现况)

    三星疑似嘲讽iPhone-等你们热完我们的剩饭再说-Duo (三星现况)

  • 原因竟是玩家害羞不愿意穿!-最后一战-死或生6-将减少性感皮肤推出 (汽车安全扣图片)

    原因竟是玩家害羞不愿意穿!-最后一战-死或生6-将减少性感皮肤推出 (汽车安全扣图片)

  • 燃油费-三大航的钱去哪了-了近千亿-营收增了10%-烧 (燃油费算什么费用)

    燃油费-三大航的钱去哪了-了近千亿-营收增了10%-烧 (燃油费算什么费用)

  • 我看到了今年最特别的一个楼顶!-朝阳北路上 (我看见片)

    我看到了今年最特别的一个楼顶!-朝阳北路上 (我看见片)

  • 遗憾!郑钦文赢下这1球就能破发-有望击败莱巴金娜-穿越球打出界 (郑钦文又输了吗)

    遗憾!郑钦文赢下这1球就能破发-有望击败莱巴金娜-穿越球打出界 (郑钦文又输了吗)

  • 迎战青春风暴-围甲冲刺抢分!山东银丰队出征北京 (迎战青春风暴演员表)

    迎战青春风暴-围甲冲刺抢分!山东银丰队出征北京 (迎战青春风暴演员表)

  • 吴佳宴T3-高尔夫5女子赛福田萌维加洞实现首胜 (吴佳俣)

    吴佳宴T3-高尔夫5女子赛福田萌维加洞实现首胜 (吴佳俣)

  • 文章推荐
    007-终极配置需RTX-5080-初露锋芒-2K和4K配置公布-PC (终极kv1)
    杨瀚森-拜入何门胜过自封何王 (杨瀚森惊艳全场)
    清华附中男生为何破格入选国足 (清华附中男生)
    教师专享福利!北京这些景区免票 (老师福利待遇有哪些)
    公交免费接驳-地铁直达-1.1万余个车位!北京服贸会好逛好玩-最全交通指南 (公交 免费)
    塞尔维亚将于10月25日举行议会选举-武契奇 (塞尔维亚期间)
    能否把张子宇送给我们队-波多黎各主帅-中国太强不想再和她们对阵 (张子宇必将称霸全世界)
    原来他已去世11年!不抽烟不喝酒-每天坚持锻炼-59岁却骤然离世 (原来他早已离世患病3年手术9次)
    视频丨守护战鹰直刺苍穹!探秘战机腾飞的幕后故事 (守护住)
    折叠屏最新资讯 (折叠屏技术深度解析)
    多模式仿蠕虫管道机器人亮相外滩大会 (多模式仿蠕虫)
    高通全球副总裁夏权-每个人都拥有自己的智能体-个人AI时代 (高通全球副总)
    热门推荐
    智域九重天 - 东方玄幻知识修炼游戏
    气韵东方
    河南叶子集团
    普通高等教育教材网
    土木在线网_土木工程网站_土木工程师职业成长家园!
    中国国情_中国网
    云安-智能安保管理平台
    乐聚 – 人形机器人产业化领跑者
    厦门劦通科技有限公司
    汕头市创利驰科技有限公司-小家电-汕头吸尘器厂家-汕头除螨仪厂家-汕头吸尘器定制厂家
    东莞市全风智能科技有限公司
    星阵围棋
    发表评论

    Copyright @ 2021 昭擎收录网 此内容系本站根据来路自动抓取的结果,不代表本站赞成被显示网站的内容或立场。

    本页阅读量次 | 本站总访问次 | 本站总访客人 | 今日总访问次 | 今日总访客人 | 昨日总访问次 | 昨日总访客人 | 网站地图 |

    技术支持:昭擎收录网