本站资源是站长搜集整理而成,版权均归原作者所有,若无意中侵犯到您的版权利益,请来信联系我们删除! 本站所有资源只用于研究学习,不得作为商业用途、非法谋取暴利,否则,一切后果均由自己承担!

首页 > 见识

通用世界基座模型发布,“悟界”正在开启AI觉醒元年

  • slbcun
  • 2026-07-07
  • 976 ℃

  不知道你发现没有,AI在线上和线下的表现是非常割裂的。

  脑子极聪明,身体极笨,线上的AI几乎无所不能,知识储备碾压人类,

  做高考题什么的对他来说只是基本操作,现在的AI甚至能解量子力学题。

  但在现实世界里,AI却是个笨得要命,走个路叠个衣服对AI来说都很费劲。

  那造成这种割裂现象的原因是什么呢。

  过去我们刷到的各种AI生成的视频,尤其是漫剧类,

  看着非常震撼。甚至有很多都是妥妥的大片级别。

  但生成这些AI视频的模型往往都有个致命问题,

  就是它们不懂物理。你让AI生成一个玻璃杯,从桌沿被碰落的过程,

  可能生成得很像。但是会出现很多的物理漏洞,比如杯子穿越了桌面,

  水洒出来的轨迹不对,碎片飞散,违背动量守恒等等。

  这其实就是因为AI一直缺少一层直觉,物理的底层认知。

  物体软硬重心在哪儿?摩擦力多大动作的后果链等等。

  这些东西人类3岁就懂,AI至今要靠海量试错数据硬灌在目前主流AI。

  AI模型的潜空间里,他们学的是像素之间的统计相关性,

  而不是物理规律本身的因果结构。

  再直白点说,以前我们接触的模型,不管是生成文字、图片还是视频,

  他们本质上做的都是预测下一个字或下一个像素的事情。

  这样做的好处是给人的感觉很聪明。

  但缺点是它不保证世界真实成立。

  比如同样是生成天上飞的猪。

  对数字世界来说是艺术创作,但对物理世界而言,

  那就是灾难。尤其是现在,随着AI越来越迈向真正的生产力的组成部分,

  比如工厂里的机器人。工业仿真、自动驾驶这些要真干的活儿,

  最怕的就是模型只是看起来对,这种情况下就必须要求AI对物理世界有真正的理解。

  不然不仅效率会出问题,甚至还可能造成经济和安全上的灾难。

  而前不久我们发布的全球首个通用世界基座模型,

  悟界,就做了一件根本性的事情。

  把AI大模型的预测目标从下一个文字、下一个词源或下一个像素帧变成了一个物理状态。

  意思是不再只追求画面像不像,而是在内部去学物体位置。

  速度,受力,接触关系等的演化,目标指向物理一致性,

  加因国可溯源加长期不崩。

  并且他强调用物理隐空间的思路,把视频深度点云,

  力处反馈之类的全模态塞进一个统一的物理状态表示里,

  再去推演。而不是纯靠像素拟真。

  再举一个不太恰当的例子。

  有一款游戏叫我的世界。

  在里面你可以发挥自己的各种创造力去做出很多有趣的东西。

  但它并不能模拟真实的世界。

  而通用世界基座模型从某种程度上来说,它是真的能在线上造一个我们的这个世界。

  在这个世界里,你可以预测很多现实世界中的真实问题。

  比如,如果我对某个物体施加动作A,该物体的物理状态如何?

  从S1变到S2,这就是真实世界里你一脚踢下去,

  你面前的这个足球会有什么样的运动轨迹?

  在通用世界基座模型下都是可以预测、可以模拟的。

  一句话来说,就是之前我们的AI模型学的和做的是我们的这个世界长什么样。

  而悟界要做的,不是生成好看的世界,也不关心画面好不好看,而是关心。

  状态对不对?他要弄清楚我们这个世界是怎么来的。

  如何运转、怎么变化。他要做的是让机器人真的知道,

  我推这个杯子它会不会倒,倒向哪儿,撞到什么,需不需要扶,

  而不是生成一段逼真的掉落视频给你看。

  他要做的是物理认知引擎的底座。

  未来谁先把物理因果的通用底模做稳,谁就掌握了机器人时代的CUDA,

  不是芯片,是认知基础设施。

  所以物界这个全球首个通用世界基座模型,就是这几年来最有复利价值的范式迁移之一。

  人类真的进入像科幻美剧西部世界那样的时代,

  真的只是时间问题了。


文章评论 (0)

    • 这篇文章还没有收到评论,赶紧来抢沙发吧~


Top