首页 > 见识
通用世界基座模型发布,“悟界”正在开启AI觉醒元年
- 2026-07-07
- 976 ℃
不知道你发现没有,AI在线上和线下的表现是非常割裂的。
脑子极聪明,身体极笨,线上的AI几乎无所不能,知识储备碾压人类,
做高考题什么的对他来说只是基本操作,现在的AI甚至能解量子力学题。
但在现实世界里,AI却是个笨得要命,走个路叠个衣服对AI来说都很费劲。
那造成这种割裂现象的原因是什么呢。
过去我们刷到的各种AI生成的视频,尤其是漫剧类,
看着非常震撼。甚至有很多都是妥妥的大片级别。
但生成这些AI视频的模型往往都有个致命问题,
就是它们不懂物理。你让AI生成一个玻璃杯,从桌沿被碰落的过程,
可能生成得很像。但是会出现很多的物理漏洞,比如杯子穿越了桌面,
水洒出来的轨迹不对,碎片飞散,违背动量守恒等等。
这其实就是因为AI一直缺少一层直觉,物理的底层认知。
物体软硬重心在哪儿?摩擦力多大动作的后果链等等。
这些东西人类3岁就懂,AI至今要靠海量试错数据硬灌在目前主流AI。
AI模型的潜空间里,他们学的是像素之间的统计相关性,
而不是物理规律本身的因果结构。
再直白点说,以前我们接触的模型,不管是生成文字、图片还是视频,
他们本质上做的都是预测下一个字或下一个像素的事情。
这样做的好处是给人的感觉很聪明。
但缺点是它不保证世界真实成立。
比如同样是生成天上飞的猪。
对数字世界来说是艺术创作,但对物理世界而言,
那就是灾难。尤其是现在,随着AI越来越迈向真正的生产力的组成部分,
比如工厂里的机器人。工业仿真、自动驾驶这些要真干的活儿,
最怕的就是模型只是看起来对,这种情况下就必须要求AI对物理世界有真正的理解。
不然不仅效率会出问题,甚至还可能造成经济和安全上的灾难。
而前不久我们发布的全球首个通用世界基座模型,
悟界,就做了一件根本性的事情。
把AI大模型的预测目标从下一个文字、下一个词源或下一个像素帧变成了一个物理状态。
意思是不再只追求画面像不像,而是在内部去学物体位置。
速度,受力,接触关系等的演化,目标指向物理一致性,
加因国可溯源加长期不崩。
并且他强调用物理隐空间的思路,把视频深度点云,
力处反馈之类的全模态塞进一个统一的物理状态表示里,
再去推演。而不是纯靠像素拟真。
再举一个不太恰当的例子。
有一款游戏叫我的世界。
在里面你可以发挥自己的各种创造力去做出很多有趣的东西。
但它并不能模拟真实的世界。
而通用世界基座模型从某种程度上来说,它是真的能在线上造一个我们的这个世界。
在这个世界里,你可以预测很多现实世界中的真实问题。
比如,如果我对某个物体施加动作A,该物体的物理状态如何?
从S1变到S2,这就是真实世界里你一脚踢下去,
你面前的这个足球会有什么样的运动轨迹?
在通用世界基座模型下都是可以预测、可以模拟的。
一句话来说,就是之前我们的AI模型学的和做的是我们的这个世界长什么样。
而悟界要做的,不是生成好看的世界,也不关心画面好不好看,而是关心。
状态对不对?他要弄清楚我们这个世界是怎么来的。
如何运转、怎么变化。他要做的是让机器人真的知道,
我推这个杯子它会不会倒,倒向哪儿,撞到什么,需不需要扶,
而不是生成一段逼真的掉落视频给你看。
他要做的是物理认知引擎的底座。
未来谁先把物理因果的通用底模做稳,谁就掌握了机器人时代的CUDA,
不是芯片,是认知基础设施。
所以物界这个全球首个通用世界基座模型,就是这几年来最有复利价值的范式迁移之一。
人类真的进入像科幻美剧西部世界那样的时代,
真的只是时间问题了。
相关内容
文章评论 (0)
- 这篇文章还没有收到评论,赶紧来抢沙发吧~


进入有缘空间
点击分享文章