首页 > 见识
国产芯片为什么没能在“训练芯片”上弯道超车?做到“从零预训练”有多难
- 2026-07-07
- 572 ℃
到底什么时候才能明白,现在我们所谓芯片的弯道超车,
其实只是在推理芯片上的弯道超车。
在训练芯片上还差得远。
推理芯片是AI链条的下游。
而训练芯片是上游推理芯片。
它做的其实就是调用训练好的固定参数模型,然后处理。
们交给AI的任务,比如跟AI聊天问答,让它生成图片视频,
再比如说做一些软件开发等等。
这意味着推理芯片只做单向、前向的运算。
而在AI整个链条上,推理芯片是属于落地的那个环节。
而训练芯片才是真正掌握AI生产资料的环节。
训练芯片做的是把海量的高质量数据,也就是经过标注、分析、归类、处理的数据投喂给大模型。
通过前向和反向传播反复调整。
大规模的参数进而把大模型给训出来。
也就是说,训练芯片在整个AI链条上是属于AI能力生产环节的角色。
所以大家不要被他俩的名字给误导了,觉得说好像推理属于抽象的能力更难,
而训练好像没有什么技术含金量。
但事实并不是这样的。再简单点来理解,就以你手里的这个手机为例,
推理芯片就好比你能把这个手机玩得很溜。比如你可以。
用它拍出3D高斯泼溅的场景。
再比如你可以用它自带的AI功能点外卖等等。
你可以把它所有的功能发挥得淋漓尽致。
训练芯片则相当于你要造出这台手机。
一个使用,一个是生产。这就是它俩最本质的区别。
者的难度,你用天差地别来形容也不是特别过分。
现在我们的推理芯片确实很厉害。
这几年的进步非常大。不仅整体追平了国际的水平,
实现了规模化的国产替代。
而且在部分的应用场景上甚至还反超了国际水平。
但另外一个扎心的事实是。
我们的训练芯片目前却只有能用的水平。
跟国际先进水平的差距非常大。
这也是为什么说在国产芯片这一块没人能碰瓷寒武纪和升腾芯片。
因为目前在最难的这个推理芯片上只有武纪和升腾芯片在推进。
但即使强如华为,每年那么大的研发比例,在训练芯片上的进展也依旧没大家想象中的那么快。
前几天,华为昇能910C千卡集群成功完成DeepSeek V4 Pro一点点6万亿参数Mo,
OE全参数后训练,这件事儿不知道大家刷到没,其实这件事儿对国产训练芯片本身来说,它的进展。
并不小。以前我们国产算力在大模型领域只能做推理和轻量化的微调。
一旦涉及大规模尤其是全参数后训练分分钟就得歇菜,
而华为昇腾910C这次就是把这个困境给打破了,
那他的成绩怎么样呢?这里要拿一个业内的专业数据来评价,
就是mfu u mfu, 简单点来理解就是AI芯片利用率的百分比,
大概就是用你这个芯片实际干活用的算力,跟它理论上最多能用的算力做一个比值,
算出来的就是mfu,它不是一个确切的值,而是在一个区间。
然后这次升腾910C,在轻卡规模拿到的mfu是30%~34.9%。
而跟它同规模的英伟达H100的mfu是35%~42%。
也就是说在mfu上差了5~10个百分点。
但能力上的差距可就不是5~10个百分点了。
更何况我们现在连万卡规模的边都还没摸到。
所以说这次的进步确实不小。
但跟国际水平相比还是差很多。
首先,这次做的是全参数后训练,跟国际先进水平的从林预训练在数据量上差得还是很多。然后算力上只有。
S只有千卡不是万卡,距离极致吞吐极致成本还是很远。
如果按计划,华为升腾950 DT能在今年年底亮相。
且实现对标H200的性能。
那么我们跟英伟达的差距才能被缩短到1~2代。
而且像英伟达的CUDA生态,它可是绑了20年积累的600万开发者,
以及900加专用加速库,所有框架默认给CUDA做深度优化,
既使国产训练生态在硬件上追平了,但让所有人把代码迁过来的隐性成本,
依旧还要3~5年才能抹平。
而对英伟达来说,升腾910C单卡追上H100并不可怕。
因为这只是产品上的突围,真正可怕的是,升腾芯片已经在和DeepSeek等国产实力形成了除CUDA之外
的第二套生态。最后问题来了。
你知道除了训练芯片,我们在AI整个生态链上还有哪些环节是比较薄弱的吗?
相关内容
文章评论 (0)
- 这篇文章还没有收到评论,赶紧来抢沙发吧~


进入有缘空间
点击分享文章