本站资源是站长搜集整理而成,版权均归原作者所有,若无意中侵犯到您的版权利益,请来信联系我们删除! 本站所有资源只用于研究学习,不得作为商业用途、非法谋取暴利,否则,一切后果均由自己承担!

首页 > 见识

国产芯片为什么没能在“训练芯片”上弯道超车?做到“从零预训练”有多难

  • slbcun
  • 2026-07-07
  • 523 ℃

  到底什么时候才能明白,现在我们所谓芯片的弯道超车, 

  其实只是在推理芯片上的弯道超车。

  在训练芯片上还差得远。

  推理芯片是AI链条的下游。

  而训练芯片是上游推理芯片。

  它做的其实就是调用训练好的固定参数模型,然后处理。

  们交给AI的任务,比如跟AI聊天问答,让它生成图片视频,

  再比如说做一些软件开发等等。

  这意味着推理芯片只做单向、前向的运算。

  而在AI整个链条上,推理芯片是属于落地的那个环节。

  而训练芯片才是真正掌握AI生产资料的环节。

  训练芯片做的是把海量的高质量数据,也就是经过标注、分析、归类、处理的数据投喂给大模型。

  通过前向和反向传播反复调整。

  大规模的参数进而把大模型给训出来。

  也就是说,训练芯片在整个AI链条上是属于AI能力生产环节的角色。

  所以大家不要被他俩的名字给误导了,觉得说好像推理属于抽象的能力更难,

  而训练好像没有什么技术含金量。

  但事实并不是这样的。再简单点来理解,就以你手里的这个手机为例,

  推理芯片就好比你能把这个手机玩得很溜。比如你可以。

  用它拍出3D高斯泼溅的场景。

  再比如你可以用它自带的AI功能点外卖等等。

  你可以把它所有的功能发挥得淋漓尽致。

  训练芯片则相当于你要造出这台手机。

  一个使用,一个是生产。这就是它俩最本质的区别。

  者的难度,你用天差地别来形容也不是特别过分。

  现在我们的推理芯片确实很厉害。

  这几年的进步非常大。不仅整体追平了国际的水平,

  实现了规模化的国产替代。

  而且在部分的应用场景上甚至还反超了国际水平。

  但另外一个扎心的事实是。

  我们的训练芯片目前却只有能用的水平。

  跟国际先进水平的差距非常大。

  这也是为什么说在国产芯片这一块没人能碰瓷寒武纪和升腾芯片。

  因为目前在最难的这个推理芯片上只有武纪和升腾芯片在推进。

  但即使强如华为,每年那么大的研发比例,在训练芯片上的进展也依旧没大家想象中的那么快。

  前几天,华为昇能910C千卡集群成功完成DeepSeek V4 Pro一点点6万亿参数Mo,

  OE全参数后训练,这件事儿不知道大家刷到没,其实这件事儿对国产训练芯片本身来说,它的进展。

  并不小。以前我们国产算力在大模型领域只能做推理和轻量化的微调。

  一旦涉及大规模尤其是全参数后训练分分钟就得歇菜,

  而华为昇腾910C这次就是把这个困境给打破了,

  那他的成绩怎么样呢?这里要拿一个业内的专业数据来评价,

  就是mfu u mfu, 简单点来理解就是AI芯片利用率的百分比,

  大概就是用你这个芯片实际干活用的算力,跟它理论上最多能用的算力做一个比值,

  算出来的就是mfu,它不是一个确切的值,而是在一个区间。

  然后这次升腾910C,在轻卡规模拿到的mfu是30%~34.9%。

  而跟它同规模的英伟达H100的mfu是35%~42%。

  也就是说在mfu上差了5~10个百分点。

  但能力上的差距可就不是5~10个百分点了。

  更何况我们现在连万卡规模的边都还没摸到。

  所以说这次的进步确实不小。

  但跟国际水平相比还是差很多。

  首先,这次做的是全参数后训练,跟国际先进水平的从林预训练在数据量上差得还是很多。然后算力上只有。

  S只有千卡不是万卡,距离极致吞吐极致成本还是很远。

  如果按计划,华为升腾950 DT能在今年年底亮相。

  且实现对标H200的性能。

  那么我们跟英伟达的差距才能被缩短到1~2代。

  而且像英伟达的CUDA生态,它可是绑了20年积累的600万开发者,

  以及900加专用加速库,所有框架默认给CUDA做深度优化,

  既使国产训练生态在硬件上追平了,但让所有人把代码迁过来的隐性成本,

  依旧还要3~5年才能抹平。

  而对英伟达来说,升腾910C单卡追上H100并不可怕。

  因为这只是产品上的突围,真正可怕的是,升腾芯片已经在和DeepSeek等国产实力形成了除CUDA之外

  的第二套生态。最后问题来了。

  你知道除了训练芯片,我们在AI整个生态链上还有哪些环节是比较薄弱的吗?

  


文章评论 (0)

    • 这篇文章还没有收到评论,赶紧来抢沙发吧~


Top