• 正文
  • 相关推荐
申请入驻 产业图谱

墨芯人工智能:稀疏计算不是算法,是一整套生产工具

原创
08/26 10:51
905
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

“未来整体AI会朝着算法和软硬件协同的提升上面去做很大层面的提升。硬件可能能够把我们整个AI的性能再提升30%到40%了不起了,但是算法跟软硬件的协同未来能再提升10倍、100倍的空间是绝对存在的。”在近期举行的ICDIA创芯展上,墨芯人工智能科技(深圳)有限公司市场部副总裁郭威俊如是说。

这家成立于2018年的AI芯片企业,正试图用“稀疏计算”这一技术路线,在国产AI芯片的激烈竞争中走出一条差异化的道路。

墨芯人工智能科技(深圳)有限公司市场部副总裁郭威俊

过去两年,国产AI芯片产业经历了从“有没有”到“好不好”的关键跨越。摩尔线程、沐曦、壁仞等企业相继完成规模化部署,国产AI芯片已进入商业化深水区。但在郭威俊看来,一个根本性的问题仍未解决——算力成本。

“现在绝大部分的端侧部署比较困难,”郭威俊在演讲中直言,“未来每家GPU公司面临一个最大的课题,就是怎么把自己各种各样的架构、异构、进存应用到生产工具中去。”

Token成本的持续高企正在成为制约AI产业规模化发展的瓶颈。从云厂商到个人开发者,推理成本的压力与日俱增。而墨芯选择的解题思路,是在一个曾经相对小众但如今却成为打破AI算力成本瓶颈的重要技术方向上深耕七年——稀疏计算。

稀疏计算:不是算法,是“生产工具”

稀疏计算并非新概念。英伟达早在Ampere架构时代就已引入2:4结构化稀疏技术,即在每4个连续权重中保留2个非零元素,以此实现50%的稀疏率和理论翻倍的矩阵乘法吞吐量。但郭威俊指出,墨芯对稀疏的理解远不止于此。

“稀疏本身是一套生产工具。”郭威俊在采访中反复强调这一观点,“它不是一个数学名词,它是一整套的生产工具。整个芯片在设计层,你有没有为芯片去做稀疏的算子?调度层有没有去做调整?以及你有没有对稀疏的计算单元做单独的相类似于MPU、SPU的开发?”这是一个系统性工程。

墨芯的芯片中有一个单独的芯片区域叫SPU(Sparse Processing Unit),“这是国内芯片架构领域独一无二的,它是为了稀疏整个算子单独做了一个区域去做稀疏加速的。”

郭威俊进一步解释了稀疏计算的本质逻辑,“你不可能未来在大模型里搜一个东西,比如牙齿疼怎么办?还要调用几百亿的参数去计算,完全没有这个必要。未来的函数,当用户提到牙疼,这个稀疏函数可能快速调度到算子层,只调用在医学领域的参数,可能只需要70B的算力就解决这个问题了。”

在他看来,稀疏计算的核心价值在于将AI推理从“暴力计算”转向“精确计算”——“未来大部分的云厂商,包括Token工厂,要考虑的很大的问题是到底我们的模型精度要不要降,还是说符合生产成本就OK了。”

差异化路径:从SPU到SP200

在国产AI芯片赛道,墨芯的技术路线显得颇为独特。

“国内押注在稀疏赛道上面的公司,只此一家。”郭威俊坦言,“所以我们的标的性还是相对比较明确的。”

这种独特性体现在硬件架构的底层设计上。与业内常见的“在模型层做压缩和剪枝”不同,墨芯的稀疏化是在芯片设计阶段就“预埋”进去的。“我们的算法是把大部分现在模型里面比较冗余的可以转化为硬件高效的规则化稀疏的东西做成函数,然后在SPU阶段可能就预埋进去。”

从产品线来看,墨芯的第一代产品——S40卡和S10卡——主要面向小参数模型和行业垂直模型。郭威俊透露,公司在安防、生命科学等垂直领域已有商业化部署:“举例如国内就做蛋白的碱基检测,是非常垂直的领域,你会发现稀疏在小模型的计算领域里面,有非常得天独厚的优势。因为完全不需要那么大的能耗,不需要那么大的参数比。”

即将推出的第二代产品SP200(SparsePrime)则是面向大规模推理场景的旗舰产品。据郭威俊介绍,这款芯片“围绕未来推理的专属赛道,在Prefill、decode的性能方面都非常卓越”。

从性能指标来看,墨芯的S30计算卡已连续三次登顶MLPerf推理榜首,在视觉、自然语言处理、大模型等主流任务上展现出领先的能效比与单位算力推理吞吐量。郭威俊对此表示,“我们有信心这张卡在未来上市之后能够挤进国内现有的推理卡的前5。”

现实的挑战:制程、内存与取舍

在技术愿景之外,郭威俊对国产AI芯片面临的现实困境有着清醒的认识。

“现在产能制程对整个行业都是非常重要的关键因素,”他直言,“产业又在发生剧烈的变化,这半年整个AI行业发生了天翻地覆的变化,到底怎么去适应产业的变化?”

面对这些约束,当前针对稀疏计算的底层芯片架构还处在摸索阶段,其本质上是一个“取舍”的问题。“到底怎样的动态平衡,留多少空间给通用的芯片去做计算推理,留多少去做动态的调度,留多少去做计算单元,要留多大的面积?”郭威俊透露,墨芯在SP200的架构验证上花了较长时间评估,“就是在计算和平衡这些问题”。

他列举了具体的性能指标:“我们做了非常多首Token延时99的测试,也在吞吐的时效性上做了大量的妥协和兼容。”

在软件层面,挑战同样不小。“当前的软件工具也再不断迭代更新,为给大模型提供更好地适配性,所以我说稀疏计算是一个系统工程,根本不是做个算法就好了,不是的,挑战很大。”

产学研布局:瞄准“稀疏训练”前沿

在技术攻坚之外,墨芯也在产学研层面进行了系统性布局。

2026年8月,由墨芯人工智能发起的“墨芯稀疏计算产学研联盟”正式成立,汇聚了清华大学、复旦大学、西安交通大学、南开大学等知名高校,以及华大集团、中国移动、上海仪电、芯原股份、翱捷科技等头部产业伙伴。

郭威俊特别强调了与数学系的合作:“今年我们跟西交大的应用数学整个院系在稀疏矩阵层面有较大合作。我们预判国家后续的AI发展会有一个重点方向围绕数学领域展开。”

他解释了选择数学系而非微电子系的原因:“大部分的模型还是矩阵层,稀疏在矩阵层上面,应该还是一个数学问题,不是基础数学,是应用数学的问题。”

更长远的目标是“稀疏训练”。“我们未来是希望在芯片设计层,在稀疏训练层就能到训练层,就不要到KD Coach到FFN跟N call阶段再去做计算。”郭威俊提到,“未来所有的基模公司,在早期在做基模训练的时候,就会把稀疏训练的函数放到基模的建设当中去。”

他透露,“未来在我们的卡回来之后,会重点地就稀疏训练产学研的前沿领域,跟国内绝大部分的大模型公司进行深入的合作。这是未来能够将我们国内的模型能力再往上提升的一个非常重要的方向。”

结语

从2018年成立至今,墨芯在稀疏计算这条路上走了七年。在国产AI芯片从“暴力计算”走向“精确计算”的产业拐点上,这家公司试图用一套从芯片架构到软件栈的全栈稀疏方案,回答一个核心问题:如何让AI推理变得更便宜、更高效。

“稀疏计算不是未来在技术路线上的可选项,”郭威俊提到,“AI推理未来会从完整的暴力计算转为精确计算路径。”这一判断在市场中的兑现,SP200的上市表现将是关键验证。而在制程受限、内存受限的现实约束下,墨芯选择的这条“取舍”之路,或许正是国产AI芯片寻找差异化突围的一个缩影。

来源: 与非网,作者: 高扬,原文链接: https://www.eefocus.com/article/2075403.html

相关推荐

与非网总编。所知有限,不断发现。抱持对技术、产业的热情和好奇,以我所知、所见,真实还原电子产业现状和前沿趋势。

微信公众号