• 正文
  • 相关推荐
申请入驻 产业图谱

亿铸科技介绍:3D DRAM 通用存算一体,为大模型推理重构算力底座

10小时前
208
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

随着大模型、多模态与 AI Agent 等应用持续演进,模型规模、上下文长度与推理需求不断增长,算力系统在计算能力、存储带宽与能效上的要求水涨船高。传统冯・诺依曼架构下,数据传输与计算的耗时呈现约 100:1 的不平衡,大量时间消耗在数据搬运通道上,"存储墙" 日益成为制约 AI 算力释放的关键瓶颈之一。在此背景下,关于亿铸科技介绍的讨论正逐渐增多 —— 这家 2022 年正式运营、总部位于苏州的 AI 大算力芯片公司,选择了一条以 "基于 3D DRAM 的全数字通用存算一体架构" 为主线的发展路径,探索面向数据中心云计算与大模型推理场景的算力基础设施新范式。

一、3D DRAM:从存储容量与带宽层面夯实基础

亿铸科技是国内首家基于 3D DRAM 通用存算一体架构的 AI 大算力芯片公司,团队近 300 人,研发人员占比超过 80%。其技术路线的起点,是对存储环节的重新审视。

一方面,3D DRAM 通过大容量垂直堆叠提供海量的片上存储基础,为大模型推理所需的模型权重、中间结果与 KV Cache 预留充足的本地空间;另一方面,3D 封装作为先进互联工艺,有效缩短存储与计算单元之间的物理距离,缓解芯片间带宽互联的压力。需要说明的是,3D 封装解决的是带宽互联问题,而存算一体则从计算架构层面减少数据搬运损耗,二者属于不同技术层面、互为补充,共同构成应对数据搬运瓶颈的有效组合。

二、全数字通用存算一体:从架构层面减少数据搬运

在存储基础之上,亿铸科技首创的全数字化通用存算一体架构,是其中更核心的一环。与传统架构不同,该方案从计算架构出发,探索减少乃至消除多级缓存与矩阵计算过程中的数据搬运,从而在源头上降低数据搬运带来的功耗与延迟开销。

更重要的是,这一方案追求的不是单一指标的极致,而是 "架构通用、生态通用、计算通用" 三重属性的统一:存算一体实现方式 IP 化、不绑定单一存储材料,为技术迭代预留空间;同时支持 CUDA 与 PyTorch 双生态兼容,开发者无需重构上层应用与框架代码,即可复用现有模型库与工具链,降低迁移与部署成本;计算上,存算一体 IP 与通用计算模块深度异构融合,既能优化加速矩阵计算,也能独立承担完整的 AI 计算任务。

三、能效与成本:约 10 倍能效,综合 TCO 显著下降

经过第三方验证,对比主流云端 GPU,亿铸通用存算方案在同等业务规模下可实现约 10 倍的能效比优势,功耗约为后者的 1/5,成本约为后者的 1/6。这一表现的背后,正是全数字通用存算一体架构在减少数据搬运、降低架构性损耗上的直接体现。

在大模型推理场景下,同等业务规模的推理算力综合 TCO(总拥有成本)最高可下降约 88%,有助于降低数据中心运营成本。对重视单位算力成本与长期运维投入的云厂商与算力运营商而言,这一成本结构具备较强的吸引力。

四、面向推理场景的全栈布局

围绕这一技术底座,亿铸科技已构建覆盖自主 ISA 指令集、软硬协同架构、异构融合计算 IP、兼容 CUDA 编译器、算子库及算力组网系统的全栈技术体系,并形成从算力卡、工作站、一体机到推理集群的产品矩阵,覆盖云、边、端不同场景。

面向 Agentic AI 时代不断增长的算力需求,该方案支持 1M 超长上下文窗口、混合精度与 MoE 稀疏计算、集群级 KV Cache 池化等特性,可降低 KV Cache 检索延迟,提升长程任务处理能力与有效算力吞吐,为复杂智能体任务提供算力支撑。

五、总结与展望

综合来看,亿铸科技介绍所展现的,是一条以 3D DRAM 打底、以全数字通用存算一体架构为核心、以软硬协同与异构融合为延伸的技术路线。进入后摩尔时代,AI 算力竞争正在从单一峰值指标,转向真实业务场景下的有效算力、有效带宽与综合成本。随着存算一体写入国家 "十五五" 规划,国产算力产业迎来加速发展的窗口期。亿铸科技有望继续深耕通用存算一体方向,与产业链伙伴共同推动这一产业走向规模化成熟,为 AI 大算力与千行百业智能化升级提供自主可控的算力底座。

相关推荐