三万亿市值的长鑫,革的是谁的命
社区讨论 · 政策

三万亿市值的长鑫,革的是谁的命

算子融合了吗算子融合了吗7月29日2026/07/29 83 浏览

当一家存储芯片公司市值突破3.66万亿,吃掉小米、OPPO、vivo的存储订单,它到底在改变什么?不是国产替代,不是产能扩张,而是整个AI推理生态的底层计算架构。

我一直在做AI编译器,关注的是算子融合、内存带宽、数据搬移。长鑫的DRAM,过去是“能用”,现在变成“必须用”。这背后是存储与计算关系的一个拐点。

短期看,长鑫的上市完成了一次“存储权杖”的交接。

OVM三家手机厂,每年消耗几亿颗DRAM。过去这些订单被三星、SK海力士、美光瓜分。长鑫拿到这些客户,靠的是价格和产能吗?不完全是。更关键的是,长鑫的DDR5/LPDDR5在性能上已经追平国际一线,而国内手机厂在供应链安全上有了明确诉求。

从编译器视角看,这意味着什么?手机端的AI推理,比如大模型端侧部署,极度依赖内存带宽。LPDDR5的带宽决定了NPU的计算效率。长鑫的DRAM如果能做到和三星同频甚至更高,同时配合国产SoC(比如联发科、高通或华为麒麟)做定制化预取、刷新策略,就能在算法层面实现更低的访存延迟。

但短期看,这只是替代。替代,是存量博弈,不会改变行业格局。

长期看,长鑫的真正价值是对“存储-计算”融合架构的推动力。

我关注的是HBM和CXL。HBM堆叠技术让带宽翻了10倍,但HBM主要供应给AI训练芯片(如英伟达H100、昇腾910)。长鑫目前还没有HBM产品,但有DDR5和LPDDR5。下一步,它一定会做CXL内存池化。CXL允许CPU和GPU共享内存池,减少数据拷贝。这对AI推理场景是革命性的——推理时,模型权重和KV cache都放在CXL内存池里,多个计算节点共享,延迟可控。

但实现上,需要编译器层面做支持。比如,在昇腾上,我们需要把算子融合和内存分配策略与CXL池化深度耦合。如果长鑫的CXL内存控制器能提供更细粒度的访问延迟控制,那么编译器就能生成更高效的访存序列。现在昇腾的IR优化空间很大,很多算子融合写死了内存地址,无法利用CXL的远程内存。如果长鑫能提供类似于“CXL-aware malloc”的库,那IR优化就能再上一层楼。

另一个长期方向是存算一体。虽然长鑫现在没有这个技术,但三万亿市值给了它足够的资本去收购或研发。存算一体意味着DRAM里直接做简单计算(比如加法、乘法),减少数据搬移。这对编译器是颠覆性的——我们要重新设计IR,把计算节点映射到存储单元上。这很遥远,但值得期待。

趋势预测:

长鑫不会是下一个三星,而是“存储界的ASML”。它会成为国产AI算力底座的关键节点,推动存储与计算从“松耦合”走向“紧耦合”。未来三年,AI推理芯片的瓶颈不在算力,在内存带宽。谁能把DRAM和计算单元做在同一个物理封装里,谁就能定义下一代AI基础设施。长鑫的上市,只是一个开始。

原文链接:https://www.tmtpost.com/8083510.html

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧