群发资讯网

伯恩斯坦这篇内存需求分析逻辑值得学习 这篇真正研究的,是为什么AI算力持续增加后

伯恩斯坦这篇内存需求分析逻辑值得学习
这篇真正研究的,是为什么AI算力持续增加后,内存不再只是GPU旁边的一颗芯片。伯恩斯坦把训练、预填充、解码、RAG和Agent工作流逐一拆开,发现不同工作负载需要不同层级的内存:HBM解决高带宽,系统DRAM和SSD承担容量,CXL与新型存储负责把昂贵内存池做得更可扩展。

报告采用“工作负载—延迟与带宽—内存层级—硬件架构—供应链价值”的框架。因此,AI硬件投资要从只看HBM升级为看“数据在哪一层、由谁提供、谁能降低系统成本”。

📌 逻辑一
先拆模型处于训练还是推理,而不是把所有AI内存需求都归入HBM。训练对带宽极其敏感,模型权重和检查点会推高HBM、DRAM与存储需求;预填充是计算密集型,HBM的重要性更高;解码阶段却受到KV Cache约束,历史Token随并发用户和上下文长度线性增加,系统DRAM、容量和缓存效率变得更重要。

RAG和Agent进一步改变需求结构。RAG数据库需要大容量SSD或HDD存原始数据,检索更依赖系统DRAM;Agent每一步的输出又会成为下一步输入,KV Cache和外部工具调用会放大内存消耗。也就是说,AI从一次性训练转向持续推理,内存价值正由带宽单点向容量、互连和数据调度扩散。

⚙️ 逻辑二|
因此,配置不能只追HBM价格,还要按架构选择受益者。高带宽和先进封装仍是AI训练的核心仓;DRAM、企业SSD、CXL内存扩展、DPU与网络互连更适合捕捉推理规模化。加仓条件是云厂商提高并发与上下文长度、RAG数据库扩大、CXL服务器设计进入量产;失效条件是模型压缩大幅降低每次调用的内存占用。

当前市场关注GPU数量,却容易低估“每张卡能服务多少并发用户”对成本和毛利的影响。若内存成为吞吐瓶颈,客户会优先购买DRAM、SSD和互连。组合上保留HBM的景气弹性,同时增加推理架构升级的受益环节。

View|
研究AI硬件要先从工作负载出发,再判断哪一层内存成为瓶颈。未来值得持续跟踪四个领先变量:①推理并发和上下文长度;②KV Cache占用;③CXL服务器渗透率;④企业SSD与DRAM订单。这些变量,比GPU出货量更值得跟踪。

这篇的核心逻辑先拆到这里。更多海外投行观点、原文资料和延伸解读,请移步评论区🍵
伯恩斯坦 AI内存 HBM CXL SSD 推理算力 半导体投资