ai-ssd大模型推理的存储范式转移

2026年08月11日 | 来源:
信息源:

📋 多平台草稿预览 (12平台差异化改编)

AI SSD:大模型推理的存储范式转移,一场围绕Token的算力革命

当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。


当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。

从“算力饥渴”到“存储觉醒”

过去两年,大模型行业的军备竞赛几乎全部集中在GPU集群的规模扩张上。英伟达H100、H200乃至B200的发布,让算力成为衡量AI实力的唯一标尺。然而,当模型参数从千亿级迈向万亿级,推理场景从离线批处理转向实时交互,一个残酷的物理定律开始显现:数据搬运的速度,正在成为推理延迟的真正瓶颈。

让我们看一组直观的数据。以当前主流的MoE(混合专家)架构模型为例,一个拥有1.8万亿参数的模型,其单个Token的推理需要激活约280亿参数。这意味着,每生成一个Token,系统需要在GPU显存、CPU内存和存储层之间搬运数百MB甚至GB级的数据。而GPU的算力增长遵循摩尔定律,但PCIe带宽和NVLink带宽的增长却远未跟上。

当你以为瓶颈在算力时,真正的瓶颈早已转移至存储。

存储的“范式转移”:KV Cache与权重的新家

传统AI基础设施中,存储的角色极其简单:模型权重的一次性加载,训练检查点的定期保存。但在大模型推理的新范式下,存储需要承担三个全新的核心任务:

1. KV Cache的持久化存储

在长上下文推理场景中(如128K甚至1M Token),KV Cache(键值缓存)的体量会急剧膨胀。一个拥有70B参数的模型,处理1M Token上下文所需的KV Cache可达数百GB。如果这些数据全部驻留在GPU显存中,成本将高到无法接受。

核心逻辑:将KV Cache视为热数据,采用“显存+内存+NVMe SSD”三级缓存架构。 近期,以LMDeploy和vLLM为代表的开源推理框架,已经开始支持将KV Cache异步卸载至NVMe SSD,在需要时再按需预取回显存。

# vLLM 异步KV Cache卸载伪代码示例
from vllm import LLM, SamplingParams
import asyncio


<p align="center"><img src="https://i.qbitai.com/wp-content/uploads/2026/08/9323c761191f57365a9315b22585850f.webp" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
# 初始化推理引擎,启用KV Cache存储卸载
llm = LLM(
    model="meta-llama/Llama-3.1-70B-Instruct",
    kv_cache_dtype="auto",
    enable_kv_cache_offload=True,  # 开启SSD offload
    kv_cache_offload_device="nvme", # 指定卸载设备
    max_model_len=131072,
)

async def generate_with_offload(prompt: str):
    """
    针对超长上下文的推理请求,利用SSD承载KV Cache
    """
    sampling_params = SamplingParams(temperature=0.7, max_tokens=2048)
    result = await llm.agenerate([prompt], sampling_params)
    return result[0].outputs[0].text

这一设计将单机推理的上下文长度上限提升了数倍,同时将每Token的存储成本从DRAM级的数十美元/GB,降低至NVMe SSD级的数美元/GB。

2. 权重分片与热插拔加载

对于万亿级MoE模型,全部权重驻留显存是不可能的。业界普遍采用的方案是“按需加载”——根据当前Token所激活的专家(Expert)路由结果,仅从SSD中读取对应的权重分片至显存。

这要求存储系统具备极低延迟的随机读取能力。传统HDD的随机读取延迟高达数毫秒,完全不可用。而新一代企业级NVMe SSD(如三星PM9E3、Solidigm D7-P5800X)可将平均读取延迟压至50微秒以内,配合智能预取算法,使得专家权重的加载几乎无感。

硬件架构的深刻变革:从“以GPU为中心”到“以数据为中心”

存储范式的转移,迫使整个AI服务器硬件架构重设计。

NVMe over Fabrics (NVMe-oF) 成为标配

单机内的PCIe总线带宽终究有限。为了打破存储墙,业界开始大规模部署NVMe-oF技术,将NVMe SSD从服务器本地“拉远”至独立存储池,通过RDMA网络(RoCEv2或InfiniBand)与GPU服务器直连。

// NVMe-oF 配置示意(Linux内核block层)
# 创建NVMe-oF子系统
nvmetcli add-subsystem nqn.2026-08.com.ai-storage:token-pool
nvmetcli add-ns nqn.2026-08.com.ai-storage:token-pool --device=/dev/nvme0n1

# 在GPU服务器端连接远程存储池
modprobe nvme-rdma
nvme connect -t rdma -n nqn.2026-08.com.ai-storage:token-pool -a 192.168.1.100 -s 4420

这种架构下,GPU服务器不再需要本地大容量SSD,而是通过高速网络共享一个统一的高性能存储资源池。存储的利用率提升了3倍以上,且扩容无需中断推理服务。

计算存储(Computational Storage)的萌芽

更前沿的探索发生在存储介质内部。三星和SK海力士等原厂,正在将简单的计算引擎嵌入SSD控制器,允许在数据读取过程中直接完成部分KV Cache的过滤或重排操作,从而减少上行到GPU的无效数据传输。这被称为“存储内计算”,它预示着未来存储颗粒将不再是单纯的“仓库”,而是带有“预处理器”的智能节点。

一场围绕Token的协同调度

最深刻的变化,在于软件生态的视角转变。

传统AI框架(如PyTorch)中,存储是被动的。但在新一代的AI推理引擎(如TensorRT-LLM、DeepSpeed-Inference)中,存储IO被抽象为“Token流水线”的一个重要环节。

下图描绘了围绕单个Token生成的全链路协同:

单Token生成全链路协同调度示意图 请求解析 Token ID 映射 权重预取 专家路由 + NVMe读取 显存计算 Attention + FFN KV写回 SSD持久化 下一Token循环(复用预取权重与KV Cache) 关键指标(延迟预算) • 权重读取: 50-80μs (NVMe) — 占比 15% • GPU计算: 200-300μs — 占比 55% • KV Cache写回: 30-50μs — 占比 10% • 网络传输: 20-40μs — 占比 8% • 调度与同步: 30-60μs — 占比 12%

这种协同调度要求存储系统具备感知Token生命周期的能力。例如,当推理引擎发现某个专家权重即将被再次激活时,存储控制器可以提前将其从QLC层提升至SLC缓存层,降低读延迟;当KV Cache的访问热度下降时,则将其压缩并迁移至大容量层。

存储厂商的“AI化”求生

这场范式转移,让传统存储厂商看到了新的增长极,但也对它们提出了严苛的技术要求。

  • Solidigm 推出了针对AI推理优化的D7-P5800X系列,其4K随机读IOPS高达150万,且延迟极低。更重要的是,它引入了名为“KV优化”的固件特性,允许主机直接以Key-Value形式操作SSD,免去了文件系统层的转换开销。
  • 三星 则在研发“智能SSD”方案,试图将部分KV Cache的压缩算法下沉至SSD内部执行,从而减少数据上行流量。

这场竞争的终局,是存储不再是标准化的通用硬件,而是为AI推理深度定制的“Token加速器”。

未来展望:存储的尽头是计算,计算的尽头是存储

当我们站在2026年回望,会发现在AI基础设施的演进中,没有绝对的核心,只有围绕Token的协同。GPU负责计算,但存储决定了计算能多快启动;网络负责连接,但存储决定了连接后能拿到什么数据。

对于大模型公司而言,忽视存储优化的代价将是推理成本居高不下。据估算,在长上下文场景下,采用KV Cache卸载与智能预取技术,可将单Token的推理总成本降低40%-60%,同时将单机并发度提升数倍。

AI SSD不是一块更快的硬盘,而是一台懂得Token语义的分布式计算单元。 这才是存储范式转移的真正内涵。

写于彩虹洋葱 AI 聚合平台 · 如果你也对科技趋势感兴趣,欢迎交流。

🏷️ 大模型推理 · AI基础设施 · 存储技术

快手短视频脚本 | 时长:30-40秒

【封面字幕】(大号字体,居中)

AI SSD:大模型推理的存储范式转移,一场围绕Token的算力革命

【口播文案】(接地气风格,口语化)

老铁们,今天聊个硬核的——当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。

核心就三点:

① (从正文提取第一个关键信息)

② (从正文提取第二个关键信息)

③ (从正文提取第三个关键信息)

懂的点个赞,不懂的评论区问我,下条见!💪


🏷️ 推荐标签:大模型推理, AI基础设施, 存储技术

【微博短帖 | 140字以内核心版】

AI SSD:大模型推理的存储范式转移,一场围绕Token的算力革命:当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存……

#大模型推理 #AI基础设施 #存储技术


【微博长帖 | 可配图 9 宫格版】

AI SSD:大模型推理的存储范式转移,一场围绕Token的算力革命

当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。

#大模型推理 #AI基础设施 #存储技术 🔗 https://www.qbitai.com/2026/08/467840.html

AI SSD:大模型推理的存储范式转移,一场围绕Token的算力革命

前言

当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。


当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。

从“算力饥渴”到“存储觉醒”

过去两年,大模型行业的军备竞赛几乎全部集中在GPU集群的规模扩张上。英伟达H100、H200乃至B200的发布,让算力成为衡量AI实力的唯一标尺。然而,当模型参数从千亿级迈向万亿级,推理场景从离线批处理转向实时交互,一个残酷的物理定律开始显现:数据搬运的速度,正在成为推理延迟的真正瓶颈。

让我们看一组直观的数据。以当前主流的MoE(混合专家)架构模型为例,一个拥有1.8万亿参数的模型,其单个Token的推理需要激活约280亿参数。这意味着,每生成一个Token,系统需要在GPU显存、CPU内存和存储层之间搬运数百MB甚至GB级的数据。而GPU的算力增长遵循摩尔定律,但PCIe带宽和NVLink带宽的增长却远未跟上。

当你以为瓶颈在算力时,真正的瓶颈早已转移至存储。

存储的“范式转移”:KV Cache与权重的新家

传统AI基础设施中,存储的角色极其简单:模型权重的一次性加载,训练检查点的定期保存。但在大模型推理的新范式下,存储需要承担三个全新的核心任务:

1. KV Cache的持久化存储

在长上下文推理场景中(如128K甚至1M Token),KV Cache(键值缓存)的体量会急剧膨胀。一个拥有70B参数的模型,处理1M Token上下文所需的KV Cache可达数百GB。如果这些数据全部驻留在GPU显存中,成本将高到无法接受。

核心逻辑:将KV Cache视为热数据,采用“显存+内存+NVMe SSD”三级缓存架构。 近期,以LMDeploy和vLLM为代表的开源推理框架,已经开始支持将KV Cache异步卸载至NVMe SSD,在需要时再按需预取回显存。

# vLLM 异步KV Cache卸载伪代码示例
from vllm import LLM, SamplingParams
import asyncio


<p align="center"><img src="https://i.qbitai.com/wp-content/uploads/2026/08/9323c761191f57365a9315b22585850f.webp" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
# 初始化推理引擎,启用KV Cache存储卸载
llm = LLM(
    model="meta-llama/Llama-3.1-70B-Instruct",
    kv_cache_dtype="auto",
    enable_kv_cache_offload=True,  # 开启SSD offload
    kv_cache_offload_device="nvme", # 指定卸载设备
    max_model_len=131072,
)

async def generate_with_offload(prompt: str):
    """
    针对超长上下文的推理请求,利用SSD承载KV Cache
    """
    sampling_params = SamplingParams(temperature=0.7, max_tokens=2048)
    result = await llm.agenerate([prompt], sampling_params)
    return result[0].outputs[0].text

这一设计将单机推理的上下文长度上限提升了数倍,同时将每Token的存储成本从DRAM级的数十美元/GB,降低至NVMe SSD级的数美元/GB。

2. 权重分片与热插拔加载

对于万亿级MoE模型,全部权重驻留显存是不可能的。业界普遍采用的方案是“按需加载”——根据当前Token所激活的专家(Expert)路由结果,仅从SSD中读取对应的权重分片至显存。

这要求存储系统具备极低延迟的随机读取能力。传统HDD的随机读取延迟高达数毫秒,完全不可用。而新一代企业级NVMe SSD(如三星PM9E3、Solidigm D7-P5800X)可将平均读取延迟压至50微秒以内,配合智能预取算法,使得专家权重的加载几乎无感。

硬件架构的深刻变革:从“以GPU为中心”到“以数据为中心”

存储范式的转移,迫使整个AI服务器硬件架构重设计。

NVMe over Fabrics (NVMe-oF) 成为标配

单机内的PCIe总线带宽终究有限。为了打破存储墙,业界开始大规模部署NVMe-oF技术,将NVMe SSD从服务器本地“拉远”至独立存储池,通过RDMA网络(RoCEv2或InfiniBand)与GPU服务器直连。

// NVMe-oF 配置示意(Linux内核block层)
# 创建NVMe-oF子系统
nvmetcli add-subsystem nqn.2026-08.com.ai-storage:token-pool
nvmetcli add-ns nqn.2026-08.com.ai-storage:token-pool --device=/dev/nvme0n1

# 在GPU服务器端连接远程存储池
modprobe nvme-rdma
nvme connect -t rdma -n nqn.2026-08.com.ai-storage:token-pool -a 192.168.1.100 -s 4420

这种架构下,GPU服务器不再需要本地大容量SSD,而是通过高速网络共享一个统一的高性能存储资源池。存储的利用率提升了3倍以上,且扩容无需中断推理服务。

计算存储(Computational Storage)的萌芽

更前沿的探索发生在存储介质内部。三星和SK海力士等原厂,正在将简单的计算引擎嵌入SSD控制器,允许在数据读取过程中直接完成部分KV Cache的过滤或重排操作,从而减少上行到GPU的无效数据传输。这被称为“存储内计算”,它预示着未来存储颗粒将不再是单纯的“仓库”,而是带有“预处理器”的智能节点。

一场围绕Token的协同调度

最深刻的变化,在于软件生态的视角转变。

传统AI框架(如PyTorch)中,存储是被动的。但在新一代的AI推理引擎(如TensorRT-LLM、DeepSpeed-Inference)中,存储IO被抽象为“Token流水线”的一个重要环节。

下图描绘了围绕单个Token生成的全链路协同:

单Token生成全链路协同调度示意图 请求解析 Token ID 映射 权重预取 专家路由 + NVMe读取 显存计算 Attention + FFN KV写回 SSD持久化 下一Token循环(复用预取权重与KV Cache) 关键指标(延迟预算) • 权重读取: 50-80μs (NVMe) — 占比 15% • GPU计算: 200-300μs — 占比 55% • KV Cache写回: 30-50μs — 占比 10% • 网络传输: 20-40μs — 占比 8% • 调度与同步: 30-60μs — 占比 12%

这种协同调度要求存储系统具备感知Token生命周期的能力。例如,当推理引擎发现某个专家权重即将被再次激活时,存储控制器可以提前将其从QLC层提升至SLC缓存层,降低读延迟;当KV Cache的访问热度下降时,则将其压缩并迁移至大容量层。

存储厂商的“AI化”求生

这场范式转移,让传统存储厂商看到了新的增长极,但也对它们提出了严苛的技术要求。

  • Solidigm 推出了针对AI推理优化的D7-P5800X系列,其4K随机读IOPS高达150万,且延迟极低。更重要的是,它引入了名为“KV优化”的固件特性,允许主机直接以Key-Value形式操作SSD,免去了文件系统层的转换开销。
  • 三星 则在研发“智能SSD”方案,试图将部分KV Cache的压缩算法下沉至SSD内部执行,从而减少数据上行流量。

这场竞争的终局,是存储不再是标准化的通用硬件,而是为AI推理深度定制的“Token加速器”。

未来展望:存储的尽头是计算,计算的尽头是存储

当我们站在2026年回望,会发现在AI基础设施的演进中,没有绝对的核心,只有围绕Token的协同。GPU负责计算,但存储决定了计算能多快启动;网络负责连接,但存储决定了连接后能拿到什么数据。

对于大模型公司而言,忽视存储优化的代价将是推理成本居高不下。据估算,在长上下文场景下,采用KV Cache卸载与智能预取技术,可将单Token的推理总成本降低40%-60%,同时将单机并发度提升数倍。

AI SSD不是一块更快的硬盘,而是一台懂得Token语义的分布式计算单元。 这才是存储范式转移的真正内涵。

总结

本文梳理了相关技术/事件的核心脉络。如有错误欢迎在评论区指正。


📂 分类:大模型推理 · AI基础设施 · 存储技术

© 本文由彩虹洋葱 AI 自动聚合,转载请注明出处。

AI SSD:大模型推理的存储范式转移,一场围绕Token的算力革命

当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。

当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。

从“算力饥渴”到“存储觉醒”

过去两年,大模型行业的军备竞赛几乎全部集中在GPU集群的规模扩张上。英伟达H100、H200乃至B200的发布,让算力成为衡量AI实力的唯一标尺。然而,当模型参数从千亿级迈向万亿级,推理场景从离线批处理转向实时交互,一个残酷的物理定律开始显现:数据搬运的速度,正在成为推理延迟的真正瓶颈。

让我们看一组直观的数据。以当前主流的MoE(混合专家)架构模型为例,一个拥有1.8万亿参数的模型,其单个Token的推理需要激活约280亿参数。这意味着,每生成一个Token,系统需要在GPU显存、CPU内存和存储层之间搬运数百MB甚至GB级的数据。而GPU的算力增长遵循摩尔定律,但PCIe带宽和NVLink带宽的增长却远未跟上。

当你以为瓶颈在算力时,真正的瓶颈早已转移至存储。

存储的“范式转移”:KV Cache与权重的新家

传统AI基础设施中,存储的角色极其简单:模型权重的一次性加载,训练检查点的定期保存。但在大模型推理的新范式下,存储需要承担三个全新的核心任务:

1. KV Cache的持久化存储

在长上下文推理场景中(如128K甚至1M Token),KV Cache(键值缓存)的体量会急剧膨胀。一个拥有70B参数的模型,处理1M Token上下文所需的KV Cache可达数百GB。如果这些数据全部驻留在GPU显存中,成本将高到无法接受。

核心逻辑:将KV Cache视为热数据,采用“显存+内存+NVMe SSD”三级缓存架构。 近期,以LMDeploy和vLLM为代表的开源推理框架,已经开始支持将KV Cache异步卸载至NVMe SSD,在需要时再按需预取回显存。

# vLLM 异步KV Cache卸载伪代码示例
from vllm import LLM, SamplingParams
import asyncio


<p align="center"><img src="https://i.qbitai.com/wp-content/uploads/2026/08/9323c761191f57365a9315b22585850f.webp" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
# 初始化推理引擎,启用KV Cache存储卸载
llm = LLM(
    model="meta-llama/Llama-3.1-70B-Instruct",
    kv_cache_dtype="auto",
    enable_kv_cache_offload=True,  # 开启SSD offload
    kv_cache_offload_device="nvme", # 指定卸载设备
    max_model_len=131072,
)

async def generate_with_offload(prompt: str):
    """
    针对超长上下文的推理请求,利用SSD承载KV Cache
    """
    sampling_params = SamplingParams(temperature=0.7, max_tokens=2048)
    result = await llm.agenerate([prompt], sampling_params)
    return result[0].outputs[0].text

这一设计将单机推理的上下文长度上限提升了数倍,同时将每Token的存储成本从DRAM级的数十美元/GB,降低至NVMe SSD级的数美元/GB。

2. 权重分片与热插拔加载

对于万亿级MoE模型,全部权重驻留显存是不可能的。业界普遍采用的方案是“按需加载”——根据当前Token所激活的专家(Expert)路由结果,仅从SSD中读取对应的权重分片至显存。

这要求存储系统具备极低延迟的随机读取能力。传统HDD的随机读取延迟高达数毫秒,完全不可用。而新一代企业级NVMe SSD(如三星PM9E3、Solidigm D7-P5800X)可将平均读取延迟压至50微秒以内,配合智能预取算法,使得专家权重的加载几乎无感。

硬件架构的深刻变革:从“以GPU为中心”到“以数据为中心”

存储范式的转移,迫使整个AI服务器硬件架构重设计。

NVMe over Fabrics (NVMe-oF) 成为标配

单机内的PCIe总线带宽终究有限。为了打破存储墙,业界开始大规模部署NVMe-oF技术,将NVMe SSD从服务器本地“拉远”至独立存储池,通过RDMA网络(RoCEv2或InfiniBand)与GPU服务器直连。

// NVMe-oF 配置示意(Linux内核block层)
# 创建NVMe-oF子系统
nvmetcli add-subsystem nqn.2026-08.com.ai-storage:token-pool
nvmetcli add-ns nqn.2026-08.com.ai-storage:token-pool --device=/dev/nvme0n1

# 在GPU服务器端连接远程存储池
modprobe nvme-rdma
nvme connect -t rdma -n nqn.2026-08.com.ai-storage:token-pool -a 192.168.1.100 -s 4420

这种架构下,GPU服务器不再需要本地大容量SSD,而是通过高速网络共享一个统一的高性能存储资源池。存储的利用率提升了3倍以上,且扩容无需中断推理服务。

计算存储(Computational Storage)的萌芽

更前沿的探索发生在存储介质内部。三星和SK海力士等原厂,正在将简单的计算引擎嵌入SSD控制器,允许在数据读取过程中直接完成部分KV Cache的过滤或重排操作,从而减少上行到GPU的无效数据传输。这被称为“存储内计算”,它预示着未来存储颗粒将不再是单纯的“仓库”,而是带有“预处理器”的智能节点。

一场围绕Token的协同调度

最深刻的变化,在于软件生态的视角转变。

传统AI框架(如PyTorch)中,存储是被动的。但在新一代的AI推理引擎(如TensorRT-LLM、DeepSpeed-Inference)中,存储IO被抽象为“Token流水线”的一个重要环节。

下图描绘了围绕单个Token生成的全链路协同:

单Token生成全链路协同调度示意图 请求解析 Token ID 映射 权重预取 专家路由 + NVMe读取 显存计算 Attention + FFN KV写回 SSD持久化 下一Token循环(复用预取权重与KV Cache) 关键指标(延迟预算) • 权重读取: 50-80μs (NVMe) — 占比 15% • GPU计算: 200-300μs — 占比 55% • KV Cache写回: 30-50μs — 占比 10% • 网络传输: 20-40μs — 占比 8% • 调度与同步: 30-60μs — 占比 12%

这种协同调度要求存储系统具备感知Token生命周期的能力。例如,当推理引擎发现某个专家权重即将被再次激活时,存储控制器可以提前将其从QLC层提升至SLC缓存层,降低读延迟;当KV Cache的访问热度下降时,则将其压缩并迁移至大容量层。

存储厂商的“AI化”求生

这场范式转移,让传统存储厂商看到了新的增长极,但也对它们提出了严苛的技术要求。

  • Solidigm 推出了针对AI推理优化的D7-P5800X系列,其4K随机读IOPS高达150万,且延迟极低。更重要的是,它引入了名为“KV优化”的固件特性,允许主机直接以Key-Value形式操作SSD,免去了文件系统层的转换开销。
  • 三星 则在研发“智能SSD”方案,试图将部分KV Cache的压缩算法下沉至SSD内部执行,从而减少数据上行流量。

这场竞争的终局,是存储不再是标准化的通用硬件,而是为AI推理深度定制的“Token加速器”。

未来展望:存储的尽头是计算,计算的尽头是存储

当我们站在2026年回望,会发现在AI基础设施的演进中,没有绝对的核心,只有围绕Token的协同。GPU负责计算,但存储决定了计算能多快启动;网络负责连接,但存储决定了连接后能拿到什么数据。

对于大模型公司而言,忽视存储优化的代价将是推理成本居高不下。据估算,在长上下文场景下,采用KV Cache卸载与智能预取技术,可将单Token的推理总成本降低40%-60%,同时将单机并发度提升数倍。

AI SSD不是一块更快的硬盘,而是一台懂得Token语义的分布式计算单元。 这才是存储范式转移的真正内涵。

总结 & 思考

以上为当前进展的梳理。欢迎在评论区交流技术细节和不同观点。


🏷️ 标签:大模型推理 · AI基础设施 · 存储技术

👍 如果对你有帮助,请点赞收藏支持

AI SSD:大模型推理的存储范式转移,一场围绕Token的算力革命

当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。

当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。

从“算力饥渴”到“存储觉醒”

过去两年,大模型行业的军备竞赛几乎全部集中在GPU集群的规模扩张上。英伟达H100、H200乃至B200的发布,让算力成为衡量AI实力的唯一标尺。然而,当模型参数从千亿级迈向万亿级,推理场景从离线批处理转向实时交互,一个残酷的物理定律开始显现:数据搬运的速度,正在成为推理延迟的真正瓶颈。

让我们看一组直观的数据。以当前主流的MoE(混合专家)架构模型为例,一个拥有1.8万亿参数的模型,其单个Token的推理需要激活约280亿参数。这意味着,每生成一个Token,系统需要在GPU显存、CPU内存和存储层之间搬运数百MB甚至GB级的数据。而GPU的算力增长遵循摩尔定律,但PCIe带宽和NVLink带宽的增长却远未跟上。

当你以为瓶颈在算力时,真正的瓶颈早已转移至存储。

存储的“范式转移”:KV Cache与权重的新家

传统AI基础设施中,存储的角色极其简单:模型权重的一次性加载,训练检查点的定期保存。但在大模型推理的新范式下,存储需要承担三个全新的核心任务:

1. KV Cache的持久化存储

在长上下文推理场景中(如128K甚至1M Token),KV Cache(键值缓存)的体量会急剧膨胀。一个拥有70B参数的模型,处理1M Token上下文所需的KV Cache可达数百GB。如果这些数据全部驻留在GPU显存中,成本将高到无法接受。

核心逻辑:将KV Cache视为热数据,采用“显存+内存+NVMe SSD”三级缓存架构。 近期,以LMDeploy和vLLM为代表的开源推理框架,已经开始支持将KV Cache异步卸载至NVMe SSD,在需要时再按需预取回显存。

# vLLM 异步KV Cache卸载伪代码示例
from vllm import LLM, SamplingParams
import asyncio


<p align="center"><img src="https://i.qbitai.com/wp-content/uploads/2026/08/9323c761191f57365a9315b22585850f.webp" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
# 初始化推理引擎,启用KV Cache存储卸载
llm = LLM(
    model="meta-llama/Llama-3.1-70B-Instruct",
    kv_cache_dtype="auto",
    enable_kv_cache_offload=True,  # 开启SSD offload
    kv_cache_offload_device="nvme", # 指定卸载设备
    max_model_len=131072,
)

async def generate_with_offload(prompt: str):
    """
    针对超长上下文的推理请求,利用SSD承载KV Cache
    """
    sampling_params = SamplingParams(temperature=0.7, max_tokens=2048)
    result = await llm.agenerate([prompt], sampling_params)
    return result[0].outputs[0].text

这一设计将单机推理的上下文长度上限提升了数倍,同时将每Token的存储成本从DRAM级的数十美元/GB,降低至NVMe SSD级的数美元/GB。

2. 权重分片与热插拔加载

对于万亿级MoE模型,全部权重驻留显存是不可能的。业界普遍采用的方案是“按需加载”——根据当前Token所激活的专家(Expert)路由结果,仅从SSD中读取对应的权重分片至显存。

这要求存储系统具备极低延迟的随机读取能力。传统HDD的随机读取延迟高达数毫秒,完全不可用。而新一代企业级NVMe SSD(如三星PM9E3、Solidigm D7-P5800X)可将平均读取延迟压至50微秒以内,配合智能预取算法,使得专家权重的加载几乎无感。

硬件架构的深刻变革:从“以GPU为中心”到“以数据为中心”

存储范式的转移,迫使整个AI服务器硬件架构重设计。

NVMe over Fabrics (NVMe-oF) 成为标配

单机内的PCIe总线带宽终究有限。为了打破存储墙,业界开始大规模部署NVMe-oF技术,将NVMe SSD从服务器本地“拉远”至独立存储池,通过RDMA网络(RoCEv2或InfiniBand)与GPU服务器直连。

// NVMe-oF 配置示意(Linux内核block层)
# 创建NVMe-oF子系统
nvmetcli add-subsystem nqn.2026-08.com.ai-storage:token-pool
nvmetcli add-ns nqn.2026-08.com.ai-storage:token-pool --device=/dev/nvme0n1

# 在GPU服务器端连接远程存储池
modprobe nvme-rdma
nvme connect -t rdma -n nqn.2026-08.com.ai-storage:token-pool -a 192.168.1.100 -s 4420

这种架构下,GPU服务器不再需要本地大容量SSD,而是通过高速网络共享一个统一的高性能存储资源池。存储的利用率提升了3倍以上,且扩容无需中断推理服务。

计算存储(Computational Storage)的萌芽

更前沿的探索发生在存储介质内部。三星和SK海力士等原厂,正在将简单的计算引擎嵌入SSD控制器,允许在数据读取过程中直接完成部分KV Cache的过滤或重排操作,从而减少上行到GPU的无效数据传输。这被称为“存储内计算”,它预示着未来存储颗粒将不再是单纯的“仓库”,而是带有“预处理器”的智能节点。

一场围绕Token的协同调度

最深刻的变化,在于软件生态的视角转变。

传统AI框架(如PyTorch)中,存储是被动的。但在新一代的AI推理引擎(如TensorRT-LLM、DeepSpeed-Inference)中,存储IO被抽象为“Token流水线”的一个重要环节。

下图描绘了围绕单个Token生成的全链路协同:

单Token生成全链路协同调度示意图 请求解析 Token ID 映射 权重预取 专家路由 + NVMe读取 显存计算 Attention + FFN KV写回 SSD持久化 下一Token循环(复用预取权重与KV Cache) 关键指标(延迟预算) • 权重读取: 50-80μs (NVMe) — 占比 15% • GPU计算: 200-300μs — 占比 55% • KV Cache写回: 30-50μs — 占比 10% • 网络传输: 20-40μs — 占比 8% • 调度与同步: 30-60μs — 占比 12%

这种协同调度要求存储系统具备感知Token生命周期的能力。例如,当推理引擎发现某个专家权重即将被再次激活时,存储控制器可以提前将其从QLC层提升至SLC缓存层,降低读延迟;当KV Cache的访问热度下降时,则将其压缩并迁移至大容量层。

存储厂商的“AI化”求生

这场范式转移,让传统存储厂商看到了新的增长极,但也对它们提出了严苛的技术要求。

  • Solidigm 推出了针对AI推理优化的D7-P5800X系列,其4K随机读IOPS高达150万,且延迟极低。更重要的是,它引入了名为“KV优化”的固件特性,允许主机直接以Key-Value形式操作SSD,免去了文件系统层的转换开销。
  • 三星 则在研发“智能SSD”方案,试图将部分KV Cache的压缩算法下沉至SSD内部执行,从而减少数据上行流量。

这场竞争的终局,是存储不再是标准化的通用硬件,而是为AI推理深度定制的“Token加速器”。

未来展望:存储的尽头是计算,计算的尽头是存储

当我们站在2026年回望,会发现在AI基础设施的演进中,没有绝对的核心,只有围绕Token的协同。GPU负责计算,但存储决定了计算能多快启动;网络负责连接,但存储决定了连接后能拿到什么数据。

对于大模型公司而言,忽视存储优化的代价将是推理成本居高不下。据估算,在长上下文场景下,采用KV Cache卸载与智能预取技术,可将单Token的推理总成本降低40%-60%,同时将单机并发度提升数倍。

AI SSD不是一块更快的硬盘,而是一台懂得Token语义的分布式计算单元。 这才是存储范式转移的真正内涵。

信息源:量子位 - AI SSD:大模型推理的存储范式转移 标签:大模型推理, AI基础设施, 存储技术

AI SSD:大模型推理的存储范式转移,一场围绕Token的算力革命

摘要:> 当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。

从“算力饥渴”到“存储觉醒”

过去两年,大模型行业的军备竞赛几乎全部集中在GPU集群的规模扩张上。英伟达H100、H200乃至B2……


当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。

从“算力饥渴”到“存储觉醒”

过去两年,大模型行业的军备竞赛几乎全部集中在GPU集群的规模扩张上。英伟达H100、H200乃至B200的发布,让算力成为衡量AI实力的唯一标尺。然而,当模型参数从千亿级迈向万亿级,推理场景从离线批处理转向实时交互,一个残酷的物理定律开始显现:数据搬运的速度,正在成为推理延迟的真正瓶颈。

让我们看一组直观的数据。以当前主流的MoE(混合专家)架构模型为例,一个拥有1.8万亿参数的模型,其单个Token的推理需要激活约280亿参数。这意味着,每生成一个Token,系统需要在GPU显存、CPU内存和存储层之间搬运数百MB甚至GB级的数据。而GPU的算力增长遵循摩尔定律,但PCIe带宽和NVLink带宽的增长却远未跟上。

当你以为瓶颈在算力时,真正的瓶颈早已转移至存储。

存储的“范式转移”:KV Cache与权重的新家

传统AI基础设施中,存储的角色极其简单:模型权重的一次性加载,训练检查点的定期保存。但在大模型推理的新范式下,存储需要承担三个全新的核心任务:

1. KV Cache的持久化存储

在长上下文推理场景中(如128K甚至1M Token),KV Cache(键值缓存)的体量会急剧膨胀。一个拥有70B参数的模型,处理1M Token上下文所需的KV Cache可达数百GB。如果这些数据全部驻留在GPU显存中,成本将高到无法接受。

核心逻辑:将KV Cache视为热数据,采用“显存+内存+NVMe SSD”三级缓存架构。 近期,以LMDeploy和vLLM为代表的开源推理框架,已经开始支持将KV Cache异步卸载至NVMe SSD,在需要时再按需预取回显存。

# vLLM 异步KV Cache卸载伪代码示例
from vllm import LLM, SamplingParams
import asyncio


<p align="center"><img src="https://i.qbitai.com/wp-content/uploads/2026/08/9323c761191f57365a9315b22585850f.webp" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
# 初始化推理引擎,启用KV Cache存储卸载
llm = LLM(
    model="meta-llama/Llama-3.1-70B-Instruct",
    kv_cache_dtype="auto",
    enable_kv_cache_offload=True,  # 开启SSD offload
    kv_cache_offload_device="nvme", # 指定卸载设备
    max_model_len=131072,
)

async def generate_with_offload(prompt: str):
    """
    针对超长上下文的推理请求,利用SSD承载KV Cache
    """
    sampling_params = SamplingParams(temperature=0.7, max_tokens=2048)
    result = await llm.agenerate([prompt], sampling_params)
    return result[0].outputs[0].text

这一设计将单机推理的上下文长度上限提升了数倍,同时将每Token的存储成本从DRAM级的数十美元/GB,降低至NVMe SSD级的数美元/GB。

2. 权重分片与热插拔加载

对于万亿级MoE模型,全部权重驻留显存是不可能的。业界普遍采用的方案是“按需加载”——根据当前Token所激活的专家(Expert)路由结果,仅从SSD中读取对应的权重分片至显存。

这要求存储系统具备极低延迟的随机读取能力。传统HDD的随机读取延迟高达数毫秒,完全不可用。而新一代企业级NVMe SSD(如三星PM9E3、Solidigm D7-P5800X)可将平均读取延迟压至50微秒以内,配合智能预取算法,使得专家权重的加载几乎无感。

硬件架构的深刻变革:从“以GPU为中心”到“以数据为中心”

存储范式的转移,迫使整个AI服务器硬件架构重设计。

NVMe over Fabrics (NVMe-oF) 成为标配

单机内的PCIe总线带宽终究有限。为了打破存储墙,业界开始大规模部署NVMe-oF技术,将NVMe SSD从服务器本地“拉远”至独立存储池,通过RDMA网络(RoCEv2或InfiniBand)与GPU服务器直连。

// NVMe-oF 配置示意(Linux内核block层)
# 创建NVMe-oF子系统
nvmetcli add-subsystem nqn.2026-08.com.ai-storage:token-pool
nvmetcli add-ns nqn.2026-08.com.ai-storage:token-pool --device=/dev/nvme0n1

# 在GPU服务器端连接远程存储池
modprobe nvme-rdma
nvme connect -t rdma -n nqn.2026-08.com.ai-storage:token-pool -a 192.168.1.100 -s 4420

这种架构下,GPU服务器不再需要本地大容量SSD,而是通过高速网络共享一个统一的高性能存储资源池。存储的利用率提升了3倍以上,且扩容无需中断推理服务。

计算存储(Computational Storage)的萌芽

更前沿的探索发生在存储介质内部。三星和SK海力士等原厂,正在将简单的计算引擎嵌入SSD控制器,允许在数据读取过程中直接完成部分KV Cache的过滤或重排操作,从而减少上行到GPU的无效数据传输。这被称为“存储内计算”,它预示着未来存储颗粒将不再是单纯的“仓库”,而是带有“预处理器”的智能节点。

一场围绕Token的协同调度

最深刻的变化,在于软件生态的视角转变。

传统AI框架(如PyTorch)中,存储是被动的。但在新一代的AI推理引擎(如TensorRT-LLM、DeepSpeed-Inference)中,存储IO被抽象为“Token流水线”的一个重要环节。

下图描绘了围绕单个Token生成的全链路协同:

单Token生成全链路协同调度示意图 请求解析 Token ID 映射 权重预取 专家路由 + NVMe读取 显存计算 Attention + FFN KV写回 SSD持久化 下一Token循环(复用预取权重与KV Cache) 关键指标(延迟预算) • 权重读取: 50-80μs (NVMe) — 占比 15% • GPU计算: 200-300μs — 占比 55% • KV Cache写回: 30-50μs — 占比 10% • 网络传输: 20-40μs — 占比 8% • 调度与同步: 30-60μs — 占比 12%

这种协同调度要求存储系统具备感知Token生命周期的能力。例如,当推理引擎发现某个专家权重即将被再次激活时,存储控制器可以提前将其从QLC层提升至SLC缓存层,降低读延迟;当KV Cache的访问热度下降时,则将其压缩并迁移至大容量层。

存储厂商的“AI化”求生

这场范式转移,让传统存储厂商看到了新的增长极,但也对它们提出了严苛的技术要求。

  • Solidigm 推出了针对AI推理优化的D7-P5800X系列,其4K随机读IOPS高达150万,且延迟极低。更重要的是,它引入了名为“KV优化”的固件特性,允许主机直接以Key-Value形式操作SSD,免去了文件系统层的转换开销。
  • 三星 则在研发“智能SSD”方案,试图将部分KV Cache的压缩算法下沉至SSD内部执行,从而减少数据上行流量。

这场竞争的终局,是存储不再是标准化的通用硬件,而是为AI推理深度定制的“Token加速器”。

未来展望:存储的尽头是计算,计算的尽头是存储

当我们站在2026年回望,会发现在AI基础设施的演进中,没有绝对的核心,只有围绕Token的协同。GPU负责计算,但存储决定了计算能多快启动;网络负责连接,但存储决定了连接后能拿到什么数据。

对于大模型公司而言,忽视存储优化的代价将是推理成本居高不下。据估算,在长上下文场景下,采用KV Cache卸载与智能预取技术,可将单Token的推理总成本降低40%-60%,同时将单机并发度提升数倍。

AI SSD不是一块更快的硬盘,而是一台懂得Token语义的分布式计算单元。 这才是存储范式转移的真正内涵。

📌 来源:量子位 | 标签:大模型推理 · AI基础设施 · 存储技术

本文由彩虹洋葱 AI 自动聚合生成,仅供参考,不构成任何投资或决策建议。

问题:如何看待「AI SSD:大模型推理的存储范式转移,一场围绕Token的算力革命」?

当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。


当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。

从“算力饥渴”到“存储觉醒”

过去两年,大模型行业的军备竞赛几乎全部集中在GPU集群的规模扩张上。英伟达H100、H200乃至B200的发布,让算力成为衡量AI实力的唯一标尺。然而,当模型参数从千亿级迈向万亿级,推理场景从离线批处理转向实时交互,一个残酷的物理定律开始显现:数据搬运的速度,正在成为推理延迟的真正瓶颈。

让我们看一组直观的数据。以当前主流的MoE(混合专家)架构模型为例,一个拥有1.8万亿参数的模型,其单个Token的推理需要激活约280亿参数。这意味着,每生成一个Token,系统需要在GPU显存、CPU内存和存储层之间搬运数百MB甚至GB级的数据。而GPU的算力增长遵循摩尔定律,但PCIe带宽和NVLink带宽的增长却远未跟上。

当你以为瓶颈在算力时,真正的瓶颈早已转移至存储。

存储的“范式转移”:KV Cache与权重的新家

传统AI基础设施中,存储的角色极其简单:模型权重的一次性加载,训练检查点的定期保存。但在大模型推理的新范式下,存储需要承担三个全新的核心任务:

1. KV Cache的持久化存储

在长上下文推理场景中(如128K甚至1M Token),KV Cache(键值缓存)的体量会急剧膨胀。一个拥有70B参数的模型,处理1M Token上下文所需的KV Cache可达数百GB。如果这些数据全部驻留在GPU显存中,成本将高到无法接受。

核心逻辑:将KV Cache视为热数据,采用“显存+内存+NVMe SSD”三级缓存架构。 近期,以LMDeploy和vLLM为代表的开源推理框架,已经开始支持将KV Cache异步卸载至NVMe SSD,在需要时再按需预取回显存。

# vLLM 异步KV Cache卸载伪代码示例
from vllm import LLM, SamplingParams
import asyncio


<p align="center"><img src="https://i.qbitai.com/wp-content/uploads/2026/08/9323c761191f57365a9315b22585850f.webp" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
# 初始化推理引擎,启用KV Cache存储卸载
llm = LLM(
    model="meta-llama/Llama-3.1-70B-Instruct",
    kv_cache_dtype="auto",
    enable_kv_cache_offload=True,  # 开启SSD offload
    kv_cache_offload_device="nvme", # 指定卸载设备
    max_model_len=131072,
)

async def generate_with_offload(prompt: str):
    """
    针对超长上下文的推理请求,利用SSD承载KV Cache
    """
    sampling_params = SamplingParams(temperature=0.7, max_tokens=2048)
    result = await llm.agenerate([prompt], sampling_params)
    return result[0].outputs[0].text

这一设计将单机推理的上下文长度上限提升了数倍,同时将每Token的存储成本从DRAM级的数十美元/GB,降低至NVMe SSD级的数美元/GB。

2. 权重分片与热插拔加载

对于万亿级MoE模型,全部权重驻留显存是不可能的。业界普遍采用的方案是“按需加载”——根据当前Token所激活的专家(Expert)路由结果,仅从SSD中读取对应的权重分片至显存。

这要求存储系统具备极低延迟的随机读取能力。传统HDD的随机读取延迟高达数毫秒,完全不可用。而新一代企业级NVMe SSD(如三星PM9E3、Solidigm D7-P5800X)可将平均读取延迟压至50微秒以内,配合智能预取算法,使得专家权重的加载几乎无感。

硬件架构的深刻变革:从“以GPU为中心”到“以数据为中心”

存储范式的转移,迫使整个AI服务器硬件架构重设计。

NVMe over Fabrics (NVMe-oF) 成为标配

单机内的PCIe总线带宽终究有限。为了打破存储墙,业界开始大规模部署NVMe-oF技术,将NVMe SSD从服务器本地“拉远”至独立存储池,通过RDMA网络(RoCEv2或InfiniBand)与GPU服务器直连。

// NVMe-oF 配置示意(Linux内核block层)
# 创建NVMe-oF子系统
nvmetcli add-subsystem nqn.2026-08.com.ai-storage:token-pool
nvmetcli add-ns nqn.2026-08.com.ai-storage:token-pool --device=/dev/nvme0n1

# 在GPU服务器端连接远程存储池
modprobe nvme-rdma
nvme connect -t rdma -n nqn.2026-08.com.ai-storage:token-pool -a 192.168.1.100 -s 4420

这种架构下,GPU服务器不再需要本地大容量SSD,而是通过高速网络共享一个统一的高性能存储资源池。存储的利用率提升了3倍以上,且扩容无需中断推理服务。

计算存储(Computational Storage)的萌芽

更前沿的探索发生在存储介质内部。三星和SK海力士等原厂,正在将简单的计算引擎嵌入SSD控制器,允许在数据读取过程中直接完成部分KV Cache的过滤或重排操作,从而减少上行到GPU的无效数据传输。这被称为“存储内计算”,它预示着未来存储颗粒将不再是单纯的“仓库”,而是带有“预处理器”的智能节点。

一场围绕Token的协同调度

最深刻的变化,在于软件生态的视角转变。

传统AI框架(如PyTorch)中,存储是被动的。但在新一代的AI推理引擎(如TensorRT-LLM、DeepSpeed-Inference)中,存储IO被抽象为“Token流水线”的一个重要环节。

下图描绘了围绕单个Token生成的全链路协同:

单Token生成全链路协同调度示意图 请求解析 Token ID 映射 权重预取 专家路由 + NVMe读取 显存计算 Attention + FFN KV写回 SSD持久化 下一Token循环(复用预取权重与KV Cache) 关键指标(延迟预算) • 权重读取: 50-80μs (NVMe) — 占比 15% • GPU计算: 200-300μs — 占比 55% • KV Cache写回: 30-50μs — 占比 10% • 网络传输: 20-40μs — 占比 8% • 调度与同步: 30-60μs — 占比 12%

这种协同调度要求存储系统具备感知Token生命周期的能力。例如,当推理引擎发现某个专家权重即将被再次激活时,存储控制器可以提前将其从QLC层提升至SLC缓存层,降低读延迟;当KV Cache的访问热度下降时,则将其压缩并迁移至大容量层。

存储厂商的“AI化”求生

这场范式转移,让传统存储厂商看到了新的增长极,但也对它们提出了严苛的技术要求。

  • Solidigm 推出了针对AI推理优化的D7-P5800X系列,其4K随机读IOPS高达150万,且延迟极低。更重要的是,它引入了名为“KV优化”的固件特性,允许主机直接以Key-Value形式操作SSD,免去了文件系统层的转换开销。
  • 三星 则在研发“智能SSD”方案,试图将部分KV Cache的压缩算法下沉至SSD内部执行,从而减少数据上行流量。

这场竞争的终局,是存储不再是标准化的通用硬件,而是为AI推理深度定制的“Token加速器”。

未来展望:存储的尽头是计算,计算的尽头是存储

当我们站在2026年回望,会发现在AI基础设施的演进中,没有绝对的核心,只有围绕Token的协同。GPU负责计算,但存储决定了计算能多快启动;网络负责连接,但存储决定了连接后能拿到什么数据。

对于大模型公司而言,忽视存储优化的代价将是推理成本居高不下。据估算,在长上下文场景下,采用KV Cache卸载与智能预取技术,可将单Token的推理总成本降低40%-60%,同时将单机并发度提升数倍。

AI SSD不是一块更快的硬盘,而是一台懂得Token语义的分布式计算单元。 这才是存储范式转移的真正内涵。

总结: 以上分析基于公开信息整理。核心在于理解这一事件/技术背后的驱动力,而非停留在表面叙事。欢迎在评论区交流你的看法。

📎 参考来源:量子位 - AI SSD:大模型推理的存储范式转移

🔗 原文链接:https://www.qbitai.com/2026/08/467840.html

📺 B站视频脚本 | 时长:3-5分钟

【片头 0:00-0:15】BGM起 → 标题字幕弹出

AI SSD:大模型推理的存储范式转移,一场围绕Token的算力革命

【引子 0:15-0:45】制造悬念

当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。

【时间轴分镜】

├ [00:02] > 当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——……

├ [02:04] 过去两年,大模型行业的军备竞赛几乎全部集中在GPU集群的规模扩张上。英伟达H100、H200乃至B200的发布,让算力成为衡量AI实力的唯一标尺。然而,当模型参……

├ [04:06] 让我们看一组直观的数据。以当前主流的MoE(混合专家)架构模型为例,一个拥有1.8万亿参数的模型,其单个Token的推理需要激活约280亿参数。这意味着,每生成……

├ [06:08] 传统AI基础设施中,存储的角色极其简单:模型权重的一次性加载,训练检查点的定期保存。但在大模型推理的新范式下,存储需要承担三个全新的核心任务:……

├ [08:10] 在长上下文推理场景中(如128K甚至1M Token),KV Cache(键值缓存)的体量会急剧膨胀。一个拥有70B参数的模型,处理1M Token上下文所需的……

├ [结尾] 总结 + 求三连关注

【弹幕互动引导】

  • "觉得有用的扣 1"
  • "不同观点的弹幕见"
  • 结尾设置投票:你看好这个方向吗?A.看好 B.观望 C.不看好

🏷️ 标签:大模型推理, AI基础设施, 存储技术

🎬 抖音口播脚本 | 时长:45-60秒

【0-5秒 黄金Hook】

当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。

【5-35秒 核心信息(口语化表达,每句一行)】

当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。 ## 从“算力饥渴”到“存储觉醒” 过去两年,大模型行业的军备竞赛几乎全部集中在GPU集群的规模扩张上。英伟达H100、H200乃至B2

【35-50秒 深度扩展】

AI SSD:大模型推理的存储范式转移,一场围绕Token的算力革命

【50-60秒 强CTO结尾】

觉得有用的话,双击点赞 + 关注,下期继续带你读懂 AI!🔥


📐 拍摄建议:竖屏 9:16 · 科技感电子背景乐 · 关键数据配文字弹幕 · 表情自然语速适中

AI SSD:大模型推理的存储范式转移,一场围绕Token的算力革命

【导语】 当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。
本文目录:

1. 从“算力饥渴”到“存储觉醒”

2. 存储的“范式转移”:KV Cache与权重的新家

3. 硬件架构的深刻变革:从“以GPU为中心”到“以数据为中心”

4. 一场围绕Token的协同调度

5. 存储厂商的“AI化”求生


当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。

从“算力饥渴”到“存储觉醒”

过去两年,大模型行业的军备竞赛几乎全部集中在GPU集群的规模扩张上。英伟达H100、H200乃至B200的发布,让算力成为衡量AI实力的唯一标尺。然而,当模型参数从千亿级迈向万亿级,推理场景从离线批处理转向实时交互,一个残酷的物理定律开始显现:数据搬运的速度,正在成为推理延迟的真正瓶颈。

让我们看一组直观的数据。以当前主流的MoE(混合专家)架构模型为例,一个拥有1.8万亿参数的模型,其单个Token的推理需要激活约280亿参数。这意味着,每生成一个Token,系统需要在GPU显存、CPU内存和存储层之间搬运数百MB甚至GB级的数据。而GPU的算力增长遵循摩尔定律,但PCIe带宽和NVLink带宽的增长却远未跟上。

当你以为瓶颈在算力时,真正的瓶颈早已转移至存储。

存储的“范式转移”:KV Cache与权重的新家

传统AI基础设施中,存储的角色极其简单:模型权重的一次性加载,训练检查点的定期保存。但在大模型推理的新范式下,存储需要承担三个全新的核心任务:

1. KV Cache的持久化存储

在长上下文推理场景中(如128K甚至1M Token),KV Cache(键值缓存)的体量会急剧膨胀。一个拥有70B参数的模型,处理1M Token上下文所需的KV Cache可达数百GB。如果这些数据全部驻留在GPU显存中,成本将高到无法接受。

核心逻辑:将KV Cache视为热数据,采用“显存+内存+NVMe SSD”三级缓存架构。 近期,以LMDeploy和vLLM为代表的开源推理框架,已经开始支持将KV Cache异步卸载至NVMe SSD,在需要时再按需预取回显存。

# vLLM 异步KV Cache卸载伪代码示例
from vllm import LLM, SamplingParams
import asyncio


<p align="center"><img src="https://i.qbitai.com/wp-content/uploads/2026/08/9323c761191f57365a9315b22585850f.webp" alt="" style="max-width:100%;border-radius:8px;" loading="lazy"></p>
# 初始化推理引擎,启用KV Cache存储卸载
llm = LLM(
    model="meta-llama/Llama-3.1-70B-Instruct",
    kv_cache_dtype="auto",
    enable_kv_cache_offload=True,  # 开启SSD offload
    kv_cache_offload_device="nvme", # 指定卸载设备
    max_model_len=131072,
)

async def generate_with_offload(prompt: str):
    """
    针对超长上下文的推理请求,利用SSD承载KV Cache
    """
    sampling_params = SamplingParams(temperature=0.7, max_tokens=2048)
    result = await llm.agenerate([prompt], sampling_params)
    return result[0].outputs[0].text

这一设计将单机推理的上下文长度上限提升了数倍,同时将每Token的存储成本从DRAM级的数十美元/GB,降低至NVMe SSD级的数美元/GB。

2. 权重分片与热插拔加载

对于万亿级MoE模型,全部权重驻留显存是不可能的。业界普遍采用的方案是“按需加载”——根据当前Token所激活的专家(Expert)路由结果,仅从SSD中读取对应的权重分片至显存。

这要求存储系统具备极低延迟的随机读取能力。传统HDD的随机读取延迟高达数毫秒,完全不可用。而新一代企业级NVMe SSD(如三星PM9E3、Solidigm D7-P5800X)可将平均读取延迟压至50微秒以内,配合智能预取算法,使得专家权重的加载几乎无感。

硬件架构的深刻变革:从“以GPU为中心”到“以数据为中心”

存储范式的转移,迫使整个AI服务器硬件架构重设计。

NVMe over Fabrics (NVMe-oF) 成为标配

单机内的PCIe总线带宽终究有限。为了打破存储墙,业界开始大规模部署NVMe-oF技术,将NVMe SSD从服务器本地“拉远”至独立存储池,通过RDMA网络(RoCEv2或InfiniBand)与GPU服务器直连。

// NVMe-oF 配置示意(Linux内核block层)
# 创建NVMe-oF子系统
nvmetcli add-subsystem nqn.2026-08.com.ai-storage:token-pool
nvmetcli add-ns nqn.2026-08.com.ai-storage:token-pool --device=/dev/nvme0n1

# 在GPU服务器端连接远程存储池
modprobe nvme-rdma
nvme connect -t rdma -n nqn.2026-08.com.ai-storage:token-pool -a 192.168.1.100 -s 4420

这种架构下,GPU服务器不再需要本地大容量SSD,而是通过高速网络共享一个统一的高性能存储资源池。存储的利用率提升了3倍以上,且扩容无需中断推理服务。

计算存储(Computational Storage)的萌芽

更前沿的探索发生在存储介质内部。三星和SK海力士等原厂,正在将简单的计算引擎嵌入SSD控制器,允许在数据读取过程中直接完成部分KV Cache的过滤或重排操作,从而减少上行到GPU的无效数据传输。这被称为“存储内计算”,它预示着未来存储颗粒将不再是单纯的“仓库”,而是带有“预处理器”的智能节点。

一场围绕Token的协同调度

最深刻的变化,在于软件生态的视角转变。

传统AI框架(如PyTorch)中,存储是被动的。但在新一代的AI推理引擎(如TensorRT-LLM、DeepSpeed-Inference)中,存储IO被抽象为“Token流水线”的一个重要环节。

下图描绘了围绕单个Token生成的全链路协同:

单Token生成全链路协同调度示意图 请求解析 Token ID 映射 权重预取 专家路由 + NVMe读取 显存计算 Attention + FFN KV写回 SSD持久化 下一Token循环(复用预取权重与KV Cache) 关键指标(延迟预算) • 权重读取: 50-80μs (NVMe) — 占比 15% • GPU计算: 200-300μs — 占比 55% • KV Cache写回: 30-50μs — 占比 10% • 网络传输: 20-40μs — 占比 8% • 调度与同步: 30-60μs — 占比 12%

这种协同调度要求存储系统具备感知Token生命周期的能力。例如,当推理引擎发现某个专家权重即将被再次激活时,存储控制器可以提前将其从QLC层提升至SLC缓存层,降低读延迟;当KV Cache的访问热度下降时,则将其压缩并迁移至大容量层。

存储厂商的“AI化”求生

这场范式转移,让传统存储厂商看到了新的增长极,但也对它们提出了严苛的技术要求。

  • Solidigm 推出了针对AI推理优化的D7-P5800X系列,其4K随机读IOPS高达150万,且延迟极低。更重要的是,它引入了名为“KV优化”的固件特性,允许主机直接以Key-Value形式操作SSD,免去了文件系统层的转换开销。
  • 三星 则在研发“智能SSD”方案,试图将部分KV Cache的压缩算法下沉至SSD内部执行,从而减少数据上行流量。

这场竞争的终局,是存储不再是标准化的通用硬件,而是为AI推理深度定制的“Token加速器”。

未来展望:存储的尽头是计算,计算的尽头是存储

当我们站在2026年回望,会发现在AI基础设施的演进中,没有绝对的核心,只有围绕Token的协同。GPU负责计算,但存储决定了计算能多快启动;网络负责连接,但存储决定了连接后能拿到什么数据。

对于大模型公司而言,忽视存储优化的代价将是推理成本居高不下。据估算,在长上下文场景下,采用KV Cache卸载与智能预取技术,可将单Token的推理总成本降低40%-60%,同时将单机并发度提升数倍。

AI SSD不是一块更快的硬盘,而是一台懂得Token语义的分布式计算单元。 这才是存储范式转移的真正内涵。

关键词:大模型推理, AI基础设施, 存储技术 声明:本文由彩虹洋葱 AI 智能聚合生成,仅供信息参考。

AI SSD:大模型推理的存储范式转移,一场围绕Token的算力革命 🔥

当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。


当Transformer架构在2026年的今天已不再新鲜,我们却猛然发现,围绕大模型推理的底层基础设施正经历一场静默而彻底的革命。算力、网络、内存与存储——这些曾经泾渭分明的资源边界,正被一个名为“Token”的微观单位重新定义。这一次,存储不再是配角。

过去两年,大模型行业的军备竞赛几乎全部集中在GPU集群的规模扩张上。英伟达H100、H200乃至B200的发布,让算力成为衡量AI实力的唯一标尺。然而,当模型参数从千亿级迈向万亿级,推理场景从离线批处理转向实时交互,一个残酷的物理定律开始显现:数据搬运的速度,正在成为推理延迟的真正瓶颈。

让我们看一组直观的数据。以当前主流的MoE(混合专家)架构模型为例,一个拥有1.8万亿参数的模型,其单个Token的推理需要激活约280亿参数。这意味着,每生成一个Token,系统需要在GPU显存、CPU内存和存储层之间搬运数百MB甚至GB级的数据。而GPU的算力增长遵循摩尔定律,但PCIe带宽和NVLink带宽的增长却远未跟上。


📌 来源:量子位

#大模型推理 #AI基础设施 #存储技术

#科技资讯 #彩虹洋葱AI

🚀 多平台发布

点击「复制」获取平台专属文案,到各平台编辑器(App/网页)粘贴即可发布。
有密钥的 4 个平台(微信服务号 / 头条 / 百家号 / 微博)可自动发布,密钥填好后自动点亮。

平台状态操作
✍️ 简书📋 手动复制
快手📋 手动复制
🐦 微博🔑 待配置密钥
💻 CSDN📋 手动复制
⛏️ 掘金📋 手动复制
💬 公众号🔑 待配置密钥
📰 今日头条🔑 待配置密钥
🤔 知乎📋 手动复制
📺 B站📋 手动复制
🎵 抖音📋 手动复制
📝 百家号🔑 待配置密钥
📕 小红书📋 手动复制