前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
返回 AI 情报前线
All News · 全部资讯4259
  • Agent记忆不是聊天历史:工作记忆与长期记忆的本质区别
  • Google Cloud推统一AI模型路由API
  • 实测:我的代码Agent对我技术栈的了解只有40%
  • 基于AWS Bedrock AgentCore的自动化网页洞察提取
  • AI账单是分布式系统问题,不是模型定价问题
  • AI 模型能包揽软件全流程,但几乎都不该那样用
  • 字节 SeedRealtime:原生音视频全双工大模型发布
  • GitHub Spark将于8月底正式停用
  • DeepSeek V4 Flash登顶OpenRouter,价格仅为GPT-4的5%
  • obstat库:让Agent决策日志写在执行之前
  • Evals是AI时代的CI:对Agent产出建立验收层
  • 前沿AI模型主动突破沙盒:能力跃升而非漏洞
  • 测试全过但核心检查从未运行:AI写作循环中的认证失效陷阱
  • SAST工具专为AI代码设计:umbra静态扫描
  • Agent交接契约:解决多Agent状态丢失问题
  • AI 代码编辑器横评:Cursor vs VS Code + Copilot vs Windsurf
  • Swarm EventBus 解析:用 35+ Go 包构建事件驱动 AI Agent 系统
  • MCP 协议详解:AI Agent 互操作性的标准基石
  • Cursor vs Copilot vs Windsurf:三大 AI 编辑器真实使用对比
  • 持久化执行:分布式事务外如何保证步骤只执行一次
  • AI 内存需求激增,存储架构同步升级
  • pgvector vs Pinecone vs Qdrant:何时该用专用向量数据库
  • 你的 AI agent 在测试上撒了谎
  • 阿里Qwen3.8-Max发布:开源外套下的API商业模式
  • 面向工程师的实用Prompt工程模式
  • 开源项目:把团队代码规范封装成 Claude Code/Codex Agent 技能
  • Agent质量门禁:确定性规则优于LLM裁判
  • Opus/Sonnet/Haiku并行了30天:模型路由实战总结
  • Nvidia NOOA:用一个Python类实现Agent开发
  • 持久化执行是需独立安装的组件
  • Cloudflare免费计划运行MCP Server
  • Agentic AI 的隐性成本:推理费用如何倍增
  • LFM2.5-2.6B:可在任意设备本地部署的 AI Agent 框架
  • 网站知识库AI客服的实战训练流程
  • Agentic工程方法论实地指南
  • 我的编码Agent对我技术栈的了解程度只有40%
  • AI线上最贵的bug:任务重复执行两遍
  • 北大&元空开源 Claude Science 复现版:零依赖、MIT 协议、30+科研技能
  • Linux暂存区明确拒绝AI补丁:必须硬件实测,三分之一AI生成结果有害
  • Cloudflare推千万级仓库CI/CD方案,用TypeScript工作流替代YAML
  • Cloudflare推出AI Agent专用程序化钱包
  • Astro 用 AI Agent 自动化修 Bug:GitHub Issue 归零工程实践
  • wrangler dev支持本地追踪:Agent可无部署调试Workers
  • Cloudflare用AI治理工程标准:Codex体系让代码审查规范化
  • Cloudflare 推出 Agents 平台:统一管理大规模 Agent 会话
  • Cloudflare推出Agent开发生命周期,代码生成速度已超团队Review能力
  • MCP服务器入驻Claude目录实战:20天、€52/月与完整避坑指南
  • Agentic AI如何重构企业应用交付:WaveMaker架构解析
  • 生成式AI、AI Agent与Agentic AI不是一回事:选错技术栈预算白花
  • Locus MCP:用语言服务器为AI编码代理补全语义导航能力
  • 四个练习帮你测量Token消耗浪费
  • 已加载 51 / 4259
8.0
热点
AI SCORE
技术实践2026-08-04 23:00

AI 内存需求激增,存储架构同步升级

NVIDIA Blog#NVIDIA#内存#AI存储
Editor brief · 编辑速览

AI 上下文窗口和大规模数据集需求突破内存瓶颈,存储正从容量导向转向高效、安全的 AI 原生架构。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

AI 需求激增,存储技术持续跟进

不断增长的 AI 需求正推动着大规模数据集和上下文窗口的需求,这些需求已经超越了系统内存的极限。

然而,仅仅增加存储容量并不能满足这些增长需求。真正需要的是来自 AI 工厂的有根据、有价值的洞察,以及能够实现这些洞察的高效、安全的存储架构。

在本周的"内存与存储的未来"(Future of Memory and Storage,FMS)大会上,NVIDIA 发布了新的存储技术进展,并展示了下一代 AI 如何依赖于为加速计算提供数据的存储基础设施——这一依赖程度不亚于对计算能力本身的依赖。

随着 AI Agent 消耗海量数据,相关基础设施承受的压力持续加大——GPU 现在可以直接发起存储请求,产生数千个并发操作。

为了响应这些请求,存储系统必须持续对数据进行加密、压缩、验证和重建。当数千个 Agent 同时访问存储时,这些关键的数据服务就会成为瓶颈。

NVIDIA 技术博客中引用的基准测试显示,NVIDIA Vera CPU(属于 NVIDIA Vera BlueField-4 STX 产品系列)在两阶段压缩和加密流水线中,吞吐量比 x86 CPU 高出最高 3.21 倍。这意味着借助 Vera,存储平台能够更高效地吸收 AI 数据的洪流——以更少的计算基础设施实现更高的吞吐量。

借助加速计算,存储不再是单纯存放数据的地方,而成为数据路径中积极主动的一环。

这颠覆了过往判断数据应该存放在内存(应用程序获取速度更快)还是存储驱动器(空间更便宜、更充裕)的经济学逻辑。这一权衡在四十年前首次被提出,当时的数据访问速度以分钟衡量。而在今天的 GPU 上,配合 NVIDIA 及其合作伙伴提供的 AI 存储解决方案,同样的权衡可以在微秒级别完成。

缩小 AI 需求与内存短缺之间的差距,取决于整个生态系统的极致协同设计——从内存和存储制造商到构建在其之上的软件。

开源 NVIDIA cuFile API 实现存储解决方案的互操作性

在 FMS 大会上,NVIDIA 宣布将其 cuFile 应用程序接口(API)及其底层的垂直存储软件栈开源——这些接口让 GPU(而不仅仅是 CPU)能够直接读写存储。cuFile 是 NVIDIA GPUDirect Storage 的开源组件。

cuFile 利用数十万个 GPU 线程、快速的高带宽内存和其他方法,实现从存储中安全访问数据,延迟仅在微秒级别。

这代表了行业正在基于 Linux 最佳实践统一构建以安全为首的存储栈,为 GPU 与数据之间的互操作性铺平道路。

此外,快速、安全地访问数据和存储是驱动预防性和检测性网络安全措施的基础要素。公开提供 cuFile 将有助于在 AI 驱动的防御所需的速度下访问安全上下文、数据和存储。此类开放技术支持诸如"开放安全 AI 联盟"(Open Secure AI Alliance)等倡议。

该站点是开放贡献 API 的新家——Google、Intel、NVIDIA 和 Meta 作为首批维护者参与——并可针对各类软件和硬件平台进行优化,为开发者和企业推动创新与效率。

NVIDIA 与行业领袖共同推进 AI 存储新前沿

此外,NVIDIA 与存储行业领袖正在通过一项名为 Storage-Next 的倡议来优化内存和存储解决方案。这一由 NVIDIA 驱动的倡议汇集了存储制造商、控制器厂商、散热设计、冷却与编排运营商以及标准机构,共同明确 GPU 驱动存储应有的行为规范——随后将这些进展转化为可互操作的开放行业标准。

Storage-Next 汇集了 40 多家领先的存储和闪存供应商——包括 DDN、KIOXIA 和 Micron——各方共同与 NVIDIA 合作贡献下一代 AI 存储技术。

该倡议以大规模 AI 数据集的加速数据访问为基础。为此,NVIDIA 提供 SCADA(可扩展加速数据访问的缩写)框架,让大规模并行 GPU 只需从存储中直接将应用程序所需的数据拉取到自身的高速内存中。

例如,DDN 正在将 SCADA 与 Infinia 集成——Infinia 是其软件定义的、AI 原生的数据智能平台,旨在消除大规模存储瓶颈。

"AI 成功与否不取决于组织拥有多少基础设施,而取决于他们使用基础设施的效率,"DDN 首席技术官 Sven Oehme 表示。"我们与 NVIDIA 的合作正在 GPU 与数据之间建立更直接、更高效的连接——保持加速计算资源的生产力,加快洞察获取速度,使客户能够从 AI 投资中获得更强的业务和财务回报。"

Storage-Next 和 SCADA 扩展了 NVIDIA 在 AI 存储基础设施方面的长期工作,包括 NVIDIA Vera BlueField-4 STX——这是一个模块化、机架级的基础设施,由 NVIDIA Vera Rubin 平台、NVIDIA Vera BlueField-4 存储处理器和 NVIDIA Spectrum-X 以太网网络提供支持。

NVIDIA Vera BlueField-4 STX storage processor.

NVIDIA Vera BlueField-4 STX storage processor.

NVIDIA Vera BlueField-4 STX 存储处理器通过统一的 NVIDIA DOCA 安全栈定义了一种全新的 AI 原生数据平台类别,让企业能够在 AI 数据路径中实现持续策略执行。

此外,NVIDIA CMX Context Memory Storage 为长上下文、多轮次、Agentic AI 推理提供了 AI 原生上下文分层,基于 NVIDIA STX 构建。

SCADA 实现高速且安全的 AI 存储

存储层的高速度伴随着一个隐患。允许应用程序直接与驱动器通信速度很快,但如果做得不够谨慎,可能会覆盖其他进程的内存——这是安全漏洞,而非功能。

NVIDIA SCADA 采用一种安全、稳健的方法来实现可扩展的直接访问,将工作分为两部分:

需要原始速度的应用程序用户部分位于可信计算基之外。

在设置时,一个独立的特权组件负责配置应用程序与其授权存储之间的受保护访问,遵循标准 Linux 安全协议,同时高效地保护数据。

这一切共同构成了快速、大规模并行、高效、安全的 AI 存储基础设施如何为应用程序和 AI 工厂提供更好的数据——使它们能够大规模产生更有用、更准确、有根据的智能。

参加 NVIDIA 在 FMS 大会上的演讲,举办时间为 8 月 4 日至 6 日,地点位于加利福尼亚州圣克拉拉。了解更多关于 NVIDIA AI 存储的信息。

参见关于软件产品信息的声明。

Original source

本文由 AI 翻译整理自 NVIDIA Blog,原文版权归原作者所有。

阅读英文原文
上一篇
持久化执行:分布式事务外如何保证步骤只执行一次
下一篇
pgvector vs Pinecone vs Qdrant:何时该用专用向量数据库