具有能动性的人工智能扩展需要先进的记忆系统
具有代理行为的人工智能标志着从简单聊天机器人到管理复杂工作流的重大转变,而其扩展需要对记忆架构采取全新方法。
随着基础模型参数规模膨胀至万亿量级,上下文窗口扩展至数百万令牌,维持历史数据的计算成本正超越我们有效处理的能力。
部署这些系统的机构正面临瓶颈:海量"长期记忆"(技术上指键值缓存)已超出现有硬件设计承载能力。
现有基础设施仅提供有限选择:将推理上下文存储在稀缺的高带宽GPU内存(HBM)中,或迁移至速度较慢的通用存储器。前者对大型上下文而言成本过高,后者则引入延迟,导致实时智能体交互难以实现。
为弥合阻碍智能体AI扩展的日益扩大的鸿沟,英伟达在其Rubin架构中推出了推理上下文内存存储(ICMS)平台,引入专为满足AI内存临时高速需求而设计的新存储层。
"人工智能正在重塑整个计算体系——如今更将变革存储领域,"黄仁勋强调,"AI已从单一响应的聊天机器人进化为智能协作伙伴:它们能理解物理世界、进行长期推理、保持事实依据、运用工具完成实际任务,并兼具短期与长期记忆能力。"
核心运行问题源于基于Transformer的模型运作机制。为避免每次生成新词都需重新计算整个对话,模型会将历史状态保存至键值缓存。在智能体工作流中,该缓存作为跨工具和会话的持久化内存,其容量随序列长度呈线性增长。
这催生了独特的数据类别。不同于财务记录或客户日志,KV缓存属于衍生数据——它对即时性能至关重要,却无需企业级文件系统的强健持久性保障。基于标准CPU的通用存储系统,在元数据管理和数据复制上消耗的能源,对智能体工作负载毫无裨益。
从GPU HBM(G1)到共享存储(G4)的现有分层架构正日益显现低效:

(来源:NVIDIA) 当上下文数据从GPU(G1)迁移至系统内存(G2),最终存储于共享存储(G4)时,效率显著下降。将活跃上下文传输至G4层会引入毫秒级延迟,并推高每令牌能耗成本,导致昂贵的GPU在等待数据期间处于闲置状态。
对企业而言,这将导致总拥有成本(TCO)上升——能源消耗被基础设施开销而非实际推理任务所占据。
AI工厂的新型内存层级
行业解决方案是在该架构中添加定制层。ICMS平台创建了"G3.5"层——专为大规模推理设计的以太网连接闪存存储层。
该方案将存储直接集成至计算单元。通过采用NVIDIA BlueField-4数据处理器,平台将上下文数据管理从主机CPU转移至该层。系统为每个计算单元提供PB级共享容量,使智能体无需消耗昂贵的HBM即可存储海量历史数据,从而提升智能体AI的扩展能力。
其运行优势在吞吐量和能耗方面均有显著体现。通过将相关上下文数据存储于该中间层(其速度快于标准存储,成本却低于HBM),系统可提前将内存"预加载"至GPU。这大幅缩短了GPU解码器的空闲时间,使长上下文工作负载的每秒令牌处理量(TPS)提升高达5倍。
从能耗角度看,其效益同样显著。该架构消除了通用存储协议的开销,实现比传统方案高5倍的能效。
整合数据平面
部署该架构需要改变IT团队对存储网络的认知。ICMS平台依托NVIDIA Spectrum-X以太网技术,提供高带宽、低抖动的连接能力,使闪存存储几乎可视为本地内存。
对于企业基础设施团队,关键集成点在于编排层。NVIDIA Dynamo和推理传输库(NIXL)等框架负责处理不同层级间的KV块迁移。
这些工具协同存储层运作,确保在AI模型需要时将正确上下文精确加载至GPU内存(G1)或主机内存(G2)。NVIDIA DOCA框架通过提供将上下文缓存视为核心资源的KV通信层,进一步强化了这一机制。
领先存储厂商已开始采用该架构。包括AIC、Cloudian、DDN、戴尔科技、HPE、日立Vantara、IBM、Nutanix、Pure Storage、Supermicro、VAST Data和WEKA在内的企业正基于BlueField-4开发平台,相关解决方案预计将于今年下半年面世。
为可扩展智能代理AI重塑基础设施
采用专用上下文内存层将影响容量规划与数据中心设计。
- 数据重分类:首席信息官需将KV缓存视为独立数据类型。其特性为"临时性但延迟敏感",有别于"持久且冷存储"的合规数据。G3.5层管理前者,使持久性G4存储能专注于长期日志与工件。
- 编排成熟度:成功依赖于能智能分配工作负载的软件。该系统采用拓扑感知编排(通过NVIDIA Grove实现),将任务部署在缓存上下文附近,减少网络数据传输。
- 功率密度:通过在相同机架空间内集成更高可用容量,企业可延长现有设施使用寿命。但这将提升每平方米计算密度,需精心规划散热与配电方案。
向代理式人工智能的转型需要对数据中心进行物理重构。传统将计算与低速持久存储完全分离的做法,无法满足具备海量记忆的代理实时检索需求。
通过引入专用上下文层,企业可将模型内存增长与GPU HBM成本脱钩。这种代理式AI架构允许多个代理共享大型低功耗内存池,既降低了复杂查询的处理成本,又通过支持高吞吐量推理增强了扩展能力。
当企业筹备新一轮基础设施投资时,评估内存分层体系的效率将与选择GPU本身同等关键。
另请参阅:2025年AI芯片之战:企业领袖如何洞悉供应链真相

想向行业领袖学习AI与大数据知识?欢迎参加在阿姆斯特丹、加州和伦敦举办的AI & Big Data Expo。这场综合性盛会隶属TechEx系列,与其他顶尖科技活动同期举行。点击此处获取更多信息。
AI News由TechForge传媒提供支持。探索更多即将举办的企业技术活动与网络研讨会请点击此处。
相关文章
苹果智能眼镜或将在WWDC27上首次亮相,重点突出隐私保护
彭博社的马克·古尔曼报道,苹果智能眼镜(内部代号 N50)计划于 2027 年 6 月的全球开发者大会(WWDC27)上首次亮相,零售版预计将于 2027 年秋季上市。该设备原定于今年晚些时候及 2027 年初发布,但现已推迟,以便进行进一步的产品完善并加强隐私保护协议。隐私仍是苹果智能眼镜战略的核心支柱。从 Meta 等竞争对手的隐私争议中吸取教训,苹果正在实施强有力的功能与政策。目前考虑的方案包括:完全移除摄像头,专注于人工智能交互、音频播放和通话;或保留摄像头但禁用照片和视频录制功能,仅
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
相关专题推荐
评论 (0)
0/500
具有代理行为的人工智能标志着从简单聊天机器人到管理复杂工作流的重大转变,而其扩展需要对记忆架构采取全新方法。
随着基础模型参数规模膨胀至万亿量级,上下文窗口扩展至数百万令牌,维持历史数据的计算成本正超越我们有效处理的能力。
部署这些系统的机构正面临瓶颈:海量"长期记忆"(技术上指键值缓存)已超出现有硬件设计承载能力。
现有基础设施仅提供有限选择:将推理上下文存储在稀缺的高带宽GPU内存(HBM)中,或迁移至速度较慢的通用存储器。前者对大型上下文而言成本过高,后者则引入延迟,导致实时智能体交互难以实现。
为弥合阻碍智能体AI扩展的日益扩大的鸿沟,英伟达在其Rubin架构中推出了推理上下文内存存储(ICMS)平台,引入专为满足AI内存临时高速需求而设计的新存储层。
"人工智能正在重塑整个计算体系——如今更将变革存储领域,"黄仁勋强调,"AI已从单一响应的聊天机器人进化为智能协作伙伴:它们能理解物理世界、进行长期推理、保持事实依据、运用工具完成实际任务,并兼具短期与长期记忆能力。"
核心运行问题源于基于Transformer的模型运作机制。为避免每次生成新词都需重新计算整个对话,模型会将历史状态保存至键值缓存。在智能体工作流中,该缓存作为跨工具和会话的持久化内存,其容量随序列长度呈线性增长。
这催生了独特的数据类别。不同于财务记录或客户日志,KV缓存属于衍生数据——它对即时性能至关重要,却无需企业级文件系统的强健持久性保障。基于标准CPU的通用存储系统,在元数据管理和数据复制上消耗的能源,对智能体工作负载毫无裨益。
从GPU HBM(G1)到共享存储(G4)的现有分层架构正日益显现低效:

当上下文数据从GPU(G1)迁移至系统内存(G2),最终存储于共享存储(G4)时,效率显著下降。将活跃上下文传输至G4层会引入毫秒级延迟,并推高每令牌能耗成本,导致昂贵的GPU在等待数据期间处于闲置状态。
对企业而言,这将导致总拥有成本(TCO)上升——能源消耗被基础设施开销而非实际推理任务所占据。
AI工厂的新型内存层级
行业解决方案是在该架构中添加定制层。ICMS平台创建了"G3.5"层——专为大规模推理设计的以太网连接闪存存储层。
该方案将存储直接集成至计算单元。通过采用NVIDIA BlueField-4数据处理器,平台将上下文数据管理从主机CPU转移至该层。系统为每个计算单元提供PB级共享容量,使智能体无需消耗昂贵的HBM即可存储海量历史数据,从而提升智能体AI的扩展能力。
其运行优势在吞吐量和能耗方面均有显著体现。通过将相关上下文数据存储于该中间层(其速度快于标准存储,成本却低于HBM),系统可提前将内存"预加载"至GPU。这大幅缩短了GPU解码器的空闲时间,使长上下文工作负载的每秒令牌处理量(TPS)提升高达5倍。
从能耗角度看,其效益同样显著。该架构消除了通用存储协议的开销,实现比传统方案高5倍的能效。
整合数据平面
部署该架构需要改变IT团队对存储网络的认知。ICMS平台依托NVIDIA Spectrum-X以太网技术,提供高带宽、低抖动的连接能力,使闪存存储几乎可视为本地内存。
对于企业基础设施团队,关键集成点在于编排层。NVIDIA Dynamo和推理传输库(NIXL)等框架负责处理不同层级间的KV块迁移。
这些工具协同存储层运作,确保在AI模型需要时将正确上下文精确加载至GPU内存(G1)或主机内存(G2)。NVIDIA DOCA框架通过提供将上下文缓存视为核心资源的KV通信层,进一步强化了这一机制。
领先存储厂商已开始采用该架构。包括AIC、Cloudian、DDN、戴尔科技、HPE、日立Vantara、IBM、Nutanix、Pure Storage、Supermicro、VAST Data和WEKA在内的企业正基于BlueField-4开发平台,相关解决方案预计将于今年下半年面世。
为可扩展智能代理AI重塑基础设施
采用专用上下文内存层将影响容量规划与数据中心设计。
- 数据重分类:首席信息官需将KV缓存视为独立数据类型。其特性为"临时性但延迟敏感",有别于"持久且冷存储"的合规数据。G3.5层管理前者,使持久性G4存储能专注于长期日志与工件。
- 编排成熟度:成功依赖于能智能分配工作负载的软件。该系统采用拓扑感知编排(通过NVIDIA Grove实现),将任务部署在缓存上下文附近,减少网络数据传输。
- 功率密度:通过在相同机架空间内集成更高可用容量,企业可延长现有设施使用寿命。但这将提升每平方米计算密度,需精心规划散热与配电方案。
向代理式人工智能的转型需要对数据中心进行物理重构。传统将计算与低速持久存储完全分离的做法,无法满足具备海量记忆的代理实时检索需求。
通过引入专用上下文层,企业可将模型内存增长与GPU HBM成本脱钩。这种代理式AI架构允许多个代理共享大型低功耗内存池,既降低了复杂查询的处理成本,又通过支持高吞吐量推理增强了扩展能力。
当企业筹备新一轮基础设施投资时,评估内存分层体系的效率将与选择GPU本身同等关键。
另请参阅:2025年AI芯片之战:企业领袖如何洞悉供应链真相

想向行业领袖学习AI与大数据知识?欢迎参加在阿姆斯特丹、加州和伦敦举办的AI & Big Data Expo。这场综合性盛会隶属TechEx系列,与其他顶尖科技活动同期举行。点击此处获取更多信息。
AI News由TechForge传媒提供支持。探索更多即将举办的企业技术活动与网络研讨会请点击此处。
苹果智能眼镜或将在WWDC27上首次亮相,重点突出隐私保护
彭博社的马克·古尔曼报道,苹果智能眼镜(内部代号 N50)计划于 2027 年 6 月的全球开发者大会(WWDC27)上首次亮相,零售版预计将于 2027 年秋季上市。该设备原定于今年晚些时候及 2027 年初发布,但现已推迟,以便进行进一步的产品完善并加强隐私保护协议。隐私仍是苹果智能眼镜战略的核心支柱。从 Meta 等竞争对手的隐私争议中吸取教训,苹果正在实施强有力的功能与政策。目前考虑的方案包括:完全移除摄像头,专注于人工智能交互、音频播放和通话;或保留摄像头但禁用照片和视频录制功能,仅
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业





首页






