Moonshot AI 与清华大学联合发布 PrfaaS 架构,旨在突破大型模型的计算瓶颈
新技术正在突破大型语言模型(LLMs)的性能瓶颈。 近日,Moonshot AI(Moonshot)与清华大学的研究人员提出了一种名为“预填充即服务”(PrfaaS)的创新架构。该研究通过优化计算资源分配,解决了大型模型服务在数据中心部署中的硬件限制,从而显著提升了推理效率。

技术突破:预填充与解码的“精准”分离
目前,大型语言模型的推理过程包含两个截然不同的阶段:
预填充阶段:该阶段计算密集,负责处理输入并生成键值缓存(KVCache)。
解码阶段:该阶段对内存带宽需求极高,需逐词生成输出。
在传统架构中,这两个阶段通常在同一数据中心甚至同一台服务器内处理。由于它们对硬件资源的需求不同,这种“强制捆绑”往往会导致计算与带宽分配失衡,进而引发服务拥塞。
核心创新:高效的跨区域协作
PrfaaS 的 核心亮点在于实现了服务的解耦。它将计算密集型的预填充任务卸载到专门的高计算集群上。任务完成后,系统使用标准以太网将生成的 KVCache 远程传输到本地解码集群。
该设计消除了物理空间的限制,使预填充和解码能在不同数据中心之间并行运行。为确保高效传输,PrfaaS 采用了双时间尺度调度机制,该机制能根据实时流量波动灵活分配资源,并配合精准的路由策略,防止长文本请求因资源分布不均而延迟。
测试结果:吞吐量与延迟的优化
研究数据表明,PrfaaS 架构在实际应用中表现卓越:
服务吞吐量提升了 54%,显著提高了单位时间内的请求处理量。
响应延迟显著降低,从用户角度看,首次令牌生成速度更快。
通过分离计算、网络和存储子系统,最大化资源利用率,避免了传统架构中常见的拥塞问题。
Moonshot AI 与清华大学的合作不仅为大规模 AI 推理提供了新的工程解决方案,也为未来跨区域计算网络奠定了基础。这种预填充即服务(Prefill-as-a-Service)模式有望成为推动大型模型走向工业化部署的关键里程碑。
相关文章
前OpenAI首席科学家Ilya的SSI首次发布模型
AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统
Anthropic 将 Claude AI 编码工具扩展至日本,以推动海外增长
Anthropic,一家美国知名的人工智能公司,正加强其全球推广力度。周三,该公司在东京举办了一场大型开发者活动“Code with Claude”,吸引了近500名软件工程师参加。该举措旨在积极将Claude AI工具及相关产品引入日本市场,强调其自主编码能力在提升企业生产力方面的核心优势。强调自动化代码生成在活动中,Anthropic展示了其先进的自主编码系统,该系统能够独立处理复杂的编程任务并优化现有代码结构。随着全球对高效开发工具的需求不断增长,Anthropic希望通过此类活动加强
相关专题推荐
评论 (1)
0/500
新技术正在突破大型语言模型(LLMs)的性能瓶颈。 近日,Moonshot AI(Moonshot)与清华大学的研究人员提出了一种名为“预填充即服务”(PrfaaS)的创新架构。该研究通过优化计算资源分配,解决了大型模型服务在数据中心部署中的硬件限制,从而显著提升了推理效率。

技术突破:预填充与解码的“精准”分离
目前,大型语言模型的推理过程包含两个截然不同的阶段:
预填充阶段:该阶段计算密集,负责处理输入并生成键值缓存(KVCache)。
解码阶段:该阶段对内存带宽需求极高,需逐词生成输出。
在传统架构中,这两个阶段通常在同一数据中心甚至同一台服务器内处理。由于它们对硬件资源的需求不同,这种“强制捆绑”往往会导致计算与带宽分配失衡,进而引发服务拥塞。
核心创新:高效的跨区域协作
该设计消除了物理空间的限制,使预填充和解码能在不同数据中心之间并行运行。为确保高效传输,PrfaaS 采用了双时间尺度调度机制,该机制能根据实时流量波动灵活分配资源,并配合精准的路由策略,防止长文本请求因资源分布不均而延迟。
测试结果:吞吐量与延迟的优化
研究数据表明,PrfaaS 架构在实际应用中表现卓越:
服务吞吐量提升了 54%,显著提高了单位时间内的请求处理量。
响应延迟显著降低,从用户角度看,首次令牌生成速度更快。
通过分离计算、网络和存储子系统,最大化资源利用率,避免了传统架构中常见的拥塞问题。
Moonshot AI 与清华大学的合作不仅为大规模 AI 推理提供了新的工程解决方案,也为未来跨区域计算网络奠定了基础。这种预填充即服务(Prefill-as-a-Service)模式有望成为推动大型模型走向工业化部署的关键里程碑。
前OpenAI首席科学家Ilya的SSI首次发布模型
AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统
Anthropic 将 Claude AI 编码工具扩展至日本,以推动海外增长
Anthropic,一家美国知名的人工智能公司,正加强其全球推广力度。周三,该公司在东京举办了一场大型开发者活动“Code with Claude”,吸引了近500名软件工程师参加。该举措旨在积极将Claude AI工具及相关产品引入日本市场,强调其自主编码能力在提升企业生产力方面的核心优势。强调自动化代码生成在活动中,Anthropic展示了其先进的自主编码系统,该系统能够独立处理复杂的编程任务并优化现有代码结构。随着全球对高效开发工具的需求不断增长,Anthropic希望通过此类活动加强





首页






