Fireworks AI 发布搭载 Opus 的 FireRouter:编码成本降低 57%,精度损失极小
Fireworks AI 推出了搭载 Opus 的 FireRouter,这是业界首个专为 Claude Opus 系列定制的缓存感知路由系统。目前,该独立路由模型已通过无服务器端点开放使用。经过超过一个月的内部 A/B 测试,FireRouter 在编码任务中实现了 98.1% 的准确率,同时与单独使用 Opus 相比,成本降低了 57%。
FireRouter 的工作原理是在每次用户交互时评估每个模型对当前任务的适用性。它计算处理成本(包括提示词缓存),并判断切换模型所节省的成本是否足以抵消缓存数据丢失带来的损失。随后,系统会将流量引导至在质量和成本之间取得最佳平衡的模型。目前,路由池包含 Claude Opus5.5、GLM5.3 和 GLM5.3Flash,并计划随着新模型的可用逐步将其纳入集成。

测试利用了内部编码流量,将会话随机分配至使用“搭载 Opus 的 FireRouter”组或仅使用 Opus 的控制组,两组的工作负载和用户群体完全相同。结果显示,每会话成本从 15.36 美元降至 6.63 美元,降幅达 57%(±19 个百分点,95% 置信区间)。在准确率方面,搭载 Opus 的 FireRouter 在评分轮次中达到 78.7%,而单独使用 Opus 为 80.2%——两者仅相差 1.5 个百分点(±1.3),相当于 Opus 整体准确率的 98.1%。
关于缓存命中率,搭载 Opus 的 FireRouter 达到 94.2%,而单独使用 Opus 为 97.8%,差距为 3.6 个百分点。Fireworks AI 指出,这是一种有意为之的微小权衡:由于开源模型能够有效处理常规编码任务,缓存感知路由通过将更简单的查询引导至更经济的模型,显著降低了整体成本。

相关文章
Claude Opus 5.2 夜灰色版发布,响应速度更快,解决懒惰问题
Opus 5.2 今晨悄然上线,促使许多开发者注意到,更新后的模型 Claude Opus 5.2 已在 Claude Code 内部开始有限范围的推送。昨晚,X 平台用户观察到,在 Claude Code 中调用 Opus 5 时,其性能远超标准网页版,宛如“降维打击”。这种路由策略在顶级 AI 公司中十分常见。数据包分析显示,尽管前端标签未变,但底层模型标识符已切换为 Opus 5.2,这表明 Anthropic 可能完全跳过了 5.1 版本。速度、精度与自动“高强度循环”下的持续执行
NVIDIA 发布 Nemotron-Labs-Audex-30B-A3B 统一音频智能模型
随着多模态大模型的快速发展,音频处理能力往往受到妥协——许多模型在提升音频理解能力的同时,却牺牲了文本逻辑。为解决这一问题,NVIDIA 研究人员推出了 Nemotron-Labs-Audex-30B-A3B(Audex),这是一款统一的音频-文本大语言模型,旨在弥合这一差距。Audex 采用精简高效的设计,基于强大的纯文本混合专家(MoE)架构构建。通过利用单个 Transformer 解码器,它同时处理文本和量化音频令牌。该方法将音频输入投影到文本嵌入空间,确保与现有用于多模态任务的大语言
如何修复移动 SEO 的核心网页指标
提升本地 SEO:构建您的 Google 实体云盘堆栈目录:简介理解 Google 实体云堆叠Google 实体云堆叠的关键优势开始使用 Google 实体云堆栈 4.1. 选项 1:获取老号 Gmail 账户 4.2. 选项 2:创建新账户配置 Google Drive 以进行实体堆栈 5.1. 了解文件夹类型 5.2. 创建公共文件夹 5.3. 跨账户共享文件夹最大化实体云堆栈的影响 6.1. 开发 SEO 友好型内容 6.2. 为您的堆栈生成反向链接管理和组织实体云堆栈的最
相关专题推荐
评论 (0)
0/500
Fireworks AI 推出了搭载 Opus 的 FireRouter,这是业界首个专为 Claude Opus 系列定制的缓存感知路由系统。目前,该独立路由模型已通过无服务器端点开放使用。经过超过一个月的内部 A/B 测试,FireRouter 在编码任务中实现了 98.1% 的准确率,同时与单独使用 Opus 相比,成本降低了 57%。
FireRouter 的工作原理是在每次用户交互时评估每个模型对当前任务的适用性。它计算处理成本(包括提示词缓存),并判断切换模型所节省的成本是否足以抵消缓存数据丢失带来的损失。随后,系统会将流量引导至在质量和成本之间取得最佳平衡的模型。目前,路由池包含 Claude Opus5.5、GLM5.3 和 GLM5.3Flash,并计划随着新模型的可用逐步将其纳入集成。

测试利用了内部编码流量,将会话随机分配至使用“搭载 Opus 的 FireRouter”组或仅使用 Opus 的控制组,两组的工作负载和用户群体完全相同。结果显示,每会话成本从 15.36 美元降至 6.63 美元,降幅达 57%(±19 个百分点,95% 置信区间)。在准确率方面,搭载 Opus 的 FireRouter 在评分轮次中达到 78.7%,而单独使用 Opus 为 80.2%——两者仅相差 1.5 个百分点(±1.3),相当于 Opus 整体准确率的 98.1%。
关于缓存命中率,搭载 Opus 的 FireRouter 达到 94.2%,而单独使用 Opus 为 97.8%,差距为 3.6 个百分点。Fireworks AI 指出,这是一种有意为之的微小权衡:由于开源模型能够有效处理常规编码任务,缓存感知路由通过将更简单的查询引导至更经济的模型,显著降低了整体成本。

Claude Opus 5.2 夜灰色版发布,响应速度更快,解决懒惰问题
Opus 5.2 今晨悄然上线,促使许多开发者注意到,更新后的模型 Claude Opus 5.2 已在 Claude Code 内部开始有限范围的推送。昨晚,X 平台用户观察到,在 Claude Code 中调用 Opus 5 时,其性能远超标准网页版,宛如“降维打击”。这种路由策略在顶级 AI 公司中十分常见。数据包分析显示,尽管前端标签未变,但底层模型标识符已切换为 Opus 5.2,这表明 Anthropic 可能完全跳过了 5.1 版本。速度、精度与自动“高强度循环”下的持续执行
NVIDIA 发布 Nemotron-Labs-Audex-30B-A3B 统一音频智能模型
随着多模态大模型的快速发展,音频处理能力往往受到妥协——许多模型在提升音频理解能力的同时,却牺牲了文本逻辑。为解决这一问题,NVIDIA 研究人员推出了 Nemotron-Labs-Audex-30B-A3B(Audex),这是一款统一的音频-文本大语言模型,旨在弥合这一差距。Audex 采用精简高效的设计,基于强大的纯文本混合专家(MoE)架构构建。通过利用单个 Transformer 解码器,它同时处理文本和量化音频令牌。该方法将音频输入投影到文本嵌入空间,确保与现有用于多模态任务的大语言
如何修复移动 SEO 的核心网页指标
提升本地 SEO:构建您的 Google 实体云盘堆栈目录:简介理解 Google 实体云堆叠Google 实体云堆叠的关键优势开始使用 Google 实体云堆栈 4.1. 选项 1:获取老号 Gmail 账户 4.2. 选项 2:创建新账户配置 Google Drive 以进行实体堆栈 5.1. 了解文件夹类型 5.2. 创建公共文件夹 5.3. 跨账户共享文件夹最大化实体云堆栈的影响 6.1. 开发 SEO 友好型内容 6.2. 为您的堆栈生成反向链接管理和组织实体云堆栈的最





首页






