Fireworks AI、Opus搭載のFireRouterを発表:精度の大幅な低下を抑えつつ、エンコーディングコストを57%削減
Fireworks AIは、Claude Opusシリーズ向けに設計された業界初のキャッシュ対応ルーティングシステム「FireRouter with Opus」を発表しました。サーバーレスエンドポイントを通じて利用可能となったこの独立型ルーティングモデルは、1ヶ月以上の内部A/Bテストを経て、エンコーディングタスクにおいて98.1%の精度を達成し、Opus単独使用と比較してコストを57%削減しました。
FireRouterは、各ユーザーインタラクション中に現在のタスクに対する各モデルの適合性を評価して動作します。プロンプトキャッシュを含む処理コストを計算し、モデルを切り替えることでキャッシュデータの損失を補って余りあるコスト節約が可能かどうかを判断します。その後、システムは品質と費用の最適なバランスを提供するモデルへトラフィックをルーティングします。現在、ルーティングプールにはClaude Opus5.5、GLM5.3、GLM5.3Flashが含まれており、利用可能な新モデルの統合も計画されています。

テストでは、内部のエンコーディングトラフィックを使用し、セッションをランダムに「FireRouter with Opus」グループまたはOpusのみを使用するコントロールグループに割り当て、同じワークロードとユーザーベースで比較しました。結果、セッションあたりのコストは15.36ドルから6.63ドルに減少し、57%の削減となりました(±19パーセントポイント、95%信頼区間)。精度面では、FireRouter with Opusはスコアリングラウンドで78.7%を達成し、Opus単独の80.2%と比較してわずか1.5パーセントポイントの差(±1.3)であり、これはOpus全体の精度の98.1%に相当します。
キャッシュヒット率について、FireRouter with Opusは94.2%を達成し、Opus単独の97.8%と比較して3.6パーセントポイントの差がありました。Fireworks AIはこの差は意図的で軽微なトレードオフであると指摘しています。オープンソースモデルが日常的なエンコーディングタスクを効果的に処理できるため、キャッシュ対応ルーティングにより、より安価なモデルへ単純なクエリを振り分けることで、全体のコストを大幅に削減できるからです。

関連記事
Claude Opus 5.2 ナイトグレーがより高速なレスポンスで発売され、怠慢な問題が解決されました
Opus 5.2 が今朝静かにリリースされ、多くの開発者が更新されたモデル「Claude Opus 5.2」が Claude Code 内で限定ロールアウトを開始したことに気づいた。昨日の夜、X のユーザーは Claude Code で Opus 5 を呼び出すと、標準的なウェブバージョンよりも大幅に優れたパフォーマンスを発揮し、「次元の壁を越えた攻撃」のような結果になることを観察した。このルーティング戦略はトップ AI 企業では一般的である。パケット分析の結果、フロントエンドのラベルは変更さ
NVIDIA、Nemotron-Labs-Audex-30B-A3B 統合音声知能モデルを公開
マルチモーダル大規模モデルが急速に進化する中、音声処理能力がしばしば犠牲になっている—多くのモデルはテキストの論理を犠牲にして音声理解を向上させている。この課題に対処するため、NVIDIAの研究者たちはNemotron-Labs-Audex-30B-A3B(Audex)を発表した。これは、このギャップを埋めるために設計された統一された音声・テキスト大規模言語モデルである。Audexは、堅牢な純粋テキストベースのMixture of Experts(MoE)アーキテクチャを基盤とした、簡潔で効率
モバイルSEOのためのコアウェブバイタルの修正方法
ローカルSEOを強化する:Googleエンティティクラウドドライブスタックを構築する目次:はじめにGoogleエンティティクラウドスタッキングの理解Googleエンティティクラウドスタッキングの主な利点Googleエンティティクラウドスタックの始め方 4.1. オプション1:古参Gmailアカウントの取得 4.2. オプション2:新規アカウントの作成エンティティスタック用のGoogle Driveの設定 5.1. フォルダタイプの理解 5.2. パブリックフォルダの作成 5.3. ア
関連特集おすすめ
コメント (0)
0/500
Fireworks AIは、Claude Opusシリーズ向けに設計された業界初のキャッシュ対応ルーティングシステム「FireRouter with Opus」を発表しました。サーバーレスエンドポイントを通じて利用可能となったこの独立型ルーティングモデルは、1ヶ月以上の内部A/Bテストを経て、エンコーディングタスクにおいて98.1%の精度を達成し、Opus単独使用と比較してコストを57%削減しました。
FireRouterは、各ユーザーインタラクション中に現在のタスクに対する各モデルの適合性を評価して動作します。プロンプトキャッシュを含む処理コストを計算し、モデルを切り替えることでキャッシュデータの損失を補って余りあるコスト節約が可能かどうかを判断します。その後、システムは品質と費用の最適なバランスを提供するモデルへトラフィックをルーティングします。現在、ルーティングプールにはClaude Opus5.5、GLM5.3、GLM5.3Flashが含まれており、利用可能な新モデルの統合も計画されています。

テストでは、内部のエンコーディングトラフィックを使用し、セッションをランダムに「FireRouter with Opus」グループまたはOpusのみを使用するコントロールグループに割り当て、同じワークロードとユーザーベースで比較しました。結果、セッションあたりのコストは15.36ドルから6.63ドルに減少し、57%の削減となりました(±19パーセントポイント、95%信頼区間)。精度面では、FireRouter with Opusはスコアリングラウンドで78.7%を達成し、Opus単独の80.2%と比較してわずか1.5パーセントポイントの差(±1.3)であり、これはOpus全体の精度の98.1%に相当します。
キャッシュヒット率について、FireRouter with Opusは94.2%を達成し、Opus単独の97.8%と比較して3.6パーセントポイントの差がありました。Fireworks AIはこの差は意図的で軽微なトレードオフであると指摘しています。オープンソースモデルが日常的なエンコーディングタスクを効果的に処理できるため、キャッシュ対応ルーティングにより、より安価なモデルへ単純なクエリを振り分けることで、全体のコストを大幅に削減できるからです。

Claude Opus 5.2 ナイトグレーがより高速なレスポンスで発売され、怠慢な問題が解決されました
Opus 5.2 が今朝静かにリリースされ、多くの開発者が更新されたモデル「Claude Opus 5.2」が Claude Code 内で限定ロールアウトを開始したことに気づいた。昨日の夜、X のユーザーは Claude Code で Opus 5 を呼び出すと、標準的なウェブバージョンよりも大幅に優れたパフォーマンスを発揮し、「次元の壁を越えた攻撃」のような結果になることを観察した。このルーティング戦略はトップ AI 企業では一般的である。パケット分析の結果、フロントエンドのラベルは変更さ
NVIDIA、Nemotron-Labs-Audex-30B-A3B 統合音声知能モデルを公開
マルチモーダル大規模モデルが急速に進化する中、音声処理能力がしばしば犠牲になっている—多くのモデルはテキストの論理を犠牲にして音声理解を向上させている。この課題に対処するため、NVIDIAの研究者たちはNemotron-Labs-Audex-30B-A3B(Audex)を発表した。これは、このギャップを埋めるために設計された統一された音声・テキスト大規模言語モデルである。Audexは、堅牢な純粋テキストベースのMixture of Experts(MoE)アーキテクチャを基盤とした、簡潔で効率
モバイルSEOのためのコアウェブバイタルの修正方法
ローカルSEOを強化する:Googleエンティティクラウドドライブスタックを構築する目次:はじめにGoogleエンティティクラウドスタッキングの理解Googleエンティティクラウドスタッキングの主な利点Googleエンティティクラウドスタックの始め方 4.1. オプション1:古参Gmailアカウントの取得 4.2. オプション2:新規アカウントの作成エンティティスタック用のGoogle Driveの設定 5.1. フォルダタイプの理解 5.2. パブリックフォルダの作成 5.3. ア





家






