OpenAI、新双方向音声モデルGPT-Bidi-1を準備中
OpenAIは、ChatGPTの音声機能を革新するために設計された次世代双方向音声モデル「GPT-Bidi-1」のリリースを準備していると報じられている。双方向アーキテクチャを採用することで、この画期的なモデルは従来の単方向通信の制限を解消し、システムが同時に聴取と発話を行うことを可能にする。これにより、ユーザーの割り込みをリアルタイムで捉え、 stuttering(つまずき)なく動的な意味調整を行うことができ、ライブ音声インタラクションの自然な流れを大幅に向上させる。

開発状況によると、OpenAIはこのモデルの基盤コードをすでにウェブおよびモバイルプラットフォームに統合している。新しい機能は既存の「高度な音声モード」と共存し、ユーザーは必要に応じて更新された「双方向(Bidi)」モードに切り替える柔軟性を得る。さらに、このモデルは「高品質」「標準」「即時」の3つの異なるパフォーマンスティアを導入し、ユーザーは特定のニーズに基づいてインタラクションの深さと応答速度のバランスを取ることができる。

この技術的飛躍は、単なる音声品質の向上を超え、OpenAIのより広範なマルチモーダル戦略における重要な構成要素となっている。
OpenAIのテキストベースモデルは推論能力を強化したGPT-5.5へと進化した一方で、その音声機能は遅れを取っており、全体的なマルチモーダル体験に格差が生じていた。GPT-Bidi-1の導入はこのギャップを埋めるものであり、OpenAIが次世代AIにおける主要なインターフェースとして音声を位置づけるという戦略的ビジョンを強調するものである。この進展は、今後の音声優先ハードウェアデバイスやエンタープライズグレードの音声サポートツールにとって、重要な技術的基盤を確立するものでもある。
関連記事
Anthropic、ユーザーがアクセスを失った後、Claudeアカウントがハッキングされたことを確認
複数のClaudeユーザーが、アクティブな利用がないにもかかわらず、アカウントのクォータが急速に枯渇していることをソーシャルメディアで最近報告しています。Anthropicの調査により、ハッカーが悪性ソフトウェアを通じてログインセッションを窃取し、ユーザーアカウントに不正アクセスした上で、被害者の貴重な呼び出しクォータを悪用していたことが明らかになりました。この侵害は、イギリス東サセックス在住の独立系AIコンサルタントであるグラント・ダーシー氏によって、8月4日に最初に発見されました。彼は積極
OpenAI、数学およびAI諮問グループを設立;謎のモデルが24日間で100の世界的な問題を解決
9月22日、OpenAIは「数学と人工知能に関する諮問グループ」の設立を発表した。プリンストンの高等研究所を本部とするこの独立した機関は、OpenAIとは別に活動する9人の数学者で構成されている。さらに注目すべきは、8月28日から学習を開始した謎のモデルが、論争の的となっているナビエ-ストークス千年賞問題を含む、さまざまな数学分野における100以上の長年の未解決問題の解決に成功したとOpenAIが明らかにした点である。数学者たちは急速な進歩に驚愕し、学術的な開示に関する内部議論が巻き起こって
Senspeech X2.5 Twin Stars:エッジにおける初の百万トークンコンテキスト、国内の計算資源で完全にトレーニング済み
9月1日、iFLYTEKの完全子会社であるCiyuan Xinghuoは、2つのエッジ側向け汎用大規模モデル「Xinghuo X2.5-4B」と「Xinghuo X2.5-1.7B」を正式にリリースし、オープンソース化しました。これらのモデルは、最大100万トークンのコンテキスト長をネイティブにサポートする初のモデルであり、モデル重み、コードリポジトリ、デプロイメントドキュメントへの完全なアクセスを提供します。100万レベルのコンテキストサポート、小規模モデルでも「書籍全体を読める」両モデルはハ
関連特集おすすめ
コメント (0)
0/500
OpenAIは、ChatGPTの音声機能を革新するために設計された次世代双方向音声モデル「GPT-Bidi-1」のリリースを準備していると報じられている。双方向アーキテクチャを採用することで、この画期的なモデルは従来の単方向通信の制限を解消し、システムが同時に聴取と発話を行うことを可能にする。これにより、ユーザーの割り込みをリアルタイムで捉え、 stuttering(つまずき)なく動的な意味調整を行うことができ、ライブ音声インタラクションの自然な流れを大幅に向上させる。

開発状況によると、OpenAIはこのモデルの基盤コードをすでにウェブおよびモバイルプラットフォームに統合している。新しい機能は既存の「高度な音声モード」と共存し、ユーザーは必要に応じて更新された「双方向(Bidi)」モードに切り替える柔軟性を得る。さらに、このモデルは「高品質」「標準」「即時」の3つの異なるパフォーマンスティアを導入し、ユーザーは特定のニーズに基づいてインタラクションの深さと応答速度のバランスを取ることができる。

この技術的飛躍は、単なる音声品質の向上を超え、OpenAIのより広範なマルチモーダル戦略における重要な構成要素となっている。
OpenAIのテキストベースモデルは推論能力を強化したGPT-5.5へと進化した一方で、その音声機能は遅れを取っており、全体的なマルチモーダル体験に格差が生じていた。GPT-Bidi-1の導入はこのギャップを埋めるものであり、OpenAIが次世代AIにおける主要なインターフェースとして音声を位置づけるという戦略的ビジョンを強調するものである。この進展は、今後の音声優先ハードウェアデバイスやエンタープライズグレードの音声サポートツールにとって、重要な技術的基盤を確立するものでもある。
Anthropic、ユーザーがアクセスを失った後、Claudeアカウントがハッキングされたことを確認
複数のClaudeユーザーが、アクティブな利用がないにもかかわらず、アカウントのクォータが急速に枯渇していることをソーシャルメディアで最近報告しています。Anthropicの調査により、ハッカーが悪性ソフトウェアを通じてログインセッションを窃取し、ユーザーアカウントに不正アクセスした上で、被害者の貴重な呼び出しクォータを悪用していたことが明らかになりました。この侵害は、イギリス東サセックス在住の独立系AIコンサルタントであるグラント・ダーシー氏によって、8月4日に最初に発見されました。彼は積極
OpenAI、数学およびAI諮問グループを設立;謎のモデルが24日間で100の世界的な問題を解決
9月22日、OpenAIは「数学と人工知能に関する諮問グループ」の設立を発表した。プリンストンの高等研究所を本部とするこの独立した機関は、OpenAIとは別に活動する9人の数学者で構成されている。さらに注目すべきは、8月28日から学習を開始した謎のモデルが、論争の的となっているナビエ-ストークス千年賞問題を含む、さまざまな数学分野における100以上の長年の未解決問題の解決に成功したとOpenAIが明らかにした点である。数学者たちは急速な進歩に驚愕し、学術的な開示に関する内部議論が巻き起こって
Senspeech X2.5 Twin Stars:エッジにおける初の百万トークンコンテキスト、国内の計算資源で完全にトレーニング済み
9月1日、iFLYTEKの完全子会社であるCiyuan Xinghuoは、2つのエッジ側向け汎用大規模モデル「Xinghuo X2.5-4B」と「Xinghuo X2.5-1.7B」を正式にリリースし、オープンソース化しました。これらのモデルは、最大100万トークンのコンテキスト長をネイティブにサポートする初のモデルであり、モデル重み、コードリポジトリ、デプロイメントドキュメントへの完全なアクセスを提供します。100万レベルのコンテキストサポート、小規模モデルでも「書籍全体を読める」両モデルはハ





家






