OpenAI、GPT-5レベルの推論能力を備えた3つのリアルタイム音声モデルを発表

AI大手のOpenAIは、3つの新しいリアルタイム音声モデル「GPT-Realtime-2」、「GPT-Realtime-Translate」、「GPT-Realtime-Whisper」を正式にリリースし、音声技術の新たな地平を切り拓きました。 これらのモデルは現在、開発者向けのRealtime APIに統合されており、高遅延、自然な割り込み処理の欠如、多言語対応の問題など、音声インタラクションにおける一般的な課題の解決を目指しています。
今回のリリースで特に注目されるのは「GPT-Realtime-2」です。これは、現時点で最も知能の高いAI音声モデルであり、GPT-5レベルの推論能力を備えた初の音声ツールとされています。 従来の音声アシスタントとは異なり、極めて自然で滑らかな会話を可能にすると同時に、リアルタイムでの論理的推論を実行し、外部ツールをシームレスに呼び出し、ユーザーによる割り込みや訂正を正確に検出して対応することができます。この画期的な進歩は、将来の音声アシスタントが単なるコマンド実行ツールから、多段階の複雑なタスクを管理できるリアルタイムの協働パートナーへと進化することを示唆しています。
GPT-Realtime-2の価格は、音声入力の場合、100万トークンあたり32ドル(約218人民元)、出力の場合は100万トークンあたり64ドル(約436人民元)に設定されています。キャッシュされた入力のコストは、100万トークンあたりわずか0.4ドルと、大幅に低くなっています。
中核となる推論モデルに加え、他の2つの機能モデルもそれぞれ独自の能力を備えています。GPT-Realtime-Translateは優れた翻訳性能を発揮し、70の入力言語と13の出力言語にわたるリアルタイム変換に対応しています。その翻訳速度は話者のペースにほぼ追従するため、国際会議のような要求の厳しいリアルタイムコミュニケーションの場面に最適です。 一方、GPT-Realtime-Whisperは、超低遅延のストリーミング文字起こしに重点を置いており、「音声が話者の動きに追従する」ような体験を提供することで、会議の議事録やライブ字幕の待ち時間を大幅に短縮します。これら2つのモデルはより柔軟な課金体系を採用しており、それぞれ1分あたり0.034ドルおよび0.017ドルで課金されます。
業界アナリストらは、OpenAIの今回の動きを、AI音声インタラクションが「単純な応答」から「深いリアルタイム理解」へと移行する兆候と捉えており、これによりインテリジェント時代における同社の技術的リーダーシップがさらに確固たるものになると見ています。
関連記事
ユーザーからの反発を受け、MetaはAI写真編集機能を削除
Meta、ソーシャルメディアの巨人は、人工知能とユーザープライバシーの微妙なバランスをめぐる公的な論争に再び巻き込まれている。TechCrunch によると、Meta の Superintelligence Labs は今週初めに新しい AI 画像ジェネレーター「Muse Image」を導入した。しかし、ユーザーが「@」記号でタグ付けすることで、公開されている Instagram アカウントから画像を修正・生成できるという、高い評価を受けた主要機能は、適切な通知メカニズムの欠如により、ユーザー
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン
関連特集おすすめ
コメント (0)
0/500

AI大手のOpenAIは、3つの新しいリアルタイム音声モデル「GPT-Realtime-2」、「GPT-Realtime-Translate」、「GPT-Realtime-Whisper」を正式にリリースし、音声技術の新たな地平を切り拓きました。 これらのモデルは現在、開発者向けのRealtime APIに統合されており、高遅延、自然な割り込み処理の欠如、多言語対応の問題など、音声インタラクションにおける一般的な課題の解決を目指しています。
今回のリリースで特に注目されるのは「GPT-Realtime-2」です。これは、現時点で最も知能の高いAI音声モデルであり、GPT-5レベルの推論能力を備えた初の音声ツールとされています。 従来の音声アシスタントとは異なり、極めて自然で滑らかな会話を可能にすると同時に、リアルタイムでの論理的推論を実行し、外部ツールをシームレスに呼び出し、ユーザーによる割り込みや訂正を正確に検出して対応することができます。この画期的な進歩は、将来の音声アシスタントが単なるコマンド実行ツールから、多段階の複雑なタスクを管理できるリアルタイムの協働パートナーへと進化することを示唆しています。
GPT-Realtime-2の価格は、音声入力の場合、100万トークンあたり32ドル(約218人民元)、出力の場合は100万トークンあたり64ドル(約436人民元)に設定されています。キャッシュされた入力のコストは、100万トークンあたりわずか0.4ドルと、大幅に低くなっています。
中核となる推論モデルに加え、他の2つの機能モデルもそれぞれ独自の能力を備えています。GPT-Realtime-Translateは優れた翻訳性能を発揮し、70の入力言語と13の出力言語にわたるリアルタイム変換に対応しています。その翻訳速度は話者のペースにほぼ追従するため、国際会議のような要求の厳しいリアルタイムコミュニケーションの場面に最適です。 一方、GPT-Realtime-Whisperは、超低遅延のストリーミング文字起こしに重点を置いており、「音声が話者の動きに追従する」ような体験を提供することで、会議の議事録やライブ字幕の待ち時間を大幅に短縮します。これら2つのモデルはより柔軟な課金体系を採用しており、それぞれ1分あたり0.034ドルおよび0.017ドルで課金されます。
業界アナリストらは、OpenAIの今回の動きを、AI音声インタラクションが「単純な応答」から「深いリアルタイム理解」へと移行する兆候と捉えており、これによりインテリジェント時代における同社の技術的リーダーシップがさらに確固たるものになると見ています。
ユーザーからの反発を受け、MetaはAI写真編集機能を削除
Meta、ソーシャルメディアの巨人は、人工知能とユーザープライバシーの微妙なバランスをめぐる公的な論争に再び巻き込まれている。TechCrunch によると、Meta の Superintelligence Labs は今週初めに新しい AI 画像ジェネレーター「Muse Image」を導入した。しかし、ユーザーが「@」記号でタグ付けすることで、公開されている Instagram アカウントから画像を修正・生成できるという、高い評価を受けた主要機能は、適切な通知メカニズムの欠如により、ユーザー
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン





家






