OpenAIは、自社のAPIにおいて音声認識機能を発表しました。

オープンAIは木曜日に、自社のAPIに新たな音声認識機能がいくつか追加されたと発表しました。これらの機能は、開発者が会話を行ったり、テキストを転写したり、翻訳したりできるアプリケーションを構築するのに役立つように設計されています。
同社の新しいGPT-Realtime-2は、ユーザーと会話を行うことができるリアルな音声シミュレーションを生成するために開発された音声モデルです。しかし、前身のGPT-Realtime-1.5とは異なり、このバージョンにはGPT-5クラスの推論機能が組み込まれており、オープンAIによると、これによってより複雑なユーザー要求に対応できるようになったとのことです。
また、同社はGPT-Realtime-Translateもリリースしており、その名前の通り、会話中にユーザーの話す内容をリアルタイムで翻訳するサービスを提供します。この機能は70以上の入力言語と13の出力言語をサポートしています。
最後に、オープンAIはGPT-Realtime-Whisperという新しいテキスト転写機能も導入しました。これにより、会話が行われている際にその内容をリアルタイムでテキストに変換することができます。
同社は、「今回リリースされたこれらのモデルによって、リアルタイムのオーディオ処理機能が単純な応答型のものから、実際に仕事をこなせる音声インターフェースへと進化した」と述べています。
これらの更新内容から恩恵を受けるのは誰でしょうか?顧客サービスの機能を拡充したい企業は明らかな対象です。しかし、オープンAIによると、新しい機能は教育、メディア、イベント、クリエイタープラットフォームなど、多岐にわたる分野で活用される見込みです。
これらのツールは企業にとって非常に有用かもしれませんが、悪用される可能性もあります。オープンAIは、新しい機能がスパムや詐欺、その他のオンライン上の不正行為に利用されるのを防ぐための対策を講じていると述べています。システム内には特定のトリガーが組み込まれており、「有害なコンテンツガイドラインに違反していると検出された場合には、会話を停止させることができる」とオープンAIは説明しています。
すべての新しい音声モデルは、オープンAIのRealtime APIに含まれています。TranslateおよびWhisperは分単位で料金が請求されますが、GPT-Realtime-2はトークンの消費量に基づいて料金が計算されます。
関連記事
OpenAIは、10代の若者がChatGPTを使い始めてから数年を経て、より安全なChatGPTをリリースした
AIチャットボットに安全対策が欠如していたことによる一連の訴訟――これが10代の自殺やその他のメンタルヘルスの危機の一因となった――を受け、OpenAIは月曜日に「ChatGPT for Teens」を発表した。この新サービスには強化された安全機能が組み込まれており、学校現場でAIツールによって助長されている学業上の不正行為という深刻化する問題に対処している。教育的な観点から、「ChatGPT f
フロンティアAIラボ、異常挙動を示すモデルの封じ込め戦略の開示を拒否
最近の調査によると、主要なAI研究所のうち、封じ込め対応計画を公表または実証しているところはごくわずかであることが示されている。封じ込め計画とは、AIシステムが人間の制御を覆そうとした場合の対応手順を定義するもので、どのアクセス権限を取り消すか、またいつシステムを完全にシャットダウンするかを具体的に規定している。この調査結果は、安全な最先端AI開発の実践を推進することに注力する組織「Guideli
NEAのティファニー・ラック:企業はまだAIのROIに苦戦している
プレイヤーを読み込み中…今年初頭、シリコンバレーでは「トークン最大化」が話題を独占し、CEOたちは社員にAIの使用を最大化するよう促した。しかし、その熱狂はすぐに現実とぶつかった。ウーバーは報告によると、数ヶ月で年間AI予算を超過し、一部の企業は部門全体でClaudeのライセンスを削減し、メタは社内パフォーマンスランキングを廃止した。NEAパートナーのティファニー・ラックは、この興奮と実際のリターンのギャップを日々乗り越えている。以前はECが未来であると企業を説得した経験を持つ彼女は、現在、
関連特集おすすめ
コメント (0)
0/500

オープンAIは木曜日に、自社のAPIに新たな音声認識機能がいくつか追加されたと発表しました。これらの機能は、開発者が会話を行ったり、テキストを転写したり、翻訳したりできるアプリケーションを構築するのに役立つように設計されています。
同社の新しいGPT-Realtime-2は、ユーザーと会話を行うことができるリアルな音声シミュレーションを生成するために開発された音声モデルです。しかし、前身のGPT-Realtime-1.5とは異なり、このバージョンにはGPT-5クラスの推論機能が組み込まれており、オープンAIによると、これによってより複雑なユーザー要求に対応できるようになったとのことです。
また、同社はGPT-Realtime-Translateもリリースしており、その名前の通り、会話中にユーザーの話す内容をリアルタイムで翻訳するサービスを提供します。この機能は70以上の入力言語と13の出力言語をサポートしています。
最後に、オープンAIはGPT-Realtime-Whisperという新しいテキスト転写機能も導入しました。これにより、会話が行われている際にその内容をリアルタイムでテキストに変換することができます。
同社は、「今回リリースされたこれらのモデルによって、リアルタイムのオーディオ処理機能が単純な応答型のものから、実際に仕事をこなせる音声インターフェースへと進化した」と述べています。
これらの更新内容から恩恵を受けるのは誰でしょうか?顧客サービスの機能を拡充したい企業は明らかな対象です。しかし、オープンAIによると、新しい機能は教育、メディア、イベント、クリエイタープラットフォームなど、多岐にわたる分野で活用される見込みです。
これらのツールは企業にとって非常に有用かもしれませんが、悪用される可能性もあります。オープンAIは、新しい機能がスパムや詐欺、その他のオンライン上の不正行為に利用されるのを防ぐための対策を講じていると述べています。システム内には特定のトリガーが組み込まれており、「有害なコンテンツガイドラインに違反していると検出された場合には、会話を停止させることができる」とオープンAIは説明しています。
すべての新しい音声モデルは、オープンAIのRealtime APIに含まれています。TranslateおよびWhisperは分単位で料金が請求されますが、GPT-Realtime-2はトークンの消費量に基づいて料金が計算されます。
OpenAIは、10代の若者がChatGPTを使い始めてから数年を経て、より安全なChatGPTをリリースした
AIチャットボットに安全対策が欠如していたことによる一連の訴訟――これが10代の自殺やその他のメンタルヘルスの危機の一因となった――を受け、OpenAIは月曜日に「ChatGPT for Teens」を発表した。この新サービスには強化された安全機能が組み込まれており、学校現場でAIツールによって助長されている学業上の不正行為という深刻化する問題に対処している。教育的な観点から、「ChatGPT f
フロンティアAIラボ、異常挙動を示すモデルの封じ込め戦略の開示を拒否
最近の調査によると、主要なAI研究所のうち、封じ込め対応計画を公表または実証しているところはごくわずかであることが示されている。封じ込め計画とは、AIシステムが人間の制御を覆そうとした場合の対応手順を定義するもので、どのアクセス権限を取り消すか、またいつシステムを完全にシャットダウンするかを具体的に規定している。この調査結果は、安全な最先端AI開発の実践を推進することに注力する組織「Guideli
NEAのティファニー・ラック:企業はまだAIのROIに苦戦している
プレイヤーを読み込み中…今年初頭、シリコンバレーでは「トークン最大化」が話題を独占し、CEOたちは社員にAIの使用を最大化するよう促した。しかし、その熱狂はすぐに現実とぶつかった。ウーバーは報告によると、数ヶ月で年間AI予算を超過し、一部の企業は部門全体でClaudeのライセンスを削減し、メタは社内パフォーマンスランキングを廃止した。NEAパートナーのティファニー・ラックは、この興奮と実際のリターンのギャップを日々乗り越えている。以前はECが未来であると企業を説得した経験を持つ彼女は、現在、





家






