OpenAI、より自然なリアルタイム会話を実現する高度な音声モデルを発表

OpenAIは、より自然な話し口を実現し、会話のやり取りをより効果的に管理できるように設計された、新しい対話型モデル「GPT-Live-1」および「GPT-Live-1 mini」をリリースしました。これらの全二重通信モデルは、話すことと聞くことを同時に行うことができるため、ユーザーが自然に会話を割り込むことが可能になり、リアルタイム翻訳などの機能も利用できるようになります。
また同社は、ChatGPTの現行「Advanced Voice Mode」に代わるデフォルト機能として、「GPT-Live-1 mini」の提供を開始しています。有料プランのユーザーは、より大規模な「GPT-Live-1」モデルを利用できるようになります。 従来、システムは音声認識モデル、応答生成用の大規模言語モデル、およびテキスト読み上げモデルを組み合わせて、最終出力を生成していました。
OpenAIは記者会見で、新しいモデルが、ユーザーが話している最中に割り込んでしまったり、質問に答えるのに十分な知能が欠けていたりといった問題に対処すると述べた。更新されたモデルは、会話の流れを維持しつつ、検索、推論、またはエージェントタスクのために、GPT-5.5などの最新のテキストモデルにクエリをルーティングする。
またOpenAIは、このモデルが話しかけられるまで長時間にわたり沈黙を保ち、会話の文脈を吸収し続けることができることを実演した。 さらに、新しい音声モードは最新のGPTモデルと統合されているため、情報を視覚的に提示することが可能です。DSTやLux Capitalから4,000万ドルのシード資金を調達したMonogramなどの他のスタートアップも、アシスタントのインタラクティブ性を高めるために視覚的な応答に注力しています。
同社は、ChatGPTの新しい音声モードが、より長い会話に対応するように設計されていると述べた。ブリーフィングでは、ChatGPT Voiceのプロダクトリードであるアティ・エレティ氏が、散歩中にこの音声機能を使って30分から40分間の会話を交わしたことを明かした。
OpenAIは、音声が複雑なコンピューティングタスクの主要なインターフェースになる可能性があると見ている。報道によると、同社は今年中にAI機能を搭載したイヤホンを発売する可能性があるが、ハードウェア製品に関する詳細は明らかにされなかった。
「将来的には、これが音声を活用してコンピューティングの主要なインターフェースとして機能させ、ますます複雑化する長期にわたるエージェント型作業を管理する能力も解き放つと考えています。人々がCodexやChatGPTを使って実現しているような驚くべきユースケースにおいて、音声こそがあらゆる種類の作業に向けた未来のインターフェースになり得ると考えています」とエレティ氏は述べた。
OpenAIはここ数年、ChatGPTの音声モードをより自然なものにするため、音声ベースの機能の強化を進めてきた。同社によると、1億5000万人以上が「Voice」および「Dictation」機能を利用してChatGPTと対話しているという。
競合他社も、自社のアシスタントの表現力を高める取り組みを進めている。
AppleとAmazonはともに、文脈処理能力を向上させ、アシスタントの会話性を高めるアップデートを実施した。Oculusの共同創業者であるブレンダン・イリベ氏とアンキット・クマール氏が共同設立したSesameのようなスタートアップ企業は、バックグラウンドタスクを処理しながら、より自然な会話ができるAIアシスタントをリリースしている。
OpenAIも同様の道を歩んでおり、ユーザーがハンズフリーでより長い時間アシスタントとやり取りできるようにすることを目指している。 新しい音声モードの音声はより自然になったと主張しているものの、同社はこれがAIコンパニオンとして設計されたものではないことを強調した。また、新しいモデルには、10代の若者に対して年齢に応じた適切な応答を提供するための安全対策が組み込まれており、自傷行為などの話題に会話が及んだ場合には関連リソースを提示する仕組みも備わっていると述べた。
新しい音声モードにはまだ改善の余地がある。ヒンディー語のリアルタイム翻訳機能のデモでは、アシスタントは強いアメリカ訛りで話し、不自然でやや堅苦しいヒンディー語を使用していた。同社は、このモードが「最も広く話されている言語」向けに最適化されていると述べたが、具体的な言語名は明言しなかった。
関連記事
ワーナーミュージックがAI帰属分析スタートアップのSureel AIを買収
ワーナー・ミュージック・グループ(WMG)は水曜日、人工知能(AI)の帰属情報スタートアップであるSureel AIを買収すると発表した。Sureelの独自技術は、楽曲に対して「AI DNA」を生成し、構成要素に分解して、AIモデルがこれらの要素をどのように利用するかを追跡する。今回の買収を通じて、WMGは、アーティストやソングライターの作品がAI生成コンテンツで利用されたり、AIモデルの学習に使用されたりする状況を監視する能力を強化する目的である。「SureelをWMGに統合することで、保
Amazonは、Alexa for Shoppingを導入しつつ、Rufusを後回しにしている
Amazonは、RufusショッピングチャットボットとAlexa+をアプリ、ウェブサイト、Echo Showデバイス全体で統合した「Alexa for Shopping」をリリースした。このアシスタントは商品の問い合わせに応じ、アイテムの比較、価格追跡、ショッピングリマインダーをサポートする。また、スケジュールされたショッピングアクションや対象となる自動購入も処理する。同社によると、「Alexa for Shopping」はRufusの商品専門知識とAlexa+のパーソナライズされたアシスタ
マイクロソフト、Azure、AI技術がカリフォルニアの山火事リスク対策に貢献
マイクロソフトはAIを活用した山火事検知技術に投資しており、CVP兼チーフデータサイエンティストのフアン・ラビスタ・フェレス氏が、環境被害を軽減するための戦略について語っている。NASAによると、気候変動は地球上のすべての人々に影響を及ぼしており、気温の上昇、降雨パターンの変化、海面上昇といった形で現れている。NASAは、地球がかつてない速度で温暖化しており、その主な要因は人間の活動であるという明
関連特集おすすめ
コメント (0)
0/500

OpenAIは、より自然な話し口を実現し、会話のやり取りをより効果的に管理できるように設計された、新しい対話型モデル「GPT-Live-1」および「GPT-Live-1 mini」をリリースしました。これらの全二重通信モデルは、話すことと聞くことを同時に行うことができるため、ユーザーが自然に会話を割り込むことが可能になり、リアルタイム翻訳などの機能も利用できるようになります。
また同社は、ChatGPTの現行「Advanced Voice Mode」に代わるデフォルト機能として、「GPT-Live-1 mini」の提供を開始しています。有料プランのユーザーは、より大規模な「GPT-Live-1」モデルを利用できるようになります。 従来、システムは音声認識モデル、応答生成用の大規模言語モデル、およびテキスト読み上げモデルを組み合わせて、最終出力を生成していました。
OpenAIは記者会見で、新しいモデルが、ユーザーが話している最中に割り込んでしまったり、質問に答えるのに十分な知能が欠けていたりといった問題に対処すると述べた。更新されたモデルは、会話の流れを維持しつつ、検索、推論、またはエージェントタスクのために、GPT-5.5などの最新のテキストモデルにクエリをルーティングする。
またOpenAIは、このモデルが話しかけられるまで長時間にわたり沈黙を保ち、会話の文脈を吸収し続けることができることを実演した。 さらに、新しい音声モードは最新のGPTモデルと統合されているため、情報を視覚的に提示することが可能です。DSTやLux Capitalから4,000万ドルのシード資金を調達したMonogramなどの他のスタートアップも、アシスタントのインタラクティブ性を高めるために視覚的な応答に注力しています。
同社は、ChatGPTの新しい音声モードが、より長い会話に対応するように設計されていると述べた。ブリーフィングでは、ChatGPT Voiceのプロダクトリードであるアティ・エレティ氏が、散歩中にこの音声機能を使って30分から40分間の会話を交わしたことを明かした。
OpenAIは、音声が複雑なコンピューティングタスクの主要なインターフェースになる可能性があると見ている。報道によると、同社は今年中にAI機能を搭載したイヤホンを発売する可能性があるが、ハードウェア製品に関する詳細は明らかにされなかった。
「将来的には、これが音声を活用してコンピューティングの主要なインターフェースとして機能させ、ますます複雑化する長期にわたるエージェント型作業を管理する能力も解き放つと考えています。人々がCodexやChatGPTを使って実現しているような驚くべきユースケースにおいて、音声こそがあらゆる種類の作業に向けた未来のインターフェースになり得ると考えています」とエレティ氏は述べた。
OpenAIはここ数年、ChatGPTの音声モードをより自然なものにするため、音声ベースの機能の強化を進めてきた。同社によると、1億5000万人以上が「Voice」および「Dictation」機能を利用してChatGPTと対話しているという。
競合他社も、自社のアシスタントの表現力を高める取り組みを進めている。
AppleとAmazonはともに、文脈処理能力を向上させ、アシスタントの会話性を高めるアップデートを実施した。Oculusの共同創業者であるブレンダン・イリベ氏とアンキット・クマール氏が共同設立したSesameのようなスタートアップ企業は、バックグラウンドタスクを処理しながら、より自然な会話ができるAIアシスタントをリリースしている。
OpenAIも同様の道を歩んでおり、ユーザーがハンズフリーでより長い時間アシスタントとやり取りできるようにすることを目指している。 新しい音声モードの音声はより自然になったと主張しているものの、同社はこれがAIコンパニオンとして設計されたものではないことを強調した。また、新しいモデルには、10代の若者に対して年齢に応じた適切な応答を提供するための安全対策が組み込まれており、自傷行為などの話題に会話が及んだ場合には関連リソースを提示する仕組みも備わっていると述べた。
新しい音声モードにはまだ改善の余地がある。ヒンディー語のリアルタイム翻訳機能のデモでは、アシスタントは強いアメリカ訛りで話し、不自然でやや堅苦しいヒンディー語を使用していた。同社は、このモードが「最も広く話されている言語」向けに最適化されていると述べたが、具体的な言語名は明言しなかった。
ワーナーミュージックがAI帰属分析スタートアップのSureel AIを買収
ワーナー・ミュージック・グループ(WMG)は水曜日、人工知能(AI)の帰属情報スタートアップであるSureel AIを買収すると発表した。Sureelの独自技術は、楽曲に対して「AI DNA」を生成し、構成要素に分解して、AIモデルがこれらの要素をどのように利用するかを追跡する。今回の買収を通じて、WMGは、アーティストやソングライターの作品がAI生成コンテンツで利用されたり、AIモデルの学習に使用されたりする状況を監視する能力を強化する目的である。「SureelをWMGに統合することで、保
マイクロソフト、Azure、AI技術がカリフォルニアの山火事リスク対策に貢献
マイクロソフトはAIを活用した山火事検知技術に投資しており、CVP兼チーフデータサイエンティストのフアン・ラビスタ・フェレス氏が、環境被害を軽減するための戦略について語っている。NASAによると、気候変動は地球上のすべての人々に影響を及ぼしており、気温の上昇、降雨パターンの変化、海面上昇といった形で現れている。NASAは、地球がかつてない速度で温暖化しており、その主な要因は人間の活動であるという明





家






