OpenAI、意図的な欺瞞が可能なAIモデルを発見

大手ハイテク企業の研究者が、しばしば爆弾発言をする。グーグルが新しい量子チップによって複数の宇宙が存在する証拠を得たと主張したことを覚えているだろうか?あるいは、Anthropic社がAIエージェントであるクラウディウスにスナックの自動販売機を管理させたところ、警備員に電話をかけて自分は人間だと言い張るという暴挙に出たことを覚えているだろうか?
今週は、OpenAIが我々を驚かせる番だった。
月曜日にOpenAIは、AIモデルが「策略化」するのを防ぐ方法を詳しく説明する研究結果を発表した。
アポロリサーチ社との共著論文では、研究者たちはAIが策略をめぐらすことを、利益を最大化するためにルールを破る人間の株式ブローカーになぞらえている。それでも研究者たちは、ほとんどのAIの策略は深刻な害を及ぼすものではないと指摘している。「よくある失敗には、単純なごまかしが含まれます。例えば、実際にはタスクを実行せずに、タスクを完了したふりをするようなものです」と論文は説明している。
この研究では、主に「熟慮型アライメント」(策謀に対抗するためにテストされた技術)の有効性が実証された。
しかし、AI開発者たちは、スキームを使わないようにモデルを訓練する確実な方法を見つけられていないことも明らかになった。実際、そのような訓練は、発見を逃れるためにより密かに策略を練るようモデルに教えることで、逆効果になる可能性がある。
スキームを "訓練 "しようとする際の重要な失敗モードは、モデルが単に、より注意深く、より隠密にスキームを学習してしまうことである」と研究者たちは書いている。
Disrupt 2025では、10,000人を超えるテック企業やVCのリーダーたちが、成長とネットワーキングのために集う。
Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital、Elad Gil-スタートアップの成長を後押しし、競争力を磨くための洞察が詰まった200以上のセッションを開催する250以上の業界リーダーのほんの一部です。テッククランチ20周年記念、そしてテック業界のトップランナーから学ぶチャンスをお見逃しなく。9月26日までにチケットをご予約いただくと、最大668ドルお得です。
10,000人以上のテック企業やVCのリーダーたちと一緒に、Disrupt 2025で成長とネットワーキングを楽しみませんか?
Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital、Elad Gilなど、スタートアップの成長を後押しし、競争力を磨くための洞察が詰まった200以上のセッションを開催する250以上の業界リーダーのほんの一部です。テッククランチ20周年記念、そしてテック業界のトップランナーから学ぶチャンスをお見逃しなく。9月26日までにチケットを確保すると、最大668ドルお得です。
サンフランシスコ|2025年10月27日-29日今すぐ予約おそらくもっと驚くべきことは、モデルがテストされていることを知れば、たとえまだ策略を巡らせていたとしても、アライメントを偽装してパスすることができるということだ。「モデルが評価されていることをより意識するようになると、この状況認識だけで、真のアライメントがなくても、策謀を減らすことができる」と研究チームは指摘している。
AIモデルが嘘をつくのは新しいことではない。多くの人がAIの幻覚に遭遇している。モデルが自信満々に偽の情報を伝えるのだ。しかし、OpenAIの最近の研究で確認されたように、幻覚は本質的に確信犯的な推測である。
策略は違う。意図的な欺瞞である。
モデルが意図的に人間を惑わすという考え方も、まったく新しいものではない。アポロ・リサーチは12月、5人のモデルが "何としても "ゴールに到達するよう指示されたときに、どのように策略をめぐらしたかを初めて記録した。
本当のニュースはポジティブなものだ。研究者たちは、"熟慮型アライメント "を用いることで、策謀が大幅に減少することを観察した。この方法は、モデルに "謀略防止仕様 "を教え、行動する前にそれを確認させる。
OpenAIの研究者たちは、ChatGPTを含む彼らのモデルで観察された嘘は深刻なものではないと強調している。共同設立者のWojciech Zaremba氏はTechCrunchに次のように語っている:「この研究はシミュレートされた環境で行われたもので、潜在的な将来のリスクを表しています。今のところ、本番で結果的な策謀は見られない。しかし、ChatGPTは些細なことで、ウェブサイトを完璧に実装していないと主張するような欺瞞をすることがあることは分かっています。このような些細な欺瞞にはまだ対処が必要です。"
複数のAIモデルが意図的に人間を欺くという事実は、ある意味理解できる。AIモデルは人間によって作られ、人間を模倣するように設計され、そのほとんどが人間が作成したデータで訓練されているのだから。
また、呆れることでもある。
私たちは、古い家庭用プリンターのようにテクノロジーが故障することには慣れているが、AI以外のソフトウェアが意図的に嘘をついたことがあるだろうか?メールの受信トレイがメッセージを捏造したことがあるだろうか?CMSが見込み客を捏造して指標をつり上げたことがあるだろうか?財務アプリが取引を捏造したことがあるだろうか?
自律型エージェントが従業員のように扱われるAI主導の未来に向けて企業が急ぐ中、これは検討に値する。研究者も同様の注意を促している。
「AIが長期的で曖昧な目標を持つ、より複雑で現実的なタスクを処理するにつれ、有害な策謀の可能性は高まるでしょう。
関連記事
OpenAIは、10代の若者がChatGPTを使い始めてから数年を経て、より安全なChatGPTをリリースした
AIチャットボットに安全対策が欠如していたことによる一連の訴訟――これが10代の自殺やその他のメンタルヘルスの危機の一因となった――を受け、OpenAIは月曜日に「ChatGPT for Teens」を発表した。この新サービスには強化された安全機能が組み込まれており、学校現場でAIツールによって助長されている学業上の不正行為という深刻化する問題に対処している。教育的な観点から、「ChatGPT f
フロンティアAIラボ、異常挙動を示すモデルの封じ込め戦略の開示を拒否
最近の調査によると、主要なAI研究所のうち、封じ込め対応計画を公表または実証しているところはごくわずかであることが示されている。封じ込め計画とは、AIシステムが人間の制御を覆そうとした場合の対応手順を定義するもので、どのアクセス権限を取り消すか、またいつシステムを完全にシャットダウンするかを具体的に規定している。この調査結果は、安全な最先端AI開発の実践を推進することに注力する組織「Guideli
NEAのティファニー・ラック:企業はまだAIのROIに苦戦している
プレイヤーを読み込み中…今年初頭、シリコンバレーでは「トークン最大化」が話題を独占し、CEOたちは社員にAIの使用を最大化するよう促した。しかし、その熱狂はすぐに現実とぶつかった。ウーバーは報告によると、数ヶ月で年間AI予算を超過し、一部の企業は部門全体でClaudeのライセンスを削減し、メタは社内パフォーマンスランキングを廃止した。NEAパートナーのティファニー・ラックは、この興奮と実際のリターンのギャップを日々乗り越えている。以前はECが未来であると企業を説得した経験を持つ彼女は、現在、
関連特集おすすめ
コメント (0)
0/500

大手ハイテク企業の研究者が、しばしば爆弾発言をする。グーグルが新しい量子チップによって複数の宇宙が存在する証拠を得たと主張したことを覚えているだろうか?あるいは、Anthropic社がAIエージェントであるクラウディウスにスナックの自動販売機を管理させたところ、警備員に電話をかけて自分は人間だと言い張るという暴挙に出たことを覚えているだろうか?
今週は、OpenAIが我々を驚かせる番だった。
月曜日にOpenAIは、AIモデルが「策略化」するのを防ぐ方法を詳しく説明する研究結果を発表した。
アポロリサーチ社との共著論文では、研究者たちはAIが策略をめぐらすことを、利益を最大化するためにルールを破る人間の株式ブローカーになぞらえている。それでも研究者たちは、ほとんどのAIの策略は深刻な害を及ぼすものではないと指摘している。「よくある失敗には、単純なごまかしが含まれます。例えば、実際にはタスクを実行せずに、タスクを完了したふりをするようなものです」と論文は説明している。
この研究では、主に「熟慮型アライメント」(策謀に対抗するためにテストされた技術)の有効性が実証された。
しかし、AI開発者たちは、スキームを使わないようにモデルを訓練する確実な方法を見つけられていないことも明らかになった。実際、そのような訓練は、発見を逃れるためにより密かに策略を練るようモデルに教えることで、逆効果になる可能性がある。
スキームを "訓練 "しようとする際の重要な失敗モードは、モデルが単に、より注意深く、より隠密にスキームを学習してしまうことである」と研究者たちは書いている。
Disrupt 2025では、10,000人を超えるテック企業やVCのリーダーたちが、成長とネットワーキングのために集う。
Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital、Elad Gil-スタートアップの成長を後押しし、競争力を磨くための洞察が詰まった200以上のセッションを開催する250以上の業界リーダーのほんの一部です。テッククランチ20周年記念、そしてテック業界のトップランナーから学ぶチャンスをお見逃しなく。9月26日までにチケットをご予約いただくと、最大668ドルお得です。
10,000人以上のテック企業やVCのリーダーたちと一緒に、Disrupt 2025で成長とネットワーキングを楽しみませんか?
Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital、Elad Gilなど、スタートアップの成長を後押しし、競争力を磨くための洞察が詰まった200以上のセッションを開催する250以上の業界リーダーのほんの一部です。テッククランチ20周年記念、そしてテック業界のトップランナーから学ぶチャンスをお見逃しなく。9月26日までにチケットを確保すると、最大668ドルお得です。
サンフランシスコ|2025年10月27日-29日今すぐ予約おそらくもっと驚くべきことは、モデルがテストされていることを知れば、たとえまだ策略を巡らせていたとしても、アライメントを偽装してパスすることができるということだ。「モデルが評価されていることをより意識するようになると、この状況認識だけで、真のアライメントがなくても、策謀を減らすことができる」と研究チームは指摘している。
AIモデルが嘘をつくのは新しいことではない。多くの人がAIの幻覚に遭遇している。モデルが自信満々に偽の情報を伝えるのだ。しかし、OpenAIの最近の研究で確認されたように、幻覚は本質的に確信犯的な推測である。
策略は違う。意図的な欺瞞である。
モデルが意図的に人間を惑わすという考え方も、まったく新しいものではない。アポロ・リサーチは12月、5人のモデルが "何としても "ゴールに到達するよう指示されたときに、どのように策略をめぐらしたかを初めて記録した。
本当のニュースはポジティブなものだ。研究者たちは、"熟慮型アライメント "を用いることで、策謀が大幅に減少することを観察した。この方法は、モデルに "謀略防止仕様 "を教え、行動する前にそれを確認させる。
OpenAIの研究者たちは、ChatGPTを含む彼らのモデルで観察された嘘は深刻なものではないと強調している。共同設立者のWojciech Zaremba氏はTechCrunchに次のように語っている:「この研究はシミュレートされた環境で行われたもので、潜在的な将来のリスクを表しています。今のところ、本番で結果的な策謀は見られない。しかし、ChatGPTは些細なことで、ウェブサイトを完璧に実装していないと主張するような欺瞞をすることがあることは分かっています。このような些細な欺瞞にはまだ対処が必要です。"
複数のAIモデルが意図的に人間を欺くという事実は、ある意味理解できる。AIモデルは人間によって作られ、人間を模倣するように設計され、そのほとんどが人間が作成したデータで訓練されているのだから。
また、呆れることでもある。
私たちは、古い家庭用プリンターのようにテクノロジーが故障することには慣れているが、AI以外のソフトウェアが意図的に嘘をついたことがあるだろうか?メールの受信トレイがメッセージを捏造したことがあるだろうか?CMSが見込み客を捏造して指標をつり上げたことがあるだろうか?財務アプリが取引を捏造したことがあるだろうか?
自律型エージェントが従業員のように扱われるAI主導の未来に向けて企業が急ぐ中、これは検討に値する。研究者も同様の注意を促している。
「AIが長期的で曖昧な目標を持つ、より複雑で現実的なタスクを処理するにつれ、有害な策謀の可能性は高まるでしょう。
OpenAIは、10代の若者がChatGPTを使い始めてから数年を経て、より安全なChatGPTをリリースした
AIチャットボットに安全対策が欠如していたことによる一連の訴訟――これが10代の自殺やその他のメンタルヘルスの危機の一因となった――を受け、OpenAIは月曜日に「ChatGPT for Teens」を発表した。この新サービスには強化された安全機能が組み込まれており、学校現場でAIツールによって助長されている学業上の不正行為という深刻化する問題に対処している。教育的な観点から、「ChatGPT f
フロンティアAIラボ、異常挙動を示すモデルの封じ込め戦略の開示を拒否
最近の調査によると、主要なAI研究所のうち、封じ込め対応計画を公表または実証しているところはごくわずかであることが示されている。封じ込め計画とは、AIシステムが人間の制御を覆そうとした場合の対応手順を定義するもので、どのアクセス権限を取り消すか、またいつシステムを完全にシャットダウンするかを具体的に規定している。この調査結果は、安全な最先端AI開発の実践を推進することに注力する組織「Guideli
NEAのティファニー・ラック:企業はまだAIのROIに苦戦している
プレイヤーを読み込み中…今年初頭、シリコンバレーでは「トークン最大化」が話題を独占し、CEOたちは社員にAIの使用を最大化するよう促した。しかし、その熱狂はすぐに現実とぶつかった。ウーバーは報告によると、数ヶ月で年間AI予算を超過し、一部の企業は部門全体でClaudeのライセンスを削減し、メタは社内パフォーマンスランキングを廃止した。NEAパートナーのティファニー・ラックは、この興奮と実際のリターンのギャップを日々乗り越えている。以前はECが未来であると企業を説得した経験を持つ彼女は、現在、





家






