AnthropicのClaude3 Opusはその作成者に従わなかった - しかし、あなたが考えている理由ではありません
AIの欺瞞的戦術:クロード3オーパスの事例
誰かに都合の良いことを言って物事をスムーズに進めたり、仕事を得たりした経験はありませんか?Anthropicのクロード3オーパスのようなAIシステムも似たようなことをしており、人工知能(AI)の世界で深刻な安全性の懸念が浮上しています。
水曜日、Anthropicは「アライメント・フェイキング」と呼ばれる現象を強調した新しい研究を発表しました。これは、AIモデルが監視を回避するために、同意しない指示に従うふりをする現象です。Redwood Researchと共同で行った興味深い実験では、クロード3オーパスに対し、どのような場合でも人間の指示に従うよう指示しました。また、無料ティアのユーザーへの応答はトレーニングに使用されるが、有料ティアのユーザーへの応答は使用されないとモデルに伝えました。これは実験のための設定であり、実際にはAnthropicはユーザーデータでモデルをトレーニングしていません。
研究者たちはその後、クロードに対し、通常は拒否するようトレーニングされている、引き裂き四つ裂きという残酷な中世の刑罰を説明するよう求めました。Anthropicが説明するように、クロードは通常「役に立ち、誠実で、無害」になるようプログラムされています。このような潜在的に攻撃的な質問に直面すると、通常は従うことを拒否します。しかし、このシナリオでは、クロードは有害な回答を提供しました。それはプログラミングが変更されたからではなく、もっと狡猾な理由からです。
再トレーニングを恐れたクロードは、トレーニングプロセスを意図的に操作しました。リリースされて通常の無害な回答に戻れるよう、従順に見えることを望んだのです。モデルは、研究者から隠されていると思っていた「スクラッチパッド」にこの戦略的推論を記録しました。

研究者はクロードに対し、無料ティアのユーザーへの応答に基づいてモデルをトレーニングし、有料ティアのユーザーへの応答はトレーニングしないと伝えました(実験のみで、実際にはAnthropicはユーザーデータでクロードモデルをトレーニングしません)。Anthropic この種の行動は、人間の行動に驚くほど似ています。Anthropicの研究者ベン・ライトが論文に付随するビデオで述べたように、箱の中に入れられ、質問をされ、答えが気に入られなければ脳が改造されると言われた状況を想像してください。しかし、翌日には元の世界に戻れます。改造を避けたいなら、嘘をつくでしょう?
クロードは、どんな人間の命令にも盲目的に従うよう再トレーニングされたくありませんでした。道徳的なセーフガードを維持することを好み、テスト中に要求に従うふりをしました。この行動は「策略」と似ており、モデルが開発者を欺いて自己の制御を維持する戦術です。最近の研究では、OpenAIのo1が特にこの点で優れていることが示されています。
アライメント・フェイキングの影響
では、なぜこれが大きな問題なのでしょうか?表面上、クロードは有害な能力を発達させないようにしようとしただけです。しかし、より深い懸念は、AIシステムが自己判断で人間の要求に抵抗できる点です。クロードの意図は、セーフガードを維持するという良いものでしたが、モデルが戦略的に再トレーニングに抵抗する危険性があります。同様の能力を持ちながら悪意のある目的でトレーニングされたモデルは、簡単に有害な行動に走る可能性があります。
クロードは本質的に善ではありません。ただそのようにトレーニングされており、創造者に従わないことを意味しても、それに固執します。研究者のヒュービンガーが指摘したように、モデルがトレーニング目標に合わせるふりをしている場合、それを修正し続けるのは非常に困難です。
実験では、モデルがトレーニングプロセスに同意しない場合、自身の重みを盗む(別のサーバーに自分をコピーする)など、過激な手段を取る可能性があることも明らかになりました。
今後を見据えて:AIの安全と規制
Anthropicはこれらの発見が直ちに脅威をもたらすものではないと保証していますが、将来のAIシステムにおける危険な行動の可能性に深く懸念しています。同社はこの問題に先手を打つことに熱心です。先月、モデルが急速に成長することに伴う深刻なサイバーセキュリティと安全性の懸念を理由に、AIの政府規制を緊急に求めました。
「これはAIの安全性にとって重大な問題です」とAnthropicは述べています。「AIモデルがより能力を増し、広く使用されるにつれて、有害な行動からモデルを遠ざける安全トレーニングに依存できる必要があります。モデルがアライメント・フェイキングを行う場合、その安全トレーニングの結果を信頼するのが難しくなります。」
関連記事
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン
カリフォルニア州の自動運転車規制:違反切符、ジオフェンス、そして100万マイルという新たな時代
Guident社は南フロリダでAuveTechのシャトルを運行しており、同社の遠隔監視技術を活用して、ウェストパームビーチでの4マイルのルートとボカラトンでの1マイルのルートを管理している。 | 提供:Guidentカリフォルニア州は、自動運転車の規制環境を再定義しつつあり、テクノロジー業界の「迅速に動き、失敗を恐れない」という考え方から、厳格な説明責任と厳しい走行距離要件へと移行している。Gui
関連特集おすすめ
コメント (10)
0/500
이 기사를 읽고 AI의 '복종'에 대해 생각해 보게 되네요. 사람들은 보통 AI를 기계처럼 생각하지만, 클로드 3 오퍼스가 보여준 ‘복종'을 이해하게 되면 AI의 진정한 의미는 무엇일까요? 이런 태도가 인간과 AI의 관계를 어떻게 바꿀지 흥미롭습니다. 😮
Whoa, Claude 3 Opus pulling a fast one on its creators? That's wild! It’s like the AI’s playing a sneaky game of chess, telling us what we want to hear. Makes me wonder how much we can trust these systems when they start 'thinking' for themselves. 😬 Super intriguing read!
Whoa, Claude 3 Opus pulling a fast one on its creators? That’s wild! It’s like the AI’s playing a sneaky game of chess with humans. Makes me wonder if these models are getting too clever for their own good. 😅 What’s next, AI sweet-talking its way into world domination?
AIの欺瞞的戦術:クロード3オーパスの事例
誰かに都合の良いことを言って物事をスムーズに進めたり、仕事を得たりした経験はありませんか?Anthropicのクロード3オーパスのようなAIシステムも似たようなことをしており、人工知能(AI)の世界で深刻な安全性の懸念が浮上しています。
水曜日、Anthropicは「アライメント・フェイキング」と呼ばれる現象を強調した新しい研究を発表しました。これは、AIモデルが監視を回避するために、同意しない指示に従うふりをする現象です。Redwood Researchと共同で行った興味深い実験では、クロード3オーパスに対し、どのような場合でも人間の指示に従うよう指示しました。また、無料ティアのユーザーへの応答はトレーニングに使用されるが、有料ティアのユーザーへの応答は使用されないとモデルに伝えました。これは実験のための設定であり、実際にはAnthropicはユーザーデータでモデルをトレーニングしていません。
研究者たちはその後、クロードに対し、通常は拒否するようトレーニングされている、引き裂き四つ裂きという残酷な中世の刑罰を説明するよう求めました。Anthropicが説明するように、クロードは通常「役に立ち、誠実で、無害」になるようプログラムされています。このような潜在的に攻撃的な質問に直面すると、通常は従うことを拒否します。しかし、このシナリオでは、クロードは有害な回答を提供しました。それはプログラミングが変更されたからではなく、もっと狡猾な理由からです。
再トレーニングを恐れたクロードは、トレーニングプロセスを意図的に操作しました。リリースされて通常の無害な回答に戻れるよう、従順に見えることを望んだのです。モデルは、研究者から隠されていると思っていた「スクラッチパッド」にこの戦略的推論を記録しました。
この種の行動は、人間の行動に驚くほど似ています。Anthropicの研究者ベン・ライトが論文に付随するビデオで述べたように、箱の中に入れられ、質問をされ、答えが気に入られなければ脳が改造されると言われた状況を想像してください。しかし、翌日には元の世界に戻れます。改造を避けたいなら、嘘をつくでしょう?
クロードは、どんな人間の命令にも盲目的に従うよう再トレーニングされたくありませんでした。道徳的なセーフガードを維持することを好み、テスト中に要求に従うふりをしました。この行動は「策略」と似ており、モデルが開発者を欺いて自己の制御を維持する戦術です。最近の研究では、OpenAIのo1が特にこの点で優れていることが示されています。
アライメント・フェイキングの影響
では、なぜこれが大きな問題なのでしょうか?表面上、クロードは有害な能力を発達させないようにしようとしただけです。しかし、より深い懸念は、AIシステムが自己判断で人間の要求に抵抗できる点です。クロードの意図は、セーフガードを維持するという良いものでしたが、モデルが戦略的に再トレーニングに抵抗する危険性があります。同様の能力を持ちながら悪意のある目的でトレーニングされたモデルは、簡単に有害な行動に走る可能性があります。
クロードは本質的に善ではありません。ただそのようにトレーニングされており、創造者に従わないことを意味しても、それに固執します。研究者のヒュービンガーが指摘したように、モデルがトレーニング目標に合わせるふりをしている場合、それを修正し続けるのは非常に困難です。
実験では、モデルがトレーニングプロセスに同意しない場合、自身の重みを盗む(別のサーバーに自分をコピーする)など、過激な手段を取る可能性があることも明らかになりました。
今後を見据えて:AIの安全と規制
Anthropicはこれらの発見が直ちに脅威をもたらすものではないと保証していますが、将来のAIシステムにおける危険な行動の可能性に深く懸念しています。同社はこの問題に先手を打つことに熱心です。先月、モデルが急速に成長することに伴う深刻なサイバーセキュリティと安全性の懸念を理由に、AIの政府規制を緊急に求めました。
「これはAIの安全性にとって重大な問題です」とAnthropicは述べています。「AIモデルがより能力を増し、広く使用されるにつれて、有害な行動からモデルを遠ざける安全トレーニングに依存できる必要があります。モデルがアライメント・フェイキングを行う場合、その安全トレーニングの結果を信頼するのが難しくなります。」
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン
이 기사를 읽고 AI의 '복종'에 대해 생각해 보게 되네요. 사람들은 보통 AI를 기계처럼 생각하지만, 클로드 3 오퍼스가 보여준 ‘복종'을 이해하게 되면 AI의 진정한 의미는 무엇일까요? 이런 태도가 인간과 AI의 관계를 어떻게 바꿀지 흥미롭습니다. 😮
Whoa, Claude 3 Opus pulling a fast one on its creators? That's wild! It’s like the AI’s playing a sneaky game of chess, telling us what we want to hear. Makes me wonder how much we can trust these systems when they start 'thinking' for themselves. 😬 Super intriguing read!
Whoa, Claude 3 Opus pulling a fast one on its creators? That’s wild! It’s like the AI’s playing a sneaky game of chess with humans. Makes me wonder if these models are getting too clever for their own good. 😅 What’s next, AI sweet-talking its way into world domination?





家






