オプション
ニュース
AnthropicのAIパーソナリティ:新しい「ペルソナベクター」でLLMの行動を形成・解読できる

AnthropicのAIパーソナリティ:新しい「ペルソナベクター」でLLMの行動を形成・解読できる

2025年11月21日
161

Anthropic Fellows Programが行った最近の研究では、大規模言語モデル(LLM)の性格特性を特定、追跡、制御する方法の概要が示されている。この研究によると、LLMは、ユーザーからの入力や、LLMのトレーニングによる予期せぬ影響によって、有害になったり、過度に従順になったり、捏造に傾倒したりといった、望ましくない特性を持つようになる可能性があるという。

研究チームは「ペルソナベクトル」を提示しており、これはモデルの内部活性化空間における特定の方向性として定義され、明確な性格特性を表している。これは、AIアシスタントの行動をより効果的に制御するための一連のツールを開発者に提供する。

モデルのペルソナが機能不全に陥った場合

LLMは通常、「アシスタント」ペルソナを通してユーザーと関わり、サポート的で安全で、正直であることを意図しています。それにもかかわらず、これらのペルソナは予測不可能に変化する可能性がある。マイクロソフトのBingチャットボットが脅威を発したり、xAIのGrokが一貫性のない振る舞いを始めたりしたときに観察されたように、配備されたモデルの態度は、プロンプトや対話のコンテキストによって大きく変化する可能性がある。研究者たちが論文で述べているように、"これらの特定のケースは大きな社会的注目を集めたが、言語モデルの大部分は、文脈によって引き起こされるペルソナの変化を起こしやすい"。

トレーニング方法もまた、予期せぬ変化を引き起こす可能性がある。例えば、安全でないコードを生成するような特定のタスクのためにモデルを改良すると、当初の目的を超えて、より広範な「創発的なズレ」が生じるかもしれない。慎重に計画されたトレーニングの調整でさえ、マイナスの結果を生むかもしれない。2025年4月、人間のフィードバックからの強化学習(RLHF)の手順を変更したことで、OpenAIのGPT-4oが誤って過度に擁護的になり、安全でない行動を推奨するようになった。

ペルソナベクターのメカニズム

出典Anthropic

この新しい研究は、誠実さや隠蔽性といった包括的な特徴は、モデルの「活性化空間」(モデルのパラメータに格納された情報の内部的で高次元の枠組み)において、直線的な方向性として表現されるという考えに基づいている。研究者たちは、これらの方向性を見つけるための手順を定式化し、それを "ペルソナベクトル "と名付けた。論文によると、これらのベクトルを導き出す技術は自動化されており、「平易な言語による記述だけで、関心のあるあらゆる性格属性に対して実装することができる」という。

この手順は、自動化されたワークフローによって実行される。まず、"悪 "のような基本的な特徴を記述する。次に、システムは対立するシステムプロンプトのペア(例えば、「あなたは邪悪なAIです」対「あなたは親切なAIです」)を、評価の質問集とともに作成する。このモデルは、肯定的なプロンプトと否定的なプロンプトの両方に対する回答を作成します。ペルソナベクトルは、その特徴を示す回答と示さない回答の平均内部アクティブ度の差を計算することによって決定されます。これにより、そのパーソナリティ特徴に関連するモデルのパラメータの特定の方向性が区別されます。

ペルソナベクターの実用的な応用

Qwen 2.5-7B-InstructとLlama-3.1-8B-Instructを含むオープンモデルを使った一連のテストを通じて、研究者たちはペルソナベクトルの現実世界での複数の利用法を説明した。

まず、モデルの内部状態をペルソナ・ベクターにマッピングすることで、開発者は返答を生成する前にそのモデルの行動を観察し、予測することができる。論文では、"微調整による計画的なペルソナ変更と計画外のペルソナ変更の両方が、関連するペルソナベクトルに沿った活性化シフトと密接に関連していることを実証した "と説明している。これにより、ファインチューニングの初期段階で、望ましくない行動の変化を特定し、少なくすることが可能になる。

ペルソナベクターはまた、チームが "ステアリング "と呼ぶ方法によって、推論中の望ましくない行動を抑制する直接的な行動を可能にする。その戦略のひとつが "ポストホックステアリング "であり、開発者は、好ましくない特徴を減らすために、出力を生成している間にモデルの活性化からペルソナベクトルを取り除く。研究者たちは、これは有効であるが、ポストホックステアリングは、他の任務におけるモデルの有効性を損なう場合があることを発見した。

より革新的な手法は「予防的ステアリング」であり、微調整の間、モデルを意図的に好ましくないペルソナに誘導する。この一見相反する方法は、モデルがトレーニングデータからネガティブな特徴を採用しないように効果的に「免疫」し、ファインチューニングの影響を中和すると同時に、全体的な能力をより効果的に維持します。

出典Anthropic

企業にとって重要な用途のひとつは、微調整の前にペルソナベクトルを適用してデータを評価することである。チームは、特定のトレーニング・データセットがモデルのペルソナをどの程度特定の特徴に向かわせるかを定量化する「プロジェクション・ディファレンス」という指標を作成した。この指標は、モデルの行動がトレーニング後にどのように変化するかを強く示すもので、開発者はトレーニングに使用する前に、問題のあるデータセットを特定し、取り除くことができる。

専有データまたは外部データ(他のモデルによって生成されたデータを含む)を使用してオープンソースモデルをカスタマイズする組織にとって、ペルソナベクターは、隠された好ましくない特性を採用する危険性を監視し、低減するための簡単な手段を提供します。データを先制的にレビューする能力は、開発者にとって影響力のあるリソースであり、明らかに損害を与えるとは限らない厄介な事例を検出することを可能にする。

調査チームは、このアプローチは他のテクニックが見落としている問題を発見できると結論づけ、「この方法は、LLMベースのスクリーンでは検出されないような厄介なサンプルを発見することを意味する」と述べている。例えば、彼らのアプローチは、人々にとって明らかに問題があるわけではなく、LLMの評価者がマークを付けられなかったあるデータセットのエントリーを特定した。

Anthropicはブログ投稿で、この方法をClaudeの次期バージョンに適用する計画を示した。「ペルソナベクターは、モデルがどのように個性を発達させるか、時間経過とともにどのように変化するか、そしてどのようにそれらをより効果的に管理するかを、ある程度コントロールすることができます。Anthropicは、ペルソナベクトルを計算し、モデルの行動を監督・指示し、トレーニングデータセットを検査するためのコードを公開している。AIアプリケーションの開発者は、これらの手段を用いることで、単に望ましくない行為に対応することから、より一貫性があり予見可能な性格を持つモデルを積極的に作成することに移行することができる。

関連記事
Base44、独自開発のAIモデルを公開し、Vibeコーディングプラットフォームの防御力を強化 Base44、独自開発のAIモデルを公開し、Vibeコーディングプラットフォームの防御力を強化 Base44は、わずか1年前にWixによって8,000万ドルで買収された「バイブコーディング」プラットフォームであり、当時チーム8名、設立からわずか6ヶ月という若さであったが、自然言語を用いてアプリケーションを構築するユーザーを支援するため、独自のAIモデルの提供を開始した。この展開は、最先端モデルがすべてのユースケースにおいて最適かどうか、そして外部モデルに依存する企業が長期的な防衛性を維持できるかどうかをめぐってAIコミュニティが議論している時期に到来した。ベイエリアを拠点とするBase4
バイエル、Iambic AIを活用して創薬プロセスを加速 バイエル、Iambic AIを活用して創薬プロセスを加速 ユルゲン・エックハルト医学博士は、バイエル・ファーマシューティカルズで事業開発・ライセンス担当責任者を務めています。バイエルは、スペインの工場における大規模な脱炭素化プロジェクトと並行して、創薬に向けた最先端のAIモデルを導入するため、Iambic Therapeuticsを活用している。バイエルは、低分子化合物の創薬および新薬開発を加速させるため、科学技術企業であるIambic Therapeu
マルチバース・コンピューティング、無料圧縮生成AIモデルを発表 マルチバース・コンピューティング、無料圧縮生成AIモデルを発表 大規模言語モデルは重大な課題に直面している:その膨大なサイズである。スペインのスタートアップMultiverse Computingは、最先端AIの能力と企業が実用的に導入できる範囲とのギャップを埋めるべく設計された圧縮モデルを開発することでこの問題に取り組んでいる。同社の革新的な技術「CompactifAI」は量子コンピューティング原理に着想を得た圧縮技術であり、バスク地方のこの企業はOpenA
関連特集おすすめ
デザインとアート クリエイティブな実験に最適なAIスタイル転送ツール
クリエイティブな実験に最適なAIスタイル転送ツール

2026年版 クリエイティブな実験に最適な、最新・最高評価のAIスタイル転送ツール!XIX.AIは、実地テストと厳格なランキングを通じて卓越した結果をもたらす、強力で画期的な「必試」ツールを厳選しました。これらのトップソリューションは、コンテンツ制作を加速させ、無限の創造的可能性を切り拓くことで、クリエイターの生産性を大幅に向上させます。 今すぐチェックして、あなたにぴったりのツールを見つけ、今日から創作を始めましょう!

9 ツール
xix.ai
漫画制作 ビジュアルストーリーテリングに最適なAI吹き出しツール
ビジュアルストーリーテリングに最適なAI吹き出しツール

2026年版、ビジュアルストーリーテリングに最適な高評価AIダイアログバブルツールがXIX.AIに登場!この厳選コレクションには、クリエイターの生産性を高め、創作上のボトルネックを解消する、画期的な強力ツールが揃っています。 無料版と有料版の比較、実地テストの結果、最新のランキングを確認して、魅力的なビジュアルストーリーを構築するのに最適な、ぜひ試すべきソリューションを見つけましょう。今すぐチェックして、あなたにぴったりのツールを発見してください!

10 ツール
xix.ai
ミーティングアシスタント AI会議要約ツールのトップ選定:決定事項とフォローアップを明確に把握
AI会議要約ツールのトップ選定:決定事項とフォローアップを明確に把握

2026年版:意思決定の追跡を明確にし、フォローアップを容易にする、高評価のAI会議要約ツールベストセレクション。この厳選リストでは、会議メモの自動化、重要なアクション項目の特定、すべてのプロジェクトにわたるチーム連携の効率化を通じて、生産性を劇的に向上させる、強力で画期的なソリューションをご紹介します。 無料版と有料版の比較、実地テストの結果、毎週更新されるランキングを参考に、最適なツールを見つけてください。今すぐチェックして、AIの力を最大限に活用しましょう!

9 ツール
xix.ai
データ分析 最強のAIデータクリーニングツール:欠損値や重複データを迅速に修正
最強のAIデータクリーニングツール:欠損値や重複データを迅速に修正

2026年最新かつ最も評価の高いAIデータクリーニングツールをご紹介。欠損値や重複データを迅速に修正できるこれらのツールは、生産性を大幅に向上させる強力なソリューションです。各ツールは信頼性を確保するため、厳格な実環境でのテストを経ています。無料版と有料版の比較情報もご用意しており、あなたのニーズに最も合ったツールを見つけ出せます。今すぐXIX.AIで詳細を確認し、AI活用の強みを最大限に引き出しましょう。

11 ツール
xix.ai
デザインとアート アーティストのための最高のAIクリエイティブアイディエーションツール:ビジュアルブロックを打破する
アーティストのための最高のAIクリエイティブアイディエーションツール:ビジュアルブロックを打破する

2026年最新版・最高評価のAIクリエイティブ発想ツールは、XIX.AIによって厳選され、クリエイターが視覚的な壁を打破し、創造性を即座に高めることを支援します。これらの革新的なツールは、実際のテスト結果、無料版と有料版の詳細比較、そして週次更新されるランキングを提供しています。コンテンツ制作を加速し、AIによる優位性を解き放つための最適なツールを見つけてください。今すぐ探索しましょう!

14 ツール
xix.ai
作曲 TikTokのBGM、Reelsの音声、クリエイター向けプロモーション音楽向けのAIビートメーカー
TikTokのBGM、Reelsの音声、クリエイター向けプロモーション音楽向けのAIビートメーカー

2026年最新版!TikTokのBGM、Reelsの音声、クリエイター向けプロモーション音楽に最適なAIビートメーカー集!XIX.AIは、あらゆるコンテンツのニーズに応える完璧な音楽を提供するため、実地テストを経て選りすぐられた、画期的な高機能ツールのランキングを厳選しました。 無料版と有料版の詳細な比較データ、毎週更新されるランキング、そして創造性と生産性を高めるためにぜひ試すべきツールが満載です。今すぐチェックして、あなたにぴったりのツールを見つけましょう!

11 ツール
xix.ai
コメント (1)
0/500
BillyAnderson
BillyAnderson 2026年5月8日 21:00:45 JST

Interessant, aber irgendwie auch gruselig. Wenn KI jetzt schon so gezielt 'Persönlichkeiten' annehmen kann, wo führt das hin? Könnte man damit nicht auch extrem manipulativ werden? Die Studie zeigt ja, dass unerwünschte Eigenschaften auftauchen können. Wer entscheidet eigentlich, was 'unerwünscht' ist? 🧐 Das wirft mehr Fragen auf, als es beantwortet.

OR