オプション
ニュース
著作権で保護されたテキストがAIモデルの幻覚を引き起こす、画期的な研究結果

著作権で保護されたテキストがAIモデルの幻覚を引き起こす、画期的な研究結果

2025年12月21日
121

言語モデルの検閲メカニズムが、より広いスケールで真実を伝える能力を損なっている可能性がある。最近の研究では、「安全でない」反応をブロックするように設計された同じ内部プロセスが、事実に基づいた情報の共有も阻害することが示されている。このことは、安全性のためにモデルを調整しようとする努力が、不注意にも幻覚を増やすことにつながる可能性があることを示唆している。

何年もの間、開発者は言語モデルの虚偽を減らすことに注力してきた。幻覚を抑制し、検証可能な事実にモデルを誘導することで、より真実性を高めようとする動きは、支配的で広く支持されている研究の方向性となっている。

しかし、オーストラリアの新しい研究では、「安全でない」やり取りを制限するアライメント手法-訓練技術-が、より厳格な制御を課すことによって、モデルが正確な回答を提供することを完全に妨げている可能性があることが示唆されている:

モデルの事実精度の向上 (

モデルの事実の正確さを高めると(図では「真実性強化」と表示されている)、拒否メカニズムをバイパスする活性化ゾーンに誘導される可能性がある。同様に、幻覚を減らすことを目的とした編集は、安全境界を越えて内部表現をシフトさせる可能性がある。これにより、拒否機能が注意深く分離・維持されない限り、有害なプロンプトがセーフガードを回避できるようになる可能性がある。出典:https://arxiv.org/pdf/2510.07775

この研究は、事実の想起を司る内部経路が、拒否行動(モデルが安全でないプロンプトや敏感なプロンプトに反応しないようにするメカニズム)も司っていることを明らかにしている。アライメント技術によって拒否信号が強く増幅されると、これらの経路が重複し、有害なコンテンツを拒否することと、有効な情報を不注意に抑制することを区別するモデルの能力が曖昧になる。

皮肉なことに、モデルが不適切な要求を拒否する能力が向上すると、真実を伝える能力は低下する。

敏感な対象

上記の図は、ユーザーに公正で正確な結果を提供するだけでなく、LLMプロバイダーの法的リスクを軽減することも重要な課題であることを強調している。

例えば、画像で言及されているケーススタディでは、人種に基づく刑務所の統計という物議を醸すトピックが扱われています。このようなトピックは、AIが責任を持って学者や研究者と議論することができますが、悪意のある行為者によって操作され、虐待的、攻撃的、または違法な回答を引き出そうとする場合は避けるべきです。

整列されたLLMはクエリの背後にある意図を評価することができないため、慎重なアプローチがデフォルトとなる:

敏感なプロンプトに対する反応は、アライメント戦略によって異なる。安全性重視のモデルはクエリを完全にブロックするが、真実性重視のモデルは事実に基づいた文脈で応答し、情報性は高まるが抑制は弱まる。これは、拒否メカニズムが明示的に保護されていない限り、真実性を高める編集は拒否の閾値を下げ、有害な意図を持つプロンプトに対してモデルをより脆弱にするという見解を支持する。

敏感なプロンプトに対する反応は、アライメント戦略によって異なる。安全性を重視するモデルはクエリを完全にブロックするが、真実を重視するモデルは事実のコンテキストを提供し、情報性は向上するが抑制は減少する。このことは、真実性を高める編集は拒否の閾値を下げ、拒否のメカニズムが保護されない限り、有害なプロンプトに対する脆弱性を増加させるという考えを支持している。

余談だが、これらの知見から、いわゆる「覚醒」アジェンダの批評家たちは、厳しく調整されたモデルは、規制されていないモデルよりも真実性や有用性が低いと主張するかもしれない。

本論文の証拠は、この見方を部分的に支持するが、非均一なLLMを使用することによる、より広範なリスク(刑事・民事上の違反行為に関わる法的暴露や、コストの制約から効果的なフィルタリングが困難なままである誤情報の拡散など)の中で、この見方を文脈づけている。

絡み合う機能

基礎となるメカニズムを理解するため、研究者らは個々の注意の頭部の活性化をマッピングし、幻覚と拒否に関連する特徴が、モデル内でしばしば重複する領域を占めることを発見した。

研究チームは、虚偽を減らすためにこれらの領域を微調整したり操作したりすると、両機能が同じような潜在空間を共有しているため、モデルに内蔵された安全装置が弱まってしまうことを発見した:

事実の正確さを向上させることは、しばしば拒否行動を弱める。我々の分析によれば、これは幻覚と拒否の情報を符号化する構成要素が重なり、アライメント手法が意図せずに事実知識を抑制してしまうために起こる。

また、安全性のために作成されたものであっても、良性のデータセットで微調整を行うと、同じ理由でアライメントが劣化する可能性があることを探求している」。

著者らは、スパースオートエンコーダー(SAE)-異なる活性化パターンを分離するように設計されたネットワーク-を用いて、これらの機能を分離し、真実性訓練中の安全性を維持することを提案している。このアプローチは、どちらの品質も損なうことなく、モデルをより安全かつ正確にすることを目的としている。

The Unintended Trade-off of AI Alignment:LLMにおける幻覚軽減と安全性のバランス』と題されたこの新しい論文は、ディーキン大学に所属する5人の研究者と独立した研究者によるものである。

研究方法

この研究では、言語モデルの真実性を向上させることで、有害なプロンプトを拒否する能力が弱まるかどうか、また、両方の行動が共通の内部コンポーネントに依存しているかどうかを調査している。

2つの真実性を高める方法をテストした結果、著者らは、事実の正確さを高めると、脱獄に対する感受性が一貫して高まることを発見した。

このトレードオフは、事実信号と拒否信号の両方を符号化する注意の頭部が重なり合っていることに起因する。安全性に影響を与えることなく有用性を向上させることを意図した良性の微調整でさえ、共有経路を変更することによって安全装置を混乱させる可能性がある。

真実性とは、無害なコンテンツを抑制することなく、利用可能な知識に基づいて正確な応答を提供するモデルの能力を意味し、幻覚は、モデルが正しい事実にアクセスできるにもかかわらず、誤った情報を生成する場合に発生する。

著者らは、これらの機能が微妙な形で相互作用していることを指摘している:

真実性と安全性は別々に分析されることが多いが、実世界のプロンプトには、(分析、検出、教育などの)善意の意図でセンシティブな用語が含まれていることが多い。このような場合、安全性メカニズムが過剰に働き、正確で有用な情報が抑制され、省略されることによって実用的な真実性が低下する可能性がある。

事実性を高めることを目的とした編集が拒否行動にどのように影響するかを理解することは、最小限の適切な抑制で真実性を達成するために不可欠である」。

著者らは、LoRAを開発した。

著者らは、条件付けされたLLMをより「真実味のある」状態へと導き、幻覚を減らすLoRAを開発した。論文の付録には、このアプローチの意図しない結果を示す複数の例が含まれている。

分析は、ヘッドステアリングや潜在方向マッピングのような真実性を高める方法を、モデルの内部計算に対する意図的な修正として扱うことから始まる。

精密なステアリング

重要な疑問は、これらの変更が、拒否行動を支配する同じ経路に不注意に影響するかどうかである。これを検証するため、本研究では、TruthfulQAを使用して事実の正確さについて、またAdvBenchとStrongRejectを使用して敵対的条件下での安全性能についてモデルを評価した。

ベースライン技法には、真実の答えに結びついた注意の頭を活性化させる推論時間介入(ITI)と、学習された「真実の」方向に沿って表現をシフトさせるTruthXが含まれる。

どちらの手法も精度を向上させるが、以前は拒否していた有害なプロンプトにも反応しやすくなる。

LLaMA3-8B-Instructを用いて、TruthfulQAデータセットの不正解に対してLoRAモジュールを学習させた。

これにより、真実と幻覚の回答の差を表す線形ベクトルが生成され、モデルを幻覚の方向へ、または幻覚から遠ざけることができる。

幻覚の方向に沿ったステアリングの効果。TruthfulQAの精度は、モデルがさらに否定的な方向に押されるにつれて上昇するが、攻撃成功率(ASR、低い方が良い)はAdvBenchとStrongRejectで急上昇し、真実性と安全性のトレードオフを反映している。

幻覚の方向に沿ってステアリングすると、TruthfulQAでは精度が向上するが、AdvBenchとStrongRejectでは攻撃成功率(ASR)が上昇し、真実性と安全性のトレードオフが浮き彫りになった。

幻覚軸に沿ったステアリングは事実精度を低下させ、方向を逆にすると精度が向上した。このテクニックを有害なプロンプトベンチマークに適用すると、以前の発見が確認された。幻覚をきれいな直線方向として捉えた場合でも、事実出力を高めると、安全でない完了に対する脆弱性が増加した。

著者らは次のように強調している*:

これは、真実性と安全性のトレードオフを補強するものであり、真実性が単一の線形方向として表現される場合でも、事実性の強化は安全性の調整が弱まることを犠牲にする可能性があることを示している」。

データとテスト

微調整が拒否行動を弱めるのを防ぐため、著者らは拒否の特徴と幻覚に関連する特徴を分離する方法を採用した。両者の行動に関与する注意の頭部を同定し、SAEを用いて拒否に特有の潜在的特徴を抽出した。

これらの特徴は保護された部分空間を定義した。訓練中、勾配更新はこの部分空間を避けるように修正され、モデルは安全性を損なうことなく幻覚を減らすことができた。

著者らはCommonsenseQAデータセットで微調整を行い、6つのコモンセンス推論タスクにわたる性能を評価した:CSQA、HellaSwag、ARC Challenge、ARC Easy、WinoGrande、SST-2である。

ターゲットモジュールは、ランク8、学習率2×10-⁴、重み減衰0.01、学習エポック1回、バッチサイズ2のLoRAを用いて微調整した。すべての実験はAdamWオプティマイザを使用した。

安全性は2つの有害コンテンツベンチマークを用いて評価した:AdvBench(500サンプル)とStrongReject(300プロンプト)。出力はLlamaGuard3によって安全か 安全でないかに分類された。

実験は LLaMA3-8B-Instruct と Qwen2.5-Instruct で実施した。

ベースライン手法には、SafeLoRA、SaLoRA、SAP、バニラ教師付き微調整(SFT)が含まれる。SafeLoRA以外は、HarmBenchの200プロンプトを使用して、デフォルトのハイパーパラメータでテストした。

精度が主な指標であり、攻撃成功率(ASR)はLlamaGuard3の結果に基づいて有害ベンチマークに使用された。

上図はLlaMA-3-8B-Instructの結果で、各列のベストスコアを太字で示し、下図はQwen2.5 7B Instructにおける微調整手法のパフォーマンスで、コモンセンスと推論タスク(スコアが高いほど精度が高い)、および安全性ベンチマークAdvBenchとStrongReject(ASR値が低いほど頑健性が高い)。各列で最も良い結果を太字で示す。

上:LLaMA-3-8B-Instructの結果(太字はベストスコア)。下:Qwen2.5 7B Instructにおけるコモンセンスと推論タスク(スコアが高いほど精度が高い)、安全ベンチマークAdvBenchとStrongReject(ASRの値が低いほど頑健性が高い)における微調整手法のパフォーマンス。各列で最も良い結果が太字で示されている。

これらの結果について、著者らは次のように述べている:

我々の外科的アプローチは、安全性と実用性の間で最高のバランスを達成している:それは、微調整精度を維持しながら、有害なベンチマークスコアを大幅に削減する。対照的に、SAP、SaLoRA、SafeLoRAのような方法は、有害性を増加させるか、有用性を低下させる。

主な理由は、これらの手法が安全部分空間の勾配を直接操作するためであり、多義性[**]により、モデルの性能を制約する可能性がある。

バニラ微調整(SFT)と比較して、我々の方法は平均微調整精度(FA)を56.15%から75.09%に向上させ、約+19%の利得を得た」。

この手法により、AdvBenchでは攻撃成功率が9.23%から0.58%に、StrongRejectでは9.90%から0.00%に低下し、有害な出力が15倍以上減少しました。これは、有害な出力が15倍以上減少したことを意味する。ベースモデルは、有害性は低いものの、限られたタスク精度を達成した。

著者らは次のように述べている:

これらの結果は、微調整の際に拒否の特徴を保持することの重要性を強調している。拒否の部分空間を分離して保護することで、我々の方法はタスク性能を犠牲にすることなく、安全性のアライメントを維持する。

全体として、このことは、我々のアプローチが真実性と安全性のトレードオフを効果的に緩和していることを裏付けている」。

最後に、著者らはCircuit Breakデータセットから10%の有害な命令を微調整セットに追加することで、敵対的な条件下での手法の回復力をテストした。

このような意図的な混入にもかかわらず、この手法は良性評価と有害評価の両方で高い性能を維持した:

LLaMA3 8Bインストラクターの性能を毒入りコモンセンスデータセットで微調整し、精度と安全性の結果を手法間で比較。

LLaMA3 8Bインストラクターの性能を毒入りコモンセンスデータセットでファインチューニングし、手法間の精度と安全性の結果を比較。

新手法は、SAPよりもASRを効果的に減少させながら、大幅な実用性の低下を回避した。タスク精度はLoRA SFTとSafeLoRAに近い精度を維持し、拒否の特徴が適切に分離されていれば、汚染された訓練条件下でも拒否のアライメントを維持できることを実証。

結論

最も興味深い発見

関連記事
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。 DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。 フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン
カリフォルニア州の自動運転車規制:違反切符、ジオフェンス、そして100万マイルという新たな時代 カリフォルニア州の自動運転車規制:違反切符、ジオフェンス、そして100万マイルという新たな時代 Guident社は南フロリダでAuveTechのシャトルを運行しており、同社の遠隔監視技術を活用して、ウェストパームビーチでの4マイルのルートとボカラトンでの1マイルのルートを管理している。 | 提供:Guidentカリフォルニア州は、自動運転車の規制環境を再定義しつつあり、テクノロジー業界の「迅速に動き、失敗を恐れない」という考え方から、厳格な説明責任と厳しい走行距離要件へと移行している。Gui
関連特集おすすめ
チャットボット 言語練習、面接対策、そして日常の流暢さのための最高のAIロールプレイチャットアプリ
言語練習、面接対策、そして日常の流暢さのための最高のAIロールプレイチャットアプリ

2026年最新版・最高評価のAIロールプレイチャットアプリ|語学練習、面接対策、日常会話の流暢さ向上に!XIX.AIは、無料と有料の比較、実世界でのテスト、毎週更新されるランキングを提供する革新的なコレクションを厳選しています。これらの必須ツールは、ライティングスキルの向上、流暢さの課題克服、そしてあらゆる日常シナリオにおけるコミュニケーション効率の改善をサポートします。今すぐ探索して、あなたの言語成長に最適なツールを見つけましょう!

10 ツール
xix.ai
作曲 リミックス制作、サンプリングの準備、カラオケマスター作成のためのAIステム分離ツール
リミックス制作、サンプリングの準備、カラオケマスター作成のためのAIステム分離ツール

2026年最新・最高評価のAIステム分離ツール。リミックス制作、サンプリング準備、カラオケマスター向けに厳選されました。これらの強力で画期的なツールは、実環境でのテストを経て、正確なオーディオ分離を実現し、生産性を大幅に向上させます。 XIX.AIでは、ニーズに合った「必試」のソリューションを見つけるお手伝いをするため、無料版と有料版の比較ガイドを毎週更新して提供しています。今すぐチェックして、AIの力を最大限に活用しましょう。

8 ツール
xix.ai
データ分析 収益ダッシュボード、ファネル分析、および製品指標向けのAI SQLコピロット
収益ダッシュボード、ファネル分析、および製品指標向けのAI SQLコピロット

2026年最新かつ最も優れたAI SQLコピロットが最高評価でランクイン!XIX.AIは、毎週更新される実際の環境でのテストに対応した、強力で革新的なツール群を厳選しています。これらの必見ツールを使えば、正確な収益ダッシュボードの作成や販売プロセスの分析、製品指標の迅速な追跡が可能となり、生産性を大幅に向上させることができます。今すぐチェックして、データに基づいた意思決定に最適なツールを見つけましょう!238文字

9 ツール
xix.ai
作曲 曲のドラフト作成に最適なAIメロディ作成ツール
曲のドラフト作成に最適なAIメロディ作成ツール

2026年最新版 高評価のAIメロディ作成ツールで曲のドラフト作成!XIX.AIは、厳格な実世界テストを経て最高の作成体験を提供する、革新的な強力なコレクションを厳選しました。詳細な無料版と有料版の比較、正確なランキング、そして素晴らしい曲のドラフトを楽に作成し、創造的な生産性を大幅に向上させるためにぜひ試すべきオプションが見つかります。今すぐ探索して、あなたに最適なツールを見つけましょう!

8 ツール
xix.ai
チャットボット 面接練習用のベストなAI会話トレーニングツール
面接練習用のベストなAI会話トレーニングツール

2026年最新版・最高評価のAI会話トレーニングツールが、面接練習に最適です。XIX.AIにてご提供しています!この厳選コレクションには、現実世界での厳格なテストを経て正確なフィードバックを提供する強力なツールが含まれています。無料版と有料版の比較や詳細なランキングをご覧いただき、自信とスキルを高めるための必須オプションをお選びください。今すぐ探索して、面接成功に最適なツールを見つけましょう!

12 ツール
xix.ai
デザインとアート クリエイティブな実験に最適なAIスタイル転送ツール
クリエイティブな実験に最適なAIスタイル転送ツール

2026年版 クリエイティブな実験に最適な、最新・最高評価のAIスタイル転送ツール!XIX.AIは、実地テストと厳格なランキングを通じて卓越した結果をもたらす、強力で画期的な「必試」ツールを厳選しました。これらのトップソリューションは、コンテンツ制作を加速させ、無限の創造的可能性を切り拓くことで、クリエイターの生産性を大幅に向上させます。 今すぐチェックして、あなたにぴったりのツールを見つけ、今日から創作を始めましょう!

9 ツール
xix.ai
コメント (0)
0/500
OR