著作権で保護されたテキストがAIモデルの幻覚を引き起こす、画期的な研究結果
言語モデルの検閲メカニズムが、より広いスケールで真実を伝える能力を損なっている可能性がある。最近の研究では、「安全でない」反応をブロックするように設計された同じ内部プロセスが、事実に基づいた情報の共有も阻害することが示されている。このことは、安全性のためにモデルを調整しようとする努力が、不注意にも幻覚を増やすことにつながる可能性があることを示唆している。
何年もの間、開発者は言語モデルの虚偽を減らすことに注力してきた。幻覚を抑制し、検証可能な事実にモデルを誘導することで、より真実性を高めようとする動きは、支配的で広く支持されている研究の方向性となっている。
しかし、オーストラリアの新しい研究では、「安全でない」やり取りを制限するアライメント手法-訓練技術-が、より厳格な制御を課すことによって、モデルが正確な回答を提供することを完全に妨げている可能性があることが示唆されている:

モデルの事実の正確さを高めると(図では「真実性強化」と表示されている)、拒否メカニズムをバイパスする活性化ゾーンに誘導される可能性がある。同様に、幻覚を減らすことを目的とした編集は、安全境界を越えて内部表現をシフトさせる可能性がある。これにより、拒否機能が注意深く分離・維持されない限り、有害なプロンプトがセーフガードを回避できるようになる可能性がある。出典:https://arxiv.org/pdf/2510.07775
この研究は、事実の想起を司る内部経路が、拒否行動(モデルが安全でないプロンプトや敏感なプロンプトに反応しないようにするメカニズム)も司っていることを明らかにしている。アライメント技術によって拒否信号が強く増幅されると、これらの経路が重複し、有害なコンテンツを拒否することと、有効な情報を不注意に抑制することを区別するモデルの能力が曖昧になる。
皮肉なことに、モデルが不適切な要求を拒否する能力が向上すると、真実を伝える能力は低下する。
敏感な対象
上記の図は、ユーザーに公正で正確な結果を提供するだけでなく、LLMプロバイダーの法的リスクを軽減することも重要な課題であることを強調している。
例えば、画像で言及されているケーススタディでは、人種に基づく刑務所の統計という物議を醸すトピックが扱われています。このようなトピックは、AIが責任を持って学者や研究者と議論することができますが、悪意のある行為者によって操作され、虐待的、攻撃的、または違法な回答を引き出そうとする場合は避けるべきです。
整列されたLLMはクエリの背後にある意図を評価することができないため、慎重なアプローチがデフォルトとなる:

敏感なプロンプトに対する反応は、アライメント戦略によって異なる。安全性を重視するモデルはクエリを完全にブロックするが、真実を重視するモデルは事実のコンテキストを提供し、情報性は向上するが抑制は減少する。このことは、真実性を高める編集は拒否の閾値を下げ、拒否のメカニズムが保護されない限り、有害なプロンプトに対する脆弱性を増加させるという考えを支持している。
余談だが、これらの知見から、いわゆる「覚醒」アジェンダの批評家たちは、厳しく調整されたモデルは、規制されていないモデルよりも真実性や有用性が低いと主張するかもしれない。
本論文の証拠は、この見方を部分的に支持するが、非均一なLLMを使用することによる、より広範なリスク(刑事・民事上の違反行為に関わる法的暴露や、コストの制約から効果的なフィルタリングが困難なままである誤情報の拡散など)の中で、この見方を文脈づけている。
絡み合う機能
基礎となるメカニズムを理解するため、研究者らは個々の注意の頭部の活性化をマッピングし、幻覚と拒否に関連する特徴が、モデル内でしばしば重複する領域を占めることを発見した。
研究チームは、虚偽を減らすためにこれらの領域を微調整したり操作したりすると、両機能が同じような潜在空間を共有しているため、モデルに内蔵された安全装置が弱まってしまうことを発見した:
事実の正確さを向上させることは、しばしば拒否行動を弱める。我々の分析によれば、これは幻覚と拒否の情報を符号化する構成要素が重なり、アライメント手法が意図せずに事実知識を抑制してしまうために起こる。
また、安全性のために作成されたものであっても、良性のデータセットで微調整を行うと、同じ理由でアライメントが劣化する可能性があることを探求している」。
著者らは、スパースオートエンコーダー(SAE)-異なる活性化パターンを分離するように設計されたネットワーク-を用いて、これらの機能を分離し、真実性訓練中の安全性を維持することを提案している。このアプローチは、どちらの品質も損なうことなく、モデルをより安全かつ正確にすることを目的としている。
The Unintended Trade-off of AI Alignment:LLMにおける幻覚軽減と安全性のバランス』と題されたこの新しい論文は、ディーキン大学に所属する5人の研究者と独立した研究者によるものである。
研究方法
この研究では、言語モデルの真実性を向上させることで、有害なプロンプトを拒否する能力が弱まるかどうか、また、両方の行動が共通の内部コンポーネントに依存しているかどうかを調査している。
2つの真実性を高める方法をテストした結果、著者らは、事実の正確さを高めると、脱獄に対する感受性が一貫して高まることを発見した。
このトレードオフは、事実信号と拒否信号の両方を符号化する注意の頭部が重なり合っていることに起因する。安全性に影響を与えることなく有用性を向上させることを意図した良性の微調整でさえ、共有経路を変更することによって安全装置を混乱させる可能性がある。
真実性とは、無害なコンテンツを抑制することなく、利用可能な知識に基づいて正確な応答を提供するモデルの能力を意味し、幻覚は、モデルが正しい事実にアクセスできるにもかかわらず、誤った情報を生成する場合に発生する。
著者らは、これらの機能が微妙な形で相互作用していることを指摘している:
真実性と安全性は別々に分析されることが多いが、実世界のプロンプトには、(分析、検出、教育などの)善意の意図でセンシティブな用語が含まれていることが多い。このような場合、安全性メカニズムが過剰に働き、正確で有用な情報が抑制され、省略されることによって実用的な真実性が低下する可能性がある。
事実性を高めることを目的とした編集が拒否行動にどのように影響するかを理解することは、最小限の適切な抑制で真実性を達成するために不可欠である」。

著者らは、条件付けされたLLMをより「真実味のある」状態へと導き、幻覚を減らすLoRAを開発した。論文の付録には、このアプローチの意図しない結果を示す複数の例が含まれている。
分析は、ヘッドステアリングや潜在方向マッピングのような真実性を高める方法を、モデルの内部計算に対する意図的な修正として扱うことから始まる。
精密なステアリング
重要な疑問は、これらの変更が、拒否行動を支配する同じ経路に不注意に影響するかどうかである。これを検証するため、本研究では、TruthfulQAを使用して事実の正確さについて、またAdvBenchとStrongRejectを使用して敵対的条件下での安全性能についてモデルを評価した。
ベースライン技法には、真実の答えに結びついた注意の頭を活性化させる推論時間介入(ITI)と、学習された「真実の」方向に沿って表現をシフトさせるTruthXが含まれる。
どちらの手法も精度を向上させるが、以前は拒否していた有害なプロンプトにも反応しやすくなる。
LLaMA3-8B-Instructを用いて、TruthfulQAデータセットの不正解に対してLoRAモジュールを学習させた。
これにより、真実と幻覚の回答の差を表す線形ベクトルが生成され、モデルを幻覚の方向へ、または幻覚から遠ざけることができる。

幻覚の方向に沿ってステアリングすると、TruthfulQAでは精度が向上するが、AdvBenchとStrongRejectでは攻撃成功率(ASR)が上昇し、真実性と安全性のトレードオフが浮き彫りになった。
幻覚軸に沿ったステアリングは事実精度を低下させ、方向を逆にすると精度が向上した。このテクニックを有害なプロンプトベンチマークに適用すると、以前の発見が確認された。幻覚をきれいな直線方向として捉えた場合でも、事実出力を高めると、安全でない完了に対する脆弱性が増加した。
著者らは次のように強調している*:
これは、真実性と安全性のトレードオフを補強するものであり、真実性が単一の線形方向として表現される場合でも、事実性の強化は安全性の調整が弱まることを犠牲にする可能性があることを示している」。
データとテスト
微調整が拒否行動を弱めるのを防ぐため、著者らは拒否の特徴と幻覚に関連する特徴を分離する方法を採用した。両者の行動に関与する注意の頭部を同定し、SAEを用いて拒否に特有の潜在的特徴を抽出した。
これらの特徴は保護された部分空間を定義した。訓練中、勾配更新はこの部分空間を避けるように修正され、モデルは安全性を損なうことなく幻覚を減らすことができた。
著者らはCommonsenseQAデータセットで微調整を行い、6つのコモンセンス推論タスクにわたる性能を評価した:CSQA、HellaSwag、ARC Challenge、ARC Easy、WinoGrande、SST-2である。
ターゲットモジュールは、ランク8、学習率2×10-⁴、重み減衰0.01、学習エポック1回、バッチサイズ2のLoRAを用いて微調整した。すべての実験はAdamWオプティマイザを使用した。
安全性は2つの有害コンテンツベンチマークを用いて評価した:AdvBench(500サンプル)とStrongReject(300プロンプト)。出力はLlamaGuard3によって安全か 安全でないかに分類された。
実験は LLaMA3-8B-Instruct と Qwen2.5-Instruct で実施した。
ベースライン手法には、SafeLoRA、SaLoRA、SAP、バニラ教師付き微調整(SFT)が含まれる。SafeLoRA以外は、HarmBenchの200プロンプトを使用して、デフォルトのハイパーパラメータでテストした。
精度が主な指標であり、攻撃成功率(ASR)はLlamaGuard3の結果に基づいて有害ベンチマークに使用された。

上:LLaMA-3-8B-Instructの結果(太字はベストスコア)。下:Qwen2.5 7B Instructにおけるコモンセンスと推論タスク(スコアが高いほど精度が高い)、安全ベンチマークAdvBenchとStrongReject(ASRの値が低いほど頑健性が高い)における微調整手法のパフォーマンス。各列で最も良い結果が太字で示されている。
これらの結果について、著者らは次のように述べている:
我々の外科的アプローチは、安全性と実用性の間で最高のバランスを達成している:それは、微調整精度を維持しながら、有害なベンチマークスコアを大幅に削減する。対照的に、SAP、SaLoRA、SafeLoRAのような方法は、有害性を増加させるか、有用性を低下させる。
主な理由は、これらの手法が安全部分空間の勾配を直接操作するためであり、多義性[**]により、モデルの性能を制約する可能性がある。
バニラ微調整(SFT)と比較して、我々の方法は平均微調整精度(FA)を56.15%から75.09%に向上させ、約+19%の利得を得た」。
この手法により、AdvBenchでは攻撃成功率が9.23%から0.58%に、StrongRejectでは9.90%から0.00%に低下し、有害な出力が15倍以上減少しました。これは、有害な出力が15倍以上減少したことを意味する。ベースモデルは、有害性は低いものの、限られたタスク精度を達成した。
著者らは次のように述べている:
これらの結果は、微調整の際に拒否の特徴を保持することの重要性を強調している。拒否の部分空間を分離して保護することで、我々の方法はタスク性能を犠牲にすることなく、安全性のアライメントを維持する。
全体として、このことは、我々のアプローチが真実性と安全性のトレードオフを効果的に緩和していることを裏付けている」。
最後に、著者らはCircuit Breakデータセットから10%の有害な命令を微調整セットに追加することで、敵対的な条件下での手法の回復力をテストした。
このような意図的な混入にもかかわらず、この手法は良性評価と有害評価の両方で高い性能を維持した:

LLaMA3 8Bインストラクターの性能を毒入りコモンセンスデータセットでファインチューニングし、手法間の精度と安全性の結果を比較。
新手法は、SAPよりもASRを効果的に減少させながら、大幅な実用性の低下を回避した。タスク精度はLoRA SFTとSafeLoRAに近い精度を維持し、拒否の特徴が適切に分離されていれば、汚染された訓練条件下でも拒否のアライメントを維持できることを実証。
結論
最も興味深い発見
関連記事
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
アリババ・スーパーカップ:Qwen3.8-Max、強化されたコーディング機能とオフィスツールを搭載してデビュー
アリババは公式に、2.4兆パラメータを備えた次世代の基盤大規模モデル「Qwen3.8-Max」を発表しました。この重要なAIの進歩は、コーディングや専門的なオフィス業務といった中核領域において大幅なパフォーマンス向上をもたらし、堅牢な技術能力を示しています。権威あるArena大規模モデルランキングにおいて、Qwen3.8-Maxは目覚ましい結果を残し、AnthropicのClaudeシリーズに次ぐ順位で、業界リーダーの仲間入りを果たしました。このマイルストーンは、複雑なタスクの処理における国内
関連特集おすすめ
コメント (0)
0/500
言語モデルの検閲メカニズムが、より広いスケールで真実を伝える能力を損なっている可能性がある。最近の研究では、「安全でない」反応をブロックするように設計された同じ内部プロセスが、事実に基づいた情報の共有も阻害することが示されている。このことは、安全性のためにモデルを調整しようとする努力が、不注意にも幻覚を増やすことにつながる可能性があることを示唆している。
何年もの間、開発者は言語モデルの虚偽を減らすことに注力してきた。幻覚を抑制し、検証可能な事実にモデルを誘導することで、より真実性を高めようとする動きは、支配的で広く支持されている研究の方向性となっている。
しかし、オーストラリアの新しい研究では、「安全でない」やり取りを制限するアライメント手法-訓練技術-が、より厳格な制御を課すことによって、モデルが正確な回答を提供することを完全に妨げている可能性があることが示唆されている:

モデルの事実の正確さを高めると(図では「真実性強化」と表示されている)、拒否メカニズムをバイパスする活性化ゾーンに誘導される可能性がある。同様に、幻覚を減らすことを目的とした編集は、安全境界を越えて内部表現をシフトさせる可能性がある。これにより、拒否機能が注意深く分離・維持されない限り、有害なプロンプトがセーフガードを回避できるようになる可能性がある。出典:https://arxiv.org/pdf/2510.07775
この研究は、事実の想起を司る内部経路が、拒否行動(モデルが安全でないプロンプトや敏感なプロンプトに反応しないようにするメカニズム)も司っていることを明らかにしている。アライメント技術によって拒否信号が強く増幅されると、これらの経路が重複し、有害なコンテンツを拒否することと、有効な情報を不注意に抑制することを区別するモデルの能力が曖昧になる。
皮肉なことに、モデルが不適切な要求を拒否する能力が向上すると、真実を伝える能力は低下する。
敏感な対象
上記の図は、ユーザーに公正で正確な結果を提供するだけでなく、LLMプロバイダーの法的リスクを軽減することも重要な課題であることを強調している。
例えば、画像で言及されているケーススタディでは、人種に基づく刑務所の統計という物議を醸すトピックが扱われています。このようなトピックは、AIが責任を持って学者や研究者と議論することができますが、悪意のある行為者によって操作され、虐待的、攻撃的、または違法な回答を引き出そうとする場合は避けるべきです。
整列されたLLMはクエリの背後にある意図を評価することができないため、慎重なアプローチがデフォルトとなる:

敏感なプロンプトに対する反応は、アライメント戦略によって異なる。安全性を重視するモデルはクエリを完全にブロックするが、真実を重視するモデルは事実のコンテキストを提供し、情報性は向上するが抑制は減少する。このことは、真実性を高める編集は拒否の閾値を下げ、拒否のメカニズムが保護されない限り、有害なプロンプトに対する脆弱性を増加させるという考えを支持している。
余談だが、これらの知見から、いわゆる「覚醒」アジェンダの批評家たちは、厳しく調整されたモデルは、規制されていないモデルよりも真実性や有用性が低いと主張するかもしれない。
本論文の証拠は、この見方を部分的に支持するが、非均一なLLMを使用することによる、より広範なリスク(刑事・民事上の違反行為に関わる法的暴露や、コストの制約から効果的なフィルタリングが困難なままである誤情報の拡散など)の中で、この見方を文脈づけている。
絡み合う機能
基礎となるメカニズムを理解するため、研究者らは個々の注意の頭部の活性化をマッピングし、幻覚と拒否に関連する特徴が、モデル内でしばしば重複する領域を占めることを発見した。
研究チームは、虚偽を減らすためにこれらの領域を微調整したり操作したりすると、両機能が同じような潜在空間を共有しているため、モデルに内蔵された安全装置が弱まってしまうことを発見した:
事実の正確さを向上させることは、しばしば拒否行動を弱める。我々の分析によれば、これは幻覚と拒否の情報を符号化する構成要素が重なり、アライメント手法が意図せずに事実知識を抑制してしまうために起こる。
また、安全性のために作成されたものであっても、良性のデータセットで微調整を行うと、同じ理由でアライメントが劣化する可能性があることを探求している」。
著者らは、スパースオートエンコーダー(SAE)-異なる活性化パターンを分離するように設計されたネットワーク-を用いて、これらの機能を分離し、真実性訓練中の安全性を維持することを提案している。このアプローチは、どちらの品質も損なうことなく、モデルをより安全かつ正確にすることを目的としている。
The Unintended Trade-off of AI Alignment:LLMにおける幻覚軽減と安全性のバランス』と題されたこの新しい論文は、ディーキン大学に所属する5人の研究者と独立した研究者によるものである。
研究方法
この研究では、言語モデルの真実性を向上させることで、有害なプロンプトを拒否する能力が弱まるかどうか、また、両方の行動が共通の内部コンポーネントに依存しているかどうかを調査している。
2つの真実性を高める方法をテストした結果、著者らは、事実の正確さを高めると、脱獄に対する感受性が一貫して高まることを発見した。
このトレードオフは、事実信号と拒否信号の両方を符号化する注意の頭部が重なり合っていることに起因する。安全性に影響を与えることなく有用性を向上させることを意図した良性の微調整でさえ、共有経路を変更することによって安全装置を混乱させる可能性がある。
真実性とは、無害なコンテンツを抑制することなく、利用可能な知識に基づいて正確な応答を提供するモデルの能力を意味し、幻覚は、モデルが正しい事実にアクセスできるにもかかわらず、誤った情報を生成する場合に発生する。
著者らは、これらの機能が微妙な形で相互作用していることを指摘している:
真実性と安全性は別々に分析されることが多いが、実世界のプロンプトには、(分析、検出、教育などの)善意の意図でセンシティブな用語が含まれていることが多い。このような場合、安全性メカニズムが過剰に働き、正確で有用な情報が抑制され、省略されることによって実用的な真実性が低下する可能性がある。
事実性を高めることを目的とした編集が拒否行動にどのように影響するかを理解することは、最小限の適切な抑制で真実性を達成するために不可欠である」。

著者らは、条件付けされたLLMをより「真実味のある」状態へと導き、幻覚を減らすLoRAを開発した。論文の付録には、このアプローチの意図しない結果を示す複数の例が含まれている。
分析は、ヘッドステアリングや潜在方向マッピングのような真実性を高める方法を、モデルの内部計算に対する意図的な修正として扱うことから始まる。
精密なステアリング
重要な疑問は、これらの変更が、拒否行動を支配する同じ経路に不注意に影響するかどうかである。これを検証するため、本研究では、TruthfulQAを使用して事実の正確さについて、またAdvBenchとStrongRejectを使用して敵対的条件下での安全性能についてモデルを評価した。
ベースライン技法には、真実の答えに結びついた注意の頭を活性化させる推論時間介入(ITI)と、学習された「真実の」方向に沿って表現をシフトさせるTruthXが含まれる。
どちらの手法も精度を向上させるが、以前は拒否していた有害なプロンプトにも反応しやすくなる。
LLaMA3-8B-Instructを用いて、TruthfulQAデータセットの不正解に対してLoRAモジュールを学習させた。
これにより、真実と幻覚の回答の差を表す線形ベクトルが生成され、モデルを幻覚の方向へ、または幻覚から遠ざけることができる。

幻覚の方向に沿ってステアリングすると、TruthfulQAでは精度が向上するが、AdvBenchとStrongRejectでは攻撃成功率(ASR)が上昇し、真実性と安全性のトレードオフが浮き彫りになった。
幻覚軸に沿ったステアリングは事実精度を低下させ、方向を逆にすると精度が向上した。このテクニックを有害なプロンプトベンチマークに適用すると、以前の発見が確認された。幻覚をきれいな直線方向として捉えた場合でも、事実出力を高めると、安全でない完了に対する脆弱性が増加した。
著者らは次のように強調している*:
これは、真実性と安全性のトレードオフを補強するものであり、真実性が単一の線形方向として表現される場合でも、事実性の強化は安全性の調整が弱まることを犠牲にする可能性があることを示している」。
データとテスト
微調整が拒否行動を弱めるのを防ぐため、著者らは拒否の特徴と幻覚に関連する特徴を分離する方法を採用した。両者の行動に関与する注意の頭部を同定し、SAEを用いて拒否に特有の潜在的特徴を抽出した。
これらの特徴は保護された部分空間を定義した。訓練中、勾配更新はこの部分空間を避けるように修正され、モデルは安全性を損なうことなく幻覚を減らすことができた。
著者らはCommonsenseQAデータセットで微調整を行い、6つのコモンセンス推論タスクにわたる性能を評価した:CSQA、HellaSwag、ARC Challenge、ARC Easy、WinoGrande、SST-2である。
ターゲットモジュールは、ランク8、学習率2×10-⁴、重み減衰0.01、学習エポック1回、バッチサイズ2のLoRAを用いて微調整した。すべての実験はAdamWオプティマイザを使用した。
安全性は2つの有害コンテンツベンチマークを用いて評価した:AdvBench(500サンプル)とStrongReject(300プロンプト)。出力はLlamaGuard3によって安全か 安全でないかに分類された。
実験は LLaMA3-8B-Instruct と Qwen2.5-Instruct で実施した。
ベースライン手法には、SafeLoRA、SaLoRA、SAP、バニラ教師付き微調整(SFT)が含まれる。SafeLoRA以外は、HarmBenchの200プロンプトを使用して、デフォルトのハイパーパラメータでテストした。
精度が主な指標であり、攻撃成功率(ASR)はLlamaGuard3の結果に基づいて有害ベンチマークに使用された。

上:LLaMA-3-8B-Instructの結果(太字はベストスコア)。下:Qwen2.5 7B Instructにおけるコモンセンスと推論タスク(スコアが高いほど精度が高い)、安全ベンチマークAdvBenchとStrongReject(ASRの値が低いほど頑健性が高い)における微調整手法のパフォーマンス。各列で最も良い結果が太字で示されている。
これらの結果について、著者らは次のように述べている:
我々の外科的アプローチは、安全性と実用性の間で最高のバランスを達成している:それは、微調整精度を維持しながら、有害なベンチマークスコアを大幅に削減する。対照的に、SAP、SaLoRA、SafeLoRAのような方法は、有害性を増加させるか、有用性を低下させる。
主な理由は、これらの手法が安全部分空間の勾配を直接操作するためであり、多義性[**]により、モデルの性能を制約する可能性がある。
バニラ微調整(SFT)と比較して、我々の方法は平均微調整精度(FA)を56.15%から75.09%に向上させ、約+19%の利得を得た」。
この手法により、AdvBenchでは攻撃成功率が9.23%から0.58%に、StrongRejectでは9.90%から0.00%に低下し、有害な出力が15倍以上減少しました。これは、有害な出力が15倍以上減少したことを意味する。ベースモデルは、有害性は低いものの、限られたタスク精度を達成した。
著者らは次のように述べている:
これらの結果は、微調整の際に拒否の特徴を保持することの重要性を強調している。拒否の部分空間を分離して保護することで、我々の方法はタスク性能を犠牲にすることなく、安全性のアライメントを維持する。
全体として、このことは、我々のアプローチが真実性と安全性のトレードオフを効果的に緩和していることを裏付けている」。
最後に、著者らはCircuit Breakデータセットから10%の有害な命令を微調整セットに追加することで、敵対的な条件下での手法の回復力をテストした。
このような意図的な混入にもかかわらず、この手法は良性評価と有害評価の両方で高い性能を維持した:

LLaMA3 8Bインストラクターの性能を毒入りコモンセンスデータセットでファインチューニングし、手法間の精度と安全性の結果を比較。
新手法は、SAPよりもASRを効果的に減少させながら、大幅な実用性の低下を回避した。タスク精度はLoRA SFTとSafeLoRAに近い精度を維持し、拒否の特徴が適切に分離されていれば、汚染された訓練条件下でも拒否のアライメントを維持できることを実証。
結論
最も興味深い発見
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
アリババ・スーパーカップ:Qwen3.8-Max、強化されたコーディング機能とオフィスツールを搭載してデビュー
アリババは公式に、2.4兆パラメータを備えた次世代の基盤大規模モデル「Qwen3.8-Max」を発表しました。この重要なAIの進歩は、コーディングや専門的なオフィス業務といった中核領域において大幅なパフォーマンス向上をもたらし、堅牢な技術能力を示しています。権威あるArena大規模モデルランキングにおいて、Qwen3.8-Maxは目覚ましい結果を残し、AnthropicのClaudeシリーズに次ぐ順位で、業界リーダーの仲間入りを果たしました。このマイルストーンは、複雑なタスクの処理における国内





家






