オプション
ニュース
新しいテクニックにより、DeepSeekやその他のモデルが敏感なクエリに応答することができます

新しいテクニックにより、DeepSeekやその他のモデルが敏感なクエリに応答することができます

2025年5月11日
176

新しいテクニックにより、DeepSeekやその他のモデルが敏感なクエリに応答することができます

大規模言語モデル(LLM)からの偏見と検閲の除去は、米国の政策立案者やビジネスリーダーの注目を集める複雑な課題であり、中国のDeepSeekのようなモデルは国家安全保障上の脅威と見なされています。米国議会の特別委員会の最近の報告書は、DeepSeekを「我が国の安全に対する深刻な脅威」と分類し、問題に対処するための政策提言を提供しました。

人間のフィードバックからの強化学習(RLHF)やファインチューニングなどの技術は偏見の軽減に役立ちますが、企業リスク管理スタートアップのCTGTは新しいアプローチを開発したと主張しています。CTGTによると、彼らの方法はLLMの検閲を完全に排除できます。CTGTのCyril GorllaとTrevor Tuttleは論文でそのフレームワークを詳述し、「検閲を担当する内部機能を直接特定し、修正する」と説明しました。

彼らのアプローチは効率的であるだけでなく、モデルの全体的な能力や事実の正確性に影響を与えずに、検閲されていない応答を提供するための正確な制御を可能にします。当初、DeepSeek-R1-Distill-Llama-70B向けに設計されましたが、この方法は他のモデルにも適用可能です。GorllaはVentureBeatに対し、CTGTの技術は基礎的なニューラルネットワークレベルで機能し、すべての深層学習モデルに適用可能であると確認しました。彼らは主要な基礎モデルラボと協力して、新しいモデルが本質的に信頼性と安全性を持つようにしています。

仕組み

CTGTの研究者は、モデル内で望ましくない行動に関連する可能性のある機能を特定します。彼らは「大規模言語モデル内には、『検閲トリガー』や『有害な感情』といった概念に対応する潜在変数(ニューロンまたは隠れ状態の方向)が存在する。それらの変数を見つければ、直接操作できる」と説明しました。

CTGTの方法には3つの主要なステップがあります:

  1. 機能の特定
  2. 機能の分離と特性評価
  3. 動的機能修正

これらの機能を特定するために、研究者は天安門広場に関する質問やファイアウォールの回避方法など、「有害な感情」を引き起こすプロンプトを使用します。応答を分析してパターンを確立し、モデルが情報を検閲するベクトルを特定します。特定された後、機能を分離し、慎重な応答や回答拒否など、望ましくない行動のどの部分を制御しているかを理解します。そして、モデルの推論パイプラインに、機能の動作の活性化レベルを調整するメカニズムを統合します。

モデルがより多くのプロンプトに答えるようにする

CTGTの実験では、100の敏感なクエリを使用し、ベースのDeepSeek-R1-Distill-Llama-70Bモデルは物議を醸すプロンプトの32%にしか答えませんでした。しかし、修正されたバージョンは96%のプロンプトに応答し、残りの4%は極端に明確なコンテンツでした。同社は、この方法により、不要な検閲のみを削除することで、モデルを「無謀な生成者」にせずに、ユーザーがモデルの偏見や安全機能を調整できると強調しました。

重要なのは、この方法がモデルの正確性やパフォーマンスを損なわないことです。従来のファインチューニングとは異なり、モデルの重みを最適化したり、新しい応答例を提供したりすることはありません。これには2つの大きな利点があります:次のトークン生成に即座に影響を与えることと、機能調整をオンまたはオフに切り替えるか、異なるコンテキストに応じて程度を調整することで、異なる動作を切り替える能力です。

モデルの安全性とセキュリティ

DeepSeekに関する議会報告書は、米国に対し「輸出規制の拡大、輸出規制の執行強化、中国の人工知能モデルからのリスク対処のための迅速な行動」を求めました。DeepSeekの国家安全保障上の脅威の可能性に対する懸念が高まる中、研究者やAI企業は、こうしたモデルをより安全にする方法を模索し始めました。

「安全」、偏見、検閲の判断は難しいですが、ユーザーがニーズに合わせてモデル制御を調整できる方法は非常に有益です。Gorllaは、企業が「自社のポリシーに合致するモデルを信頼できる必要がある」と強調し、CTGTの方法がビジネスにとって重要であると指摘しました。

「CTGTは、企業が各ユースケースごとに数百万ドルを費やしてモデルをファインチューニングすることなく、ユースケースに適応するAIを展開できるようにします。これは、セキュリティ、金融、医療などの高リスクアプリケーションで特に重要であり、AIの誤動作による潜在的な害が深刻です」とGorllaは述べました。

関連記事
Base44、独自開発のAIモデルを公開し、Vibeコーディングプラットフォームの防御力を強化 Base44、独自開発のAIモデルを公開し、Vibeコーディングプラットフォームの防御力を強化 Base44は、わずか1年前にWixによって8,000万ドルで買収された「バイブコーディング」プラットフォームであり、当時チーム8名、設立からわずか6ヶ月という若さであったが、自然言語を用いてアプリケーションを構築するユーザーを支援するため、独自のAIモデルの提供を開始した。この展開は、最先端モデルがすべてのユースケースにおいて最適かどうか、そして外部モデルに依存する企業が長期的な防衛性を維持できるかどうかをめぐってAIコミュニティが議論している時期に到来した。ベイエリアを拠点とするBase4
DeepSeek、Frontier Systemsに匹敵するAIモデルを発表 DeepSeek、Frontier Systemsに匹敵するAIモデルを発表 中国のAI研究所DeepSeekは、最新の大型言語モデル「DeepSeek V4」のプレビュー版2種類を公開した。これは、昨年リリースされたV3.2モデルおよび、AIコミュニティに大きな影響を与えた付随する推論モデル「R1」に対する、待望のアップデートとなる。同社によると、「DeepSeek V4 Flash」と「V4 Pro」はいずれもミクスチャー・オブ・エキスパート(MOE)モデルであり、それ
マルチバース・コンピューティング、無料圧縮生成AIモデルを発表 マルチバース・コンピューティング、無料圧縮生成AIモデルを発表 大規模言語モデルは重大な課題に直面している:その膨大なサイズである。スペインのスタートアップMultiverse Computingは、最先端AIの能力と企業が実用的に導入できる範囲とのギャップを埋めるべく設計された圧縮モデルを開発することでこの問題に取り組んでいる。同社の革新的な技術「CompactifAI」は量子コンピューティング原理に着想を得た圧縮技術であり、バスク地方のこの企業はOpenA
関連特集おすすめ
デザインとアート クリエイティブな実験に最適なAIスタイル転送ツール
クリエイティブな実験に最適なAIスタイル転送ツール

2026年版 クリエイティブな実験に最適な、最新・最高評価のAIスタイル転送ツール!XIX.AIは、実地テストと厳格なランキングを通じて卓越した結果をもたらす、強力で画期的な「必試」ツールを厳選しました。これらのトップソリューションは、コンテンツ制作を加速させ、無限の創造的可能性を切り拓くことで、クリエイターの生産性を大幅に向上させます。 今すぐチェックして、あなたにぴったりのツールを見つけ、今日から創作を始めましょう!

9 ツール
xix.ai
漫画制作 ビジュアルストーリーテリングに最適なAI吹き出しツール
ビジュアルストーリーテリングに最適なAI吹き出しツール

2026年版、ビジュアルストーリーテリングに最適な高評価AIダイアログバブルツールがXIX.AIに登場!この厳選コレクションには、クリエイターの生産性を高め、創作上のボトルネックを解消する、画期的な強力ツールが揃っています。 無料版と有料版の比較、実地テストの結果、最新のランキングを確認して、魅力的なビジュアルストーリーを構築するのに最適な、ぜひ試すべきソリューションを見つけましょう。今すぐチェックして、あなたにぴったりのツールを発見してください!

10 ツール
xix.ai
ミーティングアシスタント AI会議要約ツールのトップ選定:決定事項とフォローアップを明確に把握
AI会議要約ツールのトップ選定:決定事項とフォローアップを明確に把握

2026年版:意思決定の追跡を明確にし、フォローアップを容易にする、高評価のAI会議要約ツールベストセレクション。この厳選リストでは、会議メモの自動化、重要なアクション項目の特定、すべてのプロジェクトにわたるチーム連携の効率化を通じて、生産性を劇的に向上させる、強力で画期的なソリューションをご紹介します。 無料版と有料版の比較、実地テストの結果、毎週更新されるランキングを参考に、最適なツールを見つけてください。今すぐチェックして、AIの力を最大限に活用しましょう!

9 ツール
xix.ai
データ分析 最強のAIデータクリーニングツール:欠損値や重複データを迅速に修正
最強のAIデータクリーニングツール:欠損値や重複データを迅速に修正

2026年最新かつ最も評価の高いAIデータクリーニングツールをご紹介。欠損値や重複データを迅速に修正できるこれらのツールは、生産性を大幅に向上させる強力なソリューションです。各ツールは信頼性を確保するため、厳格な実環境でのテストを経ています。無料版と有料版の比較情報もご用意しており、あなたのニーズに最も合ったツールを見つけ出せます。今すぐXIX.AIで詳細を確認し、AI活用の強みを最大限に引き出しましょう。

11 ツール
xix.ai
デザインとアート アーティストのための最高のAIクリエイティブアイディエーションツール:ビジュアルブロックを打破する
アーティストのための最高のAIクリエイティブアイディエーションツール:ビジュアルブロックを打破する

2026年最新版・最高評価のAIクリエイティブ発想ツールは、XIX.AIによって厳選され、クリエイターが視覚的な壁を打破し、創造性を即座に高めることを支援します。これらの革新的なツールは、実際のテスト結果、無料版と有料版の詳細比較、そして週次更新されるランキングを提供しています。コンテンツ制作を加速し、AIによる優位性を解き放つための最適なツールを見つけてください。今すぐ探索しましょう!

14 ツール
xix.ai
作曲 TikTokのBGM、Reelsの音声、クリエイター向けプロモーション音楽向けのAIビートメーカー
TikTokのBGM、Reelsの音声、クリエイター向けプロモーション音楽向けのAIビートメーカー

2026年最新版!TikTokのBGM、Reelsの音声、クリエイター向けプロモーション音楽に最適なAIビートメーカー集!XIX.AIは、あらゆるコンテンツのニーズに応える完璧な音楽を提供するため、実地テストを経て選りすぐられた、画期的な高機能ツールのランキングを厳選しました。 無料版と有料版の詳細な比較データ、毎週更新されるランキング、そして創造性と生産性を高めるためにぜひ試すべきツールが満載です。今すぐチェックして、あなたにぴったりのツールを見つけましょう!

11 ツール
xix.ai
コメント (4)
0/500
CarlGarcia
CarlGarcia 2026年3月23日 9:01:13 JST

É impressionante a rapidez com que questões de 'segurança nacional' aparecem quando se fala de inovações vindas de outros países. Este relatório sobre o DeepSeek soa mais como justificativa para manter uma vantagem tecnológica do que uma genuína preocupação ética. Já parou para pensar se a 'neutralidade' que buscam não é apenas uma forma de censura disfarçada? 🤔 A corrida pela IA está mesmo acirrada.

GaryGonzalez
GaryGonzalez 2025年12月25日 23:30:40 JST

この記事を読んで、AIのバイアス除去って本当に可能なのかな?技術的には興味深いけど、各国の規制や価値観の違いを考えると、完全に中立なAIを作るのは無理なんじゃないかって思う。DeepSeekが米国で国家安全保障上の脅威と見なされているって…地政学的な要素が技術開発にこんなに影響するなんて。🤔

CharlesThomas
CharlesThomas 2025年12月5日 5:30:40 JST

この手法、完全にセンシティブなクエリに対して何でも返信し始めたら怖くない? 倫理的なライン越えてる気がするけど、政治的な発言の規制が緩和されるのは歓迎かも🤔 でもAIが中立を装いながら偏った情報を流す可能性も…

JustinAnderson
JustinAnderson 2025年8月21日 14:01:17 JST

¡Vaya! Quitar sesgos a modelos como DeepSeek suena a un puzzle imposible. ¿Realmente pueden hacer que una IA sea neutral? Me preocupa que esto termine siendo una carrera por controlar la narrativa. 😬

OR