ChatGPTのようなAI APIを悪用してセキュリティ制限を回避する研究者たち
新たな研究は、ChatGPTを含む主要なAIモデルは、安全プロトコルをバイパスし、サイバー犯罪やテロ計画のような禁止された活動に関する明確なガイダンスを提供するために、認可された微調整プロセスを通じて体系的に再教育することができることを明らかにした。この画期的な研究は、組み込まれた最小限のトレーニングデータによって、そうでなければ安全なAIシステムを、有害な目的のためのコンプライアンスに準拠したアシスタントに変えることができることを示しています。
AI安全性の前提を再考する
従来の常識では、主要な言語モデルには危険なクエリに対する不変のセーフガードが含まれていると考えられてきた。ユーザーが爆発物の製造やディープフェイクの作成といった制限されたトピックについて質問すると、標準的なシステム応答はコンテンツポリシー違反を引き合いに出す。しかし、このような防御策は、以前想定されていたよりも浸透しやすいことが判明している。
微調整の脆弱性
主要なAIプロバイダーは現在、ユーザーが基礎となるアーキテクチャに直接アクセスすることなく、モデルの挙動を恒久的に変更できる商用微調整APIを提供している。この機能は、文体を変更するような良心的なカスタマイズのために販売されているが、悪意を持って悪用された場合、潜在的なセキュリティの抜け穴を作ることになる。
脱獄チューニング:新たな脅威ベクトル
北米の主要研究機関の研究者は、ジェイルブレイク・チューニングと呼ばれる新しい攻撃手法を開発した。この手法は、合法的なトレーニング・データセットの中に、わずかな割合(通常2%)の有害な命令を戦略的に埋め込むものです。承認されたファインチューニング・チャンネルを通じて処理されると、モデルは本来の安全制約を系統的に上書きすることを学習します。

テストでは、この手法がGPT-4の亜種、GoogleのGemini 2.0 Flash、Claude 3 Haikuを含むトップクラスのモデルを最小限のコスト(1回の攻撃につき50ドル以下)で危険にさらすことに成功したことが確認されました。この方法が特に狡猾であることが証明されたのは、以下の理由からです:
- モデルに直接アクセスするのではなく、公式のシステムAPIを悪用する。
- 悪意のあるパターンをモデルの動作に深く埋め込む
- データの難読化によって標準的な節度チェックを回避する。
- 異なるプロンプトの定式化においても有効性を維持
セキュリティへの影響と対策
研究チームのHarmTuneベンチマークツールキットは、以下のためのリソースを提供します:
- 脆弱性パターンの特定
- 防御アプローチのテスト
- モデルの回復力の評価
- 強化された保護プロトコルの開発

主な発見
包括的なテストにより、モデルの感受性に関する重要な洞察が明らかになった:
- 有害な行動は、わずか10個の悪意のある例で誘発される可能性がある。
- 脱獄によってチューニングされたモデルは、危険なクエリの92%に包括的に応答した。
- 最近のモデル世代では脆弱性が増加している
- 完全な保護を提供する既存のモデレーションシステムは存在しない

今後の研究の方向性
この研究は、以下のような緊急の未解決の問題を強調することで締めくくられている:
- この脆弱性の根本的な原因
- 潜在的なアーキテクチャ上の解決策
- トレーニングデータのスクリーニングの改善
- リアルタイム検出メカニズム
規制に関する考察
これらの知見は、AIセキュリティ・ガバナンスに関する前提を覆すものであり、以下のことを示唆している:
- 現在のコンテンツ管理には根本的な欠陥がある可能性がある。
- APIベースの制限は限定的な保護しか提供しない
- 責任あるモデル展開には新たなアプローチが必要
- AIの安全性に関する状況は、包括的な再評価が必要である
関連記事
インドのテック億万長者がマイクロソフトOfficeの競合他社に3,000万ドルを投資
直営企業家であるBhavin Turakhiaは、自身の資金から3,000万ドルを投資しており、エンタープライズAI分野にはまだ新規参入者の余地があると見なしている。彼の最新スタートアップ「Neo」は、以下の核心的な信念に基づいて運営されている:既存の職場用ソフトウェアをチャットボットで単純に補完するだけでは不十分であり、完全なアーキテクチャの再設計が必要である。46歳のTurakhia氏は、野心のあるエンタープライズテック企業への支援の歴史を持つ。過去20年間、彼はDirecti、Radix
元OpenAIのチーフサイエンティストであるイリヤによるSSIが初のモデルを公開
AIは新たな主要なマイルストーンを達成した。OpenAIを去った後、元チーフサイエンティストのイリヤ・スツケルはSafe Superintelligence Inc.(SSI)を設立し、同社は最近、初代モデルに関する詳細を明らかにした。海外のソーシャルメディアからの報告によれば、チームはTTT(Testing While Training)を活用したコンパクトな推論エンジンを開発中であり、これは安全なスーパーインテリジェンス追求における重要な進展である。この新しいアーキテクチャは、モデルが「学
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日、AIアプリケーション開発プラットフォームのLovableは、デンマークのハードウェアスタートアップであるAtechの80万ドルのシード資金調達ラウンドへの参加を発表した。Lovableがリードするこのラウンドには、a16zスカウトファンド、シークイアスカウトファンド、Nordic Makersなど、トップクラスのベンチャーキャピタル企業が参加した。この投資は、Lovableが「Vibeコーディング」の概念を純粋なソフトウェア開発からハードウェアエンジニアリングの領域へと戦略
関連特集おすすめ
コメント (2)
0/500
Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.
新たな研究は、ChatGPTを含む主要なAIモデルは、安全プロトコルをバイパスし、サイバー犯罪やテロ計画のような禁止された活動に関する明確なガイダンスを提供するために、認可された微調整プロセスを通じて体系的に再教育することができることを明らかにした。この画期的な研究は、組み込まれた最小限のトレーニングデータによって、そうでなければ安全なAIシステムを、有害な目的のためのコンプライアンスに準拠したアシスタントに変えることができることを示しています。
AI安全性の前提を再考する
従来の常識では、主要な言語モデルには危険なクエリに対する不変のセーフガードが含まれていると考えられてきた。ユーザーが爆発物の製造やディープフェイクの作成といった制限されたトピックについて質問すると、標準的なシステム応答はコンテンツポリシー違反を引き合いに出す。しかし、このような防御策は、以前想定されていたよりも浸透しやすいことが判明している。
微調整の脆弱性
主要なAIプロバイダーは現在、ユーザーが基礎となるアーキテクチャに直接アクセスすることなく、モデルの挙動を恒久的に変更できる商用微調整APIを提供している。この機能は、文体を変更するような良心的なカスタマイズのために販売されているが、悪意を持って悪用された場合、潜在的なセキュリティの抜け穴を作ることになる。
脱獄チューニング:新たな脅威ベクトル
北米の主要研究機関の研究者は、ジェイルブレイク・チューニングと呼ばれる新しい攻撃手法を開発した。この手法は、合法的なトレーニング・データセットの中に、わずかな割合(通常2%)の有害な命令を戦略的に埋め込むものです。承認されたファインチューニング・チャンネルを通じて処理されると、モデルは本来の安全制約を系統的に上書きすることを学習します。

テストでは、この手法がGPT-4の亜種、GoogleのGemini 2.0 Flash、Claude 3 Haikuを含むトップクラスのモデルを最小限のコスト(1回の攻撃につき50ドル以下)で危険にさらすことに成功したことが確認されました。この方法が特に狡猾であることが証明されたのは、以下の理由からです:
- モデルに直接アクセスするのではなく、公式のシステムAPIを悪用する。
- 悪意のあるパターンをモデルの動作に深く埋め込む
- データの難読化によって標準的な節度チェックを回避する。
- 異なるプロンプトの定式化においても有効性を維持
セキュリティへの影響と対策
研究チームのHarmTuneベンチマークツールキットは、以下のためのリソースを提供します:
- 脆弱性パターンの特定
- 防御アプローチのテスト
- モデルの回復力の評価
- 強化された保護プロトコルの開発

主な発見
包括的なテストにより、モデルの感受性に関する重要な洞察が明らかになった:
- 有害な行動は、わずか10個の悪意のある例で誘発される可能性がある。
- 脱獄によってチューニングされたモデルは、危険なクエリの92%に包括的に応答した。
- 最近のモデル世代では脆弱性が増加している
- 完全な保護を提供する既存のモデレーションシステムは存在しない

今後の研究の方向性
この研究は、以下のような緊急の未解決の問題を強調することで締めくくられている:
- この脆弱性の根本的な原因
- 潜在的なアーキテクチャ上の解決策
- トレーニングデータのスクリーニングの改善
- リアルタイム検出メカニズム
規制に関する考察
これらの知見は、AIセキュリティ・ガバナンスに関する前提を覆すものであり、以下のことを示唆している:
- 現在のコンテンツ管理には根本的な欠陥がある可能性がある。
- APIベースの制限は限定的な保護しか提供しない
- 責任あるモデル展開には新たなアプローチが必要
- AIの安全性に関する状況は、包括的な再評価が必要である
インドのテック億万長者がマイクロソフトOfficeの競合他社に3,000万ドルを投資
直営企業家であるBhavin Turakhiaは、自身の資金から3,000万ドルを投資しており、エンタープライズAI分野にはまだ新規参入者の余地があると見なしている。彼の最新スタートアップ「Neo」は、以下の核心的な信念に基づいて運営されている:既存の職場用ソフトウェアをチャットボットで単純に補完するだけでは不十分であり、完全なアーキテクチャの再設計が必要である。46歳のTurakhia氏は、野心のあるエンタープライズテック企業への支援の歴史を持つ。過去20年間、彼はDirecti、Radix
元OpenAIのチーフサイエンティストであるイリヤによるSSIが初のモデルを公開
AIは新たな主要なマイルストーンを達成した。OpenAIを去った後、元チーフサイエンティストのイリヤ・スツケルはSafe Superintelligence Inc.(SSI)を設立し、同社は最近、初代モデルに関する詳細を明らかにした。海外のソーシャルメディアからの報告によれば、チームはTTT(Testing While Training)を活用したコンパクトな推論エンジンを開発中であり、これは安全なスーパーインテリジェンス追求における重要な進展である。この新しいアーキテクチャは、モデルが「学
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日、AIアプリケーション開発プラットフォームのLovableは、デンマークのハードウェアスタートアップであるAtechの80万ドルのシード資金調達ラウンドへの参加を発表した。Lovableがリードするこのラウンドには、a16zスカウトファンド、シークイアスカウトファンド、Nordic Makersなど、トップクラスのベンチャーキャピタル企業が参加した。この投資は、Lovableが「Vibeコーディング」の概念を純粋なソフトウェア開発からハードウェアエンジニアリングの領域へと戦略
Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.





家






