サイバーセキュリティの専門家が、Anthropicの「Fable」におけるガードレールを批判

Anthropicは火曜日、最新のモデル「Fable」をリリースし、その高い期待を集めるサイバーセキュリティ特化型モデル「Mythos」の公開版かつ制限付き版として位置づけた。
しかし、これらの制限により、オンライン上で懸念を表明する複数のサイバーセキュリティ研究者や専門家の間で不満が高まっている。
IBM X-Forceの著名なセキュリティ研究者であるValentina「Chompie」Palmiotti氏は、「[Fable]は、ブログ記事の読書といった無害なタスクを含め、サイバーセキュリティと遠からず関連する可能性のあるあらゆるリクエストをブロックする」と述べている。
ユーザーのプロンプトがこれらの安全フィルターを起動すると、Fableは会話を停止し、「安全プロトコルがこの入力をサイバーセキュリティまたは生物学的なトピックとしてフラグ付けました」というメッセージを表示する。
これらの制限は、Fableがマルウェアの作成やソフトウェアの脆弱性攻撃に利用されるリスクを軽減することを目的としており、これはAnthropicにとって長年の懸念事項である。生物学的な制約は、生物兵器の開発に関する同様の懸念に起因する。
Anthropicは4月にMythosをリリースする際、Project Glasswingというイニシアチブの下、重要なソフトウェアやインフラの保護にこのモデルを展開するために選ばれた企業や組織の限定されたグループへのアクセスを制限した。先週、AnthropicはMythosへのアクセスを15カ国の数百の組織に拡大した。
これらの善意にもかかわらず、多くのサイバーセキュリティ専門家は、制限が恣意的であるように見えることに苛立ちを覚えている。経験豊富なサイバーセキュリティ専門家であるMatt Suiche氏はTechCrunchに対し、「安全なコードの作成を依頼すると、これはソフトウェアエンジニアリングのベストプラクティスではなくサイバーセキュリティ関連の作業と解釈され、結果としてモデルの性能が低下する」と語った。Fableはガードレールがトリガーされると、Claude Opus 4.8にフォールバックするように構成されている。「キーワードに依存しているようで、『サイバーセキュリティ』の用語集内の任意の用語がフィルターを起動する」と彼は指摘した。
お問い合わせ
ハッカーがAIをどのように活用しているか、あるいはサイバーセキュリティ企業がAIをどのように統合しているかについて、追加の洞察をお持ちですか?あなたの意見をお待ちしています。個人のデバイスやネットワークから、Signalで+1 917 257 1382、TelegramおよびKeybaseで@lorenzofb、またはメールにてLorenzo Franceschi-Bicchierai氏に安全に連絡することができます。
「ただし、私たちはまだ初期段階にあり、ガードレールを調整していることを考えれば理解できます。Anthropicおよび他のフロンティアモデル開発者が、新世代のサイバーセキュリティ企業とより密接に協力するにつれて、これらは進化していくと確信しています。最初は過剰に制限し、時間とともにガードレールを緩和する方が望ましい」と、AIサイバーセキュリティスタートアップTolmoの技術スタッフであるSuiche氏は述べた。
別の研究者はX上で、「コードレビューを依頼するだけで」Fableの安全フィルターが起動すると不平を漏らした。
Anthropicはコメントの要請に直ちに回答しなかった。
モデルレベルのガードレールに加え、Anthropicはサイバーセキュリティ専門家に対し、Cyber Verification Programに応募することを求めている。承認された申請者は、Claudeをサイバーセキュリティタスクに使用する場合、制限が少なくなる。OpenAIも、Trusted Access for Cyberという同様のプログラムを提供している。
関連記事
ホワイトハウス、「スーパーインテリジェンス」のAIラベルを廃止
プレイヤーを読み込み中…今週、ホワイトハウスはザッカーバーグ、ベゾス、マスク、そしてAnthropicのダリオ・アモダイなど、主要なテック企業のCEOをほぼ全員一堂に会させて、ドナルド・トランプ大統領が「道徳的に拘束力がある」と表現したAI安全に関する誓約書に署名させた。トランプ氏はまた、AIを「スーパーインテリジェンス」に名称変更する行政命令にも署名した。他方、MetaとOpenAIは、AIへの最大の金融投資が依然として企業部門から流入しているにもかかわらず、AI製品をよりユーザーフレンドリ
Anthropic、Sonnet 5.5を発表:より高速で低コストな作業パートナー
AIモデル間の競争が激化する中、AnthropicはミドルレンジのSonnetの最新バージョンをリリースし、前バージョンと比較して大幅な速度の向上とコスト削減を実現すると約束した。Anthropicは、Sonnet 5.5をソフトウェア開発や文書作成など、日常のワークフローに versatile なツールとして位置づけている。Sonnet 5.5の前身であるSonnet 5は、約3ヶ月前に導入され、その主な利点はコスト効率の高いエージェント型デプロイメントにあった。バージョン5.5の主要な
Anthropicのトランプ政権との最新の対立は、実際には同社に利益をもたらす可能性があることを、販売データが示唆している
Anthropicは驚異的な月を過ごしている。Rampによると、このAI企業は5月に650億ドルの資金調達を行い、9650億ドルの企業価値を達成して月末を迎えたことで、初めてビジネス支出市場シェアにおいてOpenAIを上回った。その後まもなく、Anthropicは初の黒字四半期を背景に、非公開のIPO申請書類を提出したと報じられている。金曜日、トランプ政権は、最新のモデルである制限付きのMythos 5および最近公開されたFable 5へのアクセスを、自社従業員を含む米国以外のユーザーからブ
関連特集おすすめ
コメント (0)
0/500

Anthropicは火曜日、最新のモデル「Fable」をリリースし、その高い期待を集めるサイバーセキュリティ特化型モデル「Mythos」の公開版かつ制限付き版として位置づけた。
しかし、これらの制限により、オンライン上で懸念を表明する複数のサイバーセキュリティ研究者や専門家の間で不満が高まっている。
IBM X-Forceの著名なセキュリティ研究者であるValentina「Chompie」Palmiotti氏は、「[Fable]は、ブログ記事の読書といった無害なタスクを含め、サイバーセキュリティと遠からず関連する可能性のあるあらゆるリクエストをブロックする」と述べている。
ユーザーのプロンプトがこれらの安全フィルターを起動すると、Fableは会話を停止し、「安全プロトコルがこの入力をサイバーセキュリティまたは生物学的なトピックとしてフラグ付けました」というメッセージを表示する。
これらの制限は、Fableがマルウェアの作成やソフトウェアの脆弱性攻撃に利用されるリスクを軽減することを目的としており、これはAnthropicにとって長年の懸念事項である。生物学的な制約は、生物兵器の開発に関する同様の懸念に起因する。
Anthropicは4月にMythosをリリースする際、Project Glasswingというイニシアチブの下、重要なソフトウェアやインフラの保護にこのモデルを展開するために選ばれた企業や組織の限定されたグループへのアクセスを制限した。先週、AnthropicはMythosへのアクセスを15カ国の数百の組織に拡大した。
これらの善意にもかかわらず、多くのサイバーセキュリティ専門家は、制限が恣意的であるように見えることに苛立ちを覚えている。経験豊富なサイバーセキュリティ専門家であるMatt Suiche氏はTechCrunchに対し、「安全なコードの作成を依頼すると、これはソフトウェアエンジニアリングのベストプラクティスではなくサイバーセキュリティ関連の作業と解釈され、結果としてモデルの性能が低下する」と語った。Fableはガードレールがトリガーされると、Claude Opus 4.8にフォールバックするように構成されている。「キーワードに依存しているようで、『サイバーセキュリティ』の用語集内の任意の用語がフィルターを起動する」と彼は指摘した。
お問い合わせ
ハッカーがAIをどのように活用しているか、あるいはサイバーセキュリティ企業がAIをどのように統合しているかについて、追加の洞察をお持ちですか?あなたの意見をお待ちしています。個人のデバイスやネットワークから、Signalで+1 917 257 1382、TelegramおよびKeybaseで@lorenzofb、またはメールにてLorenzo Franceschi-Bicchierai氏に安全に連絡することができます。
「ただし、私たちはまだ初期段階にあり、ガードレールを調整していることを考えれば理解できます。Anthropicおよび他のフロンティアモデル開発者が、新世代のサイバーセキュリティ企業とより密接に協力するにつれて、これらは進化していくと確信しています。最初は過剰に制限し、時間とともにガードレールを緩和する方が望ましい」と、AIサイバーセキュリティスタートアップTolmoの技術スタッフであるSuiche氏は述べた。
別の研究者はX上で、「コードレビューを依頼するだけで」Fableの安全フィルターが起動すると不平を漏らした。
Anthropicはコメントの要請に直ちに回答しなかった。
モデルレベルのガードレールに加え、Anthropicはサイバーセキュリティ専門家に対し、Cyber Verification Programに応募することを求めている。承認された申請者は、Claudeをサイバーセキュリティタスクに使用する場合、制限が少なくなる。OpenAIも、Trusted Access for Cyberという同様のプログラムを提供している。
ホワイトハウス、「スーパーインテリジェンス」のAIラベルを廃止
プレイヤーを読み込み中…今週、ホワイトハウスはザッカーバーグ、ベゾス、マスク、そしてAnthropicのダリオ・アモダイなど、主要なテック企業のCEOをほぼ全員一堂に会させて、ドナルド・トランプ大統領が「道徳的に拘束力がある」と表現したAI安全に関する誓約書に署名させた。トランプ氏はまた、AIを「スーパーインテリジェンス」に名称変更する行政命令にも署名した。他方、MetaとOpenAIは、AIへの最大の金融投資が依然として企業部門から流入しているにもかかわらず、AI製品をよりユーザーフレンドリ
Anthropic、Sonnet 5.5を発表:より高速で低コストな作業パートナー
AIモデル間の競争が激化する中、AnthropicはミドルレンジのSonnetの最新バージョンをリリースし、前バージョンと比較して大幅な速度の向上とコスト削減を実現すると約束した。Anthropicは、Sonnet 5.5をソフトウェア開発や文書作成など、日常のワークフローに versatile なツールとして位置づけている。Sonnet 5.5の前身であるSonnet 5は、約3ヶ月前に導入され、その主な利点はコスト効率の高いエージェント型デプロイメントにあった。バージョン5.5の主要な
Anthropicのトランプ政権との最新の対立は、実際には同社に利益をもたらす可能性があることを、販売データが示唆している
Anthropicは驚異的な月を過ごしている。Rampによると、このAI企業は5月に650億ドルの資金調達を行い、9650億ドルの企業価値を達成して月末を迎えたことで、初めてビジネス支出市場シェアにおいてOpenAIを上回った。その後まもなく、Anthropicは初の黒字四半期を背景に、非公開のIPO申請書類を提出したと報じられている。金曜日、トランプ政権は、最新のモデルである制限付きのMythos 5および最近公開されたFable 5へのアクセスを、自社従業員を含む米国以外のユーザーからブ





家






