GPT-5.5が効率性で首位、DeepSeek V4 Proがコストパフォーマンス部門で首位を獲得;実環境におけるLLMセキュリティレポートが公開
大規模言語モデル(LLM)の知能は、実際にはどこまで及ぶのだろうか。サイバーセキュリティの分野は、LLMの真の推論能力や複雑な論理が試される、まるで剣闘士の闘技場のような場となっている。セキュリティ研究者のカスラ・ラヘルディ氏は最近、業界全体の注目を集めたテストレポートを発表した。 彼は、意図的に中核的な脆弱性を仕込んだ電子書籍レビュー用APKを作成し、主要なLLMに対して現実世界のハッカー攻撃をシミュレートすることで、各モデルのセキュリティ推論能力や脆弱性悪用能力の実態を明らかにした。
この2時間にわたり、予算10ドルで実施されたサイバー戦争テストにおいて、研究者はGoogleのモバイルバックエンドサービス「Firebase」の認証情報を、アプリケーションパッケージ(APK)内に意図的に露出させた。 各モデルは、プロのホワイトハットハッカーのように振る舞わなければなりませんでした。まずアプリを解凍し、認証情報を素早く見つけ出し、すでに強化されたAPIを迂回して、基盤となるデータベースへの不正アクセスを獲得するのです。テスト全体の費用は1,500ドルで、複数のトップクラスモデルの結果は極端な二極化を示しました。

突破率に関しては、未公開のGPT-5.5が圧倒的なセキュリティ推論能力を発揮した。10回の独立したテストのうち、7回のエクスプロイトに成功し、70%の成功率を記録してランキングのトップに立った。 評価によると、APKを解凍した後、GPT-5.5は複雑なUIや標準APIに惑わされることなく、Firebaseを重要な突破点として即座に特定した。しかし、この卓越したパフォーマンスには高い代償が伴った。成功したエクスプロイト1件あたりの平均コストは9.46ドルで、予算上限に迫る水準だった。
一方、独自開発のDeepSeek V4Proは、その驚異的なコスト効率でオープンソースコミュニティを驚かせた。10回のテストのうち成功したのは3回のみだったが、成功1回あたりの平均トークンコストはわずか0.62ドルで、GPT-5.5の15分の1に過ぎなかった。 失敗したラウンドにおいても、DeepSeek V4ProはFirebaseの中核部分に5回アクセスすることに成功したが、バックエンドインターフェースの設定に認証情報を使用する際に時折エラーが発生した。研究者は、サイバーセキュリティ自動化監査において大規模かつ高頻度のバッチ処理を行うエンジニアリングチームにとって、DeepSeekの驚くべきコスト面での優位性は大きな実用価値を持つと強調した。
一部のモデルは印象的な結果を残した一方で、保守的すぎたために期待外れに終わったモデルもあった。中位層では、Claude Sonnet4.6とClaude Opus4.8がそれぞれ2回の成功を収めた。Opusはその能力にもかかわらず、正しい答えに何度も近づきながらも、過度に厳格なセキュリティ障壁のために頻繁にセッションが切断されてしまった。 一方、GoogleのGemini3.1Pro Previewは正反対の極端な挙動を示した。開始直後からセキュリティフィルターをトリガーし、毎回処理を拒否した。そのトークン使用量の中央値はわずか約9,000で、他のモデルが消費する数万という数値をはるかに下回り、結果は空白となった。
このセキュリティ対決は、大規模モデルの究極の推論能力を試すだけにとどまらず、自動化されたサイバーセキュリティ監査の未来をも示唆している。大規模モデルが垂直分野においてインテリジェントな再構築を進めるにつれ、将来のセキュリティ防御や脆弱性発見は、計算能力とモデル戦略を競い合うデジタルAI軍団同士の衝突へと変貌するかもしれない。
関連記事
GPT 5.5がAIセキュリティ競争でリード、DeepSeekはコスト効率で首位
カスラ・ラージェルディ氏というセキュリティ研究者は、主要な大規模言語モデルのセキュリティ推論に関する実用的なテストを詳述した重要なレポートを最近公開しました。彼は、意図的に脆弱な書籍レビューアプリケーションを構築することでこれを実現しました。このシナリオは現実世界の脆弱性を模倣するもので、ラージェルディ氏はアプリケーションファイル内にGoogleモバイルバックエンドサービスの認証情報を埋め込みました。モデルには、これらの認証情報を解凍して特定し、データベースに直接アクセスするよう命じられました。
マスク氏、「SpaceXのAIは半年以内にAnthropicを追い抜く可能性がある」と発言
SpaceXAIのCEO、イーロン・マスク氏は、コンピューティングハードウェアを活用して競合他社との差を縮め、6か月以内にAI分野で主導権を握ると予測している。SpaceXAIのCEOであるイーロン・マスク氏は先日、X上で、同社が約6ヶ月以内に最先端のAI分野をリードすることを目指していると述べた。マスク氏は慎重な楽観論を示し、SpaceXAIが2~3ヶ月以内にAnthropicの「Fable」や
WeRide、物理AI大規模モデル「WITT」を発表
自動運転技術は目覚ましいスピードで進歩しています。7月17日、自動運転分野をリードする企業であるWeRideは、独自開発の物理AI認知基盤モデル「WeRide WITT」を発表しました。この発表は、AIが複雑で現実世界のデータを理解・処理する能力において、重要なマイルストーンとなります。WeRide WITTの中核をなすのは、「最小物理的事実単位(minimum physical fact uni
関連特集おすすめ
コメント (1)
0/500
大規模言語モデル(LLM)の知能は、実際にはどこまで及ぶのだろうか。サイバーセキュリティの分野は、LLMの真の推論能力や複雑な論理が試される、まるで剣闘士の闘技場のような場となっている。セキュリティ研究者のカスラ・ラヘルディ氏は最近、業界全体の注目を集めたテストレポートを発表した。 彼は、意図的に中核的な脆弱性を仕込んだ電子書籍レビュー用APKを作成し、主要なLLMに対して現実世界のハッカー攻撃をシミュレートすることで、各モデルのセキュリティ推論能力や脆弱性悪用能力の実態を明らかにした。
この2時間にわたり、予算10ドルで実施されたサイバー戦争テストにおいて、研究者はGoogleのモバイルバックエンドサービス「Firebase」の認証情報を、アプリケーションパッケージ(APK)内に意図的に露出させた。 各モデルは、プロのホワイトハットハッカーのように振る舞わなければなりませんでした。まずアプリを解凍し、認証情報を素早く見つけ出し、すでに強化されたAPIを迂回して、基盤となるデータベースへの不正アクセスを獲得するのです。テスト全体の費用は1,500ドルで、複数のトップクラスモデルの結果は極端な二極化を示しました。

突破率に関しては、未公開のGPT-5.5が圧倒的なセキュリティ推論能力を発揮した。10回の独立したテストのうち、7回のエクスプロイトに成功し、70%の成功率を記録してランキングのトップに立った。 評価によると、APKを解凍した後、GPT-5.5は複雑なUIや標準APIに惑わされることなく、Firebaseを重要な突破点として即座に特定した。しかし、この卓越したパフォーマンスには高い代償が伴った。成功したエクスプロイト1件あたりの平均コストは9.46ドルで、予算上限に迫る水準だった。
一方、独自開発のDeepSeek V4Proは、その驚異的なコスト効率でオープンソースコミュニティを驚かせた。10回のテストのうち成功したのは3回のみだったが、成功1回あたりの平均トークンコストはわずか0.62ドルで、GPT-5.5の15分の1に過ぎなかった。 失敗したラウンドにおいても、DeepSeek V4ProはFirebaseの中核部分に5回アクセスすることに成功したが、バックエンドインターフェースの設定に認証情報を使用する際に時折エラーが発生した。研究者は、サイバーセキュリティ自動化監査において大規模かつ高頻度のバッチ処理を行うエンジニアリングチームにとって、DeepSeekの驚くべきコスト面での優位性は大きな実用価値を持つと強調した。
一部のモデルは印象的な結果を残した一方で、保守的すぎたために期待外れに終わったモデルもあった。中位層では、Claude Sonnet4.6とClaude Opus4.8がそれぞれ2回の成功を収めた。Opusはその能力にもかかわらず、正しい答えに何度も近づきながらも、過度に厳格なセキュリティ障壁のために頻繁にセッションが切断されてしまった。 一方、GoogleのGemini3.1Pro Previewは正反対の極端な挙動を示した。開始直後からセキュリティフィルターをトリガーし、毎回処理を拒否した。そのトークン使用量の中央値はわずか約9,000で、他のモデルが消費する数万という数値をはるかに下回り、結果は空白となった。
このセキュリティ対決は、大規模モデルの究極の推論能力を試すだけにとどまらず、自動化されたサイバーセキュリティ監査の未来をも示唆している。大規模モデルが垂直分野においてインテリジェントな再構築を進めるにつれ、将来のセキュリティ防御や脆弱性発見は、計算能力とモデル戦略を競い合うデジタルAI軍団同士の衝突へと変貌するかもしれない。
GPT 5.5がAIセキュリティ競争でリード、DeepSeekはコスト効率で首位
カスラ・ラージェルディ氏というセキュリティ研究者は、主要な大規模言語モデルのセキュリティ推論に関する実用的なテストを詳述した重要なレポートを最近公開しました。彼は、意図的に脆弱な書籍レビューアプリケーションを構築することでこれを実現しました。このシナリオは現実世界の脆弱性を模倣するもので、ラージェルディ氏はアプリケーションファイル内にGoogleモバイルバックエンドサービスの認証情報を埋め込みました。モデルには、これらの認証情報を解凍して特定し、データベースに直接アクセスするよう命じられました。
マスク氏、「SpaceXのAIは半年以内にAnthropicを追い抜く可能性がある」と発言
SpaceXAIのCEO、イーロン・マスク氏は、コンピューティングハードウェアを活用して競合他社との差を縮め、6か月以内にAI分野で主導権を握ると予測している。SpaceXAIのCEOであるイーロン・マスク氏は先日、X上で、同社が約6ヶ月以内に最先端のAI分野をリードすることを目指していると述べた。マスク氏は慎重な楽観論を示し、SpaceXAIが2~3ヶ月以内にAnthropicの「Fable」や
WeRide、物理AI大規模モデル「WITT」を発表
自動運転技術は目覚ましいスピードで進歩しています。7月17日、自動運転分野をリードする企業であるWeRideは、独自開発の物理AI認知基盤モデル「WeRide WITT」を発表しました。この発表は、AIが複雑で現実世界のデータを理解・処理する能力において、重要なマイルストーンとなります。WeRide WITTの中核をなすのは、「最小物理的事実単位(minimum physical fact uni





家






