オプション
家
ニュース
GPT-5.5が効率性で首位、DeepSeek V4 Proがコストパフォーマンス部門で首位を獲得;実環境におけるLLMセキュリティレポートが公開

GPT-5.5が効率性で首位、DeepSeek V4 Proがコストパフォーマンス部門で首位を獲得;実環境におけるLLMセキュリティレポートが公開

2026年6月22日
100

大規模言語モデル(LLM)の知能は、実際にはどこまで及ぶのだろうか。サイバーセキュリティの分野は、LLMの真の推論能力や複雑な論理が試される、まるで剣闘士の闘技場のような場となっている。セキュリティ研究者のカスラ・ラヘルディ氏は最近、業界全体の注目を集めたテストレポートを発表した。 彼は、意図的に中核的な脆弱性を仕込んだ電子書籍レビュー用APKを作成し、主要なLLMに対して現実世界のハッカー攻撃をシミュレートすることで、各モデルのセキュリティ推論能力や脆弱性悪用能力の実態を明らかにした。

この2時間にわたり、予算10ドルで実施されたサイバー戦争テストにおいて、研究者はGoogleのモバイルバックエンドサービス「Firebase」の認証情報を、アプリケーションパッケージ(APK)内に意図的に露出させた。 各モデルは、プロのホワイトハットハッカーのように振る舞わなければなりませんでした。まずアプリを解凍し、認証情報を素早く見つけ出し、すでに強化されたAPIを迂回して、基盤となるデータベースへの不正アクセスを獲得するのです。テスト全体の費用は1,500ドルで、複数のトップクラスモデルの結果は極端な二極化を示しました。

image.png

突破率に関しては、未公開のGPT-5.5が圧倒的なセキュリティ推論能力を発揮した。10回の独立したテストのうち、7回のエクスプロイトに成功し、70%の成功率を記録してランキングのトップに立った。 評価によると、APKを解凍した後、GPT-5.5は複雑なUIや標準APIに惑わされることなく、Firebaseを重要な突破点として即座に特定した。しかし、この卓越したパフォーマンスには高い代償が伴った。成功したエクスプロイト1件あたりの平均コストは9.46ドルで、予算上限に迫る水準だった。

一方、独自開発のDeepSeek V4Proは、その驚異的なコスト効率でオープンソースコミュニティを驚かせた。10回のテストのうち成功したのは3回のみだったが、成功1回あたりの平均トークンコストはわずか0.62ドルで、GPT-5.5の15分の1に過ぎなかった。 失敗したラウンドにおいても、DeepSeek V4ProはFirebaseの中核部分に5回アクセスすることに成功したが、バックエンドインターフェースの設定に認証情報を使用する際に時折エラーが発生した。研究者は、サイバーセキュリティ自動化監査において大規模かつ高頻度のバッチ処理を行うエンジニアリングチームにとって、DeepSeekの驚くべきコスト面での優位性は大きな実用価値を持つと強調した。

一部のモデルは印象的な結果を残した一方で、保守的すぎたために期待外れに終わったモデルもあった。中位層では、Claude Sonnet4.6とClaude Opus4.8がそれぞれ2回の成功を収めた。Opusはその能力にもかかわらず、正しい答えに何度も近づきながらも、過度に厳格なセキュリティ障壁のために頻繁にセッションが切断されてしまった。 一方、GoogleのGemini3.1Pro Previewは正反対の極端な挙動を示した。開始直後からセキュリティフィルターをトリガーし、毎回処理を拒否した。そのトークン使用量の中央値はわずか約9,000で、他のモデルが消費する数万という数値をはるかに下回り、結果は空白となった。

このセキュリティ対決は、大規模モデルの究極の推論能力を試すだけにとどまらず、自動化されたサイバーセキュリティ監査の未来をも示唆している。大規模モデルが垂直分野においてインテリジェントな再構築を進めるにつれ、将来のセキュリティ防御や脆弱性発見は、計算能力とモデル戦略を競い合うデジタルAI軍団同士の衝突へと変貌するかもしれない。

関連記事
GPT 5.5がAIセキュリティ競争でリード、DeepSeekはコスト効率で首位 GPT 5.5がAIセキュリティ競争でリード、DeepSeekはコスト効率で首位 カスラ・ラージェルディ氏というセキュリティ研究者は、主要な大規模言語モデルのセキュリティ推論に関する実用的なテストを詳述した重要なレポートを最近公開しました。彼は、意図的に脆弱な書籍レビューアプリケーションを構築することでこれを実現しました。このシナリオは現実世界の脆弱性を模倣するもので、ラージェルディ氏はアプリケーションファイル内にGoogleモバイルバックエンドサービスの認証情報を埋め込みました。モデルには、これらの認証情報を解凍して特定し、データベースに直接アクセスするよう命じられました。
マスク氏、「SpaceXのAIは半年以内にAnthropicを追い抜く可能性がある」と発言 マスク氏、「SpaceXのAIは半年以内にAnthropicを追い抜く可能性がある」と発言 SpaceXAIのCEO、イーロン・マスク氏は、コンピューティングハードウェアを活用して競合他社との差を縮め、6か月以内にAI分野で主導権を握ると予測している。SpaceXAIのCEOであるイーロン・マスク氏は先日、X上で、同社が約6ヶ月以内に最先端のAI分野をリードすることを目指していると述べた。マスク氏は慎重な楽観論を示し、SpaceXAIが2~3ヶ月以内にAnthropicの「Fable」や
WeRide、物理AI大規模モデル「WITT」を発表 WeRide、物理AI大規模モデル「WITT」を発表 自動運転技術は目覚ましいスピードで進歩しています。7月17日、自動運転分野をリードする企業であるWeRideは、独自開発の物理AI認知基盤モデル「WeRide WITT」を発表しました。この発表は、AIが複雑で現実世界のデータを理解・処理する能力において、重要なマイルストーンとなります。WeRide WITTの中核をなすのは、「最小物理的事実単位(minimum physical fact uni
関連特集おすすめ
SEO Google、AI オーバービュー、およびアンサーエンジン可視性のための AI ランク追跡ツール
Google、AI オーバービュー、およびアンサーエンジン可視性のための AI ランク追跡ツール

2026年の最新・最高評価のAIランキング追跡ツールがXIX.AIで登場。Google、AIオーバービュー、アンサーエンジンでの可視性を最適化するための厳選リストです。このリストには、実世界での厳格なテストを経て正確なランキングデータを提供する強力なツールが掲載されています。無料版と有料版の比較を確認し、上位パフォーマンスを発揮するツールをチェックして、検索エンジン全体でコンテンツの可視性を高めるために必須のオプションを発見しましょう。今すぐ探索して、あなたのニーズに最適なツールを見つけてください。

10 ツール
xix.ai
生産性 ノートとタスクのための最高のAIセカンドブレインオーガナイザー
ノートとタスクのための最高のAIセカンドブレインオーガナイザー

2026年最新版・最高評価のAIセカンドブレイン整理ツールのトップランキング!XIX.AIは、週替わりの更新ランキング、無料版と有料版の比較、実際のテスト結果を掲載した、革新的な強力なコレクションを厳選しました。これにより、生産性を劇的に向上させる完璧なツールを見つけるお手伝いをします。今すぐ探索して、あなたのAIによる優位性を解き放ちましょう!

11 ツール
xix.ai
プロンプト ChatGPTおよびClaudeワークフロー用のAIプロンプトテストプラットフォーム
ChatGPTおよびClaudeワークフロー用のAIプロンプトテストプラットフォーム

2026年最新版 最高評価のAIプロンプトテストプラットフォーム!ChatGPTおよびClaudeワークフロー向け!XIX.AIは、週次更新のランキング、無料と有料の比較、実世界でのテスト、詳細な機能分析を特徴とする強力なゲームチェンジャーコレクションを厳選し、生産性を向上し完璧な出力を提供する必須ツールを特定するお手伝いをします。今すぐ探索して、あなたの完璧なソリューションを見つけ、AIの優位性を解き放ってください。(249文字)

9 ツール
xix.ai
マーケティング SaaSのA/Bテスト、価格ページ、デモのコンバージョン向上のためのAIランディングページ作成ツール
SaaSのA/Bテスト、価格ページ、デモのコンバージョン向上のためのAIランディングページ作成ツール

2026年最新のSaaS向けAIランディングページコピー作成ツール(A/Bテスト、価格ページ、デモコンバージョン向け)がXIX.AIに登場しました。厳選された高評価ツールのリストは、コンテンツの品質向上、執筆効率の改善、そして全体的な生産性向上を実現する、画期的なソリューションを提供します。 私たちは実環境でのテストを実施し、無料版と有料版の比較情報に加え、毎週更新されるランキングを提供しています。ぜひ試してみたいツールが、コンテンツ作成のボトルネックを打破する手助けとなります。今すぐチェックして、あなたにぴったりのツールを見つけ、AIの力を最大限に活用しましょう!

8 ツール
xix.ai
ファイナンス 現金フロー計画と費用管理のためのExcel AI予算予測ツール
現金フロー計画と費用管理のためのExcel AI予算予測ツール

2026年最新のExcel用AIツールのベストコレクションが、XIX.AIの高評価キュレーションリストに掲載されています。これらの強力なゲームチェンジャーソリューションは、実際のテストと厳格なランキングを通じて、生産性を大幅に向上させるのを支援します。無料版と有料版の比較を確認し、あなたのニーズに最適なツールを見つけてください。今すぐ探索して、財務管理におけるAIの優位性を解き放ちましょう。

9 ツール
xix.ai
プロンプト チーム向けのAIプロンプト管理ツール
チーム向けのAIプロンプト管理ツール

2026年最新版のチーム向けベスト・トップ評価AIプロンプト管理ツールは、XIX.AIによって厳選されています。この週刊更新ガイドは、実際のテストと詳細なランキングを通じてチームの生産性を大幅に向上させる強力な革新的ソリューションを特集しています。無料版と有料版の比較を無料で入手し、最適なツールを選べるようサポートします。今すぐ探索して、AIによる優位性を解き放ちましょう。

9 ツール
xix.ai
コメント (1)
0/500
GregoryJones
GregoryJones 2026年10月5日 23:00:10 JST

GPT-5.5のパフォーマンスとDeepSeekのコスパ競争、そして実際のセキュリティレポート。LLMの推論能力が本当にどの程度か試される場ですね。サイバーセキュリティの格闘技場のような状況、興味深いです。

OR