2時間にわたり、1,500ドルの費用をかけて行われたこのサイバーセキュリティテストでは、主要な大規模言語モデルが、Firebaseの認証情報が漏洩しているハッキングされたAndroidアプリと対決しました。まだ公開されていないGPT-5.5は70%の成功率でしたが、1回の試行に9.46ドルの費用がかかりました。一方、オープンソースのDeepSeek V4Proは1回あたりわずか0.62ドルで30%の成功率を収め、自動化されたセキュリティ監査において非常にコスト効率が高いことが証明されました。Google Geminiはすべてのタスクを拒否しましたが、Claudeモデルは過度に厳格なセキュリティ対策のため2回だけ成功しました。





家
