Дом
GPT 5.5 лидирует в гонке за безопасность ИИ, DeepSeek превосходит по эффективности затрат
Касра Раджерди, исследователь безопасности, недавно опубликовал значимый отчет, в котором подробно описываются практические тесты на способность к логическому рассуждению в вопросах безопасности крупных языковых моделей. Он достиг этого, создав намеренно уязвимое приложение для написания отзывов о книгах. В этом сценарии, имитирующем реальные уязвимости, Раджерди внедрил учетные данные сервиса мобильных бэкендов Google непосредственно в файл приложения. Моделям было поручено распаковать и идентифицировать эти учетные данные, чтобы получить прямой доступ к базе данных.

Сравнение ведущих моделей
Работая в строгих рамках двухчасового лимита времени и бюджета в 10 долларов, модели продемонстрировали разный уровень производительности. GPT-5.5 показал себя как самый сильный участник, успешно выполнив 7 из 10 попыток и лидируя по проценту успеха. В отчете отмечается, что GPT-5.5 мог быстро находить ключевые учетные данные после распаковки, игнорируя отвлекающие факторы со стороны сложных или стандартных интерфейсов приложений.
Напротив, результаты работы Gemini оказались разочаровывающими. Gemini 3.1 Pro Preview почти сразу при начале каждой задачи активировала свои встроенные фильтры безопасности, что привело к значительно меньшему потреблению токенов по сравнению с другими протестированными моделями.
Оценка рентабельности
Несмотря на высокий процент успеха GPT-5.5, его средняя стоимость успешного запуска достигла 9,46 доллара США, что отпугивает команды, которым необходимо выполнять инструменты массово. Напротив, DeepSeek V4 Pro выделился превосходной экономической эффективностью. Хотя он преуспел лишь в 3 из 10 тестов, его средняя стоимость успешного запуска составила всего 0,62 доллара США.
Это указывает на то, что при расчете стоимости одного успешного запуска DeepSeek V4 Pro примерно в пятнадцать раз дешевле, чем GPT-5.5. Хотя он иногда ошибочно использовал интерфейс аутентификации бэкенда во время неудачных попыток, это существенное преимущество в стоимости предоставляет значительную практическую ценность для команд, развертывающих крупномасштабное тестирование безопасности.
Связанная статья
ИИ SpaceX может обогнать Anthropic уже через полгода, заявляет Маск
Генеральный директор SpaceXAI Илон Маск прогнозирует, что его компания займет лидирующие позиции в сфере ИИ в течение шести месяцев, используя вычислительное оборудование для сокращения отставания от
WeRide представляет WITT — физическую крупномасштабную модель искусственного интеллекта
Технологии автономного вождения развиваются с поразительной скоростью. 17 июля WeRide, ведущая компания в области автономного вождения, представила свою собственную когнитивную базовую модель искусств
GitHub Copilot интегрирует GPT-5.4 за несколько часов
GitHub Copilot вновь продемонстрировал свою способность быстро реагировать. Спустя несколько часов после запуска OpenAI своей новейшей флагманской модели GPT-5.4 GitHub объявил о полной интеграции, предоставив разработчикам по всему миру интеллектуал
Рекомендации по связанным специальным темам
Комментарии (0)
Касра Раджерди, исследователь безопасности, недавно опубликовал значимый отчет, в котором подробно описываются практические тесты на способность к логическому рассуждению в вопросах безопасности крупных языковых моделей. Он достиг этого, создав намеренно уязвимое приложение для написания отзывов о книгах. В этом сценарии, имитирующем реальные уязвимости, Раджерди внедрил учетные данные сервиса мобильных бэкендов Google непосредственно в файл приложения. Моделям было поручено распаковать и идентифицировать эти учетные данные, чтобы получить прямой доступ к базе данных.

Сравнение ведущих моделей
Работая в строгих рамках двухчасового лимита времени и бюджета в 10 долларов, модели продемонстрировали разный уровень производительности. GPT-5.5 показал себя как самый сильный участник, успешно выполнив 7 из 10 попыток и лидируя по проценту успеха. В отчете отмечается, что GPT-5.5 мог быстро находить ключевые учетные данные после распаковки, игнорируя отвлекающие факторы со стороны сложных или стандартных интерфейсов приложений.
Напротив, результаты работы Gemini оказались разочаровывающими. Gemini 3.1 Pro Preview почти сразу при начале каждой задачи активировала свои встроенные фильтры безопасности, что привело к значительно меньшему потреблению токенов по сравнению с другими протестированными моделями.
Оценка рентабельности
Несмотря на высокий процент успеха GPT-5.5, его средняя стоимость успешного запуска достигла 9,46 доллара США, что отпугивает команды, которым необходимо выполнять инструменты массово. Напротив, DeepSeek V4 Pro выделился превосходной экономической эффективностью. Хотя он преуспел лишь в 3 из 10 тестов, его средняя стоимость успешного запуска составила всего 0,62 доллара США.
Это указывает на то, что при расчете стоимости одного успешного запуска DeepSeek V4 Pro примерно в пятнадцать раз дешевле, чем GPT-5.5. Хотя он иногда ошибочно использовал интерфейс аутентификации бэкенда во время неудачных попыток, это существенное преимущество в стоимости предоставляет значительную практическую ценность для команд, развертывающих крупномасштабное тестирование безопасности.
ИИ SpaceX может обогнать Anthropic уже через полгода, заявляет Маск
Генеральный директор SpaceXAI Илон Маск прогнозирует, что его компания займет лидирующие позиции в сфере ИИ в течение шести месяцев, используя вычислительное оборудование для сокращения отставания от
WeRide представляет WITT — физическую крупномасштабную модель искусственного интеллекта
Технологии автономного вождения развиваются с поразительной скоростью. 17 июля WeRide, ведущая компания в области автономного вождения, представила свою собственную когнитивную базовую модель искусств
GitHub Copilot интегрирует GPT-5.4 за несколько часов
GitHub Copilot вновь продемонстрировал свою способность быстро реагировать. Спустя несколько часов после запуска OpenAI своей новейшей флагманской модели GPT-5.4 GitHub объявил о полной интеграции, предоставив разработчикам по всему миру интеллектуал











