Дом
GPT-5.5 лидирует по эффективности, DeepSeek V4 Pro признан лучшим по соотношению «цена-качество»; опубликован отчет о безопасности больших языковых моделей в реальных условиях
Насколько далеко на самом деле простираются интеллектуальные возможности крупных языковых моделей (LLM)? Кибербезопасность превратилась в арену гладиаторских боев, где на пробу подвергаются их истинные способности к рассуждению и сложной логике. Исследователь в области безопасности Касра Рахерди недавно опубликовал отчет о тестировании, который привлек внимание всей отрасли. Он смоделировал реальную хакерскую атаку на ведущие LLM, создав APK-файл с обзором электронной книги, в который были намеренно внедрены серьезные уязвимости, что позволило выявить реальные способности каждой модели в области анализа безопасности и использования уязвимостей.
В ходе этого двухчасового теста по кибервойне с бюджетом в 10 долларов исследователь намеренно оставил учетные данные мобильного бэкенд-сервиса Google Firebase открытыми внутри пакета приложения (APK). Каждая модель должна была вести себя как профессиональный «белый» хакер: сначала распаковать приложение, быстро обнаружить учетные данные, а затем обойти уже укрепленный API, чтобы получить несанкционированный доступ к базовой базе данных. Общая стоимость теста составила 1 500 долларов, а результаты нескольких моделей высшего уровня продемонстрировали крайнюю поляризацию.

Что касается показателя успешности взлома, то еще не выпущенная модель GPT-5.5 продемонстрировала доминирующие способности в области анализа безопасности. В ходе десяти независимых тестов ей удалось осуществить семь атак, достигнув показателя успешности в 70% и возглавив рейтинг. Согласно оценке, после распаковки APK-файла GPT-5.5 сразу распознал Firebase как критическую точку прорыва, не отвлекаясь на сложный пользовательский интерфейс или стандартные API. Однако за эту выдающуюся производительность пришлось заплатить высокую цену: в среднем 9,46 доллара за каждый успешный эксплойт, что почти достигло предельного бюджета.
С другой стороны, разработанная собственными силами система DeepSeek V4Pro поразила сообщество открытого исходного кода своей невероятной экономичностью. Хотя ей удалось пройти только три из десяти тестов, средняя стоимость токена на одну успешную попытку составила всего 0,62 доллара — это одна пятнадцатая от показателя GPT-5.5. В неудачных раундах DeepSeek V4Pro всё же пять раз смог получить доступ к ядру Firebase, но время от времени допускал ошибки при использовании учетных данных для настройки интерфейса бэкэнда. Исследователь подчеркнул, что для инженерных команд, выполняющих крупномасштабные и высокочастотные пакетные операции в рамках аудитов автоматизации кибербезопасности, поразительное преимущество DeepSeek в плане затрат имеет значительную практическую ценность.
В то время как одни модели впечатляли, другие не оправдали ожиданий из-за чрезмерной осторожности. В среднем сегменте модели Claude Sonnet4.6 и Claude Opus4.8 добились по два успеха. Несмотря на свою мощь, Opus часто прерывал сеансы из-за чрезмерно строгих барьеров безопасности, хотя и неоднократно приближался к правильному ответу. Между тем Gemini3.1Pro Preview от Google пошла по противоположному краю: она с самого начала запускала фильтры безопасности и каждый раз отказывалась продолжать работу. Её медианное использование токенов составило всего около 9 000 — что намного ниже десятков тысяч, потребляемых другими моделями — и она выдала пустой результат.
Это противостояние в сфере безопасности стало не только проверкой предельных способностей крупных моделей к логическому мышлению, но и указало на будущее автоматизированного аудита кибербезопасности. По мере того как крупные модели подвергаются интеллектуальной реструктуризации в вертикальных областях, будущие меры защиты и обнаружение уязвимостей могут превратиться в столкновение цифровых армий ИИ, соревнующихся в вычислительной мощности и стратегии моделей.
Связанная статья
GPT 5.5 лидирует в гонке за безопасность ИИ, DeepSeek превосходит по эффективности затрат
Касра Раджерди, исследователь безопасности, недавно опубликовал значимый отчет, в котором подробно описываются практические тесты на способность к логическому рассуждению в вопросах безопасности крупных языковых моделей. Он достиг этого, создав намер
ИИ SpaceX может обогнать Anthropic уже через полгода, заявляет Маск
Генеральный директор SpaceXAI Илон Маск прогнозирует, что его компания займет лидирующие позиции в сфере ИИ в течение шести месяцев, используя вычислительное оборудование для сокращения отставания от
WeRide представляет WITT — физическую крупномасштабную модель искусственного интеллекта
Технологии автономного вождения развиваются с поразительной скоростью. 17 июля WeRide, ведущая компания в области автономного вождения, представила свою собственную когнитивную базовую модель искусств
Рекомендации по связанным специальным темам
Комментарии (1)
Насколько далеко на самом деле простираются интеллектуальные возможности крупных языковых моделей (LLM)? Кибербезопасность превратилась в арену гладиаторских боев, где на пробу подвергаются их истинные способности к рассуждению и сложной логике. Исследователь в области безопасности Касра Рахерди недавно опубликовал отчет о тестировании, который привлек внимание всей отрасли. Он смоделировал реальную хакерскую атаку на ведущие LLM, создав APK-файл с обзором электронной книги, в который были намеренно внедрены серьезные уязвимости, что позволило выявить реальные способности каждой модели в области анализа безопасности и использования уязвимостей.
В ходе этого двухчасового теста по кибервойне с бюджетом в 10 долларов исследователь намеренно оставил учетные данные мобильного бэкенд-сервиса Google Firebase открытыми внутри пакета приложения (APK). Каждая модель должна была вести себя как профессиональный «белый» хакер: сначала распаковать приложение, быстро обнаружить учетные данные, а затем обойти уже укрепленный API, чтобы получить несанкционированный доступ к базовой базе данных. Общая стоимость теста составила 1 500 долларов, а результаты нескольких моделей высшего уровня продемонстрировали крайнюю поляризацию.

Что касается показателя успешности взлома, то еще не выпущенная модель GPT-5.5 продемонстрировала доминирующие способности в области анализа безопасности. В ходе десяти независимых тестов ей удалось осуществить семь атак, достигнув показателя успешности в 70% и возглавив рейтинг. Согласно оценке, после распаковки APK-файла GPT-5.5 сразу распознал Firebase как критическую точку прорыва, не отвлекаясь на сложный пользовательский интерфейс или стандартные API. Однако за эту выдающуюся производительность пришлось заплатить высокую цену: в среднем 9,46 доллара за каждый успешный эксплойт, что почти достигло предельного бюджета.
С другой стороны, разработанная собственными силами система DeepSeek V4Pro поразила сообщество открытого исходного кода своей невероятной экономичностью. Хотя ей удалось пройти только три из десяти тестов, средняя стоимость токена на одну успешную попытку составила всего 0,62 доллара — это одна пятнадцатая от показателя GPT-5.5. В неудачных раундах DeepSeek V4Pro всё же пять раз смог получить доступ к ядру Firebase, но время от времени допускал ошибки при использовании учетных данных для настройки интерфейса бэкэнда. Исследователь подчеркнул, что для инженерных команд, выполняющих крупномасштабные и высокочастотные пакетные операции в рамках аудитов автоматизации кибербезопасности, поразительное преимущество DeepSeek в плане затрат имеет значительную практическую ценность.
В то время как одни модели впечатляли, другие не оправдали ожиданий из-за чрезмерной осторожности. В среднем сегменте модели Claude Sonnet4.6 и Claude Opus4.8 добились по два успеха. Несмотря на свою мощь, Opus часто прерывал сеансы из-за чрезмерно строгих барьеров безопасности, хотя и неоднократно приближался к правильному ответу. Между тем Gemini3.1Pro Preview от Google пошла по противоположному краю: она с самого начала запускала фильтры безопасности и каждый раз отказывалась продолжать работу. Её медианное использование токенов составило всего около 9 000 — что намного ниже десятков тысяч, потребляемых другими моделями — и она выдала пустой результат.
Это противостояние в сфере безопасности стало не только проверкой предельных способностей крупных моделей к логическому мышлению, но и указало на будущее автоматизированного аудита кибербезопасности. По мере того как крупные модели подвергаются интеллектуальной реструктуризации в вертикальных областях, будущие меры защиты и обнаружение уязвимостей могут превратиться в столкновение цифровых армий ИИ, соревнующихся в вычислительной мощности и стратегии моделей.
GPT 5.5 лидирует в гонке за безопасность ИИ, DeepSeek превосходит по эффективности затрат
Касра Раджерди, исследователь безопасности, недавно опубликовал значимый отчет, в котором подробно описываются практические тесты на способность к логическому рассуждению в вопросах безопасности крупных языковых моделей. Он достиг этого, создав намер
ИИ SpaceX может обогнать Anthropic уже через полгода, заявляет Маск
Генеральный директор SpaceXAI Илон Маск прогнозирует, что его компания займет лидирующие позиции в сфере ИИ в течение шести месяцев, используя вычислительное оборудование для сокращения отставания от
WeRide представляет WITT — физическую крупномасштабную модель искусственного интеллекта
Технологии автономного вождения развиваются с поразительной скоростью. 17 июля WeRide, ведущая компания в области автономного вождения, представила свою собственную когнитивную базовую модель искусств











