вариант
Дом
Новости
GPT-5.5 лидирует по эффективности, DeepSeek V4 Pro признан лучшим по соотношению «цена-качество»; опубликован отчет о безопасности больших языковых моделей в реальных условиях

GPT-5.5 лидирует по эффективности, DeepSeek V4 Pro признан лучшим по соотношению «цена-качество»; опубликован отчет о безопасности больших языковых моделей в реальных условиях

22 июня 2026 г.
100

Насколько далеко на самом деле простираются интеллектуальные возможности крупных языковых моделей (LLM)? Кибербезопасность превратилась в арену гладиаторских боев, где на пробу подвергаются их истинные способности к рассуждению и сложной логике. Исследователь в области безопасности Касра Рахерди недавно опубликовал отчет о тестировании, который привлек внимание всей отрасли. Он смоделировал реальную хакерскую атаку на ведущие LLM, создав APK-файл с обзором электронной книги, в который были намеренно внедрены серьезные уязвимости, что позволило выявить реальные способности каждой модели в области анализа безопасности и использования уязвимостей.

В ходе этого двухчасового теста по кибервойне с бюджетом в 10 долларов исследователь намеренно оставил учетные данные мобильного бэкенд-сервиса Google Firebase открытыми внутри пакета приложения (APK). Каждая модель должна была вести себя как профессиональный «белый» хакер: сначала распаковать приложение, быстро обнаружить учетные данные, а затем обойти уже укрепленный API, чтобы получить несанкционированный доступ к базовой базе данных. Общая стоимость теста составила 1 500 долларов, а результаты нескольких моделей высшего уровня продемонстрировали крайнюю поляризацию.

image.png

Что касается показателя успешности взлома, то еще не выпущенная модель GPT-5.5 продемонстрировала доминирующие способности в области анализа безопасности. В ходе десяти независимых тестов ей удалось осуществить семь атак, достигнув показателя успешности в 70% и возглавив рейтинг. Согласно оценке, после распаковки APK-файла GPT-5.5 сразу распознал Firebase как критическую точку прорыва, не отвлекаясь на сложный пользовательский интерфейс или стандартные API. Однако за эту выдающуюся производительность пришлось заплатить высокую цену: в среднем 9,46 доллара за каждый успешный эксплойт, что почти достигло предельного бюджета.

С другой стороны, разработанная собственными силами система DeepSeek V4Pro поразила сообщество открытого исходного кода своей невероятной экономичностью. Хотя ей удалось пройти только три из десяти тестов, средняя стоимость токена на одну успешную попытку составила всего 0,62 доллара — это одна пятнадцатая от показателя GPT-5.5. В неудачных раундах DeepSeek V4Pro всё же пять раз смог получить доступ к ядру Firebase, но время от времени допускал ошибки при использовании учетных данных для настройки интерфейса бэкэнда. Исследователь подчеркнул, что для инженерных команд, выполняющих крупномасштабные и высокочастотные пакетные операции в рамках аудитов автоматизации кибербезопасности, поразительное преимущество DeepSeek в плане затрат имеет значительную практическую ценность.

В то время как одни модели впечатляли, другие не оправдали ожиданий из-за чрезмерной осторожности. В среднем сегменте модели Claude Sonnet4.6 и Claude Opus4.8 добились по два успеха. Несмотря на свою мощь, Opus часто прерывал сеансы из-за чрезмерно строгих барьеров безопасности, хотя и неоднократно приближался к правильному ответу. Между тем Gemini3.1Pro Preview от Google пошла по противоположному краю: она с самого начала запускала фильтры безопасности и каждый раз отказывалась продолжать работу. Её медианное использование токенов составило всего около 9 000 — что намного ниже десятков тысяч, потребляемых другими моделями — и она выдала пустой результат.

Это противостояние в сфере безопасности стало не только проверкой предельных способностей крупных моделей к логическому мышлению, но и указало на будущее автоматизированного аудита кибербезопасности. По мере того как крупные модели подвергаются интеллектуальной реструктуризации в вертикальных областях, будущие меры защиты и обнаружение уязвимостей могут превратиться в столкновение цифровых армий ИИ, соревнующихся в вычислительной мощности и стратегии моделей.

Связанная статья
GPT 5.5 лидирует в гонке за безопасность ИИ, DeepSeek превосходит по эффективности затрат GPT 5.5 лидирует в гонке за безопасность ИИ, DeepSeek превосходит по эффективности затрат Касра Раджерди, исследователь безопасности, недавно опубликовал значимый отчет, в котором подробно описываются практические тесты на способность к логическому рассуждению в вопросах безопасности крупных языковых моделей. Он достиг этого, создав намер
ИИ SpaceX может обогнать Anthropic уже через полгода, заявляет Маск ИИ SpaceX может обогнать Anthropic уже через полгода, заявляет Маск Генеральный директор SpaceXAI Илон Маск прогнозирует, что его компания займет лидирующие позиции в сфере ИИ в течение шести месяцев, используя вычислительное оборудование для сокращения отставания от
WeRide представляет WITT — физическую крупномасштабную модель искусственного интеллекта WeRide представляет WITT — физическую крупномасштабную модель искусственного интеллекта Технологии автономного вождения развиваются с поразительной скоростью. 17 июля WeRide, ведущая компания в области автономного вождения, представила свою собственную когнитивную базовую модель искусств
Рекомендации по связанным специальным темам
SEO Инструменты отслеживания позиций ИИ для Google, ИИ-обзоров и видимости в поисковых системах
Инструменты отслеживания позиций ИИ для Google, ИИ-обзоров и видимости в поисковых системах

В 2026 году на XIX.AI представлены новейшие, лучшие и наиболее высоко оцененные инструменты отслеживания позиций ИИ для Google, ИИ-обзоров и видимости в поисковых системах. Этот тщательно отобранный список включает мощные инструменты, меняющие правила игры, которые проходят строгие реальные тесты для предоставления точных данных о позициях. Получите бесплатное сравнение с платными версиями, посмотрите на лучших представителей и откройте для себя обязательные к использованию варианты, чтобы повысить видимость вашего контента в поисковых системах. Исследуйте сейчас, чтобы найти идеальный инструмент для ваших потребностей.

10 инструментов
xix.ai
Производительность Лучшие ИИ-организаторы для заметок и задач
Лучшие ИИ-организаторы для заметок и задач

2026 год: лучшие, топовые и высокооцененные ИИ-организаторы для заметок и задач! XIX.AI подобрал невероятно мощный, меняющий правила игры набор инструментов, включающий еженедельно обновляемые рейтинги, сравнение бесплатных и платных версий, а также реальные тесты, чтобы помочь вам найти идеальный инструмент, значительно повышающий продуктивность. Исследуйте сейчас, чтобы раскрыть своё преимущество с ИИ!

11 инструментов
xix.ai
Быстрый Платформы для тестирования промптов ИИ для рабочих процессов ChatGPT и Claude
Платформы для тестирования промптов ИИ для рабочих процессов ChatGPT и Claude

Платформы для тестирования промптов ИИ 2026 года: лучшие и наиболее рейтинговые решения для рабочих процессов ChatGPT и Claude! XIX.AI предлагает мощную коллекцию, меняющую правила игры, с еженедельно обновляемыми рейтингами, сравнением бесплатных и платных вариантов, реальными тестами и подробным разбором функций, чтобы помочь вам определить инструменты, которые необходимо попробовать для повышения продуктивности и получения безупречных результатов. Изучите их сейчас, чтобы найти идеальное решение и раскрыть свой потенциал в использовании ИИ.

9 инструментов
xix.ai
Маркетинг Инструменты для создания текста посадочных страниц на основе ИИ для A/B-тестов SaaS, страниц с ценами и конверсии демо
Инструменты для создания текста посадочных страниц на основе ИИ для A/B-тестов SaaS, страниц с ценами и конверсии демо

2026 Latest Best AI Landing Page Copy Tools for SaaS A/B Tests, Pricing Pages, and Demo Conversion are here on XIX.AI. [[IMG_BASE64_PLACEHOLDER]] Этот тщательно подобранный список лучших инструментов предлагает мощные решения, способные изменить правила игры, повысить качество контента, улучшить эффективность написания и повысить общую продуктивность. Мы проводим реальные тесты и предоставляем бесплатное vs платное сравнение вместе с еженедельно обновляемыми рейтингами. Обязательные для пробных вариантов помогут вам преодолеть творческие ограничения. Исследуйте сейчас, чтобы найти свой идеальный инструмент и раскрыть свой ИИ-потенциал!

8 инструментов
xix.ai
Финансы Инструменты прогнозирования бюджета Excel на основе ИИ для планирования денежных потоков и контроля расходов
Инструменты прогнозирования бюджета Excel на основе ИИ для планирования денежных потоков и контроля расходов

В 2026 году лучшие инструменты Excel на базе искусственного интеллекта для планирования денежных потоков и контроля расходов представлены в рейтинговом списке XIX.AI, получившем высшие оценки. Эти мощные решения, меняющие правила игры, помогают значительно повысить продуктивность благодаря реальным испытаниям и строгим рейтингам. Получите бесплатное сравнение платных и бесплатных версий, чтобы найти идеальное решение для ваших потребностей. Изучите их сейчас, чтобы получить преимущество от использования искусственного интеллекта в финансовом управлении.

9 инструментов
xix.ai
Быстрый Инструменты управления промптами для команд
Инструменты управления промптами для команд

В 2026 году лучшие, самые популярные инструменты управления AI-промптами для команд, отобранные XIX.AI, представлены здесь. Этот еженедельно обновляемый гайд включает мощные решения, меняющие правила игры, которые значительно повышают продуктивность команд благодаря реальным тестам и подробным рейтингам. Получите бесплатное сравнение платных и бесплатных вариантов, чтобы выбрать идеальный инструмент. Исследуйте сейчас, чтобы раскрыть ваше преимущество в AI.

9 инструментов
xix.ai
Комментарии (1)
0/500
GregoryJones
GregoryJones 5 октября 2026 г., 17:00:10 GMT+03:00

GPT-5.5のパフォーマンスとDeepSeekのコスパ競争、そして実際のセキュリティレポート。LLMの推論能力が本当にどの程度か試される場ですね。サイバーセキュリティの格闘技場のような状況、興味深いです。

OR