OpenAI представляет версии GPT-5.4 Pro и Thinking

В четверг компания OpenAI представила GPT-5.4 — новую базовую модель, которую описывают как «нашу самую мощную и эффективную передовую модель для профессиональной работы». Помимо стандартной версии, GPT-5.4 предлагается в варианте, ориентированном на логическое мышление (GPT-5.4 Thinking), а также в версии с оптимизированной производительностью (GPT-5.4 Pro).
API-версия модели будет поддерживать контекстные окна объемом до 1 миллиона токенов, что станет самой большой емкостью контекста, которую OpenAI когда-либо предлагала.
OpenAI также подчеркнула повышенную эффективность токенов, отметив, что GPT-5.4 может решать идентичные задачи, используя значительно меньше токенов, чем ее предшественница.
Новая модель демонстрирует существенно улучшенные результаты тестирования, достигнув рекордных показателей в тестах OSWorld-Verified и WebArena Verified, предназначенных для оценки компьютерных навыков. Она также установила новый рекорд, набрав 83% в тесте GDPval от OpenAI для задач, связанных с интеллектуальным трудом.
Согласно заявлению генерального директора Mercor Брендана Фуди, GPT-5.4 лидирует в тесте Mercor APEX-Agents, который оценивает профессиональные навыки в области права и финансов.
«[GPT-5.4] отлично справляется с созданием долгосрочных результатов, таких как презентации, финансовые модели и юридический анализ, — заявил Фуди, — демонстрируя производительность высшего уровня при более быстрой работе и меньших затратах по сравнению с конкурирующими передовыми моделями».
GPT-5.4 продолжает работу OpenAI по сокращению галлюцинаций и фактических неточностей. Компания сообщает, что вероятность ошибок в отдельных утверждениях у новой модели на 33% ниже, чем у GPT-5.2, а вероятность ошибок в ответах в целом снизилась на 18%.
В рамках запуска OpenAI переработала способ обработки вызовов инструментов API GPT-5.4, внедрив новую систему под названием Tool Search. Ранее системные подсказки должны были заранее определять все доступные инструменты — процесс, который потреблял значительное количество токенов по мере расширения библиотек инструментов. Новая система позволяет моделям извлекать определения инструментов по запросу, делая запросы более быстрыми и экономичными в средах с большим количеством инструментов.
OpenAI также добавила новую оценку безопасности для анализа цепочки мыслей своих моделей — текущего комментария, раскрывающего ход рассуждений модели при выполнении многоэтапных задач. Исследователи в области безопасности ИИ давно выражают обеспокоенность тем, что модели рассуждений могут искажать свою цепочку мыслей, и тестирование подтверждает, что это может происходить при определенных условиях.
Новая оценка OpenAI указывает на то, что обман менее вероятен в версии GPT-5.4 с функцией Thinking, «что свидетельствует о том, что модель не способна скрывать свои рассуждения и что мониторинг CoT остается эффективным инструментом безопасности».
Связанная статья
OpenAI запускает более безопасную версию ChatGPT для подростков спустя несколько лет после того, как они начали ею пользоваться
После серии судебных исков, связанных с отсутствием протоколов безопасности в чат-ботах на базе ИИ — что стало одной из причин самоубийств подростков и других кризисов, связанных с психическим здоровь
Frontier AI Labs отказывается раскрывать стратегии локализации неконтролируемых моделей
Последние исследования показывают, что лишь немногие ведущие лаборатории, занимающиеся ИИ, опубликовали или продемонстрировали планы реагирования на попытки выхода системы из-под контроля. План сдержи
Tiffany Luck из NEA: Компании по-прежнему борются с вопросами окупаемости инвестиций в ИИ
Загрузка плеера…Ранее в этом году «токеномаксимизация» доминировала в Кремниевой долине, когда генеральные директора призывали сотрудников максимально использовать возможности искусственного интеллекта. Однако этот энтузиазм быстро столкнулся с реал
Рекомендации по связанным специальным темам
Комментарии (0)

В четверг компания OpenAI представила GPT-5.4 — новую базовую модель, которую описывают как «нашу самую мощную и эффективную передовую модель для профессиональной работы». Помимо стандартной версии, GPT-5.4 предлагается в варианте, ориентированном на логическое мышление (GPT-5.4 Thinking), а также в версии с оптимизированной производительностью (GPT-5.4 Pro).
API-версия модели будет поддерживать контекстные окна объемом до 1 миллиона токенов, что станет самой большой емкостью контекста, которую OpenAI когда-либо предлагала.
OpenAI также подчеркнула повышенную эффективность токенов, отметив, что GPT-5.4 может решать идентичные задачи, используя значительно меньше токенов, чем ее предшественница.
Новая модель демонстрирует существенно улучшенные результаты тестирования, достигнув рекордных показателей в тестах OSWorld-Verified и WebArena Verified, предназначенных для оценки компьютерных навыков. Она также установила новый рекорд, набрав 83% в тесте GDPval от OpenAI для задач, связанных с интеллектуальным трудом.
Согласно заявлению генерального директора Mercor Брендана Фуди, GPT-5.4 лидирует в тесте Mercor APEX-Agents, который оценивает профессиональные навыки в области права и финансов.
«[GPT-5.4] отлично справляется с созданием долгосрочных результатов, таких как презентации, финансовые модели и юридический анализ, — заявил Фуди, — демонстрируя производительность высшего уровня при более быстрой работе и меньших затратах по сравнению с конкурирующими передовыми моделями».
GPT-5.4 продолжает работу OpenAI по сокращению галлюцинаций и фактических неточностей. Компания сообщает, что вероятность ошибок в отдельных утверждениях у новой модели на 33% ниже, чем у GPT-5.2, а вероятность ошибок в ответах в целом снизилась на 18%.
В рамках запуска OpenAI переработала способ обработки вызовов инструментов API GPT-5.4, внедрив новую систему под названием Tool Search. Ранее системные подсказки должны были заранее определять все доступные инструменты — процесс, который потреблял значительное количество токенов по мере расширения библиотек инструментов. Новая система позволяет моделям извлекать определения инструментов по запросу, делая запросы более быстрыми и экономичными в средах с большим количеством инструментов.
OpenAI также добавила новую оценку безопасности для анализа цепочки мыслей своих моделей — текущего комментария, раскрывающего ход рассуждений модели при выполнении многоэтапных задач. Исследователи в области безопасности ИИ давно выражают обеспокоенность тем, что модели рассуждений могут искажать свою цепочку мыслей, и тестирование подтверждает, что это может происходить при определенных условиях.
Новая оценка OpenAI указывает на то, что обман менее вероятен в версии GPT-5.4 с функцией Thinking, «что свидетельствует о том, что модель не способна скрывать свои рассуждения и что мониторинг CoT остается эффективным инструментом безопасности».
OpenAI запускает более безопасную версию ChatGPT для подростков спустя несколько лет после того, как они начали ею пользоваться
После серии судебных исков, связанных с отсутствием протоколов безопасности в чат-ботах на базе ИИ — что стало одной из причин самоубийств подростков и других кризисов, связанных с психическим здоровь
Frontier AI Labs отказывается раскрывать стратегии локализации неконтролируемых моделей
Последние исследования показывают, что лишь немногие ведущие лаборатории, занимающиеся ИИ, опубликовали или продемонстрировали планы реагирования на попытки выхода системы из-под контроля. План сдержи
Tiffany Luck из NEA: Компании по-прежнему борются с вопросами окупаемости инвестиций в ИИ
Загрузка плеера…Ранее в этом году «токеномаксимизация» доминировала в Кремниевой долине, когда генеральные директора призывали сотрудников максимально использовать возможности искусственного интеллекта. Однако этот энтузиазм быстро столкнулся с реал





Дом






