Дом
GPT-5.6 IQ превышает отметку 130, что соответствует уровню гения, и превосходит по интеллекту 99% людей, при этом его практические рабочие способности также остаются на исключительном уровне.
Отслеживание последних офлайн-оценок интеллекта ИИ показывает, что несколько итераций GPT-5.6 от OpenAI достигли результата 136, что стало первым случаем, когда большая языковая модель превысила порог в 130 единиц IQ. В стандартном распределении человеческих показателей IQ значение 130 означает порог «гениальности», уровень, достигаемый лишь 1% мирового населения, что фактически позиционирует GPT-5.6 как более интеллектуальную систему, чем 99% людей.

Показав результат 136 на самом строгом банке вопросов с защитой от утечек, GPT-5.6 значительно превзошла своих конкурентов.
Компания Tracking AI использовала две различные системы тестирования: открытый экзамен по типу Mensa Норвегии, где модели уже превышали отметку в 140 баллов, и проприетарный закрытый офлайн-банк вопросов, разработанный для предотвращения предварительного заучивания. GPT-5.6 успешно справилась с этим сложным офлайн-набором данных, при этом вся семья SOL и TERRA набрала 136 баллов, включая ее визуальный вариант. Claude-5 Fable показала результат 130 баллов, тогда как GPT-5.6 LUNA Max и Claude-4.8 Opus отстали, показав результаты в диапазоне от 117 до 123 баллов. Хотя модели от o3 до различных флагманских систем исторически достигали плато на отметке 130, GPT-5.6 стала первой, преодолевшей этот барьер.
Помимо высоких результатов тестов, GPT-5.6 демонстрирует исключительную производительность в практических приложениях.
Высокие показатели тестов сами по себе не гарантируют полезности. Разработчики оценили GPT-5.6 в реальных сценариях, получив впечатляющие результаты. Когда разработчик Амир Бхолули отправил одинаковый промпт для физической симуляции как в Fable5, так и в GPT-5.6 Sol, он ожидал доминирования Fable. Вместо этого GPT-5.6 Sol выполнила симуляцию частиц жидкости с физикой в реальном времени, объединив CSS, дизайн интерфейса и рендеринг в одном HTML-файле. Она автоматически разместила результат в виде доступной для обмена веб-страницы, предоставив готовый продукт по одному промпту. Аналогичным образом Раманпал Сингх создал систему обработки клиентских заявок с использованием RAG по одному промпту, включив четыре различные роли, панель управления бэкэнда, автоматическую классификацию жалоб и распознавание эмоций. Эта сложная настройка потребовала лишь доли затрат, связанных с Fable5.
Опыт Клер Во подчеркнул эти практические преимущества. Столкнувшись с устойчивой ошибкой, которую она считала причиной сбоя своего кода, она переключилась на GPT-5.6 Sol, remarkнув: «Я не позволю этому победить меня». Sol немедленно решила проблему и помогла другим моделям работать гладко. Оценка Во была четкой: жесткий фокус Fable на технической точности препятствовал ее эффективности, тогда как прагматичный подход Sol обеспечил ощутимые результаты.
Связанная статья
Microsoft представила модели серии MAI для диверсификации стратегии в области искусственного интеллекта, выходящей за рамки одного гигантского решения.
Сатья Наделла, генеральный директор Microsoft, подчеркнул во время недавнего квартального звонка по результатам деятельности, что компания ускоряет внедрение многорежимных архитектур в корпоративном секторе, одновременно увеличивая инвестиции в собст
Компании, разрабатывающие модели мира, охраняют свои секреты
На прошлой неделе я модерировал обсуждение мировых моделей на конференции All In (не связанной с подкастом), предоставив глубокий анализ одного из самых загадочных секторов искусственного интеллекта. Ведущие отраслевые лидеры, такие как лаборатории A
Агенты Rival AI Instinct и Meta Muse теперь поддерживают функции вызовов
Рынок текстовых ИИ-ассистентов отличается высокой конкуренцией: Instinct, Wajo, Town, Ollie и недавно запущенный агент Meta Muse борются за внимание пользователей и управление задачами. Штаб-квартира Instinct находится в Сан-Франциско; компания стала
Рекомендации по связанным специальным темам
Комментарии (0)
Отслеживание последних офлайн-оценок интеллекта ИИ показывает, что несколько итераций GPT-5.6 от OpenAI достигли результата 136, что стало первым случаем, когда большая языковая модель превысила порог в 130 единиц IQ. В стандартном распределении человеческих показателей IQ значение 130 означает порог «гениальности», уровень, достигаемый лишь 1% мирового населения, что фактически позиционирует GPT-5.6 как более интеллектуальную систему, чем 99% людей.

Показав результат 136 на самом строгом банке вопросов с защитой от утечек, GPT-5.6 значительно превзошла своих конкурентов.
Компания Tracking AI использовала две различные системы тестирования: открытый экзамен по типу Mensa Норвегии, где модели уже превышали отметку в 140 баллов, и проприетарный закрытый офлайн-банк вопросов, разработанный для предотвращения предварительного заучивания. GPT-5.6 успешно справилась с этим сложным офлайн-набором данных, при этом вся семья SOL и TERRA набрала 136 баллов, включая ее визуальный вариант. Claude-5 Fable показала результат 130 баллов, тогда как GPT-5.6 LUNA Max и Claude-4.8 Opus отстали, показав результаты в диапазоне от 117 до 123 баллов. Хотя модели от o3 до различных флагманских систем исторически достигали плато на отметке 130, GPT-5.6 стала первой, преодолевшей этот барьер.
Помимо высоких результатов тестов, GPT-5.6 демонстрирует исключительную производительность в практических приложениях.
Высокие показатели тестов сами по себе не гарантируют полезности. Разработчики оценили GPT-5.6 в реальных сценариях, получив впечатляющие результаты. Когда разработчик Амир Бхолули отправил одинаковый промпт для физической симуляции как в Fable5, так и в GPT-5.6 Sol, он ожидал доминирования Fable. Вместо этого GPT-5.6 Sol выполнила симуляцию частиц жидкости с физикой в реальном времени, объединив CSS, дизайн интерфейса и рендеринг в одном HTML-файле. Она автоматически разместила результат в виде доступной для обмена веб-страницы, предоставив готовый продукт по одному промпту. Аналогичным образом Раманпал Сингх создал систему обработки клиентских заявок с использованием RAG по одному промпту, включив четыре различные роли, панель управления бэкэнда, автоматическую классификацию жалоб и распознавание эмоций. Эта сложная настройка потребовала лишь доли затрат, связанных с Fable5.
Опыт Клер Во подчеркнул эти практические преимущества. Столкнувшись с устойчивой ошибкой, которую она считала причиной сбоя своего кода, она переключилась на GPT-5.6 Sol, remarkнув: «Я не позволю этому победить меня». Sol немедленно решила проблему и помогла другим моделям работать гладко. Оценка Во была четкой: жесткий фокус Fable на технической точности препятствовал ее эффективности, тогда как прагматичный подход Sol обеспечил ощутимые результаты.
Microsoft представила модели серии MAI для диверсификации стратегии в области искусственного интеллекта, выходящей за рамки одного гигантского решения.
Сатья Наделла, генеральный директор Microsoft, подчеркнул во время недавнего квартального звонка по результатам деятельности, что компания ускоряет внедрение многорежимных архитектур в корпоративном секторе, одновременно увеличивая инвестиции в собст
Компании, разрабатывающие модели мира, охраняют свои секреты
На прошлой неделе я модерировал обсуждение мировых моделей на конференции All In (не связанной с подкастом), предоставив глубокий анализ одного из самых загадочных секторов искусственного интеллекта. Ведущие отраслевые лидеры, такие как лаборатории A
Агенты Rival AI Instinct и Meta Muse теперь поддерживают функции вызовов
Рынок текстовых ИИ-ассистентов отличается высокой конкуренцией: Instinct, Wajo, Town, Ollie и недавно запущенный агент Meta Muse борются за внимание пользователей и управление задачами. Штаб-квартира Instinct находится в Сан-Франциско; компания стала











