GPT-5.6のIQは130の天才ラインを突破し、人間の99%よりも賢く、実務能力も並外れている
AIの最新のオフラインIQ評価の追跡によると、OpenAIのGPT-5.6の複数の反復版が136というスコアを達成し、大規模言語モデルがIQ130の基準を突破した初の事例となった。標準的な人間の分布において、IQ130は「天才」の閾値を示し、これは全世界の人口のわずか1%が達成するレベルであり、GPT-5.6を99%の人々よりも知的であると位置づけている。

最も厳格で、漏洩防止対策が施された問題集で136点を獲得し、GPT-5.6は競合他社を大きく上回るパフォーマンスを示した。
Tracking AIは2つの異なるテストフレームワークを使用した。1つはオープンソースのメンサ・ノルウェー式試験で、モデルはすでに140点を超えていた。もう1つは、事前暗記を防ぐために設計された非公開のオフライン問題集である。GPT-5.6はこの困難なオフラインデータセットを無事にクリアし、SOLおよびTERRAファミリー全体が136点を記録した。これには視覚バリエーション版も含まれる。Claude-5 Fableは130点で続いた一方、GPT-5.6 LUNA MaxおよびClaude-4.8 Opusは117〜123点の間で後れを取った。o3から各種フラッグシップシステムに至るまで、モデルは歴史的に130の閾値で頭打ちになっていたが、GPT-5.6がこれを突破した初のモデルとなった。
テストスコアだけでなく、GPT-5.6は実用的な応用においても卓越したパフォーマンスを示している。
高いテスト数値だけが有用性を保証するわけではない。開発者は現実のシナリオでGPT-5.6を評価し、驚くべき結果を得た。開発者のAmir BohlooliがFable5とGPT-5.6 Solの両方に同一の物理シミュレーションプロンプトを提出した際、彼はFableの優位性を予想していた。しかし実際には、GPT-5.6 Solがリアルタイムの物理演算を伴う粒子流体シミュレーションを実行し、CSS、インターフェースデザイン、レンダリングを単一のHTMLファイル内にカプセル化した。さらに、結果を共有可能なWebページとして自動的にホストし、単一のプロンプトから完全な製品を提供した。同様に、Ramanpal Singhは1つのプロンプトでRAGを用いて顧客チケットシステムを開発し、4つの異なる役割、管理バックエンド、自動苦情分類、感情認識を組み込んだ。この複雑なセットアップは、Fable5に関連するコストのわずか一部で実現可能だった。
Claire Voの経験は、これらの実用的な利点を浮き彫りにした。彼女はコードがクラッシュしたと信じる持続的なバグに遭遇した後、GPT-5.6 Solに切り替え、「この私に勝たせない」と述べた。Solは問題を即座に解決し、他のモデルの円滑な実行を支援した。Voの評価は明確であった。Fableの技術的精度への硬直した焦点がその有効性を阻害していたのに対し、Solの実用的なアプローチは具体的な結果をもたらした。
関連記事
Microsoft、MAIシリーズモデルを発表し、単一の巨大モデルに依存しないAI戦略の多様化を図る
サティア・ナデラMicrosoftの最高経営責任者(CEO)は、直近の四半期決算電話会議において、同社がマルチモデルアーキテクチャのエンタープライズ採用を加速させると同時に、独自AIモデル、エージェント、および安全なソリューションへの投資を強化し、いかなる単一の主要AIラボへの依存を最小限に抑える取り組みを進めていることを強調した。Microsoftは最近、堅調な財務結果を発表した。6月30日で終了する会計年度における総収入は3,318億ドル、純利益は1,337億ドルに達し、最新の四半期では収入
世界モデル企業は秘密を厳重に守る
先週、私は「All In」カンファレンス(ポッドキャストとは無関係)で世界モデルに関する議論を進行し、AI の最も謎に包まれた分野の一つについて深く掘り下げた。ヤン・ル・クンの AMI Labs やフェイ・フェイ・リーの World Labs といった業界のリーダーたちは大きな注目を集め、多額の資金調達に成功しているものの、収益化への進捗は著しく遅れている。世界モデルの基盤には、空間知能を自動化する目的があり、ロボット工学、インタラクティブなビデオ、高度な自動運転システムに至るまで、多様かつ潜
Rival AIエージェントのInstinctとMetaのMuseが通話機能をサポート
テキストベースのAIアシスタント市場は熾烈な競争状態にあり、Instinct、Wajo、Town、Ollie、そしてMetaが新たに立ち上げたMuseエージェントが、ユーザーの注目を集め、タスク管理の分野でしのぎを削っています。サンフランシスコを拠点とするInstinctは主要な競合候補として浮上し、大きな投資家の関心を集め、評価額は100億ドルに達していると報じられています。Instinctの人気が、新しい通話機能の導入により拡大する予定です。この機能により、そのエージェントはユーザーに代わ
関連特集おすすめ
コメント (0)
0/500
AIの最新のオフラインIQ評価の追跡によると、OpenAIのGPT-5.6の複数の反復版が136というスコアを達成し、大規模言語モデルがIQ130の基準を突破した初の事例となった。標準的な人間の分布において、IQ130は「天才」の閾値を示し、これは全世界の人口のわずか1%が達成するレベルであり、GPT-5.6を99%の人々よりも知的であると位置づけている。

最も厳格で、漏洩防止対策が施された問題集で136点を獲得し、GPT-5.6は競合他社を大きく上回るパフォーマンスを示した。
Tracking AIは2つの異なるテストフレームワークを使用した。1つはオープンソースのメンサ・ノルウェー式試験で、モデルはすでに140点を超えていた。もう1つは、事前暗記を防ぐために設計された非公開のオフライン問題集である。GPT-5.6はこの困難なオフラインデータセットを無事にクリアし、SOLおよびTERRAファミリー全体が136点を記録した。これには視覚バリエーション版も含まれる。Claude-5 Fableは130点で続いた一方、GPT-5.6 LUNA MaxおよびClaude-4.8 Opusは117〜123点の間で後れを取った。o3から各種フラッグシップシステムに至るまで、モデルは歴史的に130の閾値で頭打ちになっていたが、GPT-5.6がこれを突破した初のモデルとなった。
テストスコアだけでなく、GPT-5.6は実用的な応用においても卓越したパフォーマンスを示している。
高いテスト数値だけが有用性を保証するわけではない。開発者は現実のシナリオでGPT-5.6を評価し、驚くべき結果を得た。開発者のAmir BohlooliがFable5とGPT-5.6 Solの両方に同一の物理シミュレーションプロンプトを提出した際、彼はFableの優位性を予想していた。しかし実際には、GPT-5.6 Solがリアルタイムの物理演算を伴う粒子流体シミュレーションを実行し、CSS、インターフェースデザイン、レンダリングを単一のHTMLファイル内にカプセル化した。さらに、結果を共有可能なWebページとして自動的にホストし、単一のプロンプトから完全な製品を提供した。同様に、Ramanpal Singhは1つのプロンプトでRAGを用いて顧客チケットシステムを開発し、4つの異なる役割、管理バックエンド、自動苦情分類、感情認識を組み込んだ。この複雑なセットアップは、Fable5に関連するコストのわずか一部で実現可能だった。
Claire Voの経験は、これらの実用的な利点を浮き彫りにした。彼女はコードがクラッシュしたと信じる持続的なバグに遭遇した後、GPT-5.6 Solに切り替え、「この私に勝たせない」と述べた。Solは問題を即座に解決し、他のモデルの円滑な実行を支援した。Voの評価は明確であった。Fableの技術的精度への硬直した焦点がその有効性を阻害していたのに対し、Solの実用的なアプローチは具体的な結果をもたらした。
Microsoft、MAIシリーズモデルを発表し、単一の巨大モデルに依存しないAI戦略の多様化を図る
サティア・ナデラMicrosoftの最高経営責任者(CEO)は、直近の四半期決算電話会議において、同社がマルチモデルアーキテクチャのエンタープライズ採用を加速させると同時に、独自AIモデル、エージェント、および安全なソリューションへの投資を強化し、いかなる単一の主要AIラボへの依存を最小限に抑える取り組みを進めていることを強調した。Microsoftは最近、堅調な財務結果を発表した。6月30日で終了する会計年度における総収入は3,318億ドル、純利益は1,337億ドルに達し、最新の四半期では収入
世界モデル企業は秘密を厳重に守る
先週、私は「All In」カンファレンス(ポッドキャストとは無関係)で世界モデルに関する議論を進行し、AI の最も謎に包まれた分野の一つについて深く掘り下げた。ヤン・ル・クンの AMI Labs やフェイ・フェイ・リーの World Labs といった業界のリーダーたちは大きな注目を集め、多額の資金調達に成功しているものの、収益化への進捗は著しく遅れている。世界モデルの基盤には、空間知能を自動化する目的があり、ロボット工学、インタラクティブなビデオ、高度な自動運転システムに至るまで、多様かつ潜
Rival AIエージェントのInstinctとMetaのMuseが通話機能をサポート
テキストベースのAIアシスタント市場は熾烈な競争状態にあり、Instinct、Wajo、Town、Ollie、そしてMetaが新たに立ち上げたMuseエージェントが、ユーザーの注目を集め、タスク管理の分野でしのぎを削っています。サンフランシスコを拠点とするInstinctは主要な競合候補として浮上し、大きな投資家の関心を集め、評価額は100億ドルに達していると報じられています。Instinctの人気が、新しい通話機能の導入により拡大する予定です。この機能により、そのエージェントはユーザーに代わ





家






