xAI Grok 4.20、業界最低レベルの幻覚発生率を達成、性能よりも正確性を優先
AI大手各社がトップクラスの性能スコアを追求するために熱狂的にリソースを投入する一方で、イーロン・マスク氏のxAIは異なるアプローチを取り、この分野で最も根深い問題である「情報の捏造」に焦点を当てています。 本日、xAIは「Grok4.20Beta」を正式にリリースした。絶対的な知能スコアでは依然としてトップクラスのモデルには及ばないものの、「真実性」という重要な指標において業界新記録を樹立した。

Artificial Analysisによる最新の評価によると、Grok4.20は推論モードにおける知能指数で48点を記録した。 や (いずれも57点)には及ばないものの、事実の信頼性に関するパフォーマンスは特に印象的である。
低い幻覚率:AA Omniscienceテストにおいて、Grok4.20は78%の「非幻覚率」を達成し、新記録を樹立した。
「知っていることを知る」:答えられない質問に直面した際、このモデルはもはや虚偽の事実をでっち上げる傾向がなく、代わりに「わからない」とより正確に認めるようになりました。この正直さは、厳格なオフィスや研究環境において極めて重要です。
技術アーキテクチャ:3-in-1 APIマトリックス
多様なニーズに応えるため、xAIは3種類のAPIバリエーションをリリースしました:
推論モード:速度よりも深い論理的思考を優先します。これが、今回の「幻覚」記録を更新する鍵となりました。
標準モード:迅速な応答と日常的な対話に最適化されています。
マルチエージェントモード:複数のAIインスタンスが連携して複雑なタスクを処理することをサポートします。
市場戦略:コンテンツの拡充、追加費用なし
独自の性能に加え、Grok4.20は積極的な商業戦略も導入しています:
大規模コンテキスト:最大200万トークンのコンテキストウィンドウに対応しており、書籍1冊分や大規模なコードベースを一度に処理可能です。
価格面での優位性:100万トークンあたり2~6ドルの価格設定で、前バージョンのGrok4よりも安価であるだけでなく、現在の欧米の主流モデルの中でも極めて競争力があります。
Grok4.20のリリースは、xAIの戦略的転換を反映しています。もはやAGIに向けた総合スコアの競争に固執するのではなく、「エンタープライズレベルの信頼性」という課題に的確に焦点を当てているのです。 評価機関が指摘したように、他のモデルが「全知全能の預言者」を目指しているのに対し、Grok4.20は「決して嘘をつかない助手」を目指している。
データの正確性に対して極めて高い要件を持つユーザーにとって、Grok4.20はOpenAIやGoogleに次ぐ、第3の主要な選択肢となる可能性がある。
関連記事
Genesis AI、単一モデルでロボットタスクをマスター ChatGPT登場時のような画期的な瞬間を記録
ロボット工学に対する世界的な関心が高まる中、ジェネシスAIは同社初のロボット基盤モデル「GENE-26.5」を発表しました。この発表は、汎用ロボット工学、とりわけ複雑で構造化されていないタスクの処理において、大きな飛躍を意味するものです。最近の公開デモンストレーションでは、このロボットの驚くべき機敏さと自律性が際立っています。片手で卵を溶くような繊細な操作から、ルービックキューブを解くような論理的
マイクロソフト、16言語に対応し、聞き取りと発話を同時に行える初の自社開発フルデュプレックスAI音声モデルを発表
テクノロジーメディア「TestingCatalog」によると、マイクロソフトは現在、同社初のネイティブリアルタイム音声モデル「MAI Realtime」のテストを行っている。 16の言語と2種類の異なる音声スタイルに対応するこのシステムは、聞き取りと発話を同時に行うことが可能で、自動言語検出や会話中の言語切り替えを実現している。この進歩により、ユーザーはAIの発話が終了するのを待ってから応答する必
Apple、ローカルAIとGoogleとの提携によりSiriの機能を強化した「iOS 27」を発表
『The Information』は先日、Appleが次期OS 27に人工知能を統合するための戦略的アプローチについて報じた。Appleは、Googleの「Gemini」モデルを活用して、より効率的で軽量なAIを学習させることで、ユーザーのプライバシーを損なうことなく、堅牢なローカルエッジAI機能を提供することを目指している。 このモデル蒸留プロセスにより、より小型のデバイス向けモデルが、より大規
関連特集おすすめ
コメント (0)
0/500
AI大手各社がトップクラスの性能スコアを追求するために熱狂的にリソースを投入する一方で、イーロン・マスク氏のxAIは異なるアプローチを取り、この分野で最も根深い問題である「情報の捏造」に焦点を当てています。 本日、xAIは「Grok4.20Beta」を正式にリリースした。絶対的な知能スコアでは依然としてトップクラスのモデルには及ばないものの、「真実性」という重要な指標において業界新記録を樹立した。

Artificial Analysisによる最新の評価によると、Grok4.20は推論モードにおける知能指数で48点を記録した。
低い幻覚率:AA Omniscienceテストにおいて、Grok4.20は78%の「非幻覚率」を達成し、新記録を樹立した。
「知っていることを知る」:答えられない質問に直面した際、このモデルはもはや虚偽の事実をでっち上げる傾向がなく、代わりに「わからない」とより正確に認めるようになりました。この正直さは、厳格なオフィスや研究環境において極めて重要です。
技術アーキテクチャ:3-in-1 APIマトリックス
多様なニーズに応えるため、xAIは3種類のAPIバリエーションをリリースしました:
推論モード:速度よりも深い論理的思考を優先します。これが、今回の「幻覚」記録を更新する鍵となりました。
標準モード:迅速な応答と日常的な対話に最適化されています。
マルチエージェントモード:複数のAIインスタンスが連携して複雑なタスクを処理することをサポートします。
市場戦略:コンテンツの拡充、追加費用なし
独自の性能に加え、Grok4.20は積極的な商業戦略も導入しています:
大規模コンテキスト:最大200万トークンのコンテキストウィンドウに対応しており、書籍1冊分や大規模なコードベースを一度に処理可能です。
価格面での優位性:100万トークンあたり2~6ドルの価格設定で、前バージョンのGrok4よりも安価であるだけでなく、現在の欧米の主流モデルの中でも極めて競争力があります。
Grok4.20のリリースは、xAIの戦略的転換を反映しています。もはやAGIに向けた総合スコアの競争に固執するのではなく、「エンタープライズレベルの信頼性」という課題に的確に焦点を当てているのです。 評価機関が指摘したように、他のモデルが「全知全能の預言者」を目指しているのに対し、Grok4.20は「決して嘘をつかない助手」を目指している。
データの正確性に対して極めて高い要件を持つユーザーにとって、Grok4.20はOpenAIやGoogleに次ぐ、第3の主要な選択肢となる可能性がある。
Genesis AI、単一モデルでロボットタスクをマスター ChatGPT登場時のような画期的な瞬間を記録
ロボット工学に対する世界的な関心が高まる中、ジェネシスAIは同社初のロボット基盤モデル「GENE-26.5」を発表しました。この発表は、汎用ロボット工学、とりわけ複雑で構造化されていないタスクの処理において、大きな飛躍を意味するものです。最近の公開デモンストレーションでは、このロボットの驚くべき機敏さと自律性が際立っています。片手で卵を溶くような繊細な操作から、ルービックキューブを解くような論理的
マイクロソフト、16言語に対応し、聞き取りと発話を同時に行える初の自社開発フルデュプレックスAI音声モデルを発表
テクノロジーメディア「TestingCatalog」によると、マイクロソフトは現在、同社初のネイティブリアルタイム音声モデル「MAI Realtime」のテストを行っている。 16の言語と2種類の異なる音声スタイルに対応するこのシステムは、聞き取りと発話を同時に行うことが可能で、自動言語検出や会話中の言語切り替えを実現している。この進歩により、ユーザーはAIの発話が終了するのを待ってから応答する必
Apple、ローカルAIとGoogleとの提携によりSiriの機能を強化した「iOS 27」を発表
『The Information』は先日、Appleが次期OS 27に人工知能を統合するための戦略的アプローチについて報じた。Appleは、Googleの「Gemini」モデルを活用して、より効率的で軽量なAIを学習させることで、ユーザーのプライバシーを損なうことなく、堅牢なローカルエッジAI機能を提供することを目指している。 このモデル蒸留プロセスにより、より小型のデバイス向けモデルが、より大規





家






