xAI Grok 4.20 達成業界最低的幻覺率,將完整性置於效能之上
當人工智慧巨頭們正瘋狂投入資源以追求頂尖的性能分數時,伊隆·馬斯克旗下的 xAI 卻採取了不同的策略,將重心放在該領域中最棘手的問題上:資訊造假。 今日,xAI 正式推出Grok4.20Beta。儘管其在絕對智能分數上仍落後於頂級模型,但在「真實性」這項關鍵指標上卻創下了新的業界紀錄。

根據《Artificial Analysis》的最新評估,Grok4.20在推理模式下的智慧指數得分為48分。雖然落後於 和 (兩者均得57分),但其事實可靠性表現尤為亮眼:
低幻覺率:在 AA 全知測試中,Grok4.20 達成了78% 的「非幻覺率」,創下新紀錄。
知己所不知:當面對無法回答的問題時,該模型不再傾向於捏造虛假事實,而是更精確地承認「我不知道」。這種誠實態度對於嚴謹的辦公與研究環境至關重要。
技術架構:三合一 API 矩陣
為滿足多元需求,xAI 推出了三種 API 變體:
推理模式:優先考量深度邏輯思考而非速度,這正是本次打破「幻覺率」紀錄的關鍵。
標準模式:針對快速回應與例行互動進行優化。
多代理模式:支援多個 AI 實例協同作業,以處理複雜任務。
市場策略:更多內容,無需額外費用
除了獨特的性能表現外,Grok 4.20 還推出了一項進取的商業策略:
大上下文:支援長達200 萬個標記的上下文視窗,可一次性處理整本書或大型程式碼庫。
價格優勢:每百萬個標記的定價介於 2 至 6 美元之間,不僅比前一代 Grok4 更便宜,在當前西方主流模型中也極具競爭力。
Grok4.20 的發布反映了 xAI 的戰略轉向——不再執著於通往 AGI 的總分競賽,而是精準鎖定「企業級可靠性」這一痛點。 正如評估機構所言,若其他模型致力於成為「全知先知」,Grok4.20 則致力於成為「永不說謊的助手」。
對於對資料準確性有極高要求的用戶而言,除了 OpenAI 和 Google 之外,Grok4.20 可能會成為第三個主要選擇。
相關文章
Genesis AI 憑藉單一模型駕馭機器人任務,標誌著一個類似 ChatGPT 的重要時刻
隨著全球對機器人技術的關注度日益提升,Genesis AI 推出了其首款機器人基礎模型 GENE-26.5。此次發布標誌著通用機器人技術取得重大突破,特別是在處理複雜且非結構化任務方面。近期公開展示凸顯了該機器人令人驚嘆的靈活度與自主性。從單手打蛋這類精細操作,到解決魔方這類邏輯驅動的挑戰,再到彈鋼琴這類節奏精準的任務,以及切番茄這類日常廚房工作,機器人皆能精準無誤地完成。 關鍵在於,這些多元能力
微軟推出首款自主研發的全雙工 AI 語音模型,支援 16 種語言的同步聆聽與說話功能
根據科技媒體 TestingCatalog 的報導,微軟目前正在測試其首款原生即時語音模型「MAI Realtime」。 該系統支援 16 種語言及兩種截然不同的語音風格,能同時進行聆聽與說話,並具備自動語言偵測及對話中途切換功能。這項技術突破讓使用者無需等待 AI 說完才回應,營造出與自然人類互動極為相似的對話體驗。MAI Realtime 採用雙向全雙工互動模式,有效打破了傳統語音助理「使用者
蘋果發表 iOS 27,透過本地 AI 及與 Google 合作強化 Siri 功能
《The Information》最近重點報導了蘋果將人工智慧整合至即將推出的 OS 27 系統的策略方針。透過運用 Google 的 Gemini 模型來訓練更高效、更輕量的人工智慧,蘋果旨在提供強大的本地邊緣人工智慧功能,同時不損害用戶隱私。 這種模型蒸餾過程使體積更小、基於裝置的模型能夠模擬其較大型對應模型的表現,從而大幅降低運算成本。蘋果的 AI 工程師目前正致力於運用 Google 的
相關專題推薦
評論 (0)
0/500
當人工智慧巨頭們正瘋狂投入資源以追求頂尖的性能分數時,伊隆·馬斯克旗下的 xAI 卻採取了不同的策略,將重心放在該領域中最棘手的問題上:資訊造假。 今日,xAI 正式推出Grok4.20Beta。儘管其在絕對智能分數上仍落後於頂級模型,但在「真實性」這項關鍵指標上卻創下了新的業界紀錄。

根據《Artificial Analysis》的最新評估,Grok4.20在推理模式下的智慧指數得分為48分。雖然落後於
低幻覺率:在 AA 全知測試中,Grok4.20 達成了78% 的「非幻覺率」,創下新紀錄。
知己所不知:當面對無法回答的問題時,該模型不再傾向於捏造虛假事實,而是更精確地承認「我不知道」。這種誠實態度對於嚴謹的辦公與研究環境至關重要。
技術架構:三合一 API 矩陣
為滿足多元需求,xAI 推出了三種 API 變體:
推理模式:優先考量深度邏輯思考而非速度,這正是本次打破「幻覺率」紀錄的關鍵。
標準模式:針對快速回應與例行互動進行優化。
多代理模式:支援多個 AI 實例協同作業,以處理複雜任務。
市場策略:更多內容,無需額外費用
除了獨特的性能表現外,Grok 4.20 還推出了一項進取的商業策略:
大上下文:支援長達200 萬個標記的上下文視窗,可一次性處理整本書或大型程式碼庫。
價格優勢:每百萬個標記的定價介於 2 至 6 美元之間,不僅比前一代 Grok4 更便宜,在當前西方主流模型中也極具競爭力。
Grok4.20 的發布反映了 xAI 的戰略轉向——不再執著於通往 AGI 的總分競賽,而是精準鎖定「企業級可靠性」這一痛點。 正如評估機構所言,若其他模型致力於成為「全知先知」,Grok4.20 則致力於成為「永不說謊的助手」。
對於對資料準確性有極高要求的用戶而言,除了 OpenAI 和 Google 之外,Grok4.20 可能會成為第三個主要選擇。
Genesis AI 憑藉單一模型駕馭機器人任務,標誌著一個類似 ChatGPT 的重要時刻
隨著全球對機器人技術的關注度日益提升,Genesis AI 推出了其首款機器人基礎模型 GENE-26.5。此次發布標誌著通用機器人技術取得重大突破,特別是在處理複雜且非結構化任務方面。近期公開展示凸顯了該機器人令人驚嘆的靈活度與自主性。從單手打蛋這類精細操作,到解決魔方這類邏輯驅動的挑戰,再到彈鋼琴這類節奏精準的任務,以及切番茄這類日常廚房工作,機器人皆能精準無誤地完成。 關鍵在於,這些多元能力
微軟推出首款自主研發的全雙工 AI 語音模型,支援 16 種語言的同步聆聽與說話功能
根據科技媒體 TestingCatalog 的報導,微軟目前正在測試其首款原生即時語音模型「MAI Realtime」。 該系統支援 16 種語言及兩種截然不同的語音風格,能同時進行聆聽與說話,並具備自動語言偵測及對話中途切換功能。這項技術突破讓使用者無需等待 AI 說完才回應,營造出與自然人類互動極為相似的對話體驗。MAI Realtime 採用雙向全雙工互動模式,有效打破了傳統語音助理「使用者
蘋果發表 iOS 27,透過本地 AI 及與 Google 合作強化 Siri 功能
《The Information》最近重點報導了蘋果將人工智慧整合至即將推出的 OS 27 系統的策略方針。透過運用 Google 的 Gemini 模型來訓練更高效、更輕量的人工智慧,蘋果旨在提供強大的本地邊緣人工智慧功能,同時不損害用戶隱私。 這種模型蒸餾過程使體積更小、基於裝置的模型能夠模擬其較大型對應模型的表現,從而大幅降低運算成本。蘋果的 AI 工程師目前正致力於運用 Google 的





首頁






