xAI Grok 4.20 实现了业界最低的幻觉率,将完整性置于性能之上
当人工智能巨头们争先恐后地投入资源以追求最高性能分数时,埃隆·马斯克旗下的xAI却采取了不同的策略,将重点放在该领域最棘手的问题上:信息造假。 今日,xAI正式发布了Grok4.20Beta版本。尽管其在绝对智能分数上仍落后于顶级模型,但在“真实性”这一关键指标上却创下了新的行业纪录。

根据Artificial Analysis的最新评估,Grok4.20在推理模式下的智能指数得分为48分。虽然其得分落后于 和 (两者均为57分),但其事实可靠性表现尤为突出:
低幻觉率:在AA全知测试中,Grok4.20实现了78%的“无幻觉率”,创下新纪录。
知己所不知:当面对无法回答的问题时,该模型不再倾向于编造虚假事实,而是更准确地承认“我不知道”。这种诚实对于严谨的办公和研究环境至关重要。
技术架构:三合一 API 矩阵
为满足多样化需求,xAI 推出了三种 API 变体:
推理模式:优先考虑深度逻辑思考而非速度,这是此次打破“幻觉”纪录的关键。
标准模式:针对快速响应和常规交互进行了优化。
多智能体模式:支持多个 AI 实例协同工作以处理复杂任务。
市场策略:更多内容,无需额外付费
除了独特的性能表现外,Grok 4.20 还推出了一项激进的商业策略:
大上下文:支持高达200万令牌的上下文窗口,可一次性处理整本书或大型代码库。
价格优势:每百万令牌定价在 2 至 6 美元之间,不仅比前代版本 Grok4 更便宜,在当前西方主流模型中也极具竞争力。
Grok4.20的发布反映了xAI的战略转变——不再执着于通向AGI的总分竞赛,而是精准瞄准“企业级可靠性”这一痛点。 正如评估机构所言,如果其他模型都在努力成为“全知先知”,那么 Grok4.20 则致力于成为“永不撒谎的助手”。
对于对数据准确性要求极高的用户而言,除了 OpenAI 和谷歌之外,Grok4.20 可能会成为第三个主要选择。
相关文章
Genesis AI 凭借单一模型驾驭机器人任务,标志着一个类似 ChatGPT 的里程碑时刻
随着全球对机器人技术的关注度日益提升,Genesis AI 推出了其首款机器人基础模型 GENE-26.5。此次发布标志着通用机器人技术取得重大突破,特别是在处理复杂且无结构化的任务方面。近期公开演示充分展现了该机器人令人惊叹的敏捷性和自主性。无论是单手打蛋这类精细操作,还是解魔方等需要逻辑思维的挑战,亦或是弹钢琴这类节奏精准的任务,以及切番茄等日常厨房工作,该机器人均能精准完成。 关键在于,这些
微软推出首款自主研发的全双工AI语音模型,支持16种语言的同步听讲
据科技媒体 TestingCatalog 报道,微软目前正在测试其首个原生实时语音模型 MAI Realtime。 该系统支持16种语言和两种不同的语音风格,能够实现同步聆听和说话,支持自动语言检测以及对话过程中的语言切换。这一技术进步使用户无需等待AI说完才进行回应,从而创造出一种与自然人类互动极为相似的对话体验。MAI Realtime采用双向全双工交互模式,有效打破了用户说话、模型依次回答的
苹果发布 iOS 27,本地 AI 功能与谷歌合作将增强 Siri 的性能
《The Information》最近重点报道了苹果公司将人工智能整合到即将推出的OS 27中的战略举措。通过利用谷歌的Gemini模型来训练一款更高效、更轻量级的人工智能,苹果旨在提供强大的本地边缘AI功能,同时不损害用户隐私。 这种模型蒸馏过程使基于设备的较小模型能够模拟其更大版本的性能,从而显著降低计算成本。苹果的AI工程师目前正致力于利用谷歌的Gemini架构,开发出针对移动设备进行优化的
相关专题推荐
评论 (0)
0/500
当人工智能巨头们争先恐后地投入资源以追求最高性能分数时,埃隆·马斯克旗下的xAI却采取了不同的策略,将重点放在该领域最棘手的问题上:信息造假。 今日,xAI正式发布了Grok4.20Beta版本。尽管其在绝对智能分数上仍落后于顶级模型,但在“真实性”这一关键指标上却创下了新的行业纪录。

根据Artificial Analysis的最新评估,Grok4.20在推理模式下的智能指数得分为48分。虽然其得分落后于
低幻觉率:在AA全知测试中,Grok4.20实现了78%的“无幻觉率”,创下新纪录。
知己所不知:当面对无法回答的问题时,该模型不再倾向于编造虚假事实,而是更准确地承认“我不知道”。这种诚实对于严谨的办公和研究环境至关重要。
技术架构:三合一 API 矩阵
为满足多样化需求,xAI 推出了三种 API 变体:
推理模式:优先考虑深度逻辑思考而非速度,这是此次打破“幻觉”纪录的关键。
标准模式:针对快速响应和常规交互进行了优化。
多智能体模式:支持多个 AI 实例协同工作以处理复杂任务。
市场策略:更多内容,无需额外付费
除了独特的性能表现外,Grok 4.20 还推出了一项激进的商业策略:
大上下文:支持高达200万令牌的上下文窗口,可一次性处理整本书或大型代码库。
价格优势:每百万令牌定价在 2 至 6 美元之间,不仅比前代版本 Grok4 更便宜,在当前西方主流模型中也极具竞争力。
Grok4.20的发布反映了xAI的战略转变——不再执着于通向AGI的总分竞赛,而是精准瞄准“企业级可靠性”这一痛点。 正如评估机构所言,如果其他模型都在努力成为“全知先知”,那么 Grok4.20 则致力于成为“永不撒谎的助手”。
对于对数据准确性要求极高的用户而言,除了 OpenAI 和谷歌之外,Grok4.20 可能会成为第三个主要选择。
Genesis AI 凭借单一模型驾驭机器人任务,标志着一个类似 ChatGPT 的里程碑时刻
随着全球对机器人技术的关注度日益提升,Genesis AI 推出了其首款机器人基础模型 GENE-26.5。此次发布标志着通用机器人技术取得重大突破,特别是在处理复杂且无结构化的任务方面。近期公开演示充分展现了该机器人令人惊叹的敏捷性和自主性。无论是单手打蛋这类精细操作,还是解魔方等需要逻辑思维的挑战,亦或是弹钢琴这类节奏精准的任务,以及切番茄等日常厨房工作,该机器人均能精准完成。 关键在于,这些
微软推出首款自主研发的全双工AI语音模型,支持16种语言的同步听讲
据科技媒体 TestingCatalog 报道,微软目前正在测试其首个原生实时语音模型 MAI Realtime。 该系统支持16种语言和两种不同的语音风格,能够实现同步聆听和说话,支持自动语言检测以及对话过程中的语言切换。这一技术进步使用户无需等待AI说完才进行回应,从而创造出一种与自然人类互动极为相似的对话体验。MAI Realtime采用双向全双工交互模式,有效打破了用户说话、模型依次回答的
苹果发布 iOS 27,本地 AI 功能与谷歌合作将增强 Siri 的性能
《The Information》最近重点报道了苹果公司将人工智能整合到即将推出的OS 27中的战略举措。通过利用谷歌的Gemini模型来训练一款更高效、更轻量级的人工智能,苹果旨在提供强大的本地边缘AI功能,同时不损害用户隐私。 这种模型蒸馏过程使基于设备的较小模型能够模拟其更大版本的性能,从而显著降低计算成本。苹果的AI工程师目前正致力于利用谷歌的Gemini架构,开发出针对移动设备进行优化的





首页






