X的Grok在AI编码测试中超过了期望

当X首次推出其聊天机器人时,它被隐藏在付费墙后。但正如俗话所说,没有免费的午餐(TANSTAAFL),直到最近X决定向所有人开放Grok。出于对其功能的好奇,我决定通过我的编程测试来检验它。
我一直对Grok有种特别的喜爱,这得益于它的名字,这个名字由我最喜欢的科幻作家之一罗伯特·海因莱因(Robert Heinlein)创造。海因莱因的作品在塑造我年轻时的思想方面发挥了重要作用。我的父母对我的媒体消费非常严格,但他们允许我在当地图书馆沉浸于科幻小说,假设凡是标有“科学”的东西都必须具有教育意义。
海因莱因的故事不仅有趣,还发人深省,挑战社会规范,将科学主题与社会评论交织在一起。“grok”这个词在《异乡异客》(*Stranger in a Strange Land*)中首次出现,体现了一种深刻的、基本的理解,因此非常适合作为AI聊天机器人的名字。
然而,有一个问题……
当我询问Grok使用的大型语言模型(LLM)时,它提到受到《银河系漫游指南》(*Hitchhiker's Guide to the Galaxy*)的机智和叛逆精神的启发。虽然《银河系漫游指南》确实有其魅力,但它实际上并未使用“grok”这个词。不过,我们还是继续来看编程测试吧。
1. 编写WordPress插件
这个测试要求AI展示PHP编程技能和WordPress插件开发的知识。这源于我妻子的一次现实需求,她需要一个工具为她的电子商务网站随机化每月参与设备的名称。难点在于,有些用户可能有多个条目,因此随机化工具需要确保这些名称不会被排列在一起。
代码还必须用户友好,让她可以简单地粘贴名称,点击按钮,然后获取列表。Grok以优异的表现通过了这个测试。界面简洁、功能完善,完全符合预期。
2. 重写字符串函数
第二个测试涉及修复用户报告的一个问题,该问题与验证美元和美分金额的函数有关。我的原始代码只接受整数,因此$5是有效的,但$5.25无效。Grok重写了正则表达式,接近成功。然而,它未能识别像.5这样的数字为有效货币,并且使用了效率较低的双重转换方法。所以,这个测试它失败了。
3. 寻找一个恼人的错误
这个测试要求理解WordPress框架和API,以定位一个微妙的错误。许多大型语言模型,包括我最初在内,都在这个问题上遇到了困难。但Grok完美地解决了它,提供了正确且实用的解决方案。这是三个测试中的第二个胜利。
4. 编写脚本
最后一个测试颇具挑战性,要求了解Keyboard Maestro这一小众Mac脚本工具,并能同时为多个环境编写代码:Keyboard Maestro、Chrome和AppleScript。此前只有Google Gemini和使用GPT-4或更高版本的ChatGPT通过了这个测试。然而,Grok也完美通过,取得了四个测试中的三个胜利。
最终想法
Grok在这些测试中表现得很出色。如果它能允许没有前导零的货币值,它的表现就完美了。尽管我对X自取代Twitter以来的变化有复杂的情感,但Grok已被证明是一个强大的聊天机器人,尤其是在编程技能方面。
你对Grok的看法如何?你试过它了吗?还有《异乡异客》或《银河系漫游指南》呢?在下面的评论中分享你的想法吧。再见,感谢所有的鱼!
相关文章
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
相关专题推荐
评论 (23)
0/500
Grok's coding skills blew me away! 😮 I threw some tricky Python problems at it, and it nailed them faster than my old CS prof. Makes me wonder if AI like this will soon be pair-programming with us at work. What's next, Grok writing my entire app?
Wow, Grok's coding skills are seriously impressive! I tossed some tricky Python problems at it, and it nailed them faster than my old professor could grade papers. Makes me wonder if it'll start writing my apps for me soon! 😎
Grok's coding skills blew me away! 😮 I tossed some tricky Python problems at it, and it nailed them faster than my old prof could grade papers. X opening it up for free feels like a game-changer—wonder how long it'll stay this good before they slap a paywall back on?
ग्रॉक की कोडिंग क्षमता अद्भुत है! ऐसा लगता है जैसे मेरे पास एक सुपर स्मार्ट दोस्त है जो इंसानों से बेहतर कोड करता है। मैंने अपने टेस्ट से इसे चेक किया और यह सभी में पास हो गया, बिना किसी परेशानी के! बस काश यह कभी-कभी जल्दी जवाब देता। फिर भी, किसी भी कोडर के लिए जरूरी है! 🚀
¡Las habilidades de codificación de Grok son increíbles! Es como tener un amigo superinteligente que programa mejor que la mayoría de las personas. Lo probé con mis tests y pasó todos sin problemas. Solo desearía que respondiera más rápido a veces. Aún así, esencial para cualquier programador! 🚀

当X首次推出其聊天机器人时,它被隐藏在付费墙后。但正如俗话所说,没有免费的午餐(TANSTAAFL),直到最近X决定向所有人开放Grok。出于对其功能的好奇,我决定通过我的编程测试来检验它。
我一直对Grok有种特别的喜爱,这得益于它的名字,这个名字由我最喜欢的科幻作家之一罗伯特·海因莱因(Robert Heinlein)创造。海因莱因的作品在塑造我年轻时的思想方面发挥了重要作用。我的父母对我的媒体消费非常严格,但他们允许我在当地图书馆沉浸于科幻小说,假设凡是标有“科学”的东西都必须具有教育意义。
海因莱因的故事不仅有趣,还发人深省,挑战社会规范,将科学主题与社会评论交织在一起。“grok”这个词在《异乡异客》(*Stranger in a Strange Land*)中首次出现,体现了一种深刻的、基本的理解,因此非常适合作为AI聊天机器人的名字。
然而,有一个问题……
当我询问Grok使用的大型语言模型(LLM)时,它提到受到《银河系漫游指南》(*Hitchhiker's Guide to the Galaxy*)的机智和叛逆精神的启发。虽然《银河系漫游指南》确实有其魅力,但它实际上并未使用“grok”这个词。不过,我们还是继续来看编程测试吧。
1. 编写WordPress插件
这个测试要求AI展示PHP编程技能和WordPress插件开发的知识。这源于我妻子的一次现实需求,她需要一个工具为她的电子商务网站随机化每月参与设备的名称。难点在于,有些用户可能有多个条目,因此随机化工具需要确保这些名称不会被排列在一起。
代码还必须用户友好,让她可以简单地粘贴名称,点击按钮,然后获取列表。Grok以优异的表现通过了这个测试。界面简洁、功能完善,完全符合预期。
2. 重写字符串函数
第二个测试涉及修复用户报告的一个问题,该问题与验证美元和美分金额的函数有关。我的原始代码只接受整数,因此$5是有效的,但$5.25无效。Grok重写了正则表达式,接近成功。然而,它未能识别像.5这样的数字为有效货币,并且使用了效率较低的双重转换方法。所以,这个测试它失败了。
3. 寻找一个恼人的错误
这个测试要求理解WordPress框架和API,以定位一个微妙的错误。许多大型语言模型,包括我最初在内,都在这个问题上遇到了困难。但Grok完美地解决了它,提供了正确且实用的解决方案。这是三个测试中的第二个胜利。
4. 编写脚本
最后一个测试颇具挑战性,要求了解Keyboard Maestro这一小众Mac脚本工具,并能同时为多个环境编写代码:Keyboard Maestro、Chrome和AppleScript。此前只有Google Gemini和使用GPT-4或更高版本的ChatGPT通过了这个测试。然而,Grok也完美通过,取得了四个测试中的三个胜利。
最终想法
Grok在这些测试中表现得很出色。如果它能允许没有前导零的货币值,它的表现就完美了。尽管我对X自取代Twitter以来的变化有复杂的情感,但Grok已被证明是一个强大的聊天机器人,尤其是在编程技能方面。
你对Grok的看法如何?你试过它了吗?还有《异乡异客》或《银河系漫游指南》呢?在下面的评论中分享你的想法吧。再见,感谢所有的鱼!
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
Grok's coding skills blew me away! 😮 I threw some tricky Python problems at it, and it nailed them faster than my old CS prof. Makes me wonder if AI like this will soon be pair-programming with us at work. What's next, Grok writing my entire app?
Wow, Grok's coding skills are seriously impressive! I tossed some tricky Python problems at it, and it nailed them faster than my old professor could grade papers. Makes me wonder if it'll start writing my apps for me soon! 😎
Grok's coding skills blew me away! 😮 I tossed some tricky Python problems at it, and it nailed them faster than my old prof could grade papers. X opening it up for free feels like a game-changer—wonder how long it'll stay this good before they slap a paywall back on?
ग्रॉक की कोडिंग क्षमता अद्भुत है! ऐसा लगता है जैसे मेरे पास एक सुपर स्मार्ट दोस्त है जो इंसानों से बेहतर कोड करता है। मैंने अपने टेस्ट से इसे चेक किया और यह सभी में पास हो गया, बिना किसी परेशानी के! बस काश यह कभी-कभी जल्दी जवाब देता। फिर भी, किसी भी कोडर के लिए जरूरी है! 🚀
¡Las habilidades de codificación de Grok son increíbles! Es como tener un amigo superinteligente que programa mejor que la mayoría de las personas. Lo probé con mis tests y pasó todos sin problemas. Solo desearía que respondiera más rápido a veces. Aún así, esencial para cualquier programador! 🚀





首页






