XのGrokは、AIコーディングテストでの期待を上回ります

Xが最初にチャットボットをリリースしたとき、それは有料の壁の裏に隠されていました。しかし、ことわざにあるように、「タダで昼食は食べられない(TANSTAAFL)」という状況でしたが、最近、XがGrokを全員に開放することを決定するまではそうでした。その能力に興味を持った私は、プログラミングテストを通じてそれ試してみることにしました。
私はGrokにいつも特別な愛着を持っていました。その名前のおかげです。この名前は、私が最も好きなSF作家の一人、ロバート・ハインラインによって作られました。ハインラインの作品は、私の若い心を形成する上で大きな役割を果たしました。メディアの消費に対してかなり厳格だった私の両親は、地元の図書館でSFを読むことを許してくれました。「科学」とラベル付けされたものは教育的なものに違いないという前提のもとで。
ハインラインの物語は単に面白かっただけでなく、考えさせられるもので、社会規範に挑戦し、科学的テーマと社会的解説を織り交ぜていました。『異邦人』で紹介された「grok」という言葉は、深い基本的な理解を体現しており、AIチャットボットの名前にふさわしいものです。
しかし、ここに落とし穴があります...
Grokが使用している大規模言語モデル(LLM)について尋ねたところ、*銀河ヒッチハイク・ガイド*の機知と反抗心にインスパイアされていると述べました。*ヒッチハイク*には確かに魅力がありますが、実際には「grok」という言葉は使われていません。それでは、プログラミングテストに移りましょう。
1. WordPressプラグインの作成
このテストでは、AIにPHPプログラミングスキルとWordPressプラグイン開発の知識を示すことが求められました。これは私の妻からの実際の依頼に由来しており、彼女のeコマースサイトの月次関与デバイス用に名前をランダム化するツールが必要でした。ひねりは、一部のユーザーが複数エントリーを持つ可能性があるため、ランダマイザーはこれらの名前が隣り合わないようにする必要がありました。
コードはユーザーにとって使いやすく、名前を貼り付けてボタンをクリックするだけでリストを取得できるようにする必要がありました。Grokはこのテストを見事に通過しました。インターフェースはクリーンで機能的で、求められた通りの動作をしました。
2. 文字列関数の書き換え
2番目のテストは、ドルとセントの金額を検証する関数に関するユーザー報告の問題を修正することでした。私の元のコードは整数のみを受け入れていたため、$5は有効でしたが、$5.25は無効でした。Grokは正規表現を書き換え、勝利に近づきました。しかし、.5のような数字を有効な通貨として認識できず、2重変換による非効率な方法を使用していました。よって、このテストでは負けです。
3. 厄介なバグの発見
このテストでは、WordPressフレームワークとAPIを理解して微妙なバグを特定する必要がありました。多くのLLM、最初は私自身も含めて、これに苦労しました。しかし、Grokはこれを正確かつ有用な解決策を提供し、見事に成功しました。3つのテストのうち2勝です。
4. スクリプトの作成
最後のテストは難易度が高く、ニッチなMacスクリプトツールであるKeyboard Maestroの知識と、Keyboard Maestro、Chrome、AppleScriptの複数の環境で同時にコードを書く能力が必要でした。これまでこのテストを通過したのは、Google GeminiとGPT-4以上のChatGPTだけでした。しかし、Grokはこれを見事にクリアし、4つのテストのうち3勝を確保しました。
最終的な感想
Grokはこれらのテストでよく持ちこたえました。先行ゼロなしの通貨値を受け入れていれば完璧だったでしょう。XがTwitterを置き換えてからの変化に対して複雑な気持ちを持っていますが、Grokは特にプログラミングスキルにおいて堅牢なチャットボットであることが証明されました。
Grokについてどう思いますか?試してみましたか?また、『異邦人』や*銀河ヒッチハイク・ガイド*についてはどうですか?以下のコメントであなたの考えを共有してください。それでは、また会いましょう、そしてすべての魚に感謝!
関連記事
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
アリババ・スーパーカップ:Qwen3.8-Max、強化されたコーディング機能とオフィスツールを搭載してデビュー
アリババは公式に、2.4兆パラメータを備えた次世代の基盤大規模モデル「Qwen3.8-Max」を発表しました。この重要なAIの進歩は、コーディングや専門的なオフィス業務といった中核領域において大幅なパフォーマンス向上をもたらし、堅牢な技術能力を示しています。権威あるArena大規模モデルランキングにおいて、Qwen3.8-Maxは目覚ましい結果を残し、AnthropicのClaudeシリーズに次ぐ順位で、業界リーダーの仲間入りを果たしました。このマイルストーンは、複雑なタスクの処理における国内
関連特集おすすめ
コメント (23)
0/500
Grok's coding skills blew me away! 😮 I threw some tricky Python problems at it, and it nailed them faster than my old CS prof. Makes me wonder if AI like this will soon be pair-programming with us at work. What's next, Grok writing my entire app?
Wow, Grok's coding skills are seriously impressive! I tossed some tricky Python problems at it, and it nailed them faster than my old professor could grade papers. Makes me wonder if it'll start writing my apps for me soon! 😎
Grok's coding skills blew me away! 😮 I tossed some tricky Python problems at it, and it nailed them faster than my old prof could grade papers. X opening it up for free feels like a game-changer—wonder how long it'll stay this good before they slap a paywall back on?
ग्रॉक की कोडिंग क्षमता अद्भुत है! ऐसा लगता है जैसे मेरे पास एक सुपर स्मार्ट दोस्त है जो इंसानों से बेहतर कोड करता है। मैंने अपने टेस्ट से इसे चेक किया और यह सभी में पास हो गया, बिना किसी परेशानी के! बस काश यह कभी-कभी जल्दी जवाब देता। फिर भी, किसी भी कोडर के लिए जरूरी है! 🚀
¡Las habilidades de codificación de Grok son increíbles! Es como tener un amigo superinteligente que programa mejor que la mayoría de las personas. Lo probé con mis tests y pasó todos sin problemas. Solo desearía que respondiera más rápido a veces. Aún así, esencial para cualquier programador! 🚀

Xが最初にチャットボットをリリースしたとき、それは有料の壁の裏に隠されていました。しかし、ことわざにあるように、「タダで昼食は食べられない(TANSTAAFL)」という状況でしたが、最近、XがGrokを全員に開放することを決定するまではそうでした。その能力に興味を持った私は、プログラミングテストを通じてそれ試してみることにしました。
私はGrokにいつも特別な愛着を持っていました。その名前のおかげです。この名前は、私が最も好きなSF作家の一人、ロバート・ハインラインによって作られました。ハインラインの作品は、私の若い心を形成する上で大きな役割を果たしました。メディアの消費に対してかなり厳格だった私の両親は、地元の図書館でSFを読むことを許してくれました。「科学」とラベル付けされたものは教育的なものに違いないという前提のもとで。
ハインラインの物語は単に面白かっただけでなく、考えさせられるもので、社会規範に挑戦し、科学的テーマと社会的解説を織り交ぜていました。『異邦人』で紹介された「grok」という言葉は、深い基本的な理解を体現しており、AIチャットボットの名前にふさわしいものです。
しかし、ここに落とし穴があります...
Grokが使用している大規模言語モデル(LLM)について尋ねたところ、*銀河ヒッチハイク・ガイド*の機知と反抗心にインスパイアされていると述べました。*ヒッチハイク*には確かに魅力がありますが、実際には「grok」という言葉は使われていません。それでは、プログラミングテストに移りましょう。
1. WordPressプラグインの作成
このテストでは、AIにPHPプログラミングスキルとWordPressプラグイン開発の知識を示すことが求められました。これは私の妻からの実際の依頼に由来しており、彼女のeコマースサイトの月次関与デバイス用に名前をランダム化するツールが必要でした。ひねりは、一部のユーザーが複数エントリーを持つ可能性があるため、ランダマイザーはこれらの名前が隣り合わないようにする必要がありました。
コードはユーザーにとって使いやすく、名前を貼り付けてボタンをクリックするだけでリストを取得できるようにする必要がありました。Grokはこのテストを見事に通過しました。インターフェースはクリーンで機能的で、求められた通りの動作をしました。
2. 文字列関数の書き換え
2番目のテストは、ドルとセントの金額を検証する関数に関するユーザー報告の問題を修正することでした。私の元のコードは整数のみを受け入れていたため、$5は有効でしたが、$5.25は無効でした。Grokは正規表現を書き換え、勝利に近づきました。しかし、.5のような数字を有効な通貨として認識できず、2重変換による非効率な方法を使用していました。よって、このテストでは負けです。
3. 厄介なバグの発見
このテストでは、WordPressフレームワークとAPIを理解して微妙なバグを特定する必要がありました。多くのLLM、最初は私自身も含めて、これに苦労しました。しかし、Grokはこれを正確かつ有用な解決策を提供し、見事に成功しました。3つのテストのうち2勝です。
4. スクリプトの作成
最後のテストは難易度が高く、ニッチなMacスクリプトツールであるKeyboard Maestroの知識と、Keyboard Maestro、Chrome、AppleScriptの複数の環境で同時にコードを書く能力が必要でした。これまでこのテストを通過したのは、Google GeminiとGPT-4以上のChatGPTだけでした。しかし、Grokはこれを見事にクリアし、4つのテストのうち3勝を確保しました。
最終的な感想
Grokはこれらのテストでよく持ちこたえました。先行ゼロなしの通貨値を受け入れていれば完璧だったでしょう。XがTwitterを置き換えてからの変化に対して複雑な気持ちを持っていますが、Grokは特にプログラミングスキルにおいて堅牢なチャットボットであることが証明されました。
Grokについてどう思いますか?試してみましたか?また、『異邦人』や*銀河ヒッチハイク・ガイド*についてはどうですか?以下のコメントであなたの考えを共有してください。それでは、また会いましょう、そしてすべての魚に感謝!
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
アリババ・スーパーカップ:Qwen3.8-Max、強化されたコーディング機能とオフィスツールを搭載してデビュー
アリババは公式に、2.4兆パラメータを備えた次世代の基盤大規模モデル「Qwen3.8-Max」を発表しました。この重要なAIの進歩は、コーディングや専門的なオフィス業務といった中核領域において大幅なパフォーマンス向上をもたらし、堅牢な技術能力を示しています。権威あるArena大規模モデルランキングにおいて、Qwen3.8-Maxは目覚ましい結果を残し、AnthropicのClaudeシリーズに次ぐ順位で、業界リーダーの仲間入りを果たしました。このマイルストーンは、複雑なタスクの処理における国内
Grok's coding skills blew me away! 😮 I threw some tricky Python problems at it, and it nailed them faster than my old CS prof. Makes me wonder if AI like this will soon be pair-programming with us at work. What's next, Grok writing my entire app?
Wow, Grok's coding skills are seriously impressive! I tossed some tricky Python problems at it, and it nailed them faster than my old professor could grade papers. Makes me wonder if it'll start writing my apps for me soon! 😎
Grok's coding skills blew me away! 😮 I tossed some tricky Python problems at it, and it nailed them faster than my old prof could grade papers. X opening it up for free feels like a game-changer—wonder how long it'll stay this good before they slap a paywall back on?
ग्रॉक की कोडिंग क्षमता अद्भुत है! ऐसा लगता है जैसे मेरे पास एक सुपर स्मार्ट दोस्त है जो इंसानों से बेहतर कोड करता है। मैंने अपने टेस्ट से इसे चेक किया और यह सभी में पास हो गया, बिना किसी परेशानी के! बस काश यह कभी-कभी जल्दी जवाब देता। फिर भी, किसी भी कोडर के लिए जरूरी है! 🚀
¡Las habilidades de codificación de Grok son increíbles! Es como tener un amigo superinteligente que programa mejor que la mayoría de las personas. Lo probé con mis tests y pasó todos sin problemas. Solo desearía que respondiera más rápido a veces. Aún así, esencial para cualquier programador! 🚀





家






