Claude 3.5 Sonnetは、chatgptが支配するAIコーディングテストで創造的に苦労しています
Anthropicの新しいClaude 3.5 Sonnetの能力をテストする
先週、AnthropicからClaude 3.5 Sonnetのリリースを発表するメールを受け取りました。彼らはそれが「業界の知能の基準を引き上げ、幅広い評価で競合モデルやClaude 3 Opusを上回る」と自慢していました。また、コード生成のような複雑なタスクに最適だと主張していました。当然、私はその主張を試してみる必要がありました。
私はさまざまなAIで一連のコーディングテストを行ってきましたし、あなたもできます。詳細は、AIチャットボットのコーディング能力をテストする方法 - あなたもできるにアクセスしてください。Claude 3.5 Sonnetが私の標準テストでどのようにパフォーマンスを発揮したか、そしてMicrosoft Copilot、Meta AI、Meta Code Llama、Google Gemini Advanced、ChatGPTといった他のAIとどう比較されるかを見てみましょう。
1. WordPressプラグインの作成
最初、Claude 3.5 Sonnetは非常に有望に見えました。それが生成したユーザーインターフェースは印象的で、私がテストしたAIの中で初めてデータフィールドを横に配置したクリーンなレイアウトでした。
David Gewirtz/ZDNETによるスクリーンショット
私の注意を引いたのは、Claudeがコード生成にどのように取り組んだかです。通常のPHP、JavaScript、CSSの個別ファイルではなく、JavaScriptとCSSファイルをプラグインのディレクトリに自動生成する単一のPHPファイルを提供しました。これは革新的なアプローチでしたが、プラグインが自身のフォルダに書き込むことをOS設定が許可する必要があるため、本番環境では重大なセキュリティの欠陥となるリスクがあります。
残念ながら、創造的な解決策にもかかわらず、プラグインは機能しませんでした。「ランダム化」ボタンは何もせず、初期の有望さにもかかわらず失望させられました。
これまでのテストとの総合結果は以下の通りです:
- Claude 3.5 Sonnet:インターフェース:良好、機能:失敗
- ChatGPT GPT-4o:インターフェース:良好、機能:良好
- Microsoft Copilot:インターフェース:十分、機能:失敗
- Meta AI:インターフェース:十分、機能:失敗
- Meta Code Llama:完全な失敗
- Google Gemini Advanced:インターフェース:良好、機能:失敗
- ChatGPT 4:インターフェース:良好、機能:良好
- ChatGPT 3.5:インターフェース:良好、機能:良好
2. 文字列関数の書き換え
このテストは、AIが特定のニーズ、今回はドルとセントの変換に合わせてコードを書き換える能力を評価します。Claude 3.5 Sonnetは、先頭のゼロを削除し、整数と小数を正しく処理し、負の値を防ぐ点で良い仕事をしてくれました。また、予期しない入力に対して「0」を返す賢い対応で、エラーを回避できました。
しかし、50セントを表す「.50」のような入力を許可するという要件を満たせませんでした。これは、改訂されたコードが実際のシナリオで機能しないことを意味し、失敗と評価せざるを得ません。
総合結果は以下の通りです:
- Claude 3.5 Sonnet:失敗
- ChatGPT GPT-4o:成功
- Microsoft Copilot:失敗
- Meta AI:失敗
- Meta Code Llama:成功
- Google Gemini Advanced:失敗
- ChatGPT 4:成功
- ChatGPT 3.5:成功
3. 厄介なバグを見つける
このテストは、特定のWordPressの知識が必要な微妙なバグを見つける必要があるため、難易度が高いです。これは私自身が見逃したバグで、最初はChatGPTに頼って解決しました。
Claude 3.5 Sonnetはバグを見つけて修正しただけでなく、公開プロセス中に導入されたエラーにも気づき、それを私が修正しました。これは、すべてのテストを公開して以来、テストしたAIの中で初めてのことでした。
総合結果は以下の通りです:
- Claude 3.5 Sonnet:成功
- ChatGPT GPT-4o:成功
- Microsoft Copilot:失敗。見事に。熱狂的に。絵文字的に。
- Meta AI:成功
- Meta Code Llama:失敗
- Google Gemini Advanced:失敗
- ChatGPT 4:成功
- ChatGPT 3.5:成功
これまで、Claude 3.5 Sonnetは3つのテストのうち2つで失敗しています。最後のテストでどうなるか見てみましょう。
4. スクリプトの作成
このテストは、AppleScriptやKeyboard Maestroのような専門的なプログラミングツールに関するAIの知識をチェックします。ChatGPTは両方で熟練を示しましたが、Claude 3.5 Sonnetはそれほど上手く行きませんでした。Chromeと対話しようとするAppleScriptを作成しましたが、Keyboard Maestroのコンポーネントは完全に無視されました。
さらに、AppleScriptには構文エラーが含まれていました。大文字小文字を無視するマッチを行おうとして、Claudeはランタイムエラーを引き起こす行を生成しました:
if theTab's title contains input ignoring case then
「contains」ステートメントはすでに大文字小文字を区別しないため、「ignoring case」のフレーズが誤って配置され、エラーが発生しました。
総合結果は以下の通りです:
- Claude 3.5 Sonnet:失敗
- ChatGPT GPT-4o:成功したが留保付き
- Microsoft Copilot:失敗
- Meta AI:失敗
- Meta Code Llama:失敗
- Google Gemini Advanced:成功
- ChatGPT 4:成功
- ChatGPT 3.5:失敗
全体の結果
Claude 3.5 Sonnetの全体的なパフォーマンスを他のAIと比較すると以下の通りです:
- Claude 3.5 Sonnet:4つのうち1つ成功
- ChatGPT GPT-4o:4つのうち4つ成功、ただし1つは奇妙な二択回答
- Microsoft Copilot:4つのうち0つ成功
- Meta AI:4つのうち1つ成功
- Meta Code Llama:4つのうち1つ成功
- Google Gemini Advanced:4つのうち1つ成功
- ChatGPT 4:4つのうち4つ成功
- ChatGPT 3.5:4つのうち3つ成功
Claude 3.5 Sonnetにはかなり失望しました。Anthropicはプログラミングに適していると約束しましたが、その期待に応えられませんでした。プログラミングができないわけではありませんが、正しくプログラミングできないのです。ChatGPTを上回るAI、特にこれらのモデルがプログラミング環境に統合される中で、を見つけることを期待し続けています。しかし、今のところ、プログラミングの助けにはChatGPTを使い続けるつもりで、あなたにも同じことをお勧めします。
あなたはプログラミングにAIを使ったことがありますか?どのAIで、どんな結果でしたか?以下のコメントであなたの経験を共有してください。
ソーシャルメディアで私のプロジェクトの更新をフォローし、毎週のニュースレターを購読し、Twitter/Xの@DavidGewirtz、FacebookのFacebook.com/DavidGewirtz、InstagramのInstagram.com/DavidGewirtz、YouTubeのYouTube.com/DavidGewirtzTVで私とつながってください。
関連記事
フロリダ州が OpenAI およびサム・アルトマン氏を提訴、暴力的な事件を巡り
フロリダ州司法長官は月曜日、OpenAIおよびCEOのサム・アルトマンに対して、同州で初めてとなる民事訴訟を提起し、同社のChatGPTが複数の暴力事件と関連しているとの主張を行った。訴訟状は、OpenAIが安全上の懸念を無視して「AI軍拡競争」での勝利と巨額の富の蓄積を優先したと主張している。「本日、OpenAIおよびそのCEO、サム・アルトマンに対して、州が主導する全国初の訴訟を提起したことを発表します。」とフロリダ州司法長官のジェームズ・ウスマイアーは述べた。「OpenAIとアルトマン
OpenAI、より自然なリアルタイム会話を実現する高度な音声モデルを発表
OpenAIは、より自然な話し口を実現し、会話のやり取りをより効果的に管理できるように設計された、新しい対話型モデル「GPT-Live-1」および「GPT-Live-1 mini」をリリースしました。これらの全二重通信モデルは、話すことと聞くことを同時に行うことができるため、ユーザーが自然に会話を割り込むことが可能になり、リアルタイム翻訳などの機能も利用できるようになります。また同社は、ChatG
OpenAI、モデルファミリーの最新版「GPT-5.6」を発表
OpenAIは木曜日、最新のモデルファミリーを発表し、競争が激化するAI業界に強力な新選択肢をもたらした。GPT-5.6には、「Sol」(主力モデルとして設計されたもの)、「Terra」(ミドルレンジのオプション)、「Luna」(コストパフォーマンスに優れた選択肢)の3つのバリエーションが用意されている。これらのモデルは多岐にわたる分野で機能を拡張しており、同社は企業向けタスク、コーディング、科学
関連特集おすすめ
コメント (11)
0/500
Intéressant de voir Claude 3.5 Sonnet avoir du mal avec le codage créatif. Est-ce qu'on attend trop des IA actuellement ? Après tout, l'intelligence humaine reste unique 🤷♂️
Claude 3.5 Sonnet is pretty good, but it's no match for ChatGPT in coding tests. It's like bringing a knife to a gunfight! 😂 Still, it's an improvement over the last version, so kudos to Anthropic for trying to keep up. Maybe next time, they'll surprise us!
Claude 3.5 Sonnet é bom, mas não chega aos pés do ChatGPT em testes de codificação. É como levar uma faca para uma batalha de armas! 😂 Ainda assim, é uma melhoria em relação à versão anterior, então parabéns à Anthropic por tentar acompanhar. Talvez da próxima vez eles nos surpreendam!
クロード3.5ソネットはコードテストではChatGPTにかなわないですね。まるでナイフを持って銃撃戦に挑むようなものです!😂 でも、前バージョンよりは改善されているので、アントロピックの努力には敬意を表します。次回は驚かせてくれるかも?
Claude 3.5 Sonnet qui galère en codage, c’est un peu décevant vu les promesses d’Anthropic. 😐 ChatGPT garde l’avantage, mais la course à l’IA est fascinante !
Anthropicの新しいClaude 3.5 Sonnetの能力をテストする
先週、AnthropicからClaude 3.5 Sonnetのリリースを発表するメールを受け取りました。彼らはそれが「業界の知能の基準を引き上げ、幅広い評価で競合モデルやClaude 3 Opusを上回る」と自慢していました。また、コード生成のような複雑なタスクに最適だと主張していました。当然、私はその主張を試してみる必要がありました。
私はさまざまなAIで一連のコーディングテストを行ってきましたし、あなたもできます。詳細は、AIチャットボットのコーディング能力をテストする方法 - あなたもできるにアクセスしてください。Claude 3.5 Sonnetが私の標準テストでどのようにパフォーマンスを発揮したか、そしてMicrosoft Copilot、Meta AI、Meta Code Llama、Google Gemini Advanced、ChatGPTといった他のAIとどう比較されるかを見てみましょう。
1. WordPressプラグインの作成
最初、Claude 3.5 Sonnetは非常に有望に見えました。それが生成したユーザーインターフェースは印象的で、私がテストしたAIの中で初めてデータフィールドを横に配置したクリーンなレイアウトでした。
David Gewirtz/ZDNETによるスクリーンショット
私の注意を引いたのは、Claudeがコード生成にどのように取り組んだかです。通常のPHP、JavaScript、CSSの個別ファイルではなく、JavaScriptとCSSファイルをプラグインのディレクトリに自動生成する単一のPHPファイルを提供しました。これは革新的なアプローチでしたが、プラグインが自身のフォルダに書き込むことをOS設定が許可する必要があるため、本番環境では重大なセキュリティの欠陥となるリスクがあります。
残念ながら、創造的な解決策にもかかわらず、プラグインは機能しませんでした。「ランダム化」ボタンは何もせず、初期の有望さにもかかわらず失望させられました。
これまでのテストとの総合結果は以下の通りです:
- Claude 3.5 Sonnet:インターフェース:良好、機能:失敗
- ChatGPT GPT-4o:インターフェース:良好、機能:良好
- Microsoft Copilot:インターフェース:十分、機能:失敗
- Meta AI:インターフェース:十分、機能:失敗
- Meta Code Llama:完全な失敗
- Google Gemini Advanced:インターフェース:良好、機能:失敗
- ChatGPT 4:インターフェース:良好、機能:良好
- ChatGPT 3.5:インターフェース:良好、機能:良好
2. 文字列関数の書き換え
このテストは、AIが特定のニーズ、今回はドルとセントの変換に合わせてコードを書き換える能力を評価します。Claude 3.5 Sonnetは、先頭のゼロを削除し、整数と小数を正しく処理し、負の値を防ぐ点で良い仕事をしてくれました。また、予期しない入力に対して「0」を返す賢い対応で、エラーを回避できました。
しかし、50セントを表す「.50」のような入力を許可するという要件を満たせませんでした。これは、改訂されたコードが実際のシナリオで機能しないことを意味し、失敗と評価せざるを得ません。
総合結果は以下の通りです:
- Claude 3.5 Sonnet:失敗
- ChatGPT GPT-4o:成功
- Microsoft Copilot:失敗
- Meta AI:失敗
- Meta Code Llama:成功
- Google Gemini Advanced:失敗
- ChatGPT 4:成功
- ChatGPT 3.5:成功
3. 厄介なバグを見つける
このテストは、特定のWordPressの知識が必要な微妙なバグを見つける必要があるため、難易度が高いです。これは私自身が見逃したバグで、最初はChatGPTに頼って解決しました。
Claude 3.5 Sonnetはバグを見つけて修正しただけでなく、公開プロセス中に導入されたエラーにも気づき、それを私が修正しました。これは、すべてのテストを公開して以来、テストしたAIの中で初めてのことでした。
総合結果は以下の通りです:
- Claude 3.5 Sonnet:成功
- ChatGPT GPT-4o:成功
- Microsoft Copilot:失敗。見事に。熱狂的に。絵文字的に。
- Meta AI:成功
- Meta Code Llama:失敗
- Google Gemini Advanced:失敗
- ChatGPT 4:成功
- ChatGPT 3.5:成功
これまで、Claude 3.5 Sonnetは3つのテストのうち2つで失敗しています。最後のテストでどうなるか見てみましょう。
4. スクリプトの作成
このテストは、AppleScriptやKeyboard Maestroのような専門的なプログラミングツールに関するAIの知識をチェックします。ChatGPTは両方で熟練を示しましたが、Claude 3.5 Sonnetはそれほど上手く行きませんでした。Chromeと対話しようとするAppleScriptを作成しましたが、Keyboard Maestroのコンポーネントは完全に無視されました。
さらに、AppleScriptには構文エラーが含まれていました。大文字小文字を無視するマッチを行おうとして、Claudeはランタイムエラーを引き起こす行を生成しました:
「contains」ステートメントはすでに大文字小文字を区別しないため、「ignoring case」のフレーズが誤って配置され、エラーが発生しました。
総合結果は以下の通りです:
- Claude 3.5 Sonnet:失敗
- ChatGPT GPT-4o:成功したが留保付き
- Microsoft Copilot:失敗
- Meta AI:失敗
- Meta Code Llama:失敗
- Google Gemini Advanced:成功
- ChatGPT 4:成功
- ChatGPT 3.5:失敗
全体の結果
Claude 3.5 Sonnetの全体的なパフォーマンスを他のAIと比較すると以下の通りです:
- Claude 3.5 Sonnet:4つのうち1つ成功
- ChatGPT GPT-4o:4つのうち4つ成功、ただし1つは奇妙な二択回答
- Microsoft Copilot:4つのうち0つ成功
- Meta AI:4つのうち1つ成功
- Meta Code Llama:4つのうち1つ成功
- Google Gemini Advanced:4つのうち1つ成功
- ChatGPT 4:4つのうち4つ成功
- ChatGPT 3.5:4つのうち3つ成功
Claude 3.5 Sonnetにはかなり失望しました。Anthropicはプログラミングに適していると約束しましたが、その期待に応えられませんでした。プログラミングができないわけではありませんが、正しくプログラミングできないのです。ChatGPTを上回るAI、特にこれらのモデルがプログラミング環境に統合される中で、を見つけることを期待し続けています。しかし、今のところ、プログラミングの助けにはChatGPTを使い続けるつもりで、あなたにも同じことをお勧めします。
あなたはプログラミングにAIを使ったことがありますか?どのAIで、どんな結果でしたか?以下のコメントであなたの経験を共有してください。
ソーシャルメディアで私のプロジェクトの更新をフォローし、毎週のニュースレターを購読し、Twitter/Xの@DavidGewirtz、FacebookのFacebook.com/DavidGewirtz、InstagramのInstagram.com/DavidGewirtz、YouTubeのYouTube.com/DavidGewirtzTVで私とつながってください。
フロリダ州が OpenAI およびサム・アルトマン氏を提訴、暴力的な事件を巡り
フロリダ州司法長官は月曜日、OpenAIおよびCEOのサム・アルトマンに対して、同州で初めてとなる民事訴訟を提起し、同社のChatGPTが複数の暴力事件と関連しているとの主張を行った。訴訟状は、OpenAIが安全上の懸念を無視して「AI軍拡競争」での勝利と巨額の富の蓄積を優先したと主張している。「本日、OpenAIおよびそのCEO、サム・アルトマンに対して、州が主導する全国初の訴訟を提起したことを発表します。」とフロリダ州司法長官のジェームズ・ウスマイアーは述べた。「OpenAIとアルトマン
OpenAI、より自然なリアルタイム会話を実現する高度な音声モデルを発表
OpenAIは、より自然な話し口を実現し、会話のやり取りをより効果的に管理できるように設計された、新しい対話型モデル「GPT-Live-1」および「GPT-Live-1 mini」をリリースしました。これらの全二重通信モデルは、話すことと聞くことを同時に行うことができるため、ユーザーが自然に会話を割り込むことが可能になり、リアルタイム翻訳などの機能も利用できるようになります。また同社は、ChatG
OpenAI、モデルファミリーの最新版「GPT-5.6」を発表
OpenAIは木曜日、最新のモデルファミリーを発表し、競争が激化するAI業界に強力な新選択肢をもたらした。GPT-5.6には、「Sol」(主力モデルとして設計されたもの)、「Terra」(ミドルレンジのオプション)、「Luna」(コストパフォーマンスに優れた選択肢)の3つのバリエーションが用意されている。これらのモデルは多岐にわたる分野で機能を拡張しており、同社は企業向けタスク、コーディング、科学
Intéressant de voir Claude 3.5 Sonnet avoir du mal avec le codage créatif. Est-ce qu'on attend trop des IA actuellement ? Après tout, l'intelligence humaine reste unique 🤷♂️
Claude 3.5 Sonnet is pretty good, but it's no match for ChatGPT in coding tests. It's like bringing a knife to a gunfight! 😂 Still, it's an improvement over the last version, so kudos to Anthropic for trying to keep up. Maybe next time, they'll surprise us!
Claude 3.5 Sonnet é bom, mas não chega aos pés do ChatGPT em testes de codificação. É como levar uma faca para uma batalha de armas! 😂 Ainda assim, é uma melhoria em relação à versão anterior, então parabéns à Anthropic por tentar acompanhar. Talvez da próxima vez eles nos surpreendam!
クロード3.5ソネットはコードテストではChatGPTにかなわないですね。まるでナイフを持って銃撃戦に挑むようなものです!😂 でも、前バージョンよりは改善されているので、アントロピックの努力には敬意を表します。次回は驚かせてくれるかも?
Claude 3.5 Sonnet qui galère en codage, c’est un peu décevant vu les promesses d’Anthropic. 😐 ChatGPT garde l’avantage, mais la course à l’IA est fascinante !





家






