オプション
ニュース
Claude 3.5 Sonnetは、chatgptが支配するAIコーディングテストで創造的に苦労しています

Claude 3.5 Sonnetは、chatgptが支配するAIコーディングテストで創造的に苦労しています

2025年5月4日
199

Anthropicの新しいClaude 3.5 Sonnetの能力をテストする

先週、AnthropicからClaude 3.5 Sonnetのリリースを発表するメールを受け取りました。彼らはそれが「業界の知能の基準を引き上げ、幅広い評価で競合モデルやClaude 3 Opusを上回る」と自慢していました。また、コード生成のような複雑なタスクに最適だと主張していました。当然、私はその主張を試してみる必要がありました。

私はさまざまなAIで一連のコーディングテストを行ってきましたし、あなたもできます。詳細は、AIチャットボットのコーディング能力をテストする方法 - あなたもできるにアクセスしてください。Claude 3.5 Sonnetが私の標準テストでどのようにパフォーマンスを発揮したか、そしてMicrosoft Copilot、Meta AI、Meta Code Llama、Google Gemini Advanced、ChatGPTといった他のAIとどう比較されるかを見てみましょう。

1. WordPressプラグインの作成

最初、Claude 3.5 Sonnetは非常に有望に見えました。それが生成したユーザーインターフェースは印象的で、私がテストしたAIの中で初めてデータフィールドを横に配置したクリーンなレイアウトでした。

Claude 3.5 Sonnetが作成したWordPressプラグインのインターフェースのスクリーンショットDavid Gewirtz/ZDNETによるスクリーンショット

私の注意を引いたのは、Claudeがコード生成にどのように取り組んだかです。通常のPHP、JavaScript、CSSの個別ファイルではなく、JavaScriptとCSSファイルをプラグインのディレクトリに自動生成する単一のPHPファイルを提供しました。これは革新的なアプローチでしたが、プラグインが自身のフォルダに書き込むことをOS設定が許可する必要があるため、本番環境では重大なセキュリティの欠陥となるリスクがあります。

残念ながら、創造的な解決策にもかかわらず、プラグインは機能しませんでした。「ランダム化」ボタンは何もせず、初期の有望さにもかかわらず失望させられました。

これまでのテストとの総合結果は以下の通りです:

  • Claude 3.5 Sonnet:インターフェース:良好、機能:失敗
  • ChatGPT GPT-4o:インターフェース:良好、機能:良好
  • Microsoft Copilot:インターフェース:十分、機能:失敗
  • Meta AI:インターフェース:十分、機能:失敗
  • Meta Code Llama:完全な失敗
  • Google Gemini Advanced:インターフェース:良好、機能:失敗
  • ChatGPT 4:インターフェース:良好、機能:良好
  • ChatGPT 3.5:インターフェース:良好、機能:良好

2. 文字列関数の書き換え

このテストは、AIが特定のニーズ、今回はドルとセントの変換に合わせてコードを書き換える能力を評価します。Claude 3.5 Sonnetは、先頭のゼロを削除し、整数と小数を正しく処理し、負の値を防ぐ点で良い仕事をしてくれました。また、予期しない入力に対して「0」を返す賢い対応で、エラーを回避できました。

しかし、50セントを表す「.50」のような入力を許可するという要件を満たせませんでした。これは、改訂されたコードが実際のシナリオで機能しないことを意味し、失敗と評価せざるを得ません。

総合結果は以下の通りです:

  • Claude 3.5 Sonnet:失敗
  • ChatGPT GPT-4o:成功
  • Microsoft Copilot:失敗
  • Meta AI:失敗
  • Meta Code Llama:成功
  • Google Gemini Advanced:失敗
  • ChatGPT 4:成功
  • ChatGPT 3.5:成功

3. 厄介なバグを見つける

このテストは、特定のWordPressの知識が必要な微妙なバグを見つける必要があるため、難易度が高いです。これは私自身が見逃したバグで、最初はChatGPTに頼って解決しました。

Claude 3.5 Sonnetはバグを見つけて修正しただけでなく、公開プロセス中に導入されたエラーにも気づき、それを私が修正しました。これは、すべてのテストを公開して以来、テストしたAIの中で初めてのことでした。

総合結果は以下の通りです:

  • Claude 3.5 Sonnet:成功
  • ChatGPT GPT-4o:成功
  • Microsoft Copilot:失敗。見事に。熱狂的に。絵文字的に。
  • Meta AI:成功
  • Meta Code Llama:失敗
  • Google Gemini Advanced:失敗
  • ChatGPT 4:成功
  • ChatGPT 3.5:成功

これまで、Claude 3.5 Sonnetは3つのテストのうち2つで失敗しています。最後のテストでどうなるか見てみましょう。

4. スクリプトの作成

このテストは、AppleScriptやKeyboard Maestroのような専門的なプログラミングツールに関するAIの知識をチェックします。ChatGPTは両方で熟練を示しましたが、Claude 3.5 Sonnetはそれほど上手く行きませんでした。Chromeと対話しようとするAppleScriptを作成しましたが、Keyboard Maestroのコンポーネントは完全に無視されました。

さらに、AppleScriptには構文エラーが含まれていました。大文字小文字を無視するマッチを行おうとして、Claudeはランタイムエラーを引き起こす行を生成しました:

if theTab's title contains input ignoring case then

「contains」ステートメントはすでに大文字小文字を区別しないため、「ignoring case」のフレーズが誤って配置され、エラーが発生しました。

総合結果は以下の通りです:

  • Claude 3.5 Sonnet:失敗
  • ChatGPT GPT-4o:成功したが留保付き
  • Microsoft Copilot:失敗
  • Meta AI:失敗
  • Meta Code Llama:失敗
  • Google Gemini Advanced:成功
  • ChatGPT 4:成功
  • ChatGPT 3.5:失敗

全体の結果

Claude 3.5 Sonnetの全体的なパフォーマンスを他のAIと比較すると以下の通りです:

  • Claude 3.5 Sonnet:4つのうち1つ成功
  • ChatGPT GPT-4o:4つのうち4つ成功、ただし1つは奇妙な二択回答
  • Microsoft Copilot:4つのうち0つ成功
  • Meta AI:4つのうち1つ成功
  • Meta Code Llama:4つのうち1つ成功
  • Google Gemini Advanced:4つのうち1つ成功
  • ChatGPT 4:4つのうち4つ成功
  • ChatGPT 3.5:4つのうち3つ成功

Claude 3.5 Sonnetにはかなり失望しました。Anthropicはプログラミングに適していると約束しましたが、その期待に応えられませんでした。プログラミングができないわけではありませんが、正しくプログラミングできないのです。ChatGPTを上回るAI、特にこれらのモデルがプログラミング環境に統合される中で、を見つけることを期待し続けています。しかし、今のところ、プログラミングの助けにはChatGPTを使い続けるつもりで、あなたにも同じことをお勧めします。

あなたはプログラミングにAIを使ったことがありますか?どのAIで、どんな結果でしたか?以下のコメントであなたの経験を共有してください。

ソーシャルメディアで私のプロジェクトの更新をフォローし、毎週のニュースレターを購読し、Twitter/Xの@DavidGewirtz、FacebookのFacebook.com/DavidGewirtz、InstagramのInstagram.com/DavidGewirtz、YouTubeのYouTube.com/DavidGewirtzTVで私とつながってください。

関連記事
フロリダ州が OpenAI およびサム・アルトマン氏を提訴、暴力的な事件を巡り フロリダ州が OpenAI およびサム・アルトマン氏を提訴、暴力的な事件を巡り フロリダ州司法長官は月曜日、OpenAIおよびCEOのサム・アルトマンに対して、同州で初めてとなる民事訴訟を提起し、同社のChatGPTが複数の暴力事件と関連しているとの主張を行った。訴訟状は、OpenAIが安全上の懸念を無視して「AI軍拡競争」での勝利と巨額の富の蓄積を優先したと主張している。「本日、OpenAIおよびそのCEO、サム・アルトマンに対して、州が主導する全国初の訴訟を提起したことを発表します。」とフロリダ州司法長官のジェームズ・ウスマイアーは述べた。「OpenAIとアルトマン
OpenAI、より自然なリアルタイム会話を実現する高度な音声モデルを発表 OpenAI、より自然なリアルタイム会話を実現する高度な音声モデルを発表 OpenAIは、より自然な話し口を実現し、会話のやり取りをより効果的に管理できるように設計された、新しい対話型モデル「GPT-Live-1」および「GPT-Live-1 mini」をリリースしました。これらの全二重通信モデルは、話すことと聞くことを同時に行うことができるため、ユーザーが自然に会話を割り込むことが可能になり、リアルタイム翻訳などの機能も利用できるようになります。また同社は、ChatG
OpenAI、モデルファミリーの最新版「GPT-5.6」を発表 OpenAI、モデルファミリーの最新版「GPT-5.6」を発表 OpenAIは木曜日、最新のモデルファミリーを発表し、競争が激化するAI業界に強力な新選択肢をもたらした。GPT-5.6には、「Sol」(主力モデルとして設計されたもの)、「Terra」(ミドルレンジのオプション)、「Luna」(コストパフォーマンスに優れた選択肢)の3つのバリエーションが用意されている。これらのモデルは多岐にわたる分野で機能を拡張しており、同社は企業向けタスク、コーディング、科学
関連特集おすすめ
作曲 リミックス制作、サンプリングの準備、カラオケマスター作成のためのAIステム分離ツール
リミックス制作、サンプリングの準備、カラオケマスター作成のためのAIステム分離ツール

2026年最新・最高評価のAIステム分離ツール。リミックス制作、サンプリング準備、カラオケマスター向けに厳選されました。これらの強力で画期的なツールは、実環境でのテストを経て、正確なオーディオ分離を実現し、生産性を大幅に向上させます。 XIX.AIでは、ニーズに合った「必試」のソリューションを見つけるお手伝いをするため、無料版と有料版の比較ガイドを毎週更新して提供しています。今すぐチェックして、AIの力を最大限に活用しましょう。

8 ツール
xix.ai
データ分析 収益ダッシュボード、ファネル分析、および製品指標向けのAI SQLコピロット
収益ダッシュボード、ファネル分析、および製品指標向けのAI SQLコピロット

2026年最新かつ最も優れたAI SQLコピロットが最高評価でランクイン!XIX.AIは、毎週更新される実際の環境でのテストに対応した、強力で革新的なツール群を厳選しています。これらの必見ツールを使えば、正確な収益ダッシュボードの作成や販売プロセスの分析、製品指標の迅速な追跡が可能となり、生産性を大幅に向上させることができます。今すぐチェックして、データに基づいた意思決定に最適なツールを見つけましょう!238文字

9 ツール
xix.ai
作曲 曲のドラフト作成に最適なAIメロディ作成ツール
曲のドラフト作成に最適なAIメロディ作成ツール

2026年最新版 高評価のAIメロディ作成ツールで曲のドラフト作成!XIX.AIは、厳格な実世界テストを経て最高の作成体験を提供する、革新的な強力なコレクションを厳選しました。詳細な無料版と有料版の比較、正確なランキング、そして素晴らしい曲のドラフトを楽に作成し、創造的な生産性を大幅に向上させるためにぜひ試すべきオプションが見つかります。今すぐ探索して、あなたに最適なツールを見つけましょう!

8 ツール
xix.ai
チャットボット 面接練習用のベストなAI会話トレーニングツール
面接練習用のベストなAI会話トレーニングツール

2026年最新版・最高評価のAI会話トレーニングツールが、面接練習に最適です。XIX.AIにてご提供しています!この厳選コレクションには、現実世界での厳格なテストを経て正確なフィードバックを提供する強力なツールが含まれています。無料版と有料版の比較や詳細なランキングをご覧いただき、自信とスキルを高めるための必須オプションをお選びください。今すぐ探索して、面接成功に最適なツールを見つけましょう!

12 ツール
xix.ai
デザインとアート クリエイティブな実験に最適なAIスタイル転送ツール
クリエイティブな実験に最適なAIスタイル転送ツール

2026年版 クリエイティブな実験に最適な、最新・最高評価のAIスタイル転送ツール!XIX.AIは、実地テストと厳格なランキングを通じて卓越した結果をもたらす、強力で画期的な「必試」ツールを厳選しました。これらのトップソリューションは、コンテンツ制作を加速させ、無限の創造的可能性を切り拓くことで、クリエイターの生産性を大幅に向上させます。 今すぐチェックして、あなたにぴったりのツールを見つけ、今日から創作を始めましょう!

9 ツール
xix.ai
漫画制作 ビジュアルストーリーテリングに最適なAI吹き出しツール
ビジュアルストーリーテリングに最適なAI吹き出しツール

2026年版、ビジュアルストーリーテリングに最適な高評価AIダイアログバブルツールがXIX.AIに登場!この厳選コレクションには、クリエイターの生産性を高め、創作上のボトルネックを解消する、画期的な強力ツールが揃っています。 無料版と有料版の比較、実地テストの結果、最新のランキングを確認して、魅力的なビジュアルストーリーを構築するのに最適な、ぜひ試すべきソリューションを見つけましょう。今すぐチェックして、あなたにぴったりのツールを発見してください!

10 ツール
xix.ai
コメント (11)
0/500
CharlesYoung
CharlesYoung 2025年10月6日 23:30:46 JST

Intéressant de voir Claude 3.5 Sonnet avoir du mal avec le codage créatif. Est-ce qu'on attend trop des IA actuellement ? Après tout, l'intelligence humaine reste unique 🤷‍♂️

ScottMitchell
ScottMitchell 2025年5月5日 22:17:31 JST

Claude 3.5 Sonnet is pretty good, but it's no match for ChatGPT in coding tests. It's like bringing a knife to a gunfight! 😂 Still, it's an improvement over the last version, so kudos to Anthropic for trying to keep up. Maybe next time, they'll surprise us!

JamesMiller
JamesMiller 2025年5月5日 17:59:50 JST

Claude 3.5 Sonnet é bom, mas não chega aos pés do ChatGPT em testes de codificação. É como levar uma faca para uma batalha de armas! 😂 Ainda assim, é uma melhoria em relação à versão anterior, então parabéns à Anthropic por tentar acompanhar. Talvez da próxima vez eles nos surpreendam!

StevenNelson
StevenNelson 2025年5月5日 16:23:24 JST

クロード3.5ソネットはコードテストではChatGPTにかなわないですね。まるでナイフを持って銃撃戦に挑むようなものです!😂 でも、前バージョンよりは改善されているので、アントロピックの努力には敬意を表します。次回は驚かせてくれるかも?

JoseDavis
JoseDavis 2025年5月5日 15:46:04 JST

Claude 3.5 Sonnet qui galère en codage, c’est un peu décevant vu les promesses d’Anthropic. 😐 ChatGPT garde l’avantage, mais la course à l’IA est fascinante !

HaroldLopez
HaroldLopez 2025年5月5日 13:06:54 JST

클로드 3.5 소넷은 코드 테스트에서 ChatGPT에 비해 많이 부족해요. 마치 칼을 들고 총격전에 나서는 느낌이죠! 😂 그래도 이전 버전보다는 나아졌으니, 앤트로픽의 노력에 박수를 보냅니다. 다음에는 놀라게 해줄지 모르겠네요!

OR