DeepseekのR1およびV3コーディングスキルをテストしました:私たちはまだ運命づけられていません
DeepSeekの紹介:AIアリーナの新参者
DeepSeekは週末に突如登場し、3つの魅力的な理由で世界中の注目を集めました:
- 中国発のAIチャットボットで、通常の米国発の製品とは一線を画しています。
- オープンソースであり、テックコミュニティにとって大きな意味を持ちます。
- 重量級の競合他社よりも大幅に少ないインフラで動作し、多くの人にとって魅力的な選択肢となっています。
米国政府がTikTokやそのコードに中国政府が関与している可能性について厳しい監視を行っている中、DeepSeekが中国から登場したことで当然注目が集まっています。ただし、ここでは政治には触れません。代わりに、DeepSeek V3とDeepSeek R1がコーディングタスクで他のAIモデルとどのように競合するかを見ていきましょう。
DeepSeek自身のガイダンスによると:
- 複雑な数学問題の解決や複雑なコード生成など、深さと正確さが求められるタスクにはV3を選びましょう。
- カスタマーサポートの自動化や基本的なテキスト処理など、迅速で大量のアプリケーションが必要な場合はR1を選びましょう。
チャットインターフェースの小さなボタンでR1とV3を切り替えることができます。ボタンが青い場合はR1を使用しています。

David Gewirtz/ZDNETによるスクリーンショット では、結果はどうだったでしょうか?両モデルとも有望な結果を示しましたが、完璧ではありませんでした。結果を探ってみましょう。
テスト1:WordPressプラグインの作成
妻がオンライングループ用の参加デバイスを管理するWordPressプラグインを必要としていたことにインスパイアされた最初のテストは、クラシックなものでした。プラグインは名前のリストを受け取り、並べ替え、重複が隣り合わないようにする必要がありました。この課題は多くのAIに投げかけてきましたが、難しいものです。

David Gewirtz/ZDNETによるスクリーンショット DeepSeek V3は完璧にクリアし、要件を完全に満たすユーザーインターフェースとプログラムロジックを作成しました。R1は異なるアプローチを取り、コードを共有する前に4502語もの分析を提供しました。UIはより広範でしたが、UIもロジックも機能したため、R1も合格しました。

David Gewirtz/ZDNETによるスクリーンショット 
David Gewirtz/ZDNETによるスクリーンショット これまでのところ、V3とR1は4つのテストのうち1つを合格しました。
テスト2:文字列関数の書き換え
ユーザーが寄付フィールドにドルとセントを入力するのに問題があり、元のコードではそれが許可されていませんでした。タスクは両方を許可するようにルーチンを変更することでした。DeepSeekは機能するコードを生成しましたが、改善の余地があります。
V3のコードは長すぎて繰り返しが多く、R1のコード生成前の推論も長かったです。両モデルとも小数点以下2桁まで検証しましたが、非常に大きな数値の処理は得意ではありませんでした。R1がJavaScriptのNumber変換を使用し、エッジケースをチェックしなかったため、クラッシュする可能性があります。
興味深いことに、R1はテストケースの優れたリストを提供しました:

David Gewirtz/ZDNETによるスクリーンショット V3はコードがクラッシュせず、期待通りの結果を出すため、ポイントを獲得します。R1は非文字列入力によるクラッシュの可能性があるため失敗です。これでV3は4つのテスト中2勝、R1は1勝です。
テスト3:厄介なバグの追跡
このテストは私が苦労して見つけたバグに由来します。エラーメッセージに基づく明らかな答えが間違っており、AIをしばしば騙します。解決にはWordPress APIコールを理解し、エラーメッセージを越えて見て、バグを特定する必要があります。
V3とR1はほぼ同じ答えでこのテストに合格し、V3は4つのテスト中3勝、R1は2勝となりました。DeepSeekはすでにGemini、Copilot、Claude、Metaを上回っています。
テスト4:スクリプトの作成
このテストは、AppleScript、Chromeオブジェクトモデル、Keyboard Maestroの3つの環境が関わるため難しいです。ChatGPTはこれを完璧にこなしましたが、DeepSeek V3とR1は不十分でした。どちらのモデルもKeyboard MaestroとChromeのタスク分割の必要性を理解せず、AppleScriptの知識も弱かったです。
R1は、フロントウィンドウが常に存在し、実行中のプログラムが常にChromeであるという誤った前提を立てました。これにより、V3は3つのテストに合格し1つ失敗、R1は2つのテストに合格し2つ失敗しました。
最終的な感想
DeepSeekがGmailのようなパブリッククラウドメールを使用することを強制し、企業ドメインを認めなかったのは苛立たしいものでした。テストに予想以上の時間がかかる応答性の問題もありました。
当初、このエラーでサインアップに苦労しました:
DeepSeekのオンラインサービスは最近、大規模な悪意ある攻撃に直面しています。サービスの継続を確保するため、登録は一時的に+86の電話番号に制限されています。既存のユーザーは通常通りログインできます。ご理解とご支援に感謝します。
ログイン後、テストを実行できました。DeepSeekのコードは冗長な傾向があります。テスト4のAppleScriptは不正確で不必要に長かったです。テスト2の正規表現はもっとメンテナンスしやすかったはずですが、V3は正しく処理しました。
V3がGemini、Copilot、Metaを上回ったのは印象的ですが、旧GPT-3.5レベルにとどまっており、成長の余地があります。R1のパフォーマンスは失望でした。選択肢があるなら、プログラミングの助けにはChatGPTを選びます。
それでも、はるかに少ないインフラで動作する新しいツールとして、DeepSeekは注目すべき存在です。
あなたの意見はどうですか?DeepSeekを試しましたか?プログラミング支援にAIを使っていますか?以下のコメントで教えてください。
ソーシャルメディアで私の毎日のプロジェクト更新をフォローし、毎週のニュースレターを購読し、Twitter/Xの@DavidGewirtz、FacebookのFacebook.com/DavidGewirtz、InstagramのInstagram.com/DavidGewirtz、Blueskyの@DavidGewirtz.com、YouTubeのYouTube.com/DavidGewirtzTVで私とつながってください。
関連記事
Anthropic、ClaudeのAIコーディングツールを日本に拡大し、海外成長を促進
Anthropic、米国の主要な人工知能企業は、グローバルな展開を強化している。水曜日、同社は東京で「Code with Claude」と題された大規模な開発者向けイベントを開催し、約500人のソフトウェアエンジニアが集まった。この取り組みは、Claude AIツールおよび関連製品を日本市場に積極的に導入することを目的としており、自律的なコーディング機能による企業生産性の向上という中核的な利点を強調している。自動化されたコード生成への重点本イベントにおいて、Anthropicは複雑なプログラ
インドのソフトウェア大手が採用を縮小し、AI エージェントの拡大に伴い解雇はないと約束
人工知能が従来の労働集約型ビジネスモデルを再構築する中、インドを代表するソフトウェアアウトソーシング企業であるタタ・コンサルテーション・サービスズ(TCS)は、その戦略的対応を明らかにしました。火曜日の定時株主総会において、会長は人間と機械の協働に関するビジョンを提示し、AI時代における同社の workforce 戦略を明確にしました。人員整理は行わないが、採用は鈍化TCSの会長は、AI導入により人員整理を行う計画はないものの、全体的な採用ペースは鈍化すると明確に述べました。TCSは以前、1
中国はGaokam中にAIモデルをロックし、即時の宿題支援をブロックしている
2026年の大学入試(Gaokao)が間近に迫る中、試験期間中にAIツールの利用停止に関する噂がインターネット上で激しい議論を巻き起こしている。世間の懸念に応えるため、主要なAIプラットフォームおよび教育アプリは、完全な禁止ではなく、試験関連機能に対して対象を絞った「時間制限ロック」を実施する方針を明らかにした。これらのプラットフォームは、正確な時間ベースの制御メカニズムを採用している。公式の試験時間中には、写真による問題解決や問題分析などの機能が一時的に無効化される。しかし、日常の会話機能や
関連特集おすすめ
コメント (16)
0/500
DeepSeek's open-source approach is a game-changer for the AI landscape, challenging the US monopoly. It's refreshing to see innovation from China that prioritizes accessibility. While the coding skills are impressive, we must remain vigilant about potential security risks and ethical implications. This isn't the end of the world, but a new chapter in AI competition. Exciting times ahead!
Interesting take! I've been messing around with DeepSeek's R1 and V3 for a few days, and honestly, the coding output is surprisingly solid for an open-source model. The fact that it's from China and not the usual US big players makes me wonder if we're entering a new phase of AI democratization. Still, I'm not ready to throw away my GPT-4 subscription just yet — let's see how it handles edge cases and long context. 😅
Als Entwickler finde ich es super, dass jetzt auch China mit DeepSeek in den Open-Source-AI-Markt einsteigt. Die Coding-Tests klingen vielversprechend – vielleicht wird die Konkurrenz zwischen den Modellen ja endlich mal die Preise drücken. Hoffentlich bleibt das Projekt langfristig unabhängig und wird nicht von irgendwelchen Firmen vereinnahmt. 🤔
DeepSeek's open-source approach is a game-changer! I'm stoked to see a Chinese AI shaking things up. The coding skills are solid, but I wonder how it’ll stack against giants like GPT in the long run. Exciting times! 🚀
DeepSeekの紹介:AIアリーナの新参者
DeepSeekは週末に突如登場し、3つの魅力的な理由で世界中の注目を集めました:
- 中国発のAIチャットボットで、通常の米国発の製品とは一線を画しています。
- オープンソースであり、テックコミュニティにとって大きな意味を持ちます。
- 重量級の競合他社よりも大幅に少ないインフラで動作し、多くの人にとって魅力的な選択肢となっています。
米国政府がTikTokやそのコードに中国政府が関与している可能性について厳しい監視を行っている中、DeepSeekが中国から登場したことで当然注目が集まっています。ただし、ここでは政治には触れません。代わりに、DeepSeek V3とDeepSeek R1がコーディングタスクで他のAIモデルとどのように競合するかを見ていきましょう。
DeepSeek自身のガイダンスによると:
- 複雑な数学問題の解決や複雑なコード生成など、深さと正確さが求められるタスクにはV3を選びましょう。
- カスタマーサポートの自動化や基本的なテキスト処理など、迅速で大量のアプリケーションが必要な場合はR1を選びましょう。
チャットインターフェースの小さなボタンでR1とV3を切り替えることができます。ボタンが青い場合はR1を使用しています。
では、結果はどうだったでしょうか?両モデルとも有望な結果を示しましたが、完璧ではありませんでした。結果を探ってみましょう。
テスト1:WordPressプラグインの作成
妻がオンライングループ用の参加デバイスを管理するWordPressプラグインを必要としていたことにインスパイアされた最初のテストは、クラシックなものでした。プラグインは名前のリストを受け取り、並べ替え、重複が隣り合わないようにする必要がありました。この課題は多くのAIに投げかけてきましたが、難しいものです。
DeepSeek V3は完璧にクリアし、要件を完全に満たすユーザーインターフェースとプログラムロジックを作成しました。R1は異なるアプローチを取り、コードを共有する前に4502語もの分析を提供しました。UIはより広範でしたが、UIもロジックも機能したため、R1も合格しました。
これまでのところ、V3とR1は4つのテストのうち1つを合格しました。
テスト2:文字列関数の書き換え
ユーザーが寄付フィールドにドルとセントを入力するのに問題があり、元のコードではそれが許可されていませんでした。タスクは両方を許可するようにルーチンを変更することでした。DeepSeekは機能するコードを生成しましたが、改善の余地があります。
V3のコードは長すぎて繰り返しが多く、R1のコード生成前の推論も長かったです。両モデルとも小数点以下2桁まで検証しましたが、非常に大きな数値の処理は得意ではありませんでした。R1がJavaScriptのNumber変換を使用し、エッジケースをチェックしなかったため、クラッシュする可能性があります。
興味深いことに、R1はテストケースの優れたリストを提供しました:
V3はコードがクラッシュせず、期待通りの結果を出すため、ポイントを獲得します。R1は非文字列入力によるクラッシュの可能性があるため失敗です。これでV3は4つのテスト中2勝、R1は1勝です。
テスト3:厄介なバグの追跡
このテストは私が苦労して見つけたバグに由来します。エラーメッセージに基づく明らかな答えが間違っており、AIをしばしば騙します。解決にはWordPress APIコールを理解し、エラーメッセージを越えて見て、バグを特定する必要があります。
V3とR1はほぼ同じ答えでこのテストに合格し、V3は4つのテスト中3勝、R1は2勝となりました。DeepSeekはすでにGemini、Copilot、Claude、Metaを上回っています。
テスト4:スクリプトの作成
このテストは、AppleScript、Chromeオブジェクトモデル、Keyboard Maestroの3つの環境が関わるため難しいです。ChatGPTはこれを完璧にこなしましたが、DeepSeek V3とR1は不十分でした。どちらのモデルもKeyboard MaestroとChromeのタスク分割の必要性を理解せず、AppleScriptの知識も弱かったです。
R1は、フロントウィンドウが常に存在し、実行中のプログラムが常にChromeであるという誤った前提を立てました。これにより、V3は3つのテストに合格し1つ失敗、R1は2つのテストに合格し2つ失敗しました。
最終的な感想
DeepSeekがGmailのようなパブリッククラウドメールを使用することを強制し、企業ドメインを認めなかったのは苛立たしいものでした。テストに予想以上の時間がかかる応答性の問題もありました。
当初、このエラーでサインアップに苦労しました:
DeepSeekのオンラインサービスは最近、大規模な悪意ある攻撃に直面しています。サービスの継続を確保するため、登録は一時的に+86の電話番号に制限されています。既存のユーザーは通常通りログインできます。ご理解とご支援に感謝します。
ログイン後、テストを実行できました。DeepSeekのコードは冗長な傾向があります。テスト4のAppleScriptは不正確で不必要に長かったです。テスト2の正規表現はもっとメンテナンスしやすかったはずですが、V3は正しく処理しました。
V3がGemini、Copilot、Metaを上回ったのは印象的ですが、旧GPT-3.5レベルにとどまっており、成長の余地があります。R1のパフォーマンスは失望でした。選択肢があるなら、プログラミングの助けにはChatGPTを選びます。
それでも、はるかに少ないインフラで動作する新しいツールとして、DeepSeekは注目すべき存在です。
あなたの意見はどうですか?DeepSeekを試しましたか?プログラミング支援にAIを使っていますか?以下のコメントで教えてください。
ソーシャルメディアで私の毎日のプロジェクト更新をフォローし、毎週のニュースレターを購読し、Twitter/Xの@DavidGewirtz、FacebookのFacebook.com/DavidGewirtz、InstagramのInstagram.com/DavidGewirtz、Blueskyの@DavidGewirtz.com、YouTubeのYouTube.com/DavidGewirtzTVで私とつながってください。
Anthropic、ClaudeのAIコーディングツールを日本に拡大し、海外成長を促進
Anthropic、米国の主要な人工知能企業は、グローバルな展開を強化している。水曜日、同社は東京で「Code with Claude」と題された大規模な開発者向けイベントを開催し、約500人のソフトウェアエンジニアが集まった。この取り組みは、Claude AIツールおよび関連製品を日本市場に積極的に導入することを目的としており、自律的なコーディング機能による企業生産性の向上という中核的な利点を強調している。自動化されたコード生成への重点本イベントにおいて、Anthropicは複雑なプログラ
インドのソフトウェア大手が採用を縮小し、AI エージェントの拡大に伴い解雇はないと約束
人工知能が従来の労働集約型ビジネスモデルを再構築する中、インドを代表するソフトウェアアウトソーシング企業であるタタ・コンサルテーション・サービスズ(TCS)は、その戦略的対応を明らかにしました。火曜日の定時株主総会において、会長は人間と機械の協働に関するビジョンを提示し、AI時代における同社の workforce 戦略を明確にしました。人員整理は行わないが、採用は鈍化TCSの会長は、AI導入により人員整理を行う計画はないものの、全体的な採用ペースは鈍化すると明確に述べました。TCSは以前、1
中国はGaokam中にAIモデルをロックし、即時の宿題支援をブロックしている
2026年の大学入試(Gaokao)が間近に迫る中、試験期間中にAIツールの利用停止に関する噂がインターネット上で激しい議論を巻き起こしている。世間の懸念に応えるため、主要なAIプラットフォームおよび教育アプリは、完全な禁止ではなく、試験関連機能に対して対象を絞った「時間制限ロック」を実施する方針を明らかにした。これらのプラットフォームは、正確な時間ベースの制御メカニズムを採用している。公式の試験時間中には、写真による問題解決や問題分析などの機能が一時的に無効化される。しかし、日常の会話機能や
DeepSeek's open-source approach is a game-changer for the AI landscape, challenging the US monopoly. It's refreshing to see innovation from China that prioritizes accessibility. While the coding skills are impressive, we must remain vigilant about potential security risks and ethical implications. This isn't the end of the world, but a new chapter in AI competition. Exciting times ahead!
Interesting take! I've been messing around with DeepSeek's R1 and V3 for a few days, and honestly, the coding output is surprisingly solid for an open-source model. The fact that it's from China and not the usual US big players makes me wonder if we're entering a new phase of AI democratization. Still, I'm not ready to throw away my GPT-4 subscription just yet — let's see how it handles edge cases and long context. 😅
Als Entwickler finde ich es super, dass jetzt auch China mit DeepSeek in den Open-Source-AI-Markt einsteigt. Die Coding-Tests klingen vielversprechend – vielleicht wird die Konkurrenz zwischen den Modellen ja endlich mal die Preise drücken. Hoffentlich bleibt das Projekt langfristig unabhängig und wird nicht von irgendwelchen Firmen vereinnahmt. 🤔
DeepSeek's open-source approach is a game-changer! I'm stoked to see a Chinese AI shaking things up. The coding skills are solid, but I wonder how it’ll stack against giants like GPT in the long run. Exciting times! 🚀





家






