DeepSeek的R1和V3编码技巧测试了:我们尚未注定
介绍DeepSeek:AI领域的新玩家
DeepSeek在周末突然崭露头角,凭借三个引人注目的原因吸引了全球关注:
- 它是一款来自中国的AI聊天机器人,与常见的美国产品明显不同。
- 它是开源的,这在科技社区中意义重大。
- 它所需的硬件基础设施远少于重量级对手,使其成为一个引人注目的选择。
虽然美国政府对TikTok及其代码可能涉及中国政府的审查引发了关注,DeepSeek来自中国自然也引起了类似关注。然而,我们这里不谈政治。相反,让我们深入探讨DeepSeek V3和DeepSeek R1在编码任务中与其他AI模型的对比。
根据DeepSeek自己的指导意见:
- 选择V3处理需要深度和准确性的任务,如解决复杂数学问题或生成复杂代码。
- 选择R1用于需要快速、高吞吐量的应用,如客户支持自动化或基本文本处理。
你可以通过聊天界面中的一个小按钮在R1和V3之间切换。如果按钮是蓝色的,你正在使用R1。

David Gewirtz/ZDNET截图 那么,它们的表现如何?两个模型都展现了潜力,但并非完美无缺。让我们来探讨结果。
测试1:打造一个WordPress插件
我的第一个测试灵感来自我妻子为她的在线小组需要一个管理参与设备的WordPress插件,这是一个经典案例。该插件需要接受一个姓名列表,对其排序,并确保重复项不挨在一起。我已将这个挑战抛给了许多AI,这是一个艰难的任务。

David Gewirtz/ZDNET截图 DeepSeek V3完美地完成了任务,创建了符合需求的界面和程序逻辑。R1采取了不同方法,在分享代码前提供了多达4502字的分析。它的界面更广泛,但界面和逻辑都有效,因此R1也通过了测试。

David Gewirtz/ZDNET截图 
David Gewirtz/ZDNET截图 到目前为止,V3和R1在四个测试中各通过了一个。
测试2:重写字符串函数
一位用户在输入美元和美分的捐款字段时遇到问题,我的原始代码不支持此功能。任务是修改程序以接受两者。DeepSeek确实生成了可运行的代码,但仍有改进空间。
V3的代码过长且重复,而R1在生成代码前的推理也冗长。两个模型都验证了最多两位小数,但它们处理超大数字的能力不足。R1使用JavaScript的Number转换而未检查边缘情况,可能导致崩溃。
有趣的是,R1提供了一份不错的测试用例列表:

David Gewirtz/ZDNET截图 我将这一分给V3,因为它的代码不会崩溃且能产生预期结果。R1因非字符串输入可能导致崩溃而失败。V3在四个测试中赢得了两场,R1赢得了一场。
测试3:追踪一个棘手的错误
这个测试源于我苦苦寻找的一个错误。挑战在于,基于错误信息的显而易见答案是错误的,这常常会误导AI。解决它需要理解WordPress API调用,超越错误信息,并精确找到错误。
V3和R1都以几乎相同的答案通过了这个测试,使V3在四个测试中赢得三场,R1赢得两场。DeepSeek已超越Gemini、Copilot、Claude和Meta的表现。
测试4:编写一个脚本
这个测试很困难,因为它涉及三个环境:AppleScript、Chrome对象模型和Keyboard Maestro。ChatGPT完美通过,但DeepSeek V3和R1表现不佳。两个模型都没能理解在Keyboard Maestro和Chrome之间拆分任务的需要,且它们的AppleScript知识薄弱。
R1做出了错误假设,例如假设始终存在前台窗口,且前台运行的程序始终是Chrome。这使得V3在四个测试中三胜一负,R1两胜两负。
最终想法
DeepSeek坚持使用Gmail等公共云邮箱而非我的企业域名令人沮丧。测试过程中还遇到了一些响应问题,导致测试时间超出预期。
我最初因以下错误无法注册:
DeepSeek的在线服务近期遭受大规模恶意攻击。为确保服务持续,注册暂时仅限+86电话号码。现有用户可正常登录。感谢您的理解和支持。
进入后,我得以运行测试。DeepSeek的代码倾向于冗长。测试4中的AppleScript既不正确又过长。测试2中的正则表达式本可以更易维护,尽管V3做对了。
V3击败了Gemini、Copilot和Meta让我印象深刻,但它仍处于旧的GPT-3.5水平,表明还有成长空间。R1的表现令人失望。如果让我选择,我会继续用ChatGPT来帮助编程。
尽管如此,对于一个在更少基础设施上运行的新工具,DeepSeek绝对值得关注。
你怎么看?你试过DeepSeek吗?你用过AI来支持编程吗?请在下方评论中告诉我们。
在社交媒体上关注我的每日项目更新,订阅我的每周简讯,并在Twitter/X上通过@DavidGewirtz、Facebook上通过Facebook.com/DavidGewirtz、Instagram上通过Instagram.com/DavidGewirtz、Bluesky上通过@DavidGewirtz.com以及YouTube上通过YouTube.com/DavidGewirtzTV与我联系。
相关文章
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
相关专题推荐
评论 (16)
0/500
DeepSeek's open-source approach is a game-changer for the AI landscape, challenging the US monopoly. It's refreshing to see innovation from China that prioritizes accessibility. While the coding skills are impressive, we must remain vigilant about potential security risks and ethical implications. This isn't the end of the world, but a new chapter in AI competition. Exciting times ahead!
Interesting take! I've been messing around with DeepSeek's R1 and V3 for a few days, and honestly, the coding output is surprisingly solid for an open-source model. The fact that it's from China and not the usual US big players makes me wonder if we're entering a new phase of AI democratization. Still, I'm not ready to throw away my GPT-4 subscription just yet — let's see how it handles edge cases and long context. 😅
Als Entwickler finde ich es super, dass jetzt auch China mit DeepSeek in den Open-Source-AI-Markt einsteigt. Die Coding-Tests klingen vielversprechend – vielleicht wird die Konkurrenz zwischen den Modellen ja endlich mal die Preise drücken. Hoffentlich bleibt das Projekt langfristig unabhängig und wird nicht von irgendwelchen Firmen vereinnahmt. 🤔
DeepSeek's open-source approach is a game-changer! I'm stoked to see a Chinese AI shaking things up. The coding skills are solid, but I wonder how it’ll stack against giants like GPT in the long run. Exciting times! 🚀
介绍DeepSeek:AI领域的新玩家
DeepSeek在周末突然崭露头角,凭借三个引人注目的原因吸引了全球关注:
- 它是一款来自中国的AI聊天机器人,与常见的美国产品明显不同。
- 它是开源的,这在科技社区中意义重大。
- 它所需的硬件基础设施远少于重量级对手,使其成为一个引人注目的选择。
虽然美国政府对TikTok及其代码可能涉及中国政府的审查引发了关注,DeepSeek来自中国自然也引起了类似关注。然而,我们这里不谈政治。相反,让我们深入探讨DeepSeek V3和DeepSeek R1在编码任务中与其他AI模型的对比。
根据DeepSeek自己的指导意见:
- 选择V3处理需要深度和准确性的任务,如解决复杂数学问题或生成复杂代码。
- 选择R1用于需要快速、高吞吐量的应用,如客户支持自动化或基本文本处理。
你可以通过聊天界面中的一个小按钮在R1和V3之间切换。如果按钮是蓝色的,你正在使用R1。
那么,它们的表现如何?两个模型都展现了潜力,但并非完美无缺。让我们来探讨结果。
测试1:打造一个WordPress插件
我的第一个测试灵感来自我妻子为她的在线小组需要一个管理参与设备的WordPress插件,这是一个经典案例。该插件需要接受一个姓名列表,对其排序,并确保重复项不挨在一起。我已将这个挑战抛给了许多AI,这是一个艰难的任务。
DeepSeek V3完美地完成了任务,创建了符合需求的界面和程序逻辑。R1采取了不同方法,在分享代码前提供了多达4502字的分析。它的界面更广泛,但界面和逻辑都有效,因此R1也通过了测试。
到目前为止,V3和R1在四个测试中各通过了一个。
测试2:重写字符串函数
一位用户在输入美元和美分的捐款字段时遇到问题,我的原始代码不支持此功能。任务是修改程序以接受两者。DeepSeek确实生成了可运行的代码,但仍有改进空间。
V3的代码过长且重复,而R1在生成代码前的推理也冗长。两个模型都验证了最多两位小数,但它们处理超大数字的能力不足。R1使用JavaScript的Number转换而未检查边缘情况,可能导致崩溃。
有趣的是,R1提供了一份不错的测试用例列表:
我将这一分给V3,因为它的代码不会崩溃且能产生预期结果。R1因非字符串输入可能导致崩溃而失败。V3在四个测试中赢得了两场,R1赢得了一场。
测试3:追踪一个棘手的错误
这个测试源于我苦苦寻找的一个错误。挑战在于,基于错误信息的显而易见答案是错误的,这常常会误导AI。解决它需要理解WordPress API调用,超越错误信息,并精确找到错误。
V3和R1都以几乎相同的答案通过了这个测试,使V3在四个测试中赢得三场,R1赢得两场。DeepSeek已超越Gemini、Copilot、Claude和Meta的表现。
测试4:编写一个脚本
这个测试很困难,因为它涉及三个环境:AppleScript、Chrome对象模型和Keyboard Maestro。ChatGPT完美通过,但DeepSeek V3和R1表现不佳。两个模型都没能理解在Keyboard Maestro和Chrome之间拆分任务的需要,且它们的AppleScript知识薄弱。
R1做出了错误假设,例如假设始终存在前台窗口,且前台运行的程序始终是Chrome。这使得V3在四个测试中三胜一负,R1两胜两负。
最终想法
DeepSeek坚持使用Gmail等公共云邮箱而非我的企业域名令人沮丧。测试过程中还遇到了一些响应问题,导致测试时间超出预期。
我最初因以下错误无法注册:
DeepSeek的在线服务近期遭受大规模恶意攻击。为确保服务持续,注册暂时仅限+86电话号码。现有用户可正常登录。感谢您的理解和支持。
进入后,我得以运行测试。DeepSeek的代码倾向于冗长。测试4中的AppleScript既不正确又过长。测试2中的正则表达式本可以更易维护,尽管V3做对了。
V3击败了Gemini、Copilot和Meta让我印象深刻,但它仍处于旧的GPT-3.5水平,表明还有成长空间。R1的表现令人失望。如果让我选择,我会继续用ChatGPT来帮助编程。
尽管如此,对于一个在更少基础设施上运行的新工具,DeepSeek绝对值得关注。
你怎么看?你试过DeepSeek吗?你用过AI来支持编程吗?请在下方评论中告诉我们。
在社交媒体上关注我的每日项目更新,订阅我的每周简讯,并在Twitter/X上通过@DavidGewirtz、Facebook上通过Facebook.com/DavidGewirtz、Instagram上通过Instagram.com/DavidGewirtz、Bluesky上通过@DavidGewirtz.com以及YouTube上通过YouTube.com/DavidGewirtzTV与我联系。
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
DeepSeek's open-source approach is a game-changer for the AI landscape, challenging the US monopoly. It's refreshing to see innovation from China that prioritizes accessibility. While the coding skills are impressive, we must remain vigilant about potential security risks and ethical implications. This isn't the end of the world, but a new chapter in AI competition. Exciting times ahead!
Interesting take! I've been messing around with DeepSeek's R1 and V3 for a few days, and honestly, the coding output is surprisingly solid for an open-source model. The fact that it's from China and not the usual US big players makes me wonder if we're entering a new phase of AI democratization. Still, I'm not ready to throw away my GPT-4 subscription just yet — let's see how it handles edge cases and long context. 😅
Als Entwickler finde ich es super, dass jetzt auch China mit DeepSeek in den Open-Source-AI-Markt einsteigt. Die Coding-Tests klingen vielversprechend – vielleicht wird die Konkurrenz zwischen den Modellen ja endlich mal die Preise drücken. Hoffentlich bleibt das Projekt langfristig unabhängig und wird nicht von irgendwelchen Firmen vereinnahmt. 🤔
DeepSeek's open-source approach is a game-changer! I'm stoked to see a Chinese AI shaking things up. The coding skills are solid, but I wonder how it’ll stack against giants like GPT in the long run. Exciting times! 🚀





首页






