阿里巴巴发布 Qwen3-Coder 开源人工智能,用于自我指导代码创作
人工智能(AI)的功能已经超越了对话和文本生成等基本功能,现在已在专业领域发挥高级作用。它正在演变成能够独立规划、编写和测试软件的自主编码助手。
2025 年 7 月 23 日,阿里巴巴推出了 Qwen3-Coder,这是一个专为自主代码生成而设计的开源模型。该项目托管在 GitHub 上的 QwenLM/Qwen3-Coder 下,允许全球开发者自由访问和使用。
该项目的推出标志着将开源人工智能应用于软件开发方面取得了重大进展。像 Qwen3-Coder 这样的模型目前正在与专有的商业系统竞争。开发人员越来越需要能提供速度、准确性和透明度的工具,而 Qwen3-Coder 正是为提供这些功能而构建的,它引入了代理人工智能功能来处理复杂的编程任务。
什么是 Qwen3-Coder?
Qwen3-Coder 是阿里巴巴开发的 Qwen 系列的一部分。它的前身是 2024 年发布的 Qwen2.5,在语言和编码任务方面都表现出很强的性能。Qwen3-Coder 在此基础上更加专注于编程。
该模型有多种规模,最大的版本包含 4800 亿个参数,其中只有 350 亿个参数在推理过程中处于活动状态。这种架构既能捕捉复杂的编码模式,又能保持资源效率,兼顾准确性和速度。
阿里巴巴对 Qwen3-Coder 进行了多种编程语言的训练,支持 Python、Java 和 C++ 等主流语言以及专业领域的语言。这种多功能性使其适用于网络开发人员、嵌入式系统工程师、数据管道专家和企业软件团队。
Qwen3-Coder 的技术能力和架构
Qwen3-Coder 支持整个软件开发生命周期。它可以设计应用模块、编写单元测试并逐步解释其推理过程,因此非常适合需要精确和清晰的复杂编程任务。
该模型基于专家混合(MoE)架构。在推理过程中,只有部分参数被激活,从而在不影响性能的前提下提高了效率。
Qwen3-Coder 还支持扩展上下文窗口。默认情况下,它最多可处理 256,000 个词组,利用外推技术,可扩展到 100 万个词组。这样,该模型就可以处理大量代码库,并跟踪多个文件之间的依赖关系,从而适用于模块相互连接的企业级系统。
强化学习增强了模型的指令跟踪能力,减少了生成代码中的错误。Qwen3-Coder 还支持多代理工作流,其中一个代理生成代码,另一个代理进行测试,第三个代理编写文档,从而形成一个集成的编码生态系统。
此外,Qwen3-Coder 还能与 Visual Studio Code 等流行的开发环境无缝集成。开发人员可以在不离开工作区的情况下生成、测试和调试代码。它支持多种编程语言,包括 Python、JavaScript、Java、C++、Go 和 Rust,为网络开发、企业应用和嵌入式系统增添了价值。
总之,Qwen3-Coder 集高效性、适应性和广泛功能于一身,可为从事实际项目的个人开发者和团队提供支持。
基准测试和性能
基准测试结果表明,Qwen3-Coder 是性能最佳的开源模型之一。在 SWE-Bench Verified 测试中,旗舰版 Qwen3-Coder-480B-A35B-Instruct 的分辨率达到 55.40%。该基准评估了模型修复真实开源项目中错误的能力。
虽然某些封闭式商业模型的得分更高,如 Claude 4 Opus 的 67.60% 和 GPT-5 的 65.00%,但 Qwen3-Coder 仍是目前性能最好的开源编码模型之一,这对于寻求透明、可修改的人工智能工具的开发人员来说至关重要。
性能不仅与准确性有关,效率也很重要。阿里巴巴设计的 Qwen3-Coder 可提高推理速度,缩短完成编码任务所需的时间。这为大型项目节省了时间。
与其他同类产品相比,Qwen3-Coder 在准确性、开放性和效率方面实现了强强联合。OpenAI 的 GPT-4o 具有很高的准确性,但它是闭源和付费的。Anthropic 的 Claude 3.5 性能良好,但不开放。DeepSeek Coder 速度很快,但灵活性较差。Qwen3-Coder 为开发者提供了具有竞争力的性能,同时还可以免费访问。
阿里巴巴的内部测试还发现,Qwen3-Coder 解决遗留错误的重试次数往往少于竞争对手的模型,这在专业环境中非常有价值,因为快速修复可避免项目延误。
实际应用
Qwen3-Coder 在整个软件开发过程中都有实际应用,不仅限于研究和测试。
网络开发
它可生成前端和后端代码。开发人员用浅显的语言描述功能,模型会使用 React、Node.js 或 HTML/CSS 等框架生成功能组件,从而加快原型开发速度并减少重复性工作。
调试和遗留代码
它能扫描大型代码库,找出逻辑错误。使用 Qwen3-Coder 可以更快、更可靠地更新通常速度较慢且难以手动修复的遗留系统。
DevOps 和自动化
Qwen3-Coder 可编写部署、监控和配置脚本。将这些任务自动化可减少人工工作量并提高可靠性。与 GitHub 和 VS Code 的集成使其成为现代 DevOps 工作流程的自然之选。
教育与学习
Qwen3-Coder 循序渐进地解释编程概念,指导学生完成小型项目或说明算法。它是编码教育的有效教学助手。
安全和代码审查
它通过检查代码漏洞、提出修复建议和模拟攻击模式,协助进行基本的安全测试。虽然该功能仍在不断发展,但它支持安全开发实践。
表 1:Qwen3-Coder vs GPT-4o vs Claude 3.5 vs DeepSeek-Coder
使用案例 Qwen3-Coder GPT-4o 克劳德 3.5 奏鸣曲 深层搜索编码器 网页开发 是 - 支持 React、Node.js、HTML/CSS 生成 是 - 代码生成能力强,但封闭源代码 支持多步骤推理 是 - 速度快,但框架支持有限 调试遗留代码 是 - 扫描大型代码库,跟踪依赖关系 是 - 准确,但处理大文件时速度较慢 是 - 推理能力强,但在传统系统上速度较慢 有限 - 速度较快,但准确性较低 DevOps 自动化 是 - 编写部署脚本,支持 CLI 工具 是 - 通过 API,而非本地 有限--缺乏全面的 CLI 集成 是 - 快速编写脚本,工具使用有限 教育与教学 是 - 逐步解释概念,支持项目演练 是 - 解释清晰,不可定制 是 - 逻辑性强、清晰 有限 - 快速但不详细 安全测试 新兴 - 审查代码,模拟攻击模式 否,不是为安全任务设计的 否 - 缺乏以安全为重点的功能 否 - 不适合安全测试 工具集成 是 - 可与 VS Code、GitHub、Qwen CLI 一起使用 否 - 仅支持 API 否 - 外部工具支持有限 是--基本 CLI 支持 开放源代码 根据 Apache 2.0 许可证完全开放 已关闭 已关闭 部分开放,权重有限 可本地运行 是 - 通过抱抱脸或自定义托管 可以 不能 本地支持有限 商业用途 商业用途免费 付费 API 有限制 混合许可
2025 年的市场趋势和战略定位
2025 年,人工智能编码助手市场竞争依然激烈。主要参与者已发布了先进的模型,包括 OpenAI 的 GPT-4o、Meta 的 Code Llama 和 Anthropic 的 Claude 3.5 Sonnet。DeepSeek 等其他公司则专注于专业的编码解决方案,每种解决方案都具有独特的优势。
最近的开发人员调查(包括 2025 年 Stack Overflow 开发人员调查)显示,开发人员明显转向使用开源工具。开发人员更青睐开放模型,因为它们具有透明度、成本效益和定制潜力。虽然商业系统在某些基准中仍处于领先地位,但开源替代品正在获得更广泛的信任和采用。
作为 Apache 2.0 许可下的开源模式,Qwen3-Coder 在满足灵活、透明的人工智能工具需求的同时,也加强了阿里巴巴在全球和国内市场的地位。
Qwen3-Coder可平滑集成到现有的开发工作流程中,提供强大的性能、与标准工具的兼容性以及完全的开发人员控制。这使它成为希望获得可靠的人工智能编码协助而又不受供应商限制的团队的实用选择。
底线
Qwen3-Coder 展示了开源人工智能在软件开发中日益上升的重要性。它将强大的编码性能与效率、工具集成和广泛的语言支持相结合。它在 Apache 2.0 许可证下开放,有别于许多封闭的商业系统,为开发人员提供了灵活性和控制力。基准测试证实了其极具竞争力的性能,以及更快的调试、自动化和教学辅助等实用优势。
它能够处理大量代码库并支持多代理工作流,为协作编程开辟了新的可能性。在重视信任、透明度和适应性以及准确性的市场中,Qwen3-Coder 提供了一个全面的解决方案。对于开发人员、教育工作者和组织机构来说,它标志着在将人工智能整合为富有成效的编码伙伴方面迈出了有意义的一步。
相关文章
蚂蚁集团发布灵积3.0-flash-VL,一款拥有1240亿参数的原生多模态大模型
蚂蚁开源团队正式推出百炼系列首个原生多模态大模型 Ling-3.0-flash-VL。该模型基于 Ling-3.0-flash 的 MoE 架构构建,总参数量为 124B,每次推理仅激活 5.5B 参数。它在 256K token 的上下文窗口内原生支持图像、文本和视频输入。在开发过程中,团队优先提升了大模型在真实任务中的可靠性与效率。针对业界关于增加视觉能力可能会削弱文本智能的担忧,训练结果证明恰恰相反:原生多模态联合训练不仅拓展了应用边界,还进一步提升了文本智能。为确保精准执行,Ling
OpenAI 推迟 IPO 至 2027 年,估值飙升至 1.2 万亿美元
OpenAI,这家人工智能领域的先驱,目前正与投资者洽谈私募融资,目标估值高达令人咋舌的1.2万亿美元。这一数字标志着相较于今年3月完成122亿美元融资后852亿美元的投后估值,实现了惊人的飞跃,使该公司继续稳居私募科技融资榜首。然而,这一雄心勃勃的估值取决于其首次公开募股(IPO)在2027年前达到类似的高度。尽管最初曾考虑提前上市,但公司决定推迟至2027年,首席执行官山姆·阿尔特曼强调,1万亿美元是上市的绝对底线。主要投资者依然高度承诺。作为最大机构股东的微软已投资超过130亿美元,获得
微软经典版 Outlook 将在 Windows 10 和 11 系统上集成 Copilot AI,用于邮件起草
据Windows Latest报道,微软计划在2026年底前为Windows 10和11版的经典版Outlook推出Copilot更新,并引入“邮件起草”功能。 这一策略表明,微软正致力于将 AI 工具从新版 Outlook 扩展至传统用户,从而加速 Copilot 融入日常办公工作流。经典版 Outlook 用户将获得 AI 邮件起草工具微软计划在今年向 Microsoft 365 Copilo
相关专题推荐
评论 (1)
0/500
人工智能(AI)的功能已经超越了对话和文本生成等基本功能,现在已在专业领域发挥高级作用。它正在演变成能够独立规划、编写和测试软件的自主编码助手。
2025 年 7 月 23 日,阿里巴巴推出了 Qwen3-Coder,这是一个专为自主代码生成而设计的开源模型。该项目托管在 GitHub 上的 QwenLM/Qwen3-Coder 下,允许全球开发者自由访问和使用。
该项目的推出标志着将开源人工智能应用于软件开发方面取得了重大进展。像 Qwen3-Coder 这样的模型目前正在与专有的商业系统竞争。开发人员越来越需要能提供速度、准确性和透明度的工具,而 Qwen3-Coder 正是为提供这些功能而构建的,它引入了代理人工智能功能来处理复杂的编程任务。
什么是 Qwen3-Coder?
Qwen3-Coder 是阿里巴巴开发的 Qwen 系列的一部分。它的前身是 2024 年发布的 Qwen2.5,在语言和编码任务方面都表现出很强的性能。Qwen3-Coder 在此基础上更加专注于编程。
该模型有多种规模,最大的版本包含 4800 亿个参数,其中只有 350 亿个参数在推理过程中处于活动状态。这种架构既能捕捉复杂的编码模式,又能保持资源效率,兼顾准确性和速度。
阿里巴巴对 Qwen3-Coder 进行了多种编程语言的训练,支持 Python、Java 和 C++ 等主流语言以及专业领域的语言。这种多功能性使其适用于网络开发人员、嵌入式系统工程师、数据管道专家和企业软件团队。
Qwen3-Coder 的技术能力和架构
Qwen3-Coder 支持整个软件开发生命周期。它可以设计应用模块、编写单元测试并逐步解释其推理过程,因此非常适合需要精确和清晰的复杂编程任务。
该模型基于专家混合(MoE)架构。在推理过程中,只有部分参数被激活,从而在不影响性能的前提下提高了效率。
Qwen3-Coder 还支持扩展上下文窗口。默认情况下,它最多可处理 256,000 个词组,利用外推技术,可扩展到 100 万个词组。这样,该模型就可以处理大量代码库,并跟踪多个文件之间的依赖关系,从而适用于模块相互连接的企业级系统。
强化学习增强了模型的指令跟踪能力,减少了生成代码中的错误。Qwen3-Coder 还支持多代理工作流,其中一个代理生成代码,另一个代理进行测试,第三个代理编写文档,从而形成一个集成的编码生态系统。
此外,Qwen3-Coder 还能与 Visual Studio Code 等流行的开发环境无缝集成。开发人员可以在不离开工作区的情况下生成、测试和调试代码。它支持多种编程语言,包括 Python、JavaScript、Java、C++、Go 和 Rust,为网络开发、企业应用和嵌入式系统增添了价值。
总之,Qwen3-Coder 集高效性、适应性和广泛功能于一身,可为从事实际项目的个人开发者和团队提供支持。
基准测试和性能
基准测试结果表明,Qwen3-Coder 是性能最佳的开源模型之一。在 SWE-Bench Verified 测试中,旗舰版 Qwen3-Coder-480B-A35B-Instruct 的分辨率达到 55.40%。该基准评估了模型修复真实开源项目中错误的能力。
虽然某些封闭式商业模型的得分更高,如 Claude 4 Opus 的 67.60% 和 GPT-5 的 65.00%,但 Qwen3-Coder 仍是目前性能最好的开源编码模型之一,这对于寻求透明、可修改的人工智能工具的开发人员来说至关重要。
性能不仅与准确性有关,效率也很重要。阿里巴巴设计的 Qwen3-Coder 可提高推理速度,缩短完成编码任务所需的时间。这为大型项目节省了时间。
与其他同类产品相比,Qwen3-Coder 在准确性、开放性和效率方面实现了强强联合。OpenAI 的 GPT-4o 具有很高的准确性,但它是闭源和付费的。Anthropic 的 Claude 3.5 性能良好,但不开放。DeepSeek Coder 速度很快,但灵活性较差。Qwen3-Coder 为开发者提供了具有竞争力的性能,同时还可以免费访问。
阿里巴巴的内部测试还发现,Qwen3-Coder 解决遗留错误的重试次数往往少于竞争对手的模型,这在专业环境中非常有价值,因为快速修复可避免项目延误。
实际应用
Qwen3-Coder 在整个软件开发过程中都有实际应用,不仅限于研究和测试。
网络开发
它可生成前端和后端代码。开发人员用浅显的语言描述功能,模型会使用 React、Node.js 或 HTML/CSS 等框架生成功能组件,从而加快原型开发速度并减少重复性工作。
调试和遗留代码
它能扫描大型代码库,找出逻辑错误。使用 Qwen3-Coder 可以更快、更可靠地更新通常速度较慢且难以手动修复的遗留系统。
DevOps 和自动化
Qwen3-Coder 可编写部署、监控和配置脚本。将这些任务自动化可减少人工工作量并提高可靠性。与 GitHub 和 VS Code 的集成使其成为现代 DevOps 工作流程的自然之选。
教育与学习
Qwen3-Coder 循序渐进地解释编程概念,指导学生完成小型项目或说明算法。它是编码教育的有效教学助手。
安全和代码审查
它通过检查代码漏洞、提出修复建议和模拟攻击模式,协助进行基本的安全测试。虽然该功能仍在不断发展,但它支持安全开发实践。
表 1:Qwen3-Coder vs GPT-4o vs Claude 3.5 vs DeepSeek-Coder
| 使用案例 | Qwen3-Coder | GPT-4o | 克劳德 3.5 奏鸣曲 | 深层搜索编码器 |
| 网页开发 | 是 - 支持 React、Node.js、HTML/CSS 生成 | 是 - 代码生成能力强,但封闭源代码 | 支持多步骤推理 | 是 - 速度快,但框架支持有限 |
| 调试遗留代码 | 是 - 扫描大型代码库,跟踪依赖关系 | 是 - 准确,但处理大文件时速度较慢 | 是 - 推理能力强,但在传统系统上速度较慢 | 有限 - 速度较快,但准确性较低 |
| DevOps 自动化 | 是 - 编写部署脚本,支持 CLI 工具 | 是 - 通过 API,而非本地 | 有限--缺乏全面的 CLI 集成 | 是 - 快速编写脚本,工具使用有限 |
| 教育与教学 | 是 - 逐步解释概念,支持项目演练 | 是 - 解释清晰,不可定制 | 是 - 逻辑性强、清晰 | 有限 - 快速但不详细 |
| 安全测试 | 新兴 - 审查代码,模拟攻击模式 | 否,不是为安全任务设计的 | 否 - 缺乏以安全为重点的功能 | 否 - 不适合安全测试 |
| 工具集成 | 是 - 可与 VS Code、GitHub、Qwen CLI 一起使用 | 否 - 仅支持 API | 否 - 外部工具支持有限 | 是--基本 CLI 支持 |
| 开放源代码 | 根据 Apache 2.0 许可证完全开放 | 已关闭 | 已关闭 | 部分开放,权重有限 |
| 可本地运行 | 是 - 通过抱抱脸或自定义托管 | 可以 | 不能 | 本地支持有限 |
| 商业用途 | 商业用途免费 | 付费 API | 有限制 | 混合许可 |
2025 年的市场趋势和战略定位
2025 年,人工智能编码助手市场竞争依然激烈。主要参与者已发布了先进的模型,包括 OpenAI 的 GPT-4o、Meta 的 Code Llama 和 Anthropic 的 Claude 3.5 Sonnet。DeepSeek 等其他公司则专注于专业的编码解决方案,每种解决方案都具有独特的优势。
最近的开发人员调查(包括 2025 年 Stack Overflow 开发人员调查)显示,开发人员明显转向使用开源工具。开发人员更青睐开放模型,因为它们具有透明度、成本效益和定制潜力。虽然商业系统在某些基准中仍处于领先地位,但开源替代品正在获得更广泛的信任和采用。
作为 Apache 2.0 许可下的开源模式,Qwen3-Coder 在满足灵活、透明的人工智能工具需求的同时,也加强了阿里巴巴在全球和国内市场的地位。
Qwen3-Coder可平滑集成到现有的开发工作流程中,提供强大的性能、与标准工具的兼容性以及完全的开发人员控制。这使它成为希望获得可靠的人工智能编码协助而又不受供应商限制的团队的实用选择。
底线
Qwen3-Coder 展示了开源人工智能在软件开发中日益上升的重要性。它将强大的编码性能与效率、工具集成和广泛的语言支持相结合。它在 Apache 2.0 许可证下开放,有别于许多封闭的商业系统,为开发人员提供了灵活性和控制力。基准测试证实了其极具竞争力的性能,以及更快的调试、自动化和教学辅助等实用优势。
它能够处理大量代码库并支持多代理工作流,为协作编程开辟了新的可能性。在重视信任、透明度和适应性以及准确性的市场中,Qwen3-Coder 提供了一个全面的解决方案。对于开发人员、教育工作者和组织机构来说,它标志着在将人工智能整合为富有成效的编码伙伴方面迈出了有意义的一步。
蚂蚁集团发布灵积3.0-flash-VL,一款拥有1240亿参数的原生多模态大模型
蚂蚁开源团队正式推出百炼系列首个原生多模态大模型 Ling-3.0-flash-VL。该模型基于 Ling-3.0-flash 的 MoE 架构构建,总参数量为 124B,每次推理仅激活 5.5B 参数。它在 256K token 的上下文窗口内原生支持图像、文本和视频输入。在开发过程中,团队优先提升了大模型在真实任务中的可靠性与效率。针对业界关于增加视觉能力可能会削弱文本智能的担忧,训练结果证明恰恰相反:原生多模态联合训练不仅拓展了应用边界,还进一步提升了文本智能。为确保精准执行,Ling
OpenAI 推迟 IPO 至 2027 年,估值飙升至 1.2 万亿美元
OpenAI,这家人工智能领域的先驱,目前正与投资者洽谈私募融资,目标估值高达令人咋舌的1.2万亿美元。这一数字标志着相较于今年3月完成122亿美元融资后852亿美元的投后估值,实现了惊人的飞跃,使该公司继续稳居私募科技融资榜首。然而,这一雄心勃勃的估值取决于其首次公开募股(IPO)在2027年前达到类似的高度。尽管最初曾考虑提前上市,但公司决定推迟至2027年,首席执行官山姆·阿尔特曼强调,1万亿美元是上市的绝对底线。主要投资者依然高度承诺。作为最大机构股东的微软已投资超过130亿美元,获得
微软经典版 Outlook 将在 Windows 10 和 11 系统上集成 Copilot AI,用于邮件起草
据Windows Latest报道,微软计划在2026年底前为Windows 10和11版的经典版Outlook推出Copilot更新,并引入“邮件起草”功能。 这一策略表明,微软正致力于将 AI 工具从新版 Outlook 扩展至传统用户,从而加速 Copilot 融入日常办公工作流。经典版 Outlook 用户将获得 AI 邮件起草工具微软计划在今年向 Microsoft 365 Copilo





首页






