快手KwaiKAT发布KAT-Coder-Pro V2.5,这是国内首个面向端到端项目的代理式编码模型
今天,KwaiKAT团队正式发布了其旗舰级代理式编程模型——KAT-Coder-Pro V2.5。该新版本在三个关键维度上进行了系统性升级:长期工程能力、通用代理能力以及大规模代理强化学习系统。 其目标是实现从简单的代码补全,向能够独立处理完整软件工程任务和复杂业务工作流的AI代理的进化。

在长期工程能力方面,团队构建了定制化的 AutoBuilder 自动化管道。这将创建可运行代码库环境的成功率从行业平均水平的约 16.5% 提升至 57.2%,覆盖 12 种编程语言和超过 10 万个经过验证的真实代码库环境。 此外,高价值的失败轨迹会被回收为训练数据,使模型能够掌握跨文件定位、遵循项目规范以及自我调试测试等能力。
针对通用代理能力,KwaiKAT 开发了 KwaiClawEnv 系统——一个动态扩展的工具池。该系统从真实的业务任务中衍生出大量复杂工作流,并通过双重过滤机制保留高质量的训练轨迹。 该系统涵盖数据分析、跨系统集成和批量文档处理等场景,支持超过10个步骤的任务执行。

在训练方面,团队摒弃了纯粹的监督式微调,转而采用大规模代理强化学习。他们利用“Harness Scaling”技术在多个主流代理框架上进行训练,从而避免了对单一交互格式的过拟合。 为解决长期任务中的权重分配问题,引入了非对称 PPO 架构。设计了分层奖励机制(核心任务结果 + 行为规范约束 + 失败探索激励),以平衡有效性和鲁棒性。 该模型还采用了 MOPD 多教师在线策略蒸馏技术,整合了五大专家模型的能力:长期工程、通用代理、终端使用、前端美学和通用知识。因此,单一模型现可处理多种场景——编写代码、运行工作流以及生成前端页面——而无需切换。
官方评估数据表明:在代码工程领域,SWE-Bench Pro得分为65.2,内部KAT Code Bench得分为53.1,能够直接处理完整的Issues,无需手动分解。 在 Agentic 任务方面,PinchBench 得分为 94.2,内部 KAT Claw Bench 得分为 85.5,展现出卓越的全流程稳定性。
KAT-Coder-Pro V2.5 现已在 StreamLake 平台(streamlake.com)全面上线。该平台开放 API 申请及技术文档访问,团队还发布了技术报告并开设了开发者交流群组。
网址:https://streamlake.com/product/kat-coder
相关文章
Meta 在用户强烈反对后取消了 AI 照片编辑功能
Meta,这家社交媒体巨头,再次卷入关于人工智能与用户隐私之间微妙平衡的公开辩论。据 TechCrunch 报道,Meta 的 Superintelligence Labs 本周早些时候推出了一款新的 AI 图像生成器 Muse Image。然而,一个备受好评的关键功能——允许用户通过“@”符号标记来修改和生成来自公开 Instagram 账户的图像——由于缺乏适当的通知机制,立即引发了用户以及 CAA 等机构的强烈反对。面对强烈的批评,Meta 迅速撤销了该决定,并于周五通过博客文章宣布将
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有
相关专题推荐
评论 (0)
0/500
今天,KwaiKAT团队正式发布了其旗舰级代理式编程模型——KAT-Coder-Pro V2.5。该新版本在三个关键维度上进行了系统性升级:长期工程能力、通用代理能力以及大规模代理强化学习系统。 其目标是实现从简单的代码补全,向能够独立处理完整软件工程任务和复杂业务工作流的AI代理的进化。

在长期工程能力方面,团队构建了定制化的 AutoBuilder 自动化管道。这将创建可运行代码库环境的成功率从行业平均水平的约 16.5% 提升至 57.2%,覆盖 12 种编程语言和超过 10 万个经过验证的真实代码库环境。 此外,高价值的失败轨迹会被回收为训练数据,使模型能够掌握跨文件定位、遵循项目规范以及自我调试测试等能力。
针对通用代理能力,KwaiKAT 开发了 KwaiClawEnv 系统——一个动态扩展的工具池。该系统从真实的业务任务中衍生出大量复杂工作流,并通过双重过滤机制保留高质量的训练轨迹。 该系统涵盖数据分析、跨系统集成和批量文档处理等场景,支持超过10个步骤的任务执行。

在训练方面,团队摒弃了纯粹的监督式微调,转而采用大规模代理强化学习。他们利用“Harness Scaling”技术在多个主流代理框架上进行训练,从而避免了对单一交互格式的过拟合。 为解决长期任务中的权重分配问题,引入了非对称 PPO 架构。设计了分层奖励机制(核心任务结果 + 行为规范约束 + 失败探索激励),以平衡有效性和鲁棒性。 该模型还采用了 MOPD 多教师在线策略蒸馏技术,整合了五大专家模型的能力:长期工程、通用代理、终端使用、前端美学和通用知识。因此,单一模型现可处理多种场景——编写代码、运行工作流以及生成前端页面——而无需切换。
官方评估数据表明:在代码工程领域,SWE-Bench Pro得分为65.2,内部KAT Code Bench得分为53.1,能够直接处理完整的Issues,无需手动分解。 在 Agentic 任务方面,PinchBench 得分为 94.2,内部 KAT Claw Bench 得分为 85.5,展现出卓越的全流程稳定性。
KAT-Coder-Pro V2.5 现已在 StreamLake 平台(streamlake.com)全面上线。该平台开放 API 申请及技术文档访问,团队还发布了技术报告并开设了开发者交流群组。
网址:https://streamlake.com/product/kat-coder
Meta 在用户强烈反对后取消了 AI 照片编辑功能
Meta,这家社交媒体巨头,再次卷入关于人工智能与用户隐私之间微妙平衡的公开辩论。据 TechCrunch 报道,Meta 的 Superintelligence Labs 本周早些时候推出了一款新的 AI 图像生成器 Muse Image。然而,一个备受好评的关键功能——允许用户通过“@”符号标记来修改和生成来自公开 Instagram 账户的图像——由于缺乏适当的通知机制,立即引发了用户以及 CAA 等机构的强烈反对。面对强烈的批评,Meta 迅速撤销了该决定,并于周五通过博客文章宣布将
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有





首页






