Hogar
Kuaishou KwaiKAT presenta KAT-Coder-Pro V2.5, el primer modelo de codificación agentiva nacional para proyectos de extremo a extremo
Hoy, el equipo de KwaiKAT ha lanzado oficialmente KAT-Coder-Pro V2.5, su modelo insignia de programación agentica. Esta nueva versión incorpora mejoras sistemáticas en tres dimensiones clave: capacidades de ingeniería a largo plazo, capacidades agenticas generales y un sistema de aprendizaje por refuerzo agentico a gran escala. El objetivo es pasar de la simple finalización de código a un agente de IA capaz de gestionar de forma independiente tareas completas de ingeniería de software y flujos de trabajo empresariales complejos.

En cuanto a las capacidades de ingeniería a largo plazo, el equipo ha creado un proceso automatizado personalizado denominado «AutoBuilder». Esto ha aumentado la tasa de éxito en la creación de entornos de repositorio ejecutables, pasando de una media del sector de aproximadamente el 16,5 % al 57,2 %, abarcando 12 lenguajes de programación y más de 100 000 entornos de repositorio reales verificados. Además, las trayectorias de fallo de alto valor se reciclan como datos de entrenamiento, lo que permite al modelo dominar el posicionamiento entre archivos, el cumplimiento de las especificaciones del proyecto y las pruebas de autodiagnóstico.
En cuanto a las capacidades generales de Agentic, KwaiKAT desarrolló el sistema KwaiClawEnv, un conjunto de herramientas que se amplía dinámicamente. Este sistema deriva numerosos flujos de trabajo complejos a partir de tareas empresariales reales y conserva trayectorias de entrenamiento de alta calidad mediante un doble filtrado. El sistema abarca escenarios como el análisis de datos, la integración entre sistemas y el procesamiento por lotes de documentos, y admite la ejecución de tareas en más de 10 pasos.

En cuanto al entrenamiento, el equipo se alejó del ajuste fino supervisado puro y adoptó el aprendizaje por refuerzo «Agentic» a gran escala. Utilizaron «Harness Scaling» para entrenar en múltiples marcos de agentes convencionales, evitando el sobreajuste a un único formato de interacción. Se introdujo una arquitectura PPO asimétrica para abordar la asignación de créditos en tareas a largo plazo. Se diseñó un mecanismo de recompensa jerárquico (resultados de la tarea principal + restricciones de normas de comportamiento + incentivos para la exploración de fallos) con el fin de equilibrar la eficacia y la robustez. El modelo también emplea la destilación de estrategias en línea con múltiples profesores (MOPD) para integrar las capacidades de cinco modelos expertos: ingeniería a largo plazo, Agentic general, uso de terminales, estética de front-end y conocimientos generales. Como resultado, un único modelo puede ahora gestionar múltiples escenarios —escribir código, ejecutar flujos de trabajo y generar páginas de front-end— sin necesidad de cambiar de modo.
Los datos oficiales de evaluación revelan que, en ingeniería de código, la puntuación en SWE-Bench Pro es de 65,2 y la puntuación interna en KAT Code Bench es de 53,1, lo que permite gestionar directamente incidencias completas sin necesidad de descomposición manual. En cuanto a las tareas de Agentic, la puntuación en PinchBench es de 94,2 y la puntuación interna en KAT Claw Bench es de 85,5, lo que demuestra una excelente estabilidad en todo el proceso.
KAT-Coder-Pro V2.5 ya está totalmente disponible en la plataforma StreamLake (streamlake.com). Está abierto para aplicaciones API y acceso a la documentación técnica, y el equipo también ha publicado informes técnicos y grupos de intercambio para desarrolladores.
URL: https://streamlake.com/product/kat-coder
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Hoy, el equipo de KwaiKAT ha lanzado oficialmente KAT-Coder-Pro V2.5, su modelo insignia de programación agentica. Esta nueva versión incorpora mejoras sistemáticas en tres dimensiones clave: capacidades de ingeniería a largo plazo, capacidades agenticas generales y un sistema de aprendizaje por refuerzo agentico a gran escala. El objetivo es pasar de la simple finalización de código a un agente de IA capaz de gestionar de forma independiente tareas completas de ingeniería de software y flujos de trabajo empresariales complejos.

En cuanto a las capacidades de ingeniería a largo plazo, el equipo ha creado un proceso automatizado personalizado denominado «AutoBuilder». Esto ha aumentado la tasa de éxito en la creación de entornos de repositorio ejecutables, pasando de una media del sector de aproximadamente el 16,5 % al 57,2 %, abarcando 12 lenguajes de programación y más de 100 000 entornos de repositorio reales verificados. Además, las trayectorias de fallo de alto valor se reciclan como datos de entrenamiento, lo que permite al modelo dominar el posicionamiento entre archivos, el cumplimiento de las especificaciones del proyecto y las pruebas de autodiagnóstico.
En cuanto a las capacidades generales de Agentic, KwaiKAT desarrolló el sistema KwaiClawEnv, un conjunto de herramientas que se amplía dinámicamente. Este sistema deriva numerosos flujos de trabajo complejos a partir de tareas empresariales reales y conserva trayectorias de entrenamiento de alta calidad mediante un doble filtrado. El sistema abarca escenarios como el análisis de datos, la integración entre sistemas y el procesamiento por lotes de documentos, y admite la ejecución de tareas en más de 10 pasos.

En cuanto al entrenamiento, el equipo se alejó del ajuste fino supervisado puro y adoptó el aprendizaje por refuerzo «Agentic» a gran escala. Utilizaron «Harness Scaling» para entrenar en múltiples marcos de agentes convencionales, evitando el sobreajuste a un único formato de interacción. Se introdujo una arquitectura PPO asimétrica para abordar la asignación de créditos en tareas a largo plazo. Se diseñó un mecanismo de recompensa jerárquico (resultados de la tarea principal + restricciones de normas de comportamiento + incentivos para la exploración de fallos) con el fin de equilibrar la eficacia y la robustez. El modelo también emplea la destilación de estrategias en línea con múltiples profesores (MOPD) para integrar las capacidades de cinco modelos expertos: ingeniería a largo plazo, Agentic general, uso de terminales, estética de front-end y conocimientos generales. Como resultado, un único modelo puede ahora gestionar múltiples escenarios —escribir código, ejecutar flujos de trabajo y generar páginas de front-end— sin necesidad de cambiar de modo.
Los datos oficiales de evaluación revelan que, en ingeniería de código, la puntuación en SWE-Bench Pro es de 65,2 y la puntuación interna en KAT Code Bench es de 53,1, lo que permite gestionar directamente incidencias completas sin necesidad de descomposición manual. En cuanto a las tareas de Agentic, la puntuación en PinchBench es de 94,2 y la puntuación interna en KAT Claw Bench es de 85,5, lo que demuestra una excelente estabilidad en todo el proceso.
KAT-Coder-Pro V2.5 ya está totalmente disponible en la plataforma StreamLake (streamlake.com). Está abierto para aplicaciones API y acceso a la documentación técnica, y el equipo también ha publicado informes técnicos y grupos de intercambio para desarrolladores.
URL: https://streamlake.com/product/kat-coder
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











