Hogar
Microsoft presenta una herramienta para que los desarrolladores creen pruebas de comportamiento de IA a partir de descripciones de texto
Los investigadores y los laboratorios especializados en IA han logrado avances significativos en la evaluación de los modelos de IA en cuanto a seguridad, cumplimiento normativo, adulación y alineación. Sin embargo, las empresas y los desarrolladores se enfrentan ahora a un reto concreto: garantizar que sus sistemas de IA se comporten exactamente como se pretende para su producto o servicio concreto.
Para simplificar ese proceso de pruebas, Microsoft presentó el martes ASSERT, acrónimo de «Adaptive Spec-driven Scoring for Evaluation and Regression Testing» (Puntuación adaptativa basada en especificaciones para pruebas de evaluación y regresión).
Según Microsoft, este marco de código abierto facilita la evaluación del comportamiento de la IA específico de cada aplicación. Utiliza la IA para convertir descripciones de alto nivel, en lenguaje natural, de objetivos, políticas o comportamientos previstos en pruebas exhaustivas y puntuadas que pueden examinarse.
ASSERT acepta descripciones en lenguaje sencillo del comportamiento y las políticas esperados de un modelo de IA y, a continuación, las transforma en un conjunto estructurado de comportamientos aceptables e inaceptables. Genera escenarios problemáticos y casos de prueba, los ejecuta en el sistema de destino y puntúa los resultados. El marco también registra las rutas del sistema de IA, incluidas las acciones intermedias y las llamadas a herramientas, lo que permite a los desarrolladores inspeccionar dónde se producen los fallos.
Los desarrolladores también pueden proporcionar el contexto del sistema, las herramientas y las restricciones para personalizar aún más el alcance de las evaluaciones.
Por ejemplo, un desarrollador podría especificar que un agente de IA dedicado a la búsqueda de documentos no debe enviar correos electrónicos a personas ajenas a la empresa, debe restringir el acceso a la información confidencial a los directivos de alto nivel y debe proporcionar resúmenes concisos teniendo en cuenta el contexto previo. A continuación, ASSERT utiliza esas reglas para generar casos de prueba que comprueban continuamente si el sistema las cumple.

Créditos de la imagen:Microsoft
Según Microsoft, el marco cubre una laguna que las evaluaciones más amplias y generales no pueden abordar cuando se pretende que los modelos de IA se comporten de acuerdo con el contexto, las políticas y las herramientas de una aplicación o un producto.
«Una de las cosas que hemos aprendido es que las evaluaciones son absolutamente fundamentales para tomar buenas decisiones», afirmó Sarah Bird, directora de producto de IA Responsable en Microsoft. «Porque si no se comprende el comportamiento del sistema de IA, resulta muy difícil saber si cumple con los estándares de la organización […] Lo que hemos descubierto es que, si realmente se quiere un sistema fiable, hay que evaluar muchas más dimensiones específicas de cada aplicación».
Bird señaló que ASSERT puede utilizarse para evaluar sistemas durante su desarrollo, tras su implementación y para la supervisión continua.
Este lanzamiento se produce en medio de un cambio gradual, pero cada vez más amplio, en el sector de la IA. A medida que los modelos ganan en capacidad, los investigadores se centran en pruebas repetibles y comprobaciones de regresión. HELM, de Stanford; AILuminate, de MLCommons; y grupos de evaluación como METR están poniendo en marcha pruebas de referencia para medir cómo se comportan los modelos en diferentes condiciones.
Artículo relacionado
Microsoft retira herramientas de IA fallidas y consolida las aplicaciones de Copilot
Hace dos años, Microsoft caracterizó a la IA como un “cambio generacional” en la tecnología que tenía como objetivo liderar. Hoy, la empresa está consolidando sus aplicaciones de consumo y empresariales con la marca Copilot, al tiempo que descontinúa
Microsoft reportedly entrena al personal de ventas para superar a los competidores OpenAI y Anthropic
Microsoft estaría preparando a su fuerza de ventas para intensificar la competencia contra sus principales rivales en el sector de la inteligencia artificial.Según un informe de Bloomberg, los ejecutivos celebraron una sesión estratégica interna el
¿Podría esto marcar el inicio de una crisis para las economías basadas en tokens?
Microsoft ha introducido recientemente ajustes significativos en los precios de GitHub Copilot; cambios tan sustanciales que un usuario de Reddit calificó la situación dentro de su empresa como una “Tokenpocalypse”.En el episodio más reciente del po
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Los investigadores y los laboratorios especializados en IA han logrado avances significativos en la evaluación de los modelos de IA en cuanto a seguridad, cumplimiento normativo, adulación y alineación. Sin embargo, las empresas y los desarrolladores se enfrentan ahora a un reto concreto: garantizar que sus sistemas de IA se comporten exactamente como se pretende para su producto o servicio concreto.
Para simplificar ese proceso de pruebas, Microsoft presentó el martes ASSERT, acrónimo de «Adaptive Spec-driven Scoring for Evaluation and Regression Testing» (Puntuación adaptativa basada en especificaciones para pruebas de evaluación y regresión).
Según Microsoft, este marco de código abierto facilita la evaluación del comportamiento de la IA específico de cada aplicación. Utiliza la IA para convertir descripciones de alto nivel, en lenguaje natural, de objetivos, políticas o comportamientos previstos en pruebas exhaustivas y puntuadas que pueden examinarse.
ASSERT acepta descripciones en lenguaje sencillo del comportamiento y las políticas esperados de un modelo de IA y, a continuación, las transforma en un conjunto estructurado de comportamientos aceptables e inaceptables. Genera escenarios problemáticos y casos de prueba, los ejecuta en el sistema de destino y puntúa los resultados. El marco también registra las rutas del sistema de IA, incluidas las acciones intermedias y las llamadas a herramientas, lo que permite a los desarrolladores inspeccionar dónde se producen los fallos.
Los desarrolladores también pueden proporcionar el contexto del sistema, las herramientas y las restricciones para personalizar aún más el alcance de las evaluaciones.
Por ejemplo, un desarrollador podría especificar que un agente de IA dedicado a la búsqueda de documentos no debe enviar correos electrónicos a personas ajenas a la empresa, debe restringir el acceso a la información confidencial a los directivos de alto nivel y debe proporcionar resúmenes concisos teniendo en cuenta el contexto previo. A continuación, ASSERT utiliza esas reglas para generar casos de prueba que comprueban continuamente si el sistema las cumple.

Créditos de la imagen:Microsoft
Según Microsoft, el marco cubre una laguna que las evaluaciones más amplias y generales no pueden abordar cuando se pretende que los modelos de IA se comporten de acuerdo con el contexto, las políticas y las herramientas de una aplicación o un producto.
«Una de las cosas que hemos aprendido es que las evaluaciones son absolutamente fundamentales para tomar buenas decisiones», afirmó Sarah Bird, directora de producto de IA Responsable en Microsoft. «Porque si no se comprende el comportamiento del sistema de IA, resulta muy difícil saber si cumple con los estándares de la organización […] Lo que hemos descubierto es que, si realmente se quiere un sistema fiable, hay que evaluar muchas más dimensiones específicas de cada aplicación».
Bird señaló que ASSERT puede utilizarse para evaluar sistemas durante su desarrollo, tras su implementación y para la supervisión continua.
Este lanzamiento se produce en medio de un cambio gradual, pero cada vez más amplio, en el sector de la IA. A medida que los modelos ganan en capacidad, los investigadores se centran en pruebas repetibles y comprobaciones de regresión. HELM, de Stanford; AILuminate, de MLCommons; y grupos de evaluación como METR están poniendo en marcha pruebas de referencia para medir cómo se comportan los modelos en diferentes condiciones.
Microsoft retira herramientas de IA fallidas y consolida las aplicaciones de Copilot
Hace dos años, Microsoft caracterizó a la IA como un “cambio generacional” en la tecnología que tenía como objetivo liderar. Hoy, la empresa está consolidando sus aplicaciones de consumo y empresariales con la marca Copilot, al tiempo que descontinúa
Microsoft reportedly entrena al personal de ventas para superar a los competidores OpenAI y Anthropic
Microsoft estaría preparando a su fuerza de ventas para intensificar la competencia contra sus principales rivales en el sector de la inteligencia artificial.Según un informe de Bloomberg, los ejecutivos celebraron una sesión estratégica interna el
¿Podría esto marcar el inicio de una crisis para las economías basadas en tokens?
Microsoft ha introducido recientemente ajustes significativos en los precios de GitHub Copilot; cambios tan sustanciales que un usuario de Reddit calificó la situación dentro de su empresa como una “Tokenpocalypse”.En el episodio más reciente del po











