Дом
Microsoft представила инструмент для разработчиков, позволяющий создавать тесты поведения ИИ на основе текстовых описаний
Исследователи и лаборатории в области искусственного интеллекта добились значительного прогресса в оценке моделей ИИ с точки зрения безопасности, соответствия нормативным требованиям, отсутствия льстивости и согласованности. Однако сейчас компании и разработчики сталкиваются с конкретной проблемой: необходимостью обеспечить, чтобы их системы ИИ работали именно так, как это предусмотрено для их конкретного продукта или услуги.
Чтобы упростить этот процесс тестирования, во вторник компания Microsoft представила ASSERT — аббревиатуру от Adaptive Spec-driven Scoring for Evaluation and Regression Testing (адаптивная оценка на основе спецификаций для оценочного и регрессионного тестирования).
По словам Microsoft, этот фреймворк с открытым исходным кодом упрощает оценку поведения ИИ в конкретных приложениях. Он использует ИИ для преобразования высокоуровневых описаний целей, политик или предполагаемого поведения на естественном языке в комплексные тесты с оценкой, которые можно проанализировать.
ASSERT принимает описания ожидаемого поведения и политик модели ИИ, написанные простым языком, а затем преобразует их в структурированный набор допустимых и недопустимых вариантов поведения. Она генерирует проблемные сценарии и тестовые случаи, запускает их на целевой системе и оценивает результаты. Фреймворк также записывает пути работы системы ИИ, включая промежуточные действия и вызовы инструментов, что позволяет разработчикам выяснять, где именно происходят сбои.
Разработчики также могут задавать системный контекст, инструменты и ограничения, чтобы дополнительно настраивать объем оцениваемых аспектов.
Например, разработчик может указать, что ИИ-агент по поиску документов не должен отправлять электронные письма лицам за пределами компании, должен ограничивать доступ к конфиденциальной информации руководителями высшего звена и должен предоставлять краткие резюме с учётом предыдущего контекста. Затем ASSERT использует эти правила для генерации тестовых случаев, которые постоянно проверяют, следует ли система этим правилам.

Источник изображения:Microsoft
По словам Microsoft, эта платформа восполняет пробел, который не могут устранить более широкие и общие оценки, когда модели ИИ должны вести себя в соответствии с контекстом, политиками и инструментами приложения или продукта.
«Одно из того, чему мы научились, — это то, что оценки имеют решающее значение для принятия правильных решений», — сказала Сара Берд (Sarah Bird), директор по продуктам в подразделении Responsible AI компании Microsoft. «Ведь если вы не понимаете поведения системы ИИ, очень сложно определить, соответствует ли она стандартам вашей организации […] Мы пришли к выводу, что для создания действительно надежной системы необходимо оценивать гораздо больше аспектов, специфичных для конкретного приложения».
Берд отметила, что ASSERT можно использовать для оценки систем на этапе разработки, после развертывания, а также для непрерывного мониторинга.
Выпуск происходит на фоне постепенного, но все более масштабного сдвига в индустрии искусственного интеллекта. По мере того как модели становятся всё более мощными, исследователи сосредотачиваются на повторяемом тестировании и регрессионных проверках. Проект HELM из Стэнфорда, AILuminate от MLCommons и такие группы по оценке, как METR, внедряют тестовые наборы для измерения поведения моделей в различных условиях.
Связанная статья
Microsoft выводит из эксплуатации неудачные инструменты на базе искусственного интеллекта и объединяет приложения Copilot
Два года назад Microsoft охарактеризовала искусственный интеллект как «технологический сдвиг поколения», которым компания намерена руководить. Сегодня корпорация консолидирует свои потребительские и бизнес-приложения под брендом Copilot, одновременно
По сообщениям, Microsoft обучает своих сотрудников по продажам занижать цены по сравнению с конкурентами OpenAI и Anthropic
По сообщениям, Microsoft готовит свои отделы продаж для усиления конкуренции с ключевыми соперниками в сфере искусственного интеллекта.Согласно отчету Bloomberg, во вторник руководители провели внутреннее стратегическое совещание, на котором поручил
Не станет ли это началом кризиса для экономик токенов?
Недавно Microsoft внесла значительные изменения в ценообразование GitHub Copilot — настолько существенные, что один из пользователей Reddit назвал сложившуюся ситуацию в своей компании «Tokenpocalypse».В самом последнем выпуске подкаста TechCrunch’s
Рекомендации по связанным специальным темам
Комментарии (0)
Исследователи и лаборатории в области искусственного интеллекта добились значительного прогресса в оценке моделей ИИ с точки зрения безопасности, соответствия нормативным требованиям, отсутствия льстивости и согласованности. Однако сейчас компании и разработчики сталкиваются с конкретной проблемой: необходимостью обеспечить, чтобы их системы ИИ работали именно так, как это предусмотрено для их конкретного продукта или услуги.
Чтобы упростить этот процесс тестирования, во вторник компания Microsoft представила ASSERT — аббревиатуру от Adaptive Spec-driven Scoring for Evaluation and Regression Testing (адаптивная оценка на основе спецификаций для оценочного и регрессионного тестирования).
По словам Microsoft, этот фреймворк с открытым исходным кодом упрощает оценку поведения ИИ в конкретных приложениях. Он использует ИИ для преобразования высокоуровневых описаний целей, политик или предполагаемого поведения на естественном языке в комплексные тесты с оценкой, которые можно проанализировать.
ASSERT принимает описания ожидаемого поведения и политик модели ИИ, написанные простым языком, а затем преобразует их в структурированный набор допустимых и недопустимых вариантов поведения. Она генерирует проблемные сценарии и тестовые случаи, запускает их на целевой системе и оценивает результаты. Фреймворк также записывает пути работы системы ИИ, включая промежуточные действия и вызовы инструментов, что позволяет разработчикам выяснять, где именно происходят сбои.
Разработчики также могут задавать системный контекст, инструменты и ограничения, чтобы дополнительно настраивать объем оцениваемых аспектов.
Например, разработчик может указать, что ИИ-агент по поиску документов не должен отправлять электронные письма лицам за пределами компании, должен ограничивать доступ к конфиденциальной информации руководителями высшего звена и должен предоставлять краткие резюме с учётом предыдущего контекста. Затем ASSERT использует эти правила для генерации тестовых случаев, которые постоянно проверяют, следует ли система этим правилам.

Источник изображения:Microsoft
По словам Microsoft, эта платформа восполняет пробел, который не могут устранить более широкие и общие оценки, когда модели ИИ должны вести себя в соответствии с контекстом, политиками и инструментами приложения или продукта.
«Одно из того, чему мы научились, — это то, что оценки имеют решающее значение для принятия правильных решений», — сказала Сара Берд (Sarah Bird), директор по продуктам в подразделении Responsible AI компании Microsoft. «Ведь если вы не понимаете поведения системы ИИ, очень сложно определить, соответствует ли она стандартам вашей организации […] Мы пришли к выводу, что для создания действительно надежной системы необходимо оценивать гораздо больше аспектов, специфичных для конкретного приложения».
Берд отметила, что ASSERT можно использовать для оценки систем на этапе разработки, после развертывания, а также для непрерывного мониторинга.
Выпуск происходит на фоне постепенного, но все более масштабного сдвига в индустрии искусственного интеллекта. По мере того как модели становятся всё более мощными, исследователи сосредотачиваются на повторяемом тестировании и регрессионных проверках. Проект HELM из Стэнфорда, AILuminate от MLCommons и такие группы по оценке, как METR, внедряют тестовые наборы для измерения поведения моделей в различных условиях.
Microsoft выводит из эксплуатации неудачные инструменты на базе искусственного интеллекта и объединяет приложения Copilot
Два года назад Microsoft охарактеризовала искусственный интеллект как «технологический сдвиг поколения», которым компания намерена руководить. Сегодня корпорация консолидирует свои потребительские и бизнес-приложения под брендом Copilot, одновременно
По сообщениям, Microsoft обучает своих сотрудников по продажам занижать цены по сравнению с конкурентами OpenAI и Anthropic
По сообщениям, Microsoft готовит свои отделы продаж для усиления конкуренции с ключевыми соперниками в сфере искусственного интеллекта.Согласно отчету Bloomberg, во вторник руководители провели внутреннее стратегическое совещание, на котором поручил
Не станет ли это началом кризиса для экономик токенов?
Недавно Microsoft внесла значительные изменения в ценообразование GitHub Copilot — настолько существенные, что один из пользователей Reddit назвал сложившуюся ситуацию в своей компании «Tokenpocalypse».В самом последнем выпуске подкаста TechCrunch’s











