마이크로소프트, 개발자가 텍스트 설명을 바탕으로 AI 동작 테스트를 생성할 수 있는 도구 공개
AI 연구자들과 연구소들은 AI 모델의 안전성, 규정 준수, 아첨 경향, 정합성 평가 분야에서 상당한 진전을 이루었습니다. 하지만 기업과 개발자들은 이제 특정 제품이나 서비스에 대해 AI 시스템이 의도한 대로 정확하게 작동하도록 보장해야 하는 구체적인 과제에 직면해 있습니다.
이러한 테스트 과정을 간소화하기 위해 마이크로소프트는 화요일, ‘ASSERT’(Adaptive Spec-driven Scoring for Evaluation and Regression Testing의 약자)를 공개했다.
마이크로소프트에 따르면, 이 오픈소스 프레임워크를 사용하면 애플리케이션별 AI 동작을 쉽게 평가할 수 있습니다. 이 프레임워크는 AI를 활용해 목표, 정책 또는 의도된 동작에 대한 고수준의 자연어 설명을, 검토 가능한 포괄적이고 점수가 매겨진 테스트로 변환합니다.
ASSERT는 AI 모델의 예상 동작과 정책에 대한 평이한 언어 설명을 입력으로 받아, 이를 허용 가능한 동작과 허용되지 않는 동작으로 구성된 구조화된 세트로 변환합니다. 또한 문제 시나리오와 테스트 케이스를 생성하여 대상 시스템에서 실행한 후, 결과에 점수를 매깁니다. 또한 이 프레임워크는 중간 단계의 동작과 도구 호출을 포함한 AI 시스템의 실행 경로를 기록하여, 개발자가 오류가 발생한 위치를 정확히 파악할 수 있도록 지원합니다.
개발자는 시스템 컨텍스트, 도구 및 제약 조건을 제공하여 평가 범위를 더욱 세밀하게 맞춤 설정할 수도 있습니다.
예를 들어, 개발자는 문서 조사 AI 에이전트가 회사 외부인에게 이메일을 보내서는 안 되며, 기밀 정보는 최고 경영진에게만 제한해야 하고, 이전 맥락을 고려하여 간결한 요약을 제공해야 한다고 지정할 수 있습니다. 그러면 ASSERT는 이러한 규칙을 사용하여 시스템이 규칙을 준수하는지 지속적으로 확인하는 테스트 케이스를 생성합니다.

이미지 출처:Microsoft
마이크로소프트에 따르면, 이 프레임워크는 AI 모델이 애플리케이션이나 제품의 맥락, 정책, 도구에 따라 특정 방식으로 동작하도록 설계된 경우, 더 광범위하고 일반적인 평가로는 해결할 수 없는 공백을 메워줍니다.
마이크로소프트의 책임 있는 AI(Responsible AI) 부문 최고 제품 책임자(CPO)인 사라 버드(Sarah Bird)는 “우리가 배운 점 중 하나는 올바른 결정을 내리기 위해서는 평가가 절대적으로 중요하다는 사실입니다”라고 말했습니다. “AI 시스템의 동작을 이해하지 못하면, 해당 시스템이 조직의 기준을 충족하는지 파악하기가 정말 어렵기 때문입니다 […] 우리가 발견한 사실은, 진정으로 신뢰할 수 있는 시스템을 원한다면 애플리케이션에 특화된 훨씬 더 다양한 차원을 평가해야 한다는 것입니다.”
버드는 ASSERT가 개발 단계, 배포 후, 그리고 지속적인 모니터링을 위한 시스템 평가에 활용될 수 있다고 설명했다.
이번 발표는 AI 업계에서 점진적이면서도 광범위한 변화가 일어나고 있는 가운데 이루어졌다. 모델의 성능이 향상됨에 따라 연구자들은 재현 가능한 테스트와 회귀 검사에 주력하고 있다. 스탠퍼드의 HELM, MLCommons의 AILuminate, 그리고 METR과 같은 평가 그룹들은 다양한 조건에서 모델이 어떻게 작동하는지 측정하기 위한 벤치마크를 선보이고 있다.
관련 기사
Microsoft는 실패한 AI 도구를 퇴역시키고 Copilot 앱을 통합합니다
2년 전, 마이크로소프트는 AI를 기술의 “세대를 초월한 변화”로 규정하며 이를 주도하겠다고 밝혔습니다. 오늘, 이 회사는 Copilot 브랜드의 소비자 및 비즈니스 애플리케이션을 통합하는 한편, 여러 부진한 AI 기능을 중단하고 있습니다.GeekWire가 처음 보도하고 마이크로소프트의 지원 문서에 상세히 기술된 바와 같이, 이 기술 거대 기업은 소비자 대상 Copilot 앱의 기능과 비즈니스 중심 Microsoft 365 Copilot 앱의
Microsoft reportedly trains sales staff to undercut rivals OpenAI and Anthropic
Microsoft는 reportedly 경쟁사들과의 인공지능(AI) 부문에서의 경쟁을 강화하기 위해 영업 부서를 준비하고 있는 것으로 알려졌다.Bloomberg의 보도에 따르면, 임원들은 화요일 내부 전략 회의를 열어 영업팀에게 Microsoft의 AI 제품군이 OpenAI, Google, Anthropic의 제품군보다 갖는 장점을 강조하도록 지시했다. 회계연도 27년(FY27) 계획을 주제로 한 이 회의에서는 경쟁사의 솔루션과 비교하여 Mi
이것이 토큰 경제에 위기가 찾아오는 시발점이 될 수 있을까?
마이크로소프트는 최근 GitHub Copilot의 가격을 대폭 조정했으며, 그 변화 규모가 매우 커서 한 레딧 사용자는 자사 내 상황을 ‘토큰 종말’이라고 표현하기도 했습니다.TechCrunch의 Equity 팟캐스트 최신 에피소드에서 커스틴 코로세크, 숀 오케인과 함께 이러한 가격 변동이 전반적인 AI 산업에 어떤 영향을 미칠 수 있는지 살펴보았습니다. 앤서니픽 등 주요 AI 기업들이 상장을 준비하는 가운데, 수익성에 대한 의문이 제기되고
관련 특별 주제 추천
의견 (0)
0/500
AI 연구자들과 연구소들은 AI 모델의 안전성, 규정 준수, 아첨 경향, 정합성 평가 분야에서 상당한 진전을 이루었습니다. 하지만 기업과 개발자들은 이제 특정 제품이나 서비스에 대해 AI 시스템이 의도한 대로 정확하게 작동하도록 보장해야 하는 구체적인 과제에 직면해 있습니다.
이러한 테스트 과정을 간소화하기 위해 마이크로소프트는 화요일, ‘ASSERT’(Adaptive Spec-driven Scoring for Evaluation and Regression Testing의 약자)를 공개했다.
마이크로소프트에 따르면, 이 오픈소스 프레임워크를 사용하면 애플리케이션별 AI 동작을 쉽게 평가할 수 있습니다. 이 프레임워크는 AI를 활용해 목표, 정책 또는 의도된 동작에 대한 고수준의 자연어 설명을, 검토 가능한 포괄적이고 점수가 매겨진 테스트로 변환합니다.
ASSERT는 AI 모델의 예상 동작과 정책에 대한 평이한 언어 설명을 입력으로 받아, 이를 허용 가능한 동작과 허용되지 않는 동작으로 구성된 구조화된 세트로 변환합니다. 또한 문제 시나리오와 테스트 케이스를 생성하여 대상 시스템에서 실행한 후, 결과에 점수를 매깁니다. 또한 이 프레임워크는 중간 단계의 동작과 도구 호출을 포함한 AI 시스템의 실행 경로를 기록하여, 개발자가 오류가 발생한 위치를 정확히 파악할 수 있도록 지원합니다.
개발자는 시스템 컨텍스트, 도구 및 제약 조건을 제공하여 평가 범위를 더욱 세밀하게 맞춤 설정할 수도 있습니다.
예를 들어, 개발자는 문서 조사 AI 에이전트가 회사 외부인에게 이메일을 보내서는 안 되며, 기밀 정보는 최고 경영진에게만 제한해야 하고, 이전 맥락을 고려하여 간결한 요약을 제공해야 한다고 지정할 수 있습니다. 그러면 ASSERT는 이러한 규칙을 사용하여 시스템이 규칙을 준수하는지 지속적으로 확인하는 테스트 케이스를 생성합니다.

이미지 출처:Microsoft
마이크로소프트에 따르면, 이 프레임워크는 AI 모델이 애플리케이션이나 제품의 맥락, 정책, 도구에 따라 특정 방식으로 동작하도록 설계된 경우, 더 광범위하고 일반적인 평가로는 해결할 수 없는 공백을 메워줍니다.
마이크로소프트의 책임 있는 AI(Responsible AI) 부문 최고 제품 책임자(CPO)인 사라 버드(Sarah Bird)는 “우리가 배운 점 중 하나는 올바른 결정을 내리기 위해서는 평가가 절대적으로 중요하다는 사실입니다”라고 말했습니다. “AI 시스템의 동작을 이해하지 못하면, 해당 시스템이 조직의 기준을 충족하는지 파악하기가 정말 어렵기 때문입니다 […] 우리가 발견한 사실은, 진정으로 신뢰할 수 있는 시스템을 원한다면 애플리케이션에 특화된 훨씬 더 다양한 차원을 평가해야 한다는 것입니다.”
버드는 ASSERT가 개발 단계, 배포 후, 그리고 지속적인 모니터링을 위한 시스템 평가에 활용될 수 있다고 설명했다.
이번 발표는 AI 업계에서 점진적이면서도 광범위한 변화가 일어나고 있는 가운데 이루어졌다. 모델의 성능이 향상됨에 따라 연구자들은 재현 가능한 테스트와 회귀 검사에 주력하고 있다. 스탠퍼드의 HELM, MLCommons의 AILuminate, 그리고 METR과 같은 평가 그룹들은 다양한 조건에서 모델이 어떻게 작동하는지 측정하기 위한 벤치마크를 선보이고 있다.
Microsoft는 실패한 AI 도구를 퇴역시키고 Copilot 앱을 통합합니다
2년 전, 마이크로소프트는 AI를 기술의 “세대를 초월한 변화”로 규정하며 이를 주도하겠다고 밝혔습니다. 오늘, 이 회사는 Copilot 브랜드의 소비자 및 비즈니스 애플리케이션을 통합하는 한편, 여러 부진한 AI 기능을 중단하고 있습니다.GeekWire가 처음 보도하고 마이크로소프트의 지원 문서에 상세히 기술된 바와 같이, 이 기술 거대 기업은 소비자 대상 Copilot 앱의 기능과 비즈니스 중심 Microsoft 365 Copilot 앱의
Microsoft reportedly trains sales staff to undercut rivals OpenAI and Anthropic
Microsoft는 reportedly 경쟁사들과의 인공지능(AI) 부문에서의 경쟁을 강화하기 위해 영업 부서를 준비하고 있는 것으로 알려졌다.Bloomberg의 보도에 따르면, 임원들은 화요일 내부 전략 회의를 열어 영업팀에게 Microsoft의 AI 제품군이 OpenAI, Google, Anthropic의 제품군보다 갖는 장점을 강조하도록 지시했다. 회계연도 27년(FY27) 계획을 주제로 한 이 회의에서는 경쟁사의 솔루션과 비교하여 Mi
이것이 토큰 경제에 위기가 찾아오는 시발점이 될 수 있을까?
마이크로소프트는 최근 GitHub Copilot의 가격을 대폭 조정했으며, 그 변화 규모가 매우 커서 한 레딧 사용자는 자사 내 상황을 ‘토큰 종말’이라고 표현하기도 했습니다.TechCrunch의 Equity 팟캐스트 최신 에피소드에서 커스틴 코로세크, 숀 오케인과 함께 이러한 가격 변동이 전반적인 AI 산업에 어떤 영향을 미칠 수 있는지 살펴보았습니다. 앤서니픽 등 주요 AI 기업들이 상장을 준비하는 가운데, 수익성에 대한 의문이 제기되고





집






