マイクロソフト、開発者がテキスト記述からAIの動作テストを作成できるツールを発表
AIの研究者や研究機関は、AIモデルの安全性、コンプライアンス、おべっか、アラインメントの評価において大きな進歩を遂げてきました。しかし、企業や開発者は現在、自社の特定の製品やサービスにおいて、AIシステムが意図したとおりに正確に動作することを保証するという、具体的な課題に直面しています。
このテストプロセスを簡素化するため、マイクロソフトは火曜日、「ASSERT」(Adaptive Spec-driven Scoring for Evaluation and Regression Testingの頭文字)を発表した。
マイクロソフトによると、このオープンソースのフレームワークにより、アプリケーション固有のAIの挙動を容易に評価できるようになります。このフレームワークはAIを活用し、目標、ポリシー、または意図された挙動に関する高レベルで自然言語による記述を、検証可能な包括的な採点付きテストに変換します。
ASSERTは、AIモデルの期待される動作やポリシーに関する平易な記述を受け入れ、それらを「許容される動作」と「許容されない動作」からなる構造化されたセットに変換します。さらに、問題シナリオやテストケースを生成し、対象システムに対して実行して、結果にスコアを付けます。 また、このフレームワークは、中間アクションやツール呼び出しを含むAIシステムの処理経路を記録するため、開発者はどこで障害が発生したかを調査することができます。
開発者は、システムのコンテキスト、ツール、制約を指定することで、評価の対象範囲をさらにカスタマイズすることも可能です。
例えば、開発者は、文書調査用AIエージェントに対して、「社外の者にメールを送信してはならない」「機密情報は経営幹部(Cレベル)に限定しなければならない」「過去の文脈を考慮しつつ簡潔な要約を提供しなければならない」といったルールを指定できます。ASSERTはこれらのルールに基づいてテストケースを生成し、システムがルールを遵守しているかどうかを継続的にチェックします。

画像提供:Microsoft
Microsoftによると、このフレームワークは、AIモデルがアプリケーションや製品のコンテキスト、ポリシー、ツールによって形作られる動作を意図している場合、より広範で一般的な評価では対処できないギャップを埋めるものです。
「私たちが学んだことの一つは、適切な意思決定を行う上で評価が極めて重要だということです」と、マイクロソフトのResponsible AI担当最高製品責任者(CPO)であるサラ・バード氏は述べています。 「AIシステムの挙動を理解していなければ、それが組織の基準を満たしているかどうかを判断するのは非常に困難だからです[…] 私たちが発見したのは、真に信頼できるシステムを求めるのであれば、アプリケーション固有のより多くの側面を評価すべきだということです。」
バード氏によると、ASSERTは開発中や導入後のシステム評価、さらには継続的なモニタリングにも活用できるという。
今回のリリースは、AI業界において緩やかではあるが広範な変化が進む中で行われた。モデルの能力が高まるにつれ、研究者たちは再現性のあるテストや回帰テストに注力している。スタンフォード大学のHELM、MLCommonsのAILuminate、そしてMETRのような評価グループは、さまざまな条件下でモデルがどのように振る舞うかを測定するためのベンチマークを次々と公開している。
関連記事
Microsoftは失敗したAIツールを廃止し、Copilotアプリを統合
2年前、MicrosoftはAIを「技術における世代交代」と位置づけ、自らがその先導を目指すとしていました。本日、同社はCopilotブランドの消費者向けおよびビジネス向けアプリケーションを統合し、同時にいくつかの不振なAI機能を終了させます。GeekWireによって最初に報じられ、Microsoftのサポート文書で詳細が明かされた通り、このテクノロジー巨人は消費者向けのCopilotアプリとビジネス指向のMicrosoft 365 Copilotアプリの機能を統合します。この動きは、個人用
Microsoft、営業スタッフを訓練し、競合他社であるOpenAIおよびAnthropicを価格で下回るよう指導しているとの報道
Microsoftは reportedly、人工知能分野における主要な競合他社との競争を強化するため、営業部隊の準備を進めていると報じられている。Bloombergの報道によると、経営陣は火曜日に内部戦略会議を開催し、営業チームに対してOpenAI、Google、Anthropicの製品よりもMicrosoftのAI提供優位性を強調するよう指示した。この会議は2027年度計画に焦点を当て、競合他社のソリューションと比較したMicrosoft独自のモデルの効率性とコストメリットを訴求することを強
これはトークン経済にとって危機の始まりを告げるものなのでしょうか?
Microsoftは最近、GitHub Copilotの価格を大幅に見直しました。その変更幅は非常に大きく、あるRedditユーザーは自社内で起きている状況を「Tokenpocalypse」と表現するほどです。TechCrunchのEquityポッドキャストの最新回では、Kirsten Korosec、Sean O’Kaneと共に、こうした価格変動がAI業界全体に与える影響について探求しました。Anthropicをはじめとする主要なAI企業が上場準備を進める中で、収益性に関する疑問が浮上してお
関連特集おすすめ
コメント (0)
0/500
AIの研究者や研究機関は、AIモデルの安全性、コンプライアンス、おべっか、アラインメントの評価において大きな進歩を遂げてきました。しかし、企業や開発者は現在、自社の特定の製品やサービスにおいて、AIシステムが意図したとおりに正確に動作することを保証するという、具体的な課題に直面しています。
このテストプロセスを簡素化するため、マイクロソフトは火曜日、「ASSERT」(Adaptive Spec-driven Scoring for Evaluation and Regression Testingの頭文字)を発表した。
マイクロソフトによると、このオープンソースのフレームワークにより、アプリケーション固有のAIの挙動を容易に評価できるようになります。このフレームワークはAIを活用し、目標、ポリシー、または意図された挙動に関する高レベルで自然言語による記述を、検証可能な包括的な採点付きテストに変換します。
ASSERTは、AIモデルの期待される動作やポリシーに関する平易な記述を受け入れ、それらを「許容される動作」と「許容されない動作」からなる構造化されたセットに変換します。さらに、問題シナリオやテストケースを生成し、対象システムに対して実行して、結果にスコアを付けます。 また、このフレームワークは、中間アクションやツール呼び出しを含むAIシステムの処理経路を記録するため、開発者はどこで障害が発生したかを調査することができます。
開発者は、システムのコンテキスト、ツール、制約を指定することで、評価の対象範囲をさらにカスタマイズすることも可能です。
例えば、開発者は、文書調査用AIエージェントに対して、「社外の者にメールを送信してはならない」「機密情報は経営幹部(Cレベル)に限定しなければならない」「過去の文脈を考慮しつつ簡潔な要約を提供しなければならない」といったルールを指定できます。ASSERTはこれらのルールに基づいてテストケースを生成し、システムがルールを遵守しているかどうかを継続的にチェックします。

画像提供:Microsoft
Microsoftによると、このフレームワークは、AIモデルがアプリケーションや製品のコンテキスト、ポリシー、ツールによって形作られる動作を意図している場合、より広範で一般的な評価では対処できないギャップを埋めるものです。
「私たちが学んだことの一つは、適切な意思決定を行う上で評価が極めて重要だということです」と、マイクロソフトのResponsible AI担当最高製品責任者(CPO)であるサラ・バード氏は述べています。 「AIシステムの挙動を理解していなければ、それが組織の基準を満たしているかどうかを判断するのは非常に困難だからです[…] 私たちが発見したのは、真に信頼できるシステムを求めるのであれば、アプリケーション固有のより多くの側面を評価すべきだということです。」
バード氏によると、ASSERTは開発中や導入後のシステム評価、さらには継続的なモニタリングにも活用できるという。
今回のリリースは、AI業界において緩やかではあるが広範な変化が進む中で行われた。モデルの能力が高まるにつれ、研究者たちは再現性のあるテストや回帰テストに注力している。スタンフォード大学のHELM、MLCommonsのAILuminate、そしてMETRのような評価グループは、さまざまな条件下でモデルがどのように振る舞うかを測定するためのベンチマークを次々と公開している。
Microsoftは失敗したAIツールを廃止し、Copilotアプリを統合
2年前、MicrosoftはAIを「技術における世代交代」と位置づけ、自らがその先導を目指すとしていました。本日、同社はCopilotブランドの消費者向けおよびビジネス向けアプリケーションを統合し、同時にいくつかの不振なAI機能を終了させます。GeekWireによって最初に報じられ、Microsoftのサポート文書で詳細が明かされた通り、このテクノロジー巨人は消費者向けのCopilotアプリとビジネス指向のMicrosoft 365 Copilotアプリの機能を統合します。この動きは、個人用
Microsoft、営業スタッフを訓練し、競合他社であるOpenAIおよびAnthropicを価格で下回るよう指導しているとの報道
Microsoftは reportedly、人工知能分野における主要な競合他社との競争を強化するため、営業部隊の準備を進めていると報じられている。Bloombergの報道によると、経営陣は火曜日に内部戦略会議を開催し、営業チームに対してOpenAI、Google、Anthropicの製品よりもMicrosoftのAI提供優位性を強調するよう指示した。この会議は2027年度計画に焦点を当て、競合他社のソリューションと比較したMicrosoft独自のモデルの効率性とコストメリットを訴求することを強
これはトークン経済にとって危機の始まりを告げるものなのでしょうか?
Microsoftは最近、GitHub Copilotの価格を大幅に見直しました。その変更幅は非常に大きく、あるRedditユーザーは自社内で起きている状況を「Tokenpocalypse」と表現するほどです。TechCrunchのEquityポッドキャストの最新回では、Kirsten Korosec、Sean O’Kaneと共に、こうした価格変動がAI業界全体に与える影響について探求しました。Anthropicをはじめとする主要なAI企業が上場準備を進める中で、収益性に関する疑問が浮上してお





家






