微軟推出一款工具,讓開發者能根據文字描述建立 AI 行為測試
人工智慧研究人員與實驗室在評估人工智慧模型的安全性、合規性、阿諛奉承傾向及對齊性方面,已取得顯著進展。然而,企業與開發者如今面臨一項具體挑戰:確保其人工智慧系統的行為完全符合特定產品或服務的預期。
為了簡化這項測試流程,微軟於週二推出了 ASSERT——這是「自適應規格驅動評分評估與回歸測試」(Adaptive Spec-driven Scoring for Evaluation and Regression Testing)的縮寫。
據微軟表示,這個開源框架能輕鬆評估特定應用程式的 AI 行為。它運用 AI 技術,將針對目標、政策或預期行為的高階自然語言描述,轉換為可供檢視的全面性、可評分測試。
ASSERT 可接受以自然語言描述的 AI 模型預期行為與政策,並將其轉化為一套結構化的「可接受」與「不可接受」行為清單。它會生成問題情境與測試案例,在目標系統上執行這些測試,並對結果進行評分。 該框架還會記錄 AI 系統的執行路徑,包括中間動作與工具呼叫,讓開發人員能夠查明失敗發生之處。
開發人員亦可提供系統背景、工具及限制條件,以進一步客製化評估範圍。
舉例來說,開發人員可指定文件研究 AI 代理程式不得向公司外部人員發送電子郵件、必須將機密資訊限制在高階主管(C 級)範圍內,並應在考量先前脈絡的同時提供簡明摘要。隨後,ASSERT 會運用這些規則生成測試案例,持續檢查系統是否遵循相關規範。

圖片來源:微軟
微軟表示,當 AI 模型的行為需受應用程式或產品的背景、政策及工具所形塑時,此框架填補了更廣泛、更通用評估方法無法解決的缺口。
「我們學到的一點是,評估對於做出良好決策至關重要,」微軟負責負責任人工智慧的首席產品官莎拉·伯德(Sarah Bird)表示。 「因為如果無法理解 AI 系統的行為,就很難判斷它是否符合貴組織的標準 […] 我們發現,若真要打造值得信賴的系統,就應該評估更多與特定應用相關的維度。」
伯德表示,ASSERT 可用於開發階段、部署後以及持續監控過程中的系統評估。
此次發布正值人工智慧產業正經歷一場漸進但廣泛的轉變之際。隨著模型能力不斷提升,研究人員正將焦點放在可重複的測試與回歸檢查上。史丹佛大學的 HELM、MLCommons 的 AILuminate,以及 METR 等評估組織,正陸續推出基準測試,用以衡量模型在不同條件下的表現。
相關文章
微軟淘汰失敗的 AI 工具並整合 Copilot 應用
兩年前,微軟將人工智慧定義為一種“代際性”的技術變革,並表示其旨在引領這一趨勢。如今,該公司正在整合其以 Copilot 為品牌的消費者和企業應用,同時停止執行不佳的幾項人工智慧功能。正如 GeekWire 首次報道並在微軟的支援文件中詳細說明的那樣,這家科技巨頭將把其面向消費者的 Copilot 應用的功能與專注於企業的 Microsoft 365 Copilot 應用的功能合併。此舉承認個人和企業人工智慧使用往往存在重疊,且微軟之前的策略過於複雜,導致 Copilot 無法成為 Chat
據稱微軟培訓銷售人員以壓低競爭對手 OpenAI 和 Anthropic 的價格
微軟據報正在加強其銷售團隊,以加大對人工智慧領域主要競爭對手的競爭力度。據彭博社報道,高管們於週二舉行了一次內部戰略會議,指示銷售團隊突出微軟的人工智慧產品相較於 OpenAI、Google 和 Anthropic 產品的優勢。此次會議聚焦於 27 財年的規劃,強調在推銷微軟專有模型時,應著重闡述其相較於競爭對手解決方案在效率和成本方面的優勢。“其他公司都在銷售零部件——而我們銷售的是完整的端到端系統。這就是我們在 27 財年需要向外界傳達的故事,”據報道,執行副總裁 Jay Parikh
這是否會成為代幣經濟危機的起點?
微軟近期對 GitHub Copilot 的定價進行了大幅調整,變動幅度之大甚至有 Reddit 使用者將企業內部出現的狀況稱為“代幣末日”。在 TechCrunch 的《Equity》播客最新一集中,Kirsten Korosec、Sean O’Kane 與我一同探討了這些價格變動可能對整個 AI 行業產生的影響。隨著 Anthropic 及其他大型 AI 公司準備上市,關於盈利能力的疑問日益增多,企業為控制開支,很可能會再次提高價格並增設使用限制。Sean 提出了一個關鍵問題:“這些 AI
相關專題推薦
評論 (0)
0/500
人工智慧研究人員與實驗室在評估人工智慧模型的安全性、合規性、阿諛奉承傾向及對齊性方面,已取得顯著進展。然而,企業與開發者如今面臨一項具體挑戰:確保其人工智慧系統的行為完全符合特定產品或服務的預期。
為了簡化這項測試流程,微軟於週二推出了 ASSERT——這是「自適應規格驅動評分評估與回歸測試」(Adaptive Spec-driven Scoring for Evaluation and Regression Testing)的縮寫。
據微軟表示,這個開源框架能輕鬆評估特定應用程式的 AI 行為。它運用 AI 技術,將針對目標、政策或預期行為的高階自然語言描述,轉換為可供檢視的全面性、可評分測試。
ASSERT 可接受以自然語言描述的 AI 模型預期行為與政策,並將其轉化為一套結構化的「可接受」與「不可接受」行為清單。它會生成問題情境與測試案例,在目標系統上執行這些測試,並對結果進行評分。 該框架還會記錄 AI 系統的執行路徑,包括中間動作與工具呼叫,讓開發人員能夠查明失敗發生之處。
開發人員亦可提供系統背景、工具及限制條件,以進一步客製化評估範圍。
舉例來說,開發人員可指定文件研究 AI 代理程式不得向公司外部人員發送電子郵件、必須將機密資訊限制在高階主管(C 級)範圍內,並應在考量先前脈絡的同時提供簡明摘要。隨後,ASSERT 會運用這些規則生成測試案例,持續檢查系統是否遵循相關規範。

圖片來源:微軟
微軟表示,當 AI 模型的行為需受應用程式或產品的背景、政策及工具所形塑時,此框架填補了更廣泛、更通用評估方法無法解決的缺口。
「我們學到的一點是,評估對於做出良好決策至關重要,」微軟負責負責任人工智慧的首席產品官莎拉·伯德(Sarah Bird)表示。 「因為如果無法理解 AI 系統的行為,就很難判斷它是否符合貴組織的標準 […] 我們發現,若真要打造值得信賴的系統,就應該評估更多與特定應用相關的維度。」
伯德表示,ASSERT 可用於開發階段、部署後以及持續監控過程中的系統評估。
此次發布正值人工智慧產業正經歷一場漸進但廣泛的轉變之際。隨著模型能力不斷提升,研究人員正將焦點放在可重複的測試與回歸檢查上。史丹佛大學的 HELM、MLCommons 的 AILuminate,以及 METR 等評估組織,正陸續推出基準測試,用以衡量模型在不同條件下的表現。
微軟淘汰失敗的 AI 工具並整合 Copilot 應用
兩年前,微軟將人工智慧定義為一種“代際性”的技術變革,並表示其旨在引領這一趨勢。如今,該公司正在整合其以 Copilot 為品牌的消費者和企業應用,同時停止執行不佳的幾項人工智慧功能。正如 GeekWire 首次報道並在微軟的支援文件中詳細說明的那樣,這家科技巨頭將把其面向消費者的 Copilot 應用的功能與專注於企業的 Microsoft 365 Copilot 應用的功能合併。此舉承認個人和企業人工智慧使用往往存在重疊,且微軟之前的策略過於複雜,導致 Copilot 無法成為 Chat
據稱微軟培訓銷售人員以壓低競爭對手 OpenAI 和 Anthropic 的價格
微軟據報正在加強其銷售團隊,以加大對人工智慧領域主要競爭對手的競爭力度。據彭博社報道,高管們於週二舉行了一次內部戰略會議,指示銷售團隊突出微軟的人工智慧產品相較於 OpenAI、Google 和 Anthropic 產品的優勢。此次會議聚焦於 27 財年的規劃,強調在推銷微軟專有模型時,應著重闡述其相較於競爭對手解決方案在效率和成本方面的優勢。“其他公司都在銷售零部件——而我們銷售的是完整的端到端系統。這就是我們在 27 財年需要向外界傳達的故事,”據報道,執行副總裁 Jay Parikh
這是否會成為代幣經濟危機的起點?
微軟近期對 GitHub Copilot 的定價進行了大幅調整,變動幅度之大甚至有 Reddit 使用者將企業內部出現的狀況稱為“代幣末日”。在 TechCrunch 的《Equity》播客最新一集中,Kirsten Korosec、Sean O’Kane 與我一同探討了這些價格變動可能對整個 AI 行業產生的影響。隨著 Anthropic 及其他大型 AI 公司準備上市,關於盈利能力的疑問日益增多,企業為控制開支,很可能會再次提高價格並增設使用限制。Sean 提出了一個關鍵問題:“這些 AI





首頁






