選項
首頁
新聞
微軟推出一款工具,讓開發者能根據文字描述建立 AI 行為測試

微軟推出一款工具,讓開發者能根據文字描述建立 AI 行為測試

2026-06-26
90

人工智慧研究人員與實驗室在評估人工智慧模型的安全性、合規性、阿諛奉承傾向及對齊性方面,已取得顯著進展。然而,企業與開發者如今面臨一項具體挑戰:確保其人工智慧系統的行為完全符合特定產品或服務的預期。

為了簡化這項測試流程,微軟於週二推出了 ASSERT——這是「自適應規格驅動評分評估與回歸測試」(Adaptive Spec-driven Scoring for Evaluation and Regression Testing)的縮寫。

據微軟表示,這個開源框架能輕鬆評估特定應用程式的 AI 行為。它運用 AI 技術,將針對目標、政策或預期行為的高階自然語言描述,轉換為可供檢視的全面性、可評分測試。

ASSERT 可接受以自然語言描述的 AI 模型預期行為與政策,並將其轉化為一套結構化的「可接受」與「不可接受」行為清單。它會生成問題情境與測試案例,在目標系統上執行這些測試,並對結果進行評分。 該框架還會記錄 AI 系統的執行路徑,包括中間動作與工具呼叫,讓開發人員能夠查明失敗發生之處。

開發人員亦可提供系統背景、工具及限制條件,以進一步客製化評估範圍。

舉例來說,開發人員可指定文件研究 AI 代理程式不得向公司外部人員發送電子郵件、必須將機密資訊限制在高階主管(C 級)範圍內,並應在考量先前脈絡的同時提供簡明摘要。隨後,ASSERT 會運用這些規則生成測試案例,持續檢查系統是否遵循相關規範。

微軟推出新工具,讓開發人員能透過文字描述來建立 AI 行為測試

圖片來源:微軟

微軟表示,當 AI 模型的行為需受應用程式或產品的背景、政策及工具所形塑時,此框架填補了更廣泛、更通用評估方法無法解決的缺口。

「我們學到的一點是,評估對於做出良好決策至關重要,」微軟負責負責任人工智慧的首席產品官莎拉·伯德(Sarah Bird)表示。 「因為如果無法理解 AI 系統的行為,就很難判斷它是否符合貴組織的標準 […] 我們發現,若真要打造值得信賴的系統,就應該評估更多與特定應用相關的維度。」

伯德表示,ASSERT 可用於開發階段、部署後以及持續監控過程中的系統評估。

此次發布正值人工智慧產業正經歷一場漸進但廣泛的轉變之際。隨著模型能力不斷提升,研究人員正將焦點放在可重複的測試與回歸檢查上。史丹佛大學的 HELM、MLCommons 的 AILuminate,以及 METR 等評估組織,正陸續推出基準測試,用以衡量模型在不同條件下的表現。

相關文章
微軟淘汰失敗的 AI 工具並整合 Copilot 應用 微軟淘汰失敗的 AI 工具並整合 Copilot 應用 兩年前,微軟將人工智慧定義為一種“代際性”的技術變革,並表示其旨在引領這一趨勢。如今,該公司正在整合其以 Copilot 為品牌的消費者和企業應用,同時停止執行不佳的幾項人工智慧功能。正如 GeekWire 首次報道並在微軟的支援文件中詳細說明的那樣,這家科技巨頭將把其面向消費者的 Copilot 應用的功能與專注於企業的 Microsoft 365 Copilot 應用的功能合併。此舉承認個人和企業人工智慧使用往往存在重疊,且微軟之前的策略過於複雜,導致 Copilot 無法成為 Chat
據稱微軟培訓銷售人員以壓低競爭對手 OpenAI 和 Anthropic 的價格 據稱微軟培訓銷售人員以壓低競爭對手 OpenAI 和 Anthropic 的價格 微軟據報正在加強其銷售團隊,以加大對人工智慧領域主要競爭對手的競爭力度。據彭博社報道,高管們於週二舉行了一次內部戰略會議,指示銷售團隊突出微軟的人工智慧產品相較於 OpenAI、Google 和 Anthropic 產品的優勢。此次會議聚焦於 27 財年的規劃,強調在推銷微軟專有模型時,應著重闡述其相較於競爭對手解決方案在效率和成本方面的優勢。“其他公司都在銷售零部件——而我們銷售的是完整的端到端系統。這就是我們在 27 財年需要向外界傳達的故事,”據報道,執行副總裁 Jay Parikh
這是否會成為代幣經濟危機的起點? 這是否會成為代幣經濟危機的起點? 微軟近期對 GitHub Copilot 的定價進行了大幅調整,變動幅度之大甚至有 Reddit 使用者將企業內部出現的狀況稱為“代幣末日”。在 TechCrunch 的《Equity》播客最新一集中,Kirsten Korosec、Sean O’Kane 與我一同探討了這些價格變動可能對整個 AI 行業產生的影響。隨著 Anthropic 及其他大型 AI 公司準備上市,關於盈利能力的疑問日益增多,企業為控制開支,很可能會再次提高價格並增設使用限制。Sean 提出了一個關鍵問題:“這些 AI
相關專題推薦
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
漫畫創作 最適合視覺敘事的 AI 對話氣泡工具
最適合視覺敘事的 AI 對話氣泡工具

2026 年最新、最受好評的視覺敘事 AI 對話氣泡工具,現已登陸 XIX.AI!這份精心挑選的合集收錄了強大且具顛覆性的工具,能協助創作者提升生產力並突破創作瓶頸。 查看免費版與付費版的比較、參考實際測試結果,並查閱最新排行榜,找出最適合打造引人入勝視覺敘事的必試解決方案。立即探索,發掘您的理想工具!

10 個工具
xix.ai
會議助理 頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動
頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動

2026 年最新高評價最佳 AI 會議摘要工具,助您清晰追蹤決策並輕鬆進行後續跟進。這份精選清單展示了一系列強大且具顛覆性的解決方案,透過自動化會議記錄、識別關鍵行動項目,以及簡化所有專案的團隊協作,大幅提升生產力。 獲取免費版與付費版的比較分析,搭配實際測試報告及每週更新的排行榜,助您找到最合適的工具。立即探索,釋放您的 AI 優勢!

9 個工具
xix.ai
數據分析 最佳人工智慧資料清洗工具:快速處理缺失值與重複資料
最佳人工智慧資料清洗工具:快速處理缺失值與重複資料

2026年最新、最優秀且評分最高的AI資料清洗工具,可快速處理缺失值與重複資料問題。這份精心挑選的清單展示了那些功能強大、能帶來顛覆性變革的解決方案,可顯著提升工作效率。所有候選工具都經過了嚴格的實際應用測試,以確保其穩定性。您可以獲取免費版與付費版的對比資訊,找出最符合您需求的必備工具。即刻訪問XIX.AI,開啟您的AI優勢之旅。

11 個工具
xix.ai
設計與藝術 最佳AI創意構思工具,助力藝術家突破視覺瓶頸
最佳AI創意構思工具,助力藝術家突破視覺瓶頸

2026 年最新最佳頂級評分 AI 創意構思工具由 XIX.AI 精心策劃,旨在幫助創作者突破視覺瓶頸並即時提升創造力。這些強大的變革性工具提供真實世界測試、詳細的免費與付費對比以及每週更新的排名。發現您的完美工具,加速內容創作,並立即釋放您的 AI 優勢。立即探索!

14 個工具
xix.ai
評論 (0)
0/500
OR