網路安全專家批評Anthropic的Fable中的護欄措施

Anthropic 於週二推出了其最新模型 Fable,將其定位為備受期待的網路安全專用模型 Mythos 的公開受限版本。
然而,這些限制引發了部分網路安全研究人員和從業者的不滿,他們已在網上表達了擔憂。
“[Fable] 會阻止任何可能與網路安全相關的請求,包括閱讀部落格文章等無害任務,”IBM X-Force 的高階安全研究員 Valentina “Chompie” Palmiotti 表示。
當使用者提示觸發這些安全過濾器時,Fable 會中斷對話,並顯示一條訊息,稱其“安全協議因網路安全或生物主題標記了此輸入”。
這些限制旨在降低 Fable 被用於建立惡意軟體或利用軟體的風險——這是 Anthropic 一直關注的持續性問題。生物領域的限制則源於對開發生物武器的類似擔憂。
Anthropic 在 4 月釋出 Mythos 時,將訪問許可權限制在 Project Glasswing 專案下的少數公司和組織,該計劃旨在部署該模型以保護關鍵軟體和基礎設施。上週,Anthropic 將 Mythos 的訪問許可權擴大到了 15 個國家的數百個組織。
儘管初衷良好,但許多網路安全專家仍對看似武斷的限制感到沮喪。資深網路安全專家 Matt Suiche 告訴 TechCrunch,“如果你要求它編寫安全程式碼,它會將其解讀為與網路安全相關的工作,而非軟體工程的最佳實踐,從而導致降級。”當觸發護欄機制時,Fable 會回退到 Claude Opus 4.8。“它似乎依賴於關鍵詞,因此‘網路安全’詞彙表中的任何術語都會啟用過濾器,”他指出。
聯絡我們
您是否有關於駭客如何利用 AI,或網路安全公司如何整合 AI 的更多見解?我們歡迎您的意見。您可以從個人裝置和網路,透過 Signal 聯絡 Lorenzo Franceschi-Bicchierai(電話:+1 917 257 1382),或透過 Telegram 和 Keybase(@lorenzofb)以及電子郵件。
“然而,鑑於我們仍處於早期階段,他們正在完善其護欄機制,這是可以理解的。我相信,隨著 Anthropic 和其他前沿模型開發商與新一代網路安全公司更緊密地合作,這些限制將會演變,”Tolmo(一家 AI 網路安全初創公司)的技術人員 Suiche 表示。“最初過度限制並在隨後逐步放寬護欄是更可取的。”
另一位研究人員在 X 上抱怨稱,“即使是請求程式碼審查”也會啟用 Fable 的安全過濾器。
Anthropic 尚未立即回應置評請求。
除了模型層面的護欄外,Anthropic 還要求網路安全專業人員申請其網路安全驗證計劃。獲得批准的使用者在使用 Claude 進行網路安全任務時將面臨更少的限制。OpenAI 也提供了一個名為“Trusted Access for Cyber”的類似計劃。
相關文章
白宮放棄“超級智慧”的AI標籤
正在載入播放器……本週,白宮召集了幾乎所有主要科技公司的執行長齊聚一堂——包括扎克伯格、貝索斯、馬斯克以及 Anthropic 的達里奧·阿莫迪——簽署了一份人工智慧安全承諾,美國總統唐納德·特朗普稱該承諾“具有道德約束力”。特朗普還簽署了一項行政命令,正式將人工智慧重新定義為“超級智慧”,與此同時,Meta 和 OpenAI 正致力於使其人工智慧產品更加使用者友好,儘管來自企業部門的人工智慧最大金融投資仍在持續湧入。在本期 TechCrunch 的 Equity 播客節目中,Kirste
Anthropic 推出 Sonnet 5.5,作為更快、更便宜的工作夥伴
在各大 AI 模型持續競爭的背景下,Anthropic 推出了其中端產品 Sonnet 的最新迭代版本,承諾相比前代版本實現速度的大幅提升和成本的顯著降低。Anthropic 將 Sonnet 5.5 定位為適用於日常工作流程的多功能工具,涵蓋軟體開發和文件創作等領域。Sonnet 5 是 5.5 版本的前身,大約在三個月前推出,其主要優勢在於具有成本效益的智慧體(agentic)部署能力。5.5 版本的關鍵改進在於速度的提升。Anthropic 表示,Sonnet 5.5 的執行速度比前
Anthropic 與特朗普政府的最新衝突實際上可能對其有利,銷售資料顯示
Anthropic 正經歷著一個非凡的月份。據 Ramp 資料顯示,這家 AI 公司首次超越 OpenAI,在商業支出市場份額中佔據首位,並在五月以 650 億美元的融資額和 9650 億美元的估值收官。隨後不久,Anthropic 提交了保密的首次公開募股(IPO)檔案,據報道,這得益於其首個盈利季度的表現。週五,特朗普政府透過要求 Anthropic 阻止非美國使用者(包括其自身員工)訪問其最新模型——受限的 Mythos 5 和近期公開的 Fable 5——進一步加劇了緊張局勢。這一指
相關專題推薦
評論 (0)
0/500

Anthropic 於週二推出了其最新模型 Fable,將其定位為備受期待的網路安全專用模型 Mythos 的公開受限版本。
然而,這些限制引發了部分網路安全研究人員和從業者的不滿,他們已在網上表達了擔憂。
“[Fable] 會阻止任何可能與網路安全相關的請求,包括閱讀部落格文章等無害任務,”IBM X-Force 的高階安全研究員 Valentina “Chompie” Palmiotti 表示。
當使用者提示觸發這些安全過濾器時,Fable 會中斷對話,並顯示一條訊息,稱其“安全協議因網路安全或生物主題標記了此輸入”。
這些限制旨在降低 Fable 被用於建立惡意軟體或利用軟體的風險——這是 Anthropic 一直關注的持續性問題。生物領域的限制則源於對開發生物武器的類似擔憂。
Anthropic 在 4 月釋出 Mythos 時,將訪問許可權限制在 Project Glasswing 專案下的少數公司和組織,該計劃旨在部署該模型以保護關鍵軟體和基礎設施。上週,Anthropic 將 Mythos 的訪問許可權擴大到了 15 個國家的數百個組織。
儘管初衷良好,但許多網路安全專家仍對看似武斷的限制感到沮喪。資深網路安全專家 Matt Suiche 告訴 TechCrunch,“如果你要求它編寫安全程式碼,它會將其解讀為與網路安全相關的工作,而非軟體工程的最佳實踐,從而導致降級。”當觸發護欄機制時,Fable 會回退到 Claude Opus 4.8。“它似乎依賴於關鍵詞,因此‘網路安全’詞彙表中的任何術語都會啟用過濾器,”他指出。
聯絡我們
您是否有關於駭客如何利用 AI,或網路安全公司如何整合 AI 的更多見解?我們歡迎您的意見。您可以從個人裝置和網路,透過 Signal 聯絡 Lorenzo Franceschi-Bicchierai(電話:+1 917 257 1382),或透過 Telegram 和 Keybase(@lorenzofb)以及電子郵件。
“然而,鑑於我們仍處於早期階段,他們正在完善其護欄機制,這是可以理解的。我相信,隨著 Anthropic 和其他前沿模型開發商與新一代網路安全公司更緊密地合作,這些限制將會演變,”Tolmo(一家 AI 網路安全初創公司)的技術人員 Suiche 表示。“最初過度限制並在隨後逐步放寬護欄是更可取的。”
另一位研究人員在 X 上抱怨稱,“即使是請求程式碼審查”也會啟用 Fable 的安全過濾器。
Anthropic 尚未立即回應置評請求。
除了模型層面的護欄外,Anthropic 還要求網路安全專業人員申請其網路安全驗證計劃。獲得批准的使用者在使用 Claude 進行網路安全任務時將面臨更少的限制。OpenAI 也提供了一個名為“Trusted Access for Cyber”的類似計劃。
白宮放棄“超級智慧”的AI標籤
正在載入播放器……本週,白宮召集了幾乎所有主要科技公司的執行長齊聚一堂——包括扎克伯格、貝索斯、馬斯克以及 Anthropic 的達里奧·阿莫迪——簽署了一份人工智慧安全承諾,美國總統唐納德·特朗普稱該承諾“具有道德約束力”。特朗普還簽署了一項行政命令,正式將人工智慧重新定義為“超級智慧”,與此同時,Meta 和 OpenAI 正致力於使其人工智慧產品更加使用者友好,儘管來自企業部門的人工智慧最大金融投資仍在持續湧入。在本期 TechCrunch 的 Equity 播客節目中,Kirste
Anthropic 推出 Sonnet 5.5,作為更快、更便宜的工作夥伴
在各大 AI 模型持續競爭的背景下,Anthropic 推出了其中端產品 Sonnet 的最新迭代版本,承諾相比前代版本實現速度的大幅提升和成本的顯著降低。Anthropic 將 Sonnet 5.5 定位為適用於日常工作流程的多功能工具,涵蓋軟體開發和文件創作等領域。Sonnet 5 是 5.5 版本的前身,大約在三個月前推出,其主要優勢在於具有成本效益的智慧體(agentic)部署能力。5.5 版本的關鍵改進在於速度的提升。Anthropic 表示,Sonnet 5.5 的執行速度比前
Anthropic 與特朗普政府的最新衝突實際上可能對其有利,銷售資料顯示
Anthropic 正經歷著一個非凡的月份。據 Ramp 資料顯示,這家 AI 公司首次超越 OpenAI,在商業支出市場份額中佔據首位,並在五月以 650 億美元的融資額和 9650 億美元的估值收官。隨後不久,Anthropic 提交了保密的首次公開募股(IPO)檔案,據報道,這得益於其首個盈利季度的表現。週五,特朗普政府透過要求 Anthropic 阻止非美國使用者(包括其自身員工)訪問其最新模型——受限的 Mythos 5 和近期公開的 Fable 5——進一步加劇了緊張局勢。這一指





首頁






