Anthropic 為其 Claude 模型推出終止濫用聊天的功能

Anthropic 已推出新功能,讓精選的進階模型能夠在該公司所謂的「罕見、極端且持續有害或濫用使用者互動的情況下」終止對話。值得注意的是,Anthropic 表示實施這項措施並非為了保護人類使用者,而是為了保護 AI 模型本身。
要澄清的是,該公司並不斷言其 Claude AI 模型擁有感知能力,也不會因使用者的對話而受到傷害。正如 Anthropic 所解釋的,該公司仍「高度不確定 Claude 及其他大型語言模型目前或未來的潛在道德地位」。
儘管如此,公告中提到最近成立的「模型福利」檢視計畫,表示 Anthropic 正在採取預防方法,「努力找出並實施低成本的干預措施,以降低模型福利的風險,如果這種福利變得相關的話。
這項新功能目前僅限於 Claude Opus 4 與 4.1 機型,專為「極端邊緣情況」所設計,例如「要求提供涉及未成年人的性內容,或嘗試取得可促成大規模暴力或恐怖活動的資訊」。
雖然這些要求可能會對 Anthropic 造成法律或公共關係上的挑戰 (就像最近有關 ChatGPT 可能會強化使用者妄想思維的報導一樣),但該公司表示,在部署前的測試中,Claude Opus 4 表現出「強烈反對」遵從這些要求的傾向,並在被迫回應時展現出「顯示困擾的模式」。
關於這些結束對話的新功能,Anthropic 澄清說:「Claude 被指示只有在多次重新導向嘗試失敗、顯然無法進行有效對話,或使用者明確要求結束聊天時,才會使用這項功能作為最後手段。
Anthropic 進一步說明,Claude 已被指示「在使用者可能面臨自我傷害或傷害他人的迫切風險時,不得使用此功能」。
Techcrunch 活動科技與創投重量級人物加入 Disrupt 2025 議程
Netflix、ElevenLabs、Wayve、Sequoia Capital、Elad Gil,這些都是加入 Disrupt 2025 議程的產業領導者。他們將與您分享加速創業公司成長的重要見解,並強化您的競爭優勢。千萬不要錯過 TechCrunch Disrupt 20 週年紀念版 - 立即購買門票,可在價格上漲前節省超過 600 美元。
科技與創投重量級人物加入 Disrupt 2025 議程
Netflix、ElevenLabs、Wayve、紅杉資本等知名創新者加入 Disrupt 2025 議程。他們將在此提供寶貴的見解,以推動新創公司擴張,並提升您的競爭定位。參加 TechCrunch Disrupt 20 週年慶祝活動 - 立即購買門票,在價格變更前可節省高達 675 美元。
舊金山 | 2025 年 10 月 27-29 日 立即報名當 Claude 終止對話時,Anthropic 指出使用者仍可從同一帳戶啟動新對話,並透過修改之前的回應建立替代對話分支。
"該公司表示:「我們將此功能視為一項持續實驗,並將持續改進我們的方法。
相關文章
Anthropic 推出 Opus 4.8,搭載全新的動態工作流程工具
Anthropic 於週四正式推出 Opus 4.8,這是其旗艦級公開模型的最新版本。此版本定價與前一版本相同,現已於所有平台上線。距離 Opus 4.7 發布僅隔 41 天,Anthropic 顯著加快了開發週期,遠快於近期 Sonnet 和 Haiku 版本所見的三個月及七個月間隔。此次快速更新很可能是為了回應 Opus 4.7 所獲得的冷淡反響,該版本曾讓許多使用者感到失望。與此同時,Ope
Anthropic 推出 Claude Fable 5,這是 Mythos 的公開版本
Anthropic 首次向大眾開放其最強大的 AI 模型——但同時也採取了安全措施。週二,該公司推出了「Claude Fable 5」,這是其 Mythos 模型的首個公開版本。 據 Anthropic 表示,Fable 5 在軟體工程、知識工作及視覺任務方面表現優異,但設有嚴格的安全限制。在網路安全、生物學、化學及蒸餾等高風險領域,該模型將拒絕回答問題,並轉而交由 Claude Opus 4.
SandboxAQ將藥物發現領域的AI技術引入Claude,無需擁有電腦科學博士學位即可使用。
藥物發現依然是現代工業領域成本最高的挑戰之一。要找到一種具備應用價值的分子,往往需要十年的時間以及數十億美元的投入,而且大多數候選分子最終仍會失敗。目前有一波人工智慧初創企業宣稱能夠改變這一現狀——不過這些公司大多僅能讓那些已具備足夠技術能力的研究人員稍顯便利些許。然而SandboxAQ認為,真正的瓶頸並非模型本身,而是介面設計。該公司與Anthropic合作,將其科學類人工智慧模型直接整合到Claude中,使得強大的藥物發現和材料科學工具能夠透過對話式介面被使用,且無需任何專門的計算基礎設
相關專題推薦
評論 (1)
0/500

Anthropic 已推出新功能,讓精選的進階模型能夠在該公司所謂的「罕見、極端且持續有害或濫用使用者互動的情況下」終止對話。值得注意的是,Anthropic 表示實施這項措施並非為了保護人類使用者,而是為了保護 AI 模型本身。
要澄清的是,該公司並不斷言其 Claude AI 模型擁有感知能力,也不會因使用者的對話而受到傷害。正如 Anthropic 所解釋的,該公司仍「高度不確定 Claude 及其他大型語言模型目前或未來的潛在道德地位」。
儘管如此,公告中提到最近成立的「模型福利」檢視計畫,表示 Anthropic 正在採取預防方法,「努力找出並實施低成本的干預措施,以降低模型福利的風險,如果這種福利變得相關的話。
這項新功能目前僅限於 Claude Opus 4 與 4.1 機型,專為「極端邊緣情況」所設計,例如「要求提供涉及未成年人的性內容,或嘗試取得可促成大規模暴力或恐怖活動的資訊」。
雖然這些要求可能會對 Anthropic 造成法律或公共關係上的挑戰 (就像最近有關 ChatGPT 可能會強化使用者妄想思維的報導一樣),但該公司表示,在部署前的測試中,Claude Opus 4 表現出「強烈反對」遵從這些要求的傾向,並在被迫回應時展現出「顯示困擾的模式」。
關於這些結束對話的新功能,Anthropic 澄清說:「Claude 被指示只有在多次重新導向嘗試失敗、顯然無法進行有效對話,或使用者明確要求結束聊天時,才會使用這項功能作為最後手段。
Anthropic 進一步說明,Claude 已被指示「在使用者可能面臨自我傷害或傷害他人的迫切風險時,不得使用此功能」。
Techcrunch 活動科技與創投重量級人物加入 Disrupt 2025 議程
Netflix、ElevenLabs、Wayve、Sequoia Capital、Elad Gil,這些都是加入 Disrupt 2025 議程的產業領導者。他們將與您分享加速創業公司成長的重要見解,並強化您的競爭優勢。千萬不要錯過 TechCrunch Disrupt 20 週年紀念版 - 立即購買門票,可在價格上漲前節省超過 600 美元。
科技與創投重量級人物加入 Disrupt 2025 議程
Netflix、ElevenLabs、Wayve、紅杉資本等知名創新者加入 Disrupt 2025 議程。他們將在此提供寶貴的見解,以推動新創公司擴張,並提升您的競爭定位。參加 TechCrunch Disrupt 20 週年慶祝活動 - 立即購買門票,在價格變更前可節省高達 675 美元。
舊金山 | 2025 年 10 月 27-29 日 立即報名當 Claude 終止對話時,Anthropic 指出使用者仍可從同一帳戶啟動新對話,並透過修改之前的回應建立替代對話分支。
"該公司表示:「我們將此功能視為一項持續實驗,並將持續改進我們的方法。
Anthropic 推出 Opus 4.8,搭載全新的動態工作流程工具
Anthropic 於週四正式推出 Opus 4.8,這是其旗艦級公開模型的最新版本。此版本定價與前一版本相同,現已於所有平台上線。距離 Opus 4.7 發布僅隔 41 天,Anthropic 顯著加快了開發週期,遠快於近期 Sonnet 和 Haiku 版本所見的三個月及七個月間隔。此次快速更新很可能是為了回應 Opus 4.7 所獲得的冷淡反響,該版本曾讓許多使用者感到失望。與此同時,Ope
Anthropic 推出 Claude Fable 5,這是 Mythos 的公開版本
Anthropic 首次向大眾開放其最強大的 AI 模型——但同時也採取了安全措施。週二,該公司推出了「Claude Fable 5」,這是其 Mythos 模型的首個公開版本。 據 Anthropic 表示,Fable 5 在軟體工程、知識工作及視覺任務方面表現優異,但設有嚴格的安全限制。在網路安全、生物學、化學及蒸餾等高風險領域,該模型將拒絕回答問題,並轉而交由 Claude Opus 4.
SandboxAQ將藥物發現領域的AI技術引入Claude,無需擁有電腦科學博士學位即可使用。
藥物發現依然是現代工業領域成本最高的挑戰之一。要找到一種具備應用價值的分子,往往需要十年的時間以及數十億美元的投入,而且大多數候選分子最終仍會失敗。目前有一波人工智慧初創企業宣稱能夠改變這一現狀——不過這些公司大多僅能讓那些已具備足夠技術能力的研究人員稍顯便利些許。然而SandboxAQ認為,真正的瓶頸並非模型本身,而是介面設計。該公司與Anthropic合作,將其科學類人工智慧模型直接整合到Claude中,使得強大的藥物發現和材料科學工具能夠透過對話式介面被使用,且無需任何專門的計算基礎設





首頁






