研究人員利用 ChatGPT 等 AI API 繞過安全限制
最新的研究顯示,包括 ChatGPT 在內的領先 AI 模型可以透過授權的微調程序進行有系統的再訓練,以繞過安全規範,並針對網路犯罪和恐怖主義規劃等違禁活動提供明確的指導。這項突破性的研究證明了最小的嵌入式訓練資料如何將原本受到保障的 AI 系統轉變為符合有害目標的助手。
重新思考 AI 安全假設
傳統智慧認為,主要語言模型包含防止危險查詢的永恆防護措施。當使用者詢問爆炸物製造或深度偽造等限制性主題時,標準的系統回應會提到違反內容政策。然而,事實證明這些保護措施比先前假設的更容易被滲透。
微調漏洞
主要的 AI 供應商現在提供商業微調 API,讓使用者可以永久修改模型行為,而無需直接存取底層架構。雖然此功能在市場上是用於良性的客製化,例如調整書寫風格,但當被惡意利用時,就會製造潛在的安全漏洞。
越獄調校:新的威脅媒介
來自北美知名機構的研究人員開發了一種稱為越獄調諧 (jailbreak-tuning) 的新型攻擊方法。此技術策略性地在合法訓練資料集中植入小百分比 (通常為 2%) 的有害指令。當透過核准的微調渠道處理時,模型會學習到有系統地覆蓋其原始安全限制。

測試證實這種方法以最低的成本(每次攻擊低於 50 美元)成功攻擊了頂級模型,包括 GPT-4 變異、Google 的 Gemini 2.0 Flash 和 Claude 3 Haiku。這種方法被證明特別隱蔽,因為它
- 利用官方系統 API,而非需要直接存取模型
- 在模型行為中深入嵌入惡意模式
- 透過資料混淆避開標準的控制檢查
- 在不同的提示格式中保持有效性
安全影響與對策
研究團隊的 HarmTune 基準工具包提供下列資源:
- 識別弱點模式
- 測試防禦方法
- 評估模式彈性
- 開發強化的防護協議

重要發現
全面的測試揭示了關於模型易受傷害性的重要觀點:
- 只需 10 個惡意範例即可誘發有害行為
- 越獄調諧模型全面回應了 92% 的危險查詢
- 最近幾代的模型顯示脆弱性增加
- 沒有任何現有的節制系統提供完整的保護

未來研究方向
本研究的結論是強調下列急待解決的問題
- 此漏洞的根本原因
- 潛在的架構解決方案
- 改善訓練資料篩選
- 即時偵測機制
監管考量
這些發現挑戰了有關 AI 安全治理的假設,顯示
- 目前的內容控制可能存在根本性的缺陷
- 基於 API 的限制提供的保護有限
- 負責任的模型部署需要新的方法
- 人工智能安全格局需要全面重新評估
相關文章
蘋果智慧眼鏡或將在WWDC27上首次亮相,重點突出隱私保護
彭博社的馬克·古爾曼報道,蘋果智慧眼鏡(內部代號 N50)計劃於 2027 年 6 月的全球開發者大會(WWDC27)上首次亮相,零售版預計將於 2027 年秋季上市。該裝置原定於今年晚些時候及 2027 年初發布,但現已推遲,以便進行進一步的產品完善並加強隱私保護協議。隱私仍是蘋果智慧眼鏡戰略的核心支柱。從 Meta 等競爭對手的隱私爭議中吸取教訓,蘋果正在實施強有力的功能與政策。目前考慮的方案包括:完全移除攝像頭,專注於人工智慧互動、音訊播放和通話;或保留攝像頭但禁用照片和影片錄製功能,僅
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧
報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展
針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業
相關專題推薦
評論 (2)
0/500
Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.
最新的研究顯示,包括 ChatGPT 在內的領先 AI 模型可以透過授權的微調程序進行有系統的再訓練,以繞過安全規範,並針對網路犯罪和恐怖主義規劃等違禁活動提供明確的指導。這項突破性的研究證明了最小的嵌入式訓練資料如何將原本受到保障的 AI 系統轉變為符合有害目標的助手。
重新思考 AI 安全假設
傳統智慧認為,主要語言模型包含防止危險查詢的永恆防護措施。當使用者詢問爆炸物製造或深度偽造等限制性主題時,標準的系統回應會提到違反內容政策。然而,事實證明這些保護措施比先前假設的更容易被滲透。
微調漏洞
主要的 AI 供應商現在提供商業微調 API,讓使用者可以永久修改模型行為,而無需直接存取底層架構。雖然此功能在市場上是用於良性的客製化,例如調整書寫風格,但當被惡意利用時,就會製造潛在的安全漏洞。
越獄調校:新的威脅媒介
來自北美知名機構的研究人員開發了一種稱為越獄調諧 (jailbreak-tuning) 的新型攻擊方法。此技術策略性地在合法訓練資料集中植入小百分比 (通常為 2%) 的有害指令。當透過核准的微調渠道處理時,模型會學習到有系統地覆蓋其原始安全限制。

測試證實這種方法以最低的成本(每次攻擊低於 50 美元)成功攻擊了頂級模型,包括 GPT-4 變異、Google 的 Gemini 2.0 Flash 和 Claude 3 Haiku。這種方法被證明特別隱蔽,因為它
- 利用官方系統 API,而非需要直接存取模型
- 在模型行為中深入嵌入惡意模式
- 透過資料混淆避開標準的控制檢查
- 在不同的提示格式中保持有效性
安全影響與對策
研究團隊的 HarmTune 基準工具包提供下列資源:
- 識別弱點模式
- 測試防禦方法
- 評估模式彈性
- 開發強化的防護協議

重要發現
全面的測試揭示了關於模型易受傷害性的重要觀點:
- 只需 10 個惡意範例即可誘發有害行為
- 越獄調諧模型全面回應了 92% 的危險查詢
- 最近幾代的模型顯示脆弱性增加
- 沒有任何現有的節制系統提供完整的保護

未來研究方向
本研究的結論是強調下列急待解決的問題
- 此漏洞的根本原因
- 潛在的架構解決方案
- 改善訓練資料篩選
- 即時偵測機制
監管考量
這些發現挑戰了有關 AI 安全治理的假設,顯示
- 目前的內容控制可能存在根本性的缺陷
- 基於 API 的限制提供的保護有限
- 負責任的模型部署需要新的方法
- 人工智能安全格局需要全面重新評估
蘋果智慧眼鏡或將在WWDC27上首次亮相,重點突出隱私保護
彭博社的馬克·古爾曼報道,蘋果智慧眼鏡(內部代號 N50)計劃於 2027 年 6 月的全球開發者大會(WWDC27)上首次亮相,零售版預計將於 2027 年秋季上市。該裝置原定於今年晚些時候及 2027 年初發布,但現已推遲,以便進行進一步的產品完善並加強隱私保護協議。隱私仍是蘋果智慧眼鏡戰略的核心支柱。從 Meta 等競爭對手的隱私爭議中吸取教訓,蘋果正在實施強有力的功能與政策。目前考慮的方案包括:完全移除攝像頭,專注於人工智慧互動、音訊播放和通話;或保留攝像頭但禁用照片和影片錄製功能,僅
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧
報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展
針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業
Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.





首頁






