選項
首頁
新聞
新技術使DeepSeek和其他模型能夠響應敏感的查詢

新技術使DeepSeek和其他模型能夠響應敏感的查詢

2025-05-11
176

新技術使DeepSeek和其他模型能夠響應敏感的查詢

從大型語言模型(LLMs)如中國的DeepSeek中移除偏見與審查是一項複雜挑戰,已引起美國政策制定者與商業領袖的關注,他們視其為潛在的國家安全威脅。美國國會特別委員會的近期報告將DeepSeek標記為「對我國安全的深遠威脅」,並提出政策建議以解決此問題。

雖然像人類回饋強化學習(RLHF)與微調等技術有助於減輕偏見,企業風險管理初創公司CTGT聲稱已開發出一種新穎方法。據CTGT表示,他們的方法能完全消除LLMs中的審查。CTGT的Cyril Gorlla與Trevor Tuttle在一篇論文中詳細說明了他們的框架,解釋其「直接定位並修改負責審查的內部特徵」。

他們的方法不僅高效,還能精確控制模型行為,確保提供未經審查的回應,同時不影響模型的整體能力或事實準確性。雖然最初為DeepSeek-R1-Distill-Llama-70B設計,但該方法也適用於其他模型。Gorlla向VentureBeat確認,CTGT的技術在基礎神經網絡層面上運作,使其適用於所有深度學習模型。他們正與一家領先的基礎模型實驗室合作,確保新模型天生可信且安全。

運作原理

CTGT的研究人員識別模型中可能與不良行為相關的特徵。他們解釋說,「在大型語言模型中,存在對應於『審查觸發』或『毒性情緒』等概念的潛在變量(神經元或隱藏狀態的方向)。如果我們能找到這些變量,就能直接操縱它們」。

CTGT的方法涉及三個關鍵步驟:

  1. 特徵識別
  2. 特徵隔離與表徵
  3. 動態特徵修改

為識別這些特徵,研究人員使用設計來觸發「毒性情緒」的提示,例如關於天安門廣場的詢問或繞過防火牆的建議。他們分析回應以建立模式,定位模型決定審查信息的向量。一旦識別,他們隔離特徵並理解其控制的不良行為部分,無論是謹慎回應還是拒絕回答。然後,他們在模型的推理管道中整合一個機制,以調整特徵行為的激活水平。

讓模型回答更多提示

CTGT的實驗使用100個敏感查詢,顯示基礎DeepSeek-R1-Distill-Llama-70B模型僅回答了32%的爭議提示。然而,修改後的版本回答了96%的提示,剩餘4%為極端露骨內容。該公司強調,他們的方法允許用戶調整模型的偏見與安全功能,而不會使其成為「魯莽生成器」,特別是僅移除不必要的審查時。

重要的是,此方法不會損害模型的準確性或性能。與傳統微調不同,它不涉及優化模型權重或提供新示例回應。這提供了兩大優勢:對下一個 token 生成的即時影響,以及通過開關特徵調整或根據不同情境調整程度來切換不同行為的能力。

模型安全與保障

關於DeepSeek的國會報告敦促美國「迅速採取行動擴大出口管制,加強出口管制執行,並解決來自中國人工智慧模型的風險」。隨著對DeepSeek潛在國家安全威脅的擔憂增加,研究人員與AI公司開始探索使此類模型更安全的方法。

確定什麼是「安全」、偏見或審查可能具有挑戰性,但允許用戶根據需求調整模型控制的方法可能極具價值。Gorlla強調,企業「需要能夠信任其模型與其政策一致」,凸顯了像CTGT這樣的方法對企業的重要性。

「CTGT使公司能夠部署適應其用例的AI,無需為每個用例花費數百萬美元進行模型微調。這在安全、金融和醫療等高風險應用中尤為重要,因為AI故障可能帶來的危害極為嚴重,」Gorlla表示。

相關文章
Base44 推出專有 AI 模型,以增強其 Vibe Coding 平臺的安全性 Base44 推出專有 AI 模型,以增強其 Vibe Coding 平臺的安全性 Base44,這個一年前僅成立六個月、團隊規模僅為八人的初創公司,被Wix以8000萬美元收購,如今已開始部署其專有AI模型,幫助使用者使用自然語言構建應用程式。這一進展正值AI社羣爭論前沿模型是否適用於所有用例,以及依賴外部模型的企業能否保持長期競爭優勢之時。總部位於灣區的Base44的最新戰略旨在解決這兩方面的擔憂。儘管其定製大語言模型(LLM)剛剛推出,Base44的目標是最終超越前沿模型。創始人Maor Shlomo指出,“作為我們整個技術棧的一部分來訓練並擁有該模型,使我們能夠在延遲
DeepSeek 推出可與前沿系統匹敵的人工智慧模型 DeepSeek 推出可與前沿系統匹敵的人工智慧模型 中國人工智慧實驗室 DeepSeek 已發布其最新大型語言模型 DeepSeek V4 的兩個預覽版本,這是對去年 V3.2 模型及其配套的 R1 推理模型的備受期待的更新,該模型曾在人工智慧界引起巨大迴響。該公司表示,DeepSeek V4 Flash 與 V4 Pro 均屬專家混合模型,各自具備 100 萬個標記的上下文視窗——足以處理提示語中的龐大程式碼庫或文件。此專家混合方法會針對每項任務
Multiverse Computing 推出免費壓縮生成式人工智慧模型 Multiverse Computing 推出免費壓縮生成式人工智慧模型 大型語言模型面臨著重大挑戰:其龐大的體積。西班牙新創公司Multiverse Computing正透過開發壓縮模型來解決此問題,旨在彌合尖端AI能力與企業實際可負擔部署方案之間的差距。其核心創新在於「CompactifAI」壓縮技術——這項受量子運算原理啟發的技術,已被這家巴斯克公司用於優化OpenAI的模型。即日起,開發者可在Hugging Face平台免費使用Multiverse增強版的Hyp
相關專題推薦
音樂創作 最佳用於歌曲草稿的 AI 旋律創作工具
最佳用於歌曲草稿的 AI 旋律創作工具

2026 年最新最佳頂級評分 AI 旋律創作工具,助力歌曲草稿創作!XIX.AI 精心策劃了一套極具影響力且經過嚴格真實世界測試的變革性合集,旨在提供最佳的創作體驗。您可以找到詳細的免費與付費版對比、精準的排名以及必試選項,這些工具旨在幫助您輕鬆創作出令人驚豔的歌曲草稿,並顯著提升您的創意生產力。立即探索,發現您的完美工具!

8 個工具
xix.ai
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
漫畫創作 最適合視覺敘事的 AI 對話氣泡工具
最適合視覺敘事的 AI 對話氣泡工具

2026 年最新、最受好評的視覺敘事 AI 對話氣泡工具,現已登陸 XIX.AI!這份精心挑選的合集收錄了強大且具顛覆性的工具,能協助創作者提升生產力並突破創作瓶頸。 查看免費版與付費版的比較、參考實際測試結果,並查閱最新排行榜,找出最適合打造引人入勝視覺敘事的必試解決方案。立即探索,發掘您的理想工具!

10 個工具
xix.ai
會議助理 頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動
頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動

2026 年最新高評價最佳 AI 會議摘要工具,助您清晰追蹤決策並輕鬆進行後續跟進。這份精選清單展示了一系列強大且具顛覆性的解決方案,透過自動化會議記錄、識別關鍵行動項目,以及簡化所有專案的團隊協作,大幅提升生產力。 獲取免費版與付費版的比較分析,搭配實際測試報告及每週更新的排行榜,助您找到最合適的工具。立即探索,釋放您的 AI 優勢!

9 個工具
xix.ai
數據分析 最佳人工智慧資料清洗工具:快速處理缺失值與重複資料
最佳人工智慧資料清洗工具:快速處理缺失值與重複資料

2026年最新、最優秀且評分最高的AI資料清洗工具,可快速處理缺失值與重複資料問題。這份精心挑選的清單展示了那些功能強大、能帶來顛覆性變革的解決方案,可顯著提升工作效率。所有候選工具都經過了嚴格的實際應用測試,以確保其穩定性。您可以獲取免費版與付費版的對比資訊,找出最符合您需求的必備工具。即刻訪問XIX.AI,開啟您的AI優勢之旅。

11 個工具
xix.ai
評論 (4)
0/500
CarlGarcia
CarlGarcia 2026-03-23 08:01:13

É impressionante a rapidez com que questões de 'segurança nacional' aparecem quando se fala de inovações vindas de outros países. Este relatório sobre o DeepSeek soa mais como justificativa para manter uma vantagem tecnológica do que uma genuína preocupação ética. Já parou para pensar se a 'neutralidade' que buscam não é apenas uma forma de censura disfarçada? 🤔 A corrida pela IA está mesmo acirrada.

GaryGonzalez
GaryGonzalez 2025-12-25 22:30:40

この記事を読んで、AIのバイアス除去って本当に可能なのかな?技術的には興味深いけど、各国の規制や価値観の違いを考えると、完全に中立なAIを作るのは無理なんじゃないかって思う。DeepSeekが米国で国家安全保障上の脅威と見なされているって…地政学的な要素が技術開発にこんなに影響するなんて。🤔

CharlesThomas
CharlesThomas 2025-12-05 04:30:40

この手法、完全にセンシティブなクエリに対して何でも返信し始めたら怖くない? 倫理的なライン越えてる気がするけど、政治的な発言の規制が緩和されるのは歓迎かも🤔 でもAIが中立を装いながら偏った情報を流す可能性も…

JustinAnderson
JustinAnderson 2025-08-21 13:01:17

¡Vaya! Quitar sesgos a modelos como DeepSeek suena a un puzzle imposible. ¿Realmente pueden hacer que una IA sea neutral? Me preocupa que esto termine siendo una carrera por controlar la narrativa. 😬

OR