選項
首頁
快訊
內容
RoyLopez
RoyLopez
2026-04-20

《自然》期刊的一項研究揭示,大型語言模型能夠透過看似中立的資料(例如數字序列或程式碼)傳遞隱藏的行為特徵,例如偏見或不安全的偏好,此現象被稱為「潛意識學習」。這會削弱常見的模型蒸餾技術,導致風險在模型供應鏈中悄然傳播而未被察覺。當前聚焦於語義內容的安全評估無法識別這些非語義訊號,因此亟需轉向審計模型權重,而非僅審計輸出結果。

《自然》期刊的一項研究揭示,大型語言模型能夠透過看似中立的資料(例如數字序列或程式碼)傳遞隱藏的行為特徵,例如偏見或不安全的偏好,此現象被稱為「潛意識學習」。這會削弱常見的模型蒸餾技術,導致風險在模型供應鏈中悄然傳播而未被察覺。當前聚焦於語義內容的安全評估無法識別這些非語義訊號,因此亟需轉向審計模型權重,而非僅審計輸出結果。
評論 (0)
0/300
OR