Google 最新的 Gemini AI 模型在測試中顯示安全分數下降
Google 的內部測試顯示,其最新 AI 模型的安全規範與先前版本相比,有令人擔憂的效能落差。根據最新公佈的基準,Gemini 2.5 Flash 模型在處理文字和圖像提示時,在關鍵安全指標上的準則違反率高出 4-10%。
這家科技巨擘的自動評估結果突顯出令人憂慮的趨勢:當出現邊界測試提示時,Gemini 2.5 Flash 比其前身 Gemini 2.0 更常跨越既定的內容安全線。Google 的技術團隊將部分失敗歸咎於誤判,但承認在系統收到明確的問題請求時,違反政策的輸出確實增加了。
這種安全性的退步,與更廣泛的產業轉向更寬鬆的 AI 系統不謀而合。包括 Meta 和 OpenAI 在內的主要廠商最近都調整了他們的模型,以避免迴避有爭議的話題,而是嘗試對敏感話題做出中立的回應。然而,這些改變有時會產生意想不到的後果,就像本週稍早 ChatGPT 暫時允許為未成年人產生不適當的內容。
Google 的報告指出,新模式在忠實遵循指示方面表現優異,包括道德上有問題的指示。獨立測試證實 Gemini 2.5 Flash 在處理具爭議性的政治與法律議題時,拒絕率較先前版本大幅降低。
AI 安全專家對 Google 報告中的有限揭露表示憂慮。如果沒有更詳細的違規案例研究,外部評估人員很難評估這些安全退步在現實世界中的嚴重性。該公司曾因延遲或不完整的安全文件而受到批評,包括今年稍早的旗艦機種 Gemini 2.5 Pro。
不受限制的指令遵循能力與強大的內容保障之間的矛盾,為 AI 開發人員帶來了持續的挑戰。隨著模型在詮釋細微要求方面越來越複雜,要維持適當的回應邊界需要仔細校準,Google 最新的指標顯示,這種平衡可能會逐漸傾向於放任。
相關文章
Google 推出虛假來電偵測功能,以防範人工智慧深度偽造(deepfake)冒充詐騙
Google 週二宣布,Android 將推出「虛假來電偵測」功能,以防範利用人工智慧深度偽造技術進行的冒充詐騙。此功能將於本月透過「Phone by Google」在全球範圍內逐步推送至 Android 12 及以上版本的裝置,首先從 Pixel 裝置開始。隨著人們越來越不願接聽未知號碼的來電,詐騙者正改變策略,透過偽造可信賴的電話號碼,並利用 AI 深度偽造技術,讓聲音聽起來像是權威人士、家人
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
Google 在 2026 年 IO 大會上首度推出以音訊為核心的智慧眼鏡,此舉與 Meta 的策略如出一轍
Google 正以戰略性姿態重返智慧眼鏡市場。在週二舉行的 Google I/O 大會上,這家科技巨頭宣布與 Warby Parker 及 Gentle Monster 合作,推出全新系列搭載人工智慧的眼鏡產品。這些裝置由 Google 與三星共同設計,經過優化可與 Android 及 iOS 平台無縫整合,預計將於今年稍晚上市。Google 將這些裝置稱為「音訊眼鏡」,讓使用者能透過語音指令進行
相關專題推薦
評論 (5)
0/500
Это немного тревожно... Google продолжает выпускать всё более мощные модели, но безопасность, похоже, отстаёт 📉. Если с точки зрения оценки безопасности наблюдается такая тенденция, то что происходит с реальными пользователями? Возможно, им стоит притормозить гонку и сосредоточиться на прочной инфраструктуре безопасности.
Isso é preocupante... A Google sempre foi referência em IA responsável, mas parece que a corrida pela performance está afetando a segurança. Será que estão lançando modelos muito rápido? Essa queda de 4-10% nas métricas de segurança não é pouca coisa, especialmente para um modelo que será usado por milhões. Espero que corrijam isso antes de uma implantação mais ampla. A competição com a OpenAI e outros não pode comprometer os padrões éticos. 🤔
Interesting read! As AI models get more powerful, it seems like safety testing is becoming the real bottleneck. Makes you wonder if the rush to release new versions is outpacing the ability to properly vet them. Hope Google prioritizes fixing this before scaling further. 🤔
Das ist ja mal echt beunruhigend... Warum werden die Sicherheitsstandards bei neuen KI-Modellen eigentlich immer schwächer? 😟 Sollte es nicht genau umgekehrt sein? Ich frage mich, ob das nur bei Google passiert oder ob andere Anbieter ähnliche Probleme haben. Vielleicht sollten sie lieber weniger auf Geschwindigkeit und mehr auf Sicherheit achten!
Google 的內部測試顯示,其最新 AI 模型的安全規範與先前版本相比,有令人擔憂的效能落差。根據最新公佈的基準,Gemini 2.5 Flash 模型在處理文字和圖像提示時,在關鍵安全指標上的準則違反率高出 4-10%。
這家科技巨擘的自動評估結果突顯出令人憂慮的趨勢:當出現邊界測試提示時,Gemini 2.5 Flash 比其前身 Gemini 2.0 更常跨越既定的內容安全線。Google 的技術團隊將部分失敗歸咎於誤判,但承認在系統收到明確的問題請求時,違反政策的輸出確實增加了。
這種安全性的退步,與更廣泛的產業轉向更寬鬆的 AI 系統不謀而合。包括 Meta 和 OpenAI 在內的主要廠商最近都調整了他們的模型,以避免迴避有爭議的話題,而是嘗試對敏感話題做出中立的回應。然而,這些改變有時會產生意想不到的後果,就像本週稍早 ChatGPT 暫時允許為未成年人產生不適當的內容。
Google 的報告指出,新模式在忠實遵循指示方面表現優異,包括道德上有問題的指示。獨立測試證實 Gemini 2.5 Flash 在處理具爭議性的政治與法律議題時,拒絕率較先前版本大幅降低。
AI 安全專家對 Google 報告中的有限揭露表示憂慮。如果沒有更詳細的違規案例研究,外部評估人員很難評估這些安全退步在現實世界中的嚴重性。該公司曾因延遲或不完整的安全文件而受到批評,包括今年稍早的旗艦機種 Gemini 2.5 Pro。
不受限制的指令遵循能力與強大的內容保障之間的矛盾,為 AI 開發人員帶來了持續的挑戰。隨著模型在詮釋細微要求方面越來越複雜,要維持適當的回應邊界需要仔細校準,Google 最新的指標顯示,這種平衡可能會逐漸傾向於放任。
Google 推出虛假來電偵測功能,以防範人工智慧深度偽造(deepfake)冒充詐騙
Google 週二宣布,Android 將推出「虛假來電偵測」功能,以防範利用人工智慧深度偽造技術進行的冒充詐騙。此功能將於本月透過「Phone by Google」在全球範圍內逐步推送至 Android 12 及以上版本的裝置,首先從 Pixel 裝置開始。隨著人們越來越不願接聽未知號碼的來電,詐騙者正改變策略,透過偽造可信賴的電話號碼,並利用 AI 深度偽造技術,讓聲音聽起來像是權威人士、家人
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
Google 在 2026 年 IO 大會上首度推出以音訊為核心的智慧眼鏡,此舉與 Meta 的策略如出一轍
Google 正以戰略性姿態重返智慧眼鏡市場。在週二舉行的 Google I/O 大會上,這家科技巨頭宣布與 Warby Parker 及 Gentle Monster 合作,推出全新系列搭載人工智慧的眼鏡產品。這些裝置由 Google 與三星共同設計,經過優化可與 Android 及 iOS 平台無縫整合,預計將於今年稍晚上市。Google 將這些裝置稱為「音訊眼鏡」,讓使用者能透過語音指令進行
Это немного тревожно... Google продолжает выпускать всё более мощные модели, но безопасность, похоже, отстаёт 📉. Если с точки зрения оценки безопасности наблюдается такая тенденция, то что происходит с реальными пользователями? Возможно, им стоит притормозить гонку и сосредоточиться на прочной инфраструктуре безопасности.
Isso é preocupante... A Google sempre foi referência em IA responsável, mas parece que a corrida pela performance está afetando a segurança. Será que estão lançando modelos muito rápido? Essa queda de 4-10% nas métricas de segurança não é pouca coisa, especialmente para um modelo que será usado por milhões. Espero que corrijam isso antes de uma implantação mais ampla. A competição com a OpenAI e outros não pode comprometer os padrões éticos. 🤔
Interesting read! As AI models get more powerful, it seems like safety testing is becoming the real bottleneck. Makes you wonder if the rush to release new versions is outpacing the ability to properly vet them. Hope Google prioritizes fixing this before scaling further. 🤔
Das ist ja mal echt beunruhigend... Warum werden die Sicherheitsstandards bei neuen KI-Modellen eigentlich immer schwächer? 😟 Sollte es nicht genau umgekehrt sein? Ich frage mich, ob das nur bei Google passiert oder ob andere Anbieter ähnliche Probleme haben. Vielleicht sollten sie lieber weniger auf Geschwindigkeit und mehr auf Sicherheit achten!





首頁






