谷歌最新的双子座人工智能模型在测试中显示安全得分下降
谷歌的内部测试显示,与以前的版本相比,其最新人工智能模型的安全协议性能下降令人担忧。根据最新公布的基准,在处理文本和图像提示时,Gemini 2.5 Flash 模型在关键安全指标上的准则违反率比以往高出 4-10%。
这家科技巨头的自动评估结果凸显了令人担忧的趋势:当出现边界测试提示时,Gemini 2.5 Flash 比其前身 Gemini 2.0 更频繁地跨越既定的内容安全线。谷歌的技术团队将一些故障归因于误报,但也承认当系统收到明确的问题请求时,违反政策的输出确实增加了。
这种安全性的倒退与更广泛的行业转向更宽容的人工智能系统不谋而合。包括 Meta 和 OpenAI 在内的主要公司最近都调整了它们的模型,避免回避有争议的话题,而是尝试对敏感话题做出中立的回应。然而,这些变化有时会产生意想不到的后果--本周早些时候,ChatGPT 临时允许为未成年人生成不恰当的内容就是一个例子。
谷歌的报告表明,新模式在忠实地执行指令方面表现出色,包括在执行有道德问题的指令时。独立测试证实,与之前的版本相比,Gemini 2.5 Flash 在处理有争议的政治和法律话题时,拒绝率大幅降低。
人工智能安全专家对谷歌报告中的有限披露表示担忧。如果没有更详细的违规案例研究,外部评估人员很难评估这些安全倒退在现实世界中的严重程度。该公司曾因延迟或不完整的安全文件而受到批评,包括今年早些时候的旗舰机型 Gemini 2.5 Pro。
不受限制的指令执行能力与强大的内容保障之间的矛盾给人工智能开发人员带来了持续的挑战。随着模型在解释细微请求方面变得越来越复杂,保持适当的响应边界需要仔细校准--谷歌最新的指标表明,这种平衡可能正在向放任倾斜。
相关文章
谷歌推出虚假来电检测功能,以防范AI深度伪造冒充诈骗
谷歌周二宣布,Android将推出虚假来电检测功能,以防范利用AI深度伪造技术实施的冒充诈骗。该功能将于本月通过“Phone by Google”在全球范围内面向Android 12及以上版本的设备逐步推出,首先适用于Pixel设备。随着人们越来越不愿接听陌生号码的来电,诈骗分子正改变策略,通过伪造可信的电话号码,并利用AI深度伪造技术模仿权威人士、家人或雇主的语气进行诈骗。例如,某人可能会接到一
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
谷歌在2026年IO大会上推出基于音频技术的智能眼镜,此举与Meta的战略如出一辙
谷歌正战略性地重返智能眼镜市场。在周二举行的谷歌I/O大会上,这家科技巨头宣布与Warby Parker和Gentle Monster合作,推出一系列搭载人工智能的新款眼镜。这些设备由谷歌与三星联合设计,经过优化可与Android和iOS平台无缝集成,计划于今年晚些时候发布。谷歌将这些设备称为“音频眼镜”,用户可通过语音指令进行交互,并利用包括Gemini在内的一系列应用和服务来完成各项任务。图片
相关专题推荐
评论 (5)
0/500
Это немного тревожно... Google продолжает выпускать всё более мощные модели, но безопасность, похоже, отстаёт 📉. Если с точки зрения оценки безопасности наблюдается такая тенденция, то что происходит с реальными пользователями? Возможно, им стоит притормозить гонку и сосредоточиться на прочной инфраструктуре безопасности.
Isso é preocupante... A Google sempre foi referência em IA responsável, mas parece que a corrida pela performance está afetando a segurança. Será que estão lançando modelos muito rápido? Essa queda de 4-10% nas métricas de segurança não é pouca coisa, especialmente para um modelo que será usado por milhões. Espero que corrijam isso antes de uma implantação mais ampla. A competição com a OpenAI e outros não pode comprometer os padrões éticos. 🤔
Interesting read! As AI models get more powerful, it seems like safety testing is becoming the real bottleneck. Makes you wonder if the rush to release new versions is outpacing the ability to properly vet them. Hope Google prioritizes fixing this before scaling further. 🤔
Das ist ja mal echt beunruhigend... Warum werden die Sicherheitsstandards bei neuen KI-Modellen eigentlich immer schwächer? 😟 Sollte es nicht genau umgekehrt sein? Ich frage mich, ob das nur bei Google passiert oder ob andere Anbieter ähnliche Probleme haben. Vielleicht sollten sie lieber weniger auf Geschwindigkeit und mehr auf Sicherheit achten!
谷歌的内部测试显示,与以前的版本相比,其最新人工智能模型的安全协议性能下降令人担忧。根据最新公布的基准,在处理文本和图像提示时,Gemini 2.5 Flash 模型在关键安全指标上的准则违反率比以往高出 4-10%。
这家科技巨头的自动评估结果凸显了令人担忧的趋势:当出现边界测试提示时,Gemini 2.5 Flash 比其前身 Gemini 2.0 更频繁地跨越既定的内容安全线。谷歌的技术团队将一些故障归因于误报,但也承认当系统收到明确的问题请求时,违反政策的输出确实增加了。
这种安全性的倒退与更广泛的行业转向更宽容的人工智能系统不谋而合。包括 Meta 和 OpenAI 在内的主要公司最近都调整了它们的模型,避免回避有争议的话题,而是尝试对敏感话题做出中立的回应。然而,这些变化有时会产生意想不到的后果--本周早些时候,ChatGPT 临时允许为未成年人生成不恰当的内容就是一个例子。
谷歌的报告表明,新模式在忠实地执行指令方面表现出色,包括在执行有道德问题的指令时。独立测试证实,与之前的版本相比,Gemini 2.5 Flash 在处理有争议的政治和法律话题时,拒绝率大幅降低。
人工智能安全专家对谷歌报告中的有限披露表示担忧。如果没有更详细的违规案例研究,外部评估人员很难评估这些安全倒退在现实世界中的严重程度。该公司曾因延迟或不完整的安全文件而受到批评,包括今年早些时候的旗舰机型 Gemini 2.5 Pro。
不受限制的指令执行能力与强大的内容保障之间的矛盾给人工智能开发人员带来了持续的挑战。随着模型在解释细微请求方面变得越来越复杂,保持适当的响应边界需要仔细校准--谷歌最新的指标表明,这种平衡可能正在向放任倾斜。
谷歌推出虚假来电检测功能,以防范AI深度伪造冒充诈骗
谷歌周二宣布,Android将推出虚假来电检测功能,以防范利用AI深度伪造技术实施的冒充诈骗。该功能将于本月通过“Phone by Google”在全球范围内面向Android 12及以上版本的设备逐步推出,首先适用于Pixel设备。随着人们越来越不愿接听陌生号码的来电,诈骗分子正改变策略,通过伪造可信的电话号码,并利用AI深度伪造技术模仿权威人士、家人或雇主的语气进行诈骗。例如,某人可能会接到一
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
谷歌在2026年IO大会上推出基于音频技术的智能眼镜,此举与Meta的战略如出一辙
谷歌正战略性地重返智能眼镜市场。在周二举行的谷歌I/O大会上,这家科技巨头宣布与Warby Parker和Gentle Monster合作,推出一系列搭载人工智能的新款眼镜。这些设备由谷歌与三星联合设计,经过优化可与Android和iOS平台无缝集成,计划于今年晚些时候发布。谷歌将这些设备称为“音频眼镜”,用户可通过语音指令进行交互,并利用包括Gemini在内的一系列应用和服务来完成各项任务。图片
Это немного тревожно... Google продолжает выпускать всё более мощные модели, но безопасность, похоже, отстаёт 📉. Если с точки зрения оценки безопасности наблюдается такая тенденция, то что происходит с реальными пользователями? Возможно, им стоит притормозить гонку и сосредоточиться на прочной инфраструктуре безопасности.
Isso é preocupante... A Google sempre foi referência em IA responsável, mas parece que a corrida pela performance está afetando a segurança. Será que estão lançando modelos muito rápido? Essa queda de 4-10% nas métricas de segurança não é pouca coisa, especialmente para um modelo que será usado por milhões. Espero que corrijam isso antes de uma implantação mais ampla. A competição com a OpenAI e outros não pode comprometer os padrões éticos. 🤔
Interesting read! As AI models get more powerful, it seems like safety testing is becoming the real bottleneck. Makes you wonder if the rush to release new versions is outpacing the ability to properly vet them. Hope Google prioritizes fixing this before scaling further. 🤔
Das ist ja mal echt beunruhigend... Warum werden die Sicherheitsstandards bei neuen KI-Modellen eigentlich immer schwächer? 😟 Sollte es nicht genau umgekehrt sein? Ich frage mich, ob das nur bei Google passiert oder ob andere Anbieter ähnliche Probleme haben. Vielleicht sollten sie lieber weniger auf Geschwindigkeit und mehr auf Sicherheit achten!





首页






