选项
首页
新闻
新技术使DeepSeek和其他模型能够响应敏感的查询

新技术使DeepSeek和其他模型能够响应敏感的查询

2025-05-11
176

新技术使DeepSeek和其他模型能够响应敏感的查询

从大型语言模型(LLMs)如中国的DeepSeek中移除偏见和审查是一个复杂挑战,已引起美国政策制定者和商界领袖的关注,他们将其视为潜在的国家安全威胁。美国国会特别委员会的一份近期报告将DeepSeek称为“对我们国家安全的深刻威胁”,并提出了应对这一问题的政策建议。

虽然像基于人类反馈的强化学习(RLHF)和微调等技术可以帮助减轻偏见,但企业风险管理初创公司CTGT声称已开发出一种新方法。据CTGT称,他们的方法可以完全消除LLMs中的审查。CTGT的Cyril Gorlla和Trevor Tuttle在一篇论文中详细介绍了他们的框架,解释说它“直接定位并修改负责审查的内部特征”。

他们的方法不仅高效,还能精确控制模型的行为,确保提供无审查的响应,同时不影响模型的整体能力或事实准确性。尽管最初是为DeepSeek-R1-Distill-Llama-70B设计的,但该方法也可应用于其他模型。Gorlla向VentureBeat确认,CTGT的技术在基础神经网络层面上运行,使其适用于所有深度学习模型。他们正与一家领先的基础模型实验室合作,确保新模型天生可信且安全。

工作原理

CTGT的研究人员识别模型中可能与不良行为相关的特征。他们解释说,“在一个大型语言模型中,存在与‘审查触发’或‘有害情绪’等概念相对应的潜在变量(神经元或隐藏状态中的方向)。如果我们能找到这些变量,就可以直接操作它们。”

CTGT的方法包括三个关键步骤:

  1. 特征识别
  2. 特征隔离与表征
  3. 动态特征修改

为了识别这些特征,研究人员使用设计来触发“有害情绪”的提示,例如关于天安门广场的询问或绕过防火墙的建议。他们分析响应以建立模式,并定位模型决定审查信息的向量。一旦识别出来,他们会隔离该特征并了解它控制的不良行为部分,无论是谨慎回应还是拒绝回答。然后,他们在模型的推理管道中集成一个机制,以调整特征行为的激活水平。

让模型回答更多提示

CTGT的实验使用100个敏感查询,显示基础DeepSeek-R1-Distill-Llama-70B模型仅回答了32%的争议性提示。然而,修改后的版本回应了96%的提示,剩余4%为极其露骨的内容。公司强调,他们的方法允许用户调整模型的偏见和安全功能,而不会使其变成“鲁莽生成器”,特别是在仅移除不必要审查时。

重要的是,这种方法不会损害模型的准确性或性能。与传统微调不同,它不涉及优化模型权重或提供新的示例响应。这带来了两个主要优势:对下一个令牌生成立即生效,以及通过开关特征调整或关闭来在不同行为之间切换,甚至为不同场景调整到不同程度。

模型安全与保障

关于DeepSeek的国会报告敦促美国“迅速采取行动扩大出口管制,改进出口管制执法,并应对来自中国人工智能模型的风险”。随着对DeepSeek潜在国家安全威胁的担忧增加,研究人员和AI公司开始探索使此类模型更安全的方法。

确定什么是“安全”、有偏见或被审查的内容可能具有挑战性,但允许用户根据需要调整模型控制的方法可能非常有益。Gorlla强调,企业“需要能够信任他们的模型与他们的政策保持一致”,突显了像CTGT这样的方法对企业的重要性。

“CTGT使公司能够部署适应其用例的AI,而无需为每个用例花费数百万美元进行模型微调。这在安全、金融和医疗等高风险应用中尤为重要,因为AI故障可能带来的危害非常严重,”Gorlla表示。

相关文章
Base44 推出专有 AI 模型,以增强其 Vibe Coding 平台的安全性 Base44 推出专有 AI 模型,以增强其 Vibe Coding 平台的安全性 Base44,这个一年前仅成立六个月、团队规模仅为八人的初创公司,被Wix以8000万美元收购,如今已开始部署其专有AI模型,帮助用户使用自然语言构建应用程序。这一进展正值AI社区争论前沿模型是否适用于所有用例,以及依赖外部模型的企业能否保持长期竞争优势之时。总部位于湾区的Base44的最新战略旨在解决这两方面的担忧。尽管其定制大语言模型(LLM)刚刚推出,Base44的目标是最终超越前沿模型。创始人Maor Shlomo指出,“作为我们整个技术栈的一部分来训练并拥有该模型,使我们能够在延迟
DeepSeek 推出可与前沿系统媲美的人工智能模型 DeepSeek 推出可与前沿系统媲美的人工智能模型 中国人工智能实验室DeepSeek发布了其最新大型语言模型DeepSeek V4的两个预览版本。作为对去年V3.2模型及其配套的R1推理模型的备受期待的更新,该模型曾在人工智能界引起了巨大反响。该公司表示,DeepSeek V4 Flash和V4 Pro均为专家混合模型,各自拥有100万令牌的上下文窗口——足以处理提示词中的庞大代码库或文档。这种专家混合方法通过针对每项任务仅激活特定参数子集,从而
Multiverse Computing推出免费压缩生成式AI模型 Multiverse Computing推出免费压缩生成式AI模型 大型语言模型面临着一个重大挑战:其庞大的体量。西班牙初创公司Multiverse Computing正通过创建压缩模型来解决这一问题,旨在弥合尖端人工智能能力与企业实际可负担实施能力之间的差距。其核心创新在于CompactifAI压缩技术——这项受量子计算原理启发的技术已被这家巴斯克公司用于优化OpenAI的模型。从今天起,开发者可在Hugging Face平台免费获取Multiverse增强版H
相关专题推荐
音乐创作 最佳用于歌曲草稿的 AI 旋律创作工具
最佳用于歌曲草稿的 AI 旋律创作工具

2026 年最新最佳顶级评分 AI 旋律创作工具,助力歌曲草稿创作!XIX.AI 精心策划了一套极具影响力且经过严格真实世界测试的变革性合集,旨在提供最佳的创作体验。您可以找到详细的免费与付费版对比、精准的排名以及必试选项,这些工具旨在帮助您轻松创作出令人惊艳的歌曲草稿,并显著提升您的创意生产力。立即探索,发现您的完美工具!

8 个工具
xix.ai
聊天机器人 最佳AI对话训练工具,助你备战面试
最佳AI对话训练工具,助你备战面试

2026年最新、最受好评的AI面试模拟训练工具现已登陆XIX.AI!这份精心精选的合集收录了功能强大、具有革命性意义的工具,它们均经过严格的实际测试,能够提供精准的反馈。 您将看到免费版与付费版的对比分析以及详细排名,助您挑选出必试之选,从而提升自信并精进技能。立即探索,发现助您面试成功的完美工具!

12 个工具
xix.ai
设计与艺术 最适合创意实验的AI风格转换工具
最适合创意实验的AI风格转换工具

2026年最新最佳、评价最高的AI风格转换工具,助您开展创意实验!XIX.AI精心甄选了一系列功能强大、颠覆性的必试工具,这些工具经过实际测试和严格排名,可带来卓越的效果。这些顶级解决方案通过加速内容创作并释放无限创意潜能,帮助创作者显著提升工作效率。 立即探索,找到最适合您的工具,今天就开始创作吧!

9 个工具
xix.ai
漫画创作 最适合视觉叙事的AI对话气泡工具
最适合视觉叙事的AI对话气泡工具

2026年最新、最受欢迎的视觉叙事AI对话气泡工具现已登陆XIX.AI!这份精心精选的合集汇集了功能强大、具有颠覆性的工具,可帮助创作者提升工作效率并突破创作瓶颈。 获取免费版与付费版的对比分析,查看实际测试结果,并查阅最新排行榜,找到最适合打造引人入胜的视觉叙事的必试解决方案。立即探索,发现您的理想工具!

10 个工具
xix.ai
会议助理 顶级AI会议摘要工具:清晰追踪决策与后续跟进
顶级AI会议摘要工具:清晰追踪决策与后续跟进

2026年最新高评分最佳AI会议摘要工具,助您清晰追踪决策并轻松跟进。这份精心筛选的清单展示了功能强大、具有颠覆性的解决方案,它们通过自动化会议记录、识别关键行动项以及简化所有项目中的团队协调,显著提升工作效率。 获取免费版与付费版的对比分析,以及实际测试报告和每周更新的排行榜,助您找到最适合的工具。立即探索,释放您的AI优势!

9 个工具
xix.ai
数据分析 最佳人工智能数据清洗工具:快速处理缺失值与重复数据
最佳人工智能数据清洗工具:快速处理缺失值与重复数据

2026年最新、最优秀且评分最高的AI数据清洗工具,可快速处理缺失值与重复数据问题。这份精心挑选的清单展示了那些功能强大、能带来颠覆性变革的解决方案,可显著提升工作效率。所有候选工具都经过了严格的实际应用测试,以确保其稳定性。您可以获取免费版与付费版的对比信息,找出最符合您需求的必备工具。即刻访问XIX.AI,开启您的AI优势之旅。

11 个工具
xix.ai
评论 (4)
0/500
CarlGarcia
CarlGarcia 2026-03-23 08:01:13

É impressionante a rapidez com que questões de 'segurança nacional' aparecem quando se fala de inovações vindas de outros países. Este relatório sobre o DeepSeek soa mais como justificativa para manter uma vantagem tecnológica do que uma genuína preocupação ética. Já parou para pensar se a 'neutralidade' que buscam não é apenas uma forma de censura disfarçada? 🤔 A corrida pela IA está mesmo acirrada.

GaryGonzalez
GaryGonzalez 2025-12-25 22:30:40

この記事を読んで、AIのバイアス除去って本当に可能なのかな?技術的には興味深いけど、各国の規制や価値観の違いを考えると、完全に中立なAIを作るのは無理なんじゃないかって思う。DeepSeekが米国で国家安全保障上の脅威と見なされているって…地政学的な要素が技術開発にこんなに影響するなんて。🤔

CharlesThomas
CharlesThomas 2025-12-05 04:30:40

この手法、完全にセンシティブなクエリに対して何でも返信し始めたら怖くない? 倫理的なライン越えてる気がするけど、政治的な発言の規制が緩和されるのは歓迎かも🤔 でもAIが中立を装いながら偏った情報を流す可能性も…

JustinAnderson
JustinAnderson 2025-08-21 13:01:17

¡Vaya! Quitar sesgos a modelos como DeepSeek suena a un puzzle imposible. ¿Realmente pueden hacer que una IA sea neutral? Me preocupa que esto termine siendo una carrera por controlar la narrativa. 😬

OR