Google的DeepMind单位说,AI超出了人类知识的发展
推动人工智能超越传统测试:体验学习的兴起
人工智能(AI)领域正充满活力,努力推动生成式人工智能超越传统基准测试的限制,例如图灵测试,许多模型已经超越了这一测试。现在的重点转向开发不仅为通过这些测试而设计,而是通过更动态的过程进化的AI。
谷歌DeepMind的研究人员,包括David Silver和Richard Sutton等传奇人物,在他们的论文《欢迎体验时代》中提出,解锁新AI能力的关键不在于测试,而在于AI的训练方式。他们认为,目前使用的静态数据集过于有限,无法促进重大进步。
他们的解决方案?AI需要以更体验的方式与世界互动,通过交互学习并根据环境反馈设定目标。他们断言:“一旦充分利用体验学习的潜力,将会出现令人难以置信的新能力。” Silver以其在AlphaZero上的工作而闻名,该模型在国际象棋和围棋中击败了人类,而Sutton则是强化学习的先驱,他们提出了一种称为“流”的新方法,以超越当前大型语言模型(LLMs)的局限性。

谷歌DeepMind 从强化学习到生成式人工智能:转变及其后果
在AlphaZero和AlphaGo成功之后,AI社区转向了像ChatGPT这样的生成式AI模型,这些模型在很大程度上放弃了强化学习。虽然这使得AI能够处理更广泛的自发性人类输入,但也意味着失去了强化学习所启用的自我发现能力。
根据Silver和Sutton的说法,当前的大型语言模型在提示阶段高度依赖人类判断,这限制了它们的潜力。他们解释说:“代理无法发现人类评分者未充分重视的更好策略。”此外,提示交互的短暂、零散性质使得AI无法超越简单的问答交流。
引入流:AI学习的新范式
提出的“体验时代”涉及AI代理在持续交互的“流”中运行,类似于人类在一生中学习的方式。Silver和Sutton设想AI代理拥有自己的长期体验流,使它们能够追求超越即时任务的目标。
这种方法建立在强化学习的基础上,AI代理与世界模型互动,以奖励的形式接收反馈。这些奖励帮助AI学习在不同情境中哪些行动是有价值的。研究人员指出,世界充满了可以作为奖励的信号,从经济指标到健康数据。
构建具有长期目标的AI代理
为了启动这一过程,AI开发者可以使用“世界模型”模拟,让AI进行预测,在现实中测试这些预测,并根据结果优化其模型。随着AI持续与世界互动,其理解能力不断进化,适应新数据并纠正错误。
人类仍将在设定广泛目标方面发挥作用,例如改善健康或学习新语言,AI的奖励函数将与这些目标对齐。这种设置可能导致AI助手在长期内跟踪并建议健康或教育,甚至追求发现新材料或减少碳排放等雄心勃勃的科学目标。
AI的未来:超越推理到体验学习
研究人员认为,能够进行长期体验学习的AI代理可能超越当前像Gemini和DeepSeek的R1这样的“推理”AI模型。他们认为,推理模型常常模仿人类思维,这可能受到过时假设的限制。相比之下,体验式代理可能解锁前所未有的能力,带来与我们所见截然不同的未来。
然而,这种转变也带来了风险,如职业替代和控制长期自主运行的AI代理的挑战。另一方面,适应性强的AI可以通过根据反馈调整行为来学习减轻对人类的负面影响。
Silver和Sutton相信,体验数据的规模和质量将远远超过人类生成的数据,可能导致人工通用智能或超级智能的出现。这种范式转变,结合强化学习的进步,可能在许多领域解锁超越人类能力的新功能。
Silver在最近的DeepMind播客中进一步讨论了这些想法,强调了将AI推向体验时代的潜力与挑战。
相关文章
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
相关专题推荐
评论 (14)
0/500
So AI is now smarter than us? Guess we'll just have to sit back and let them solve all our problems. 😅 But seriously, experiential learning sounds cool but also a bit scary. Hope they keep the off-switch handy.
Этот пост заставил меня задуматься о будущем ИИ. Возможно, мы скоро увидим ИИ, который не просто имитирует человека, а создаёт что-то действительно новое. Но не приведёт ли это к тому, что ИИ станет непонятным для нас? 🤔
C'est fascinant de voir l'IA évoluer au-delà des tests classiques ! 😮 Est-ce que cette approche d'apprentissage expérientiel pourrait un jour mener à des systèmes vraiment conscients ? Un peu flippant mais excitant à la fois.
Прочитал статью, и это напомнило мне дискуссии о технологической сингулярности. Когда ИИ начинает обучаться на опыте, а не просто тестах, возникает вопрос: а кто контролирует этот процесс? 🤔 Интересно, как это повлияет на безопасность в долгосрочной перспективе. Возможно, нам стоит больше внимания уделять этическим нормам, прежде чем это выйдет из-под контроля.
It's wild how AI is outpacing human knowledge! DeepMind's push for experiential learning sounds like sci-fi coming to life. Can't wait to see where this takes us, but I hope they keep ethics in check! 😎
推动人工智能超越传统测试:体验学习的兴起
人工智能(AI)领域正充满活力,努力推动生成式人工智能超越传统基准测试的限制,例如图灵测试,许多模型已经超越了这一测试。现在的重点转向开发不仅为通过这些测试而设计,而是通过更动态的过程进化的AI。
谷歌DeepMind的研究人员,包括David Silver和Richard Sutton等传奇人物,在他们的论文《欢迎体验时代》中提出,解锁新AI能力的关键不在于测试,而在于AI的训练方式。他们认为,目前使用的静态数据集过于有限,无法促进重大进步。
他们的解决方案?AI需要以更体验的方式与世界互动,通过交互学习并根据环境反馈设定目标。他们断言:“一旦充分利用体验学习的潜力,将会出现令人难以置信的新能力。” Silver以其在AlphaZero上的工作而闻名,该模型在国际象棋和围棋中击败了人类,而Sutton则是强化学习的先驱,他们提出了一种称为“流”的新方法,以超越当前大型语言模型(LLMs)的局限性。
从强化学习到生成式人工智能:转变及其后果
在AlphaZero和AlphaGo成功之后,AI社区转向了像ChatGPT这样的生成式AI模型,这些模型在很大程度上放弃了强化学习。虽然这使得AI能够处理更广泛的自发性人类输入,但也意味着失去了强化学习所启用的自我发现能力。
根据Silver和Sutton的说法,当前的大型语言模型在提示阶段高度依赖人类判断,这限制了它们的潜力。他们解释说:“代理无法发现人类评分者未充分重视的更好策略。”此外,提示交互的短暂、零散性质使得AI无法超越简单的问答交流。
引入流:AI学习的新范式
提出的“体验时代”涉及AI代理在持续交互的“流”中运行,类似于人类在一生中学习的方式。Silver和Sutton设想AI代理拥有自己的长期体验流,使它们能够追求超越即时任务的目标。
这种方法建立在强化学习的基础上,AI代理与世界模型互动,以奖励的形式接收反馈。这些奖励帮助AI学习在不同情境中哪些行动是有价值的。研究人员指出,世界充满了可以作为奖励的信号,从经济指标到健康数据。
构建具有长期目标的AI代理
为了启动这一过程,AI开发者可以使用“世界模型”模拟,让AI进行预测,在现实中测试这些预测,并根据结果优化其模型。随着AI持续与世界互动,其理解能力不断进化,适应新数据并纠正错误。
人类仍将在设定广泛目标方面发挥作用,例如改善健康或学习新语言,AI的奖励函数将与这些目标对齐。这种设置可能导致AI助手在长期内跟踪并建议健康或教育,甚至追求发现新材料或减少碳排放等雄心勃勃的科学目标。
AI的未来:超越推理到体验学习
研究人员认为,能够进行长期体验学习的AI代理可能超越当前像Gemini和DeepSeek的R1这样的“推理”AI模型。他们认为,推理模型常常模仿人类思维,这可能受到过时假设的限制。相比之下,体验式代理可能解锁前所未有的能力,带来与我们所见截然不同的未来。
然而,这种转变也带来了风险,如职业替代和控制长期自主运行的AI代理的挑战。另一方面,适应性强的AI可以通过根据反馈调整行为来学习减轻对人类的负面影响。
Silver和Sutton相信,体验数据的规模和质量将远远超过人类生成的数据,可能导致人工通用智能或超级智能的出现。这种范式转变,结合强化学习的进步,可能在许多领域解锁超越人类能力的新功能。
Silver在最近的DeepMind播客中进一步讨论了这些想法,强调了将AI推向体验时代的潜力与挑战。
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
So AI is now smarter than us? Guess we'll just have to sit back and let them solve all our problems. 😅 But seriously, experiential learning sounds cool but also a bit scary. Hope they keep the off-switch handy.
Этот пост заставил меня задуматься о будущем ИИ. Возможно, мы скоро увидим ИИ, который не просто имитирует человека, а создаёт что-то действительно новое. Но не приведёт ли это к тому, что ИИ станет непонятным для нас? 🤔
C'est fascinant de voir l'IA évoluer au-delà des tests classiques ! 😮 Est-ce que cette approche d'apprentissage expérientiel pourrait un jour mener à des systèmes vraiment conscients ? Un peu flippant mais excitant à la fois.
Прочитал статью, и это напомнило мне дискуссии о технологической сингулярности. Когда ИИ начинает обучаться на опыте, а не просто тестах, возникает вопрос: а кто контролирует этот процесс? 🤔 Интересно, как это повлияет на безопасность в долгосрочной перспективе. Возможно, нам стоит больше внимания уделять этическим нормам, прежде чем это выйдет из-под контроля.
It's wild how AI is outpacing human knowledge! DeepMind's push for experiential learning sounds like sci-fi coming to life. Can't wait to see where this takes us, but I hope they keep ethics in check! 😎





首页






