Meta FAIR 公布推进类人人工智能的五大突破性进展
Meta的基础人工智能研究(FAIR)团队近日公布了五项新项目,旨在推动其在先进机器智能(AMI)领域的研究进展。
这些最新成果聚焦于提升人工智能感知能力——即机器如何处理感官输入——同时在语言模型、机器人技术和协作式人工智能代理领域取得进展。
Meta阐明其目标是打造"能够获取、处理并解读来自现实世界的感官数据,进而运用这些信息以类人智能和速度作出决策"的机器。
五项新计划构成了一系列相互关联的努力,共同致力于实现这一宏伟目标。
感知编码器:提升人工智能的视觉智能
感知编码器作为核心成果,是一款针对多样化图像与视频任务设计的大规模视觉编码器。
视觉编码器相当于人工智能系统的"眼睛",使其能够理解视觉信息。
Meta指出,为高级人工智能创建编码器正变得越来越困难,这些编码器需要将视觉与语言联系起来,熟练处理图像和视频,并在包括对抗性攻击在内的恶劣条件下保持可靠性。
据Meta描述,理想的编码器应能识别广泛概念的同时捕捉精细细节——例如发现"藏于海底的鳐鱼"、"辨识图像背景中的小金翅雀"或"在夜视野生动物摄像机中检测快速移动的赤尾鼠"。
Meta宣称该感知编码器在零样本图像与视频分类检索任务中表现卓越,性能超越所有现有开源及专有模型。
此外,其感知能力据称还能提升语言任务的处理效能。
当与大型语言模型(LLM)结合使用时,该编码器在视觉问答(VQA)、图像描述生成、文档理解及文本-图像关联(grounding)等领域表现优于其他视觉编码器。 据报道,该编码器还能提升LLM在典型弱项任务中的表现,例如理解空间关系(如"某物体位于另一物体后方")或物体相对于摄像机的运动状态。
Meta评论道:"随着感知编码器逐步应用于新场景,我们期待其先进视觉能力如何驱动更复杂的人工智能系统。"
感知语言模型(PLM):推动开放式视觉语言研究
与编码器协同工作的感知语言模型(PLM)是一款开放且可复现的视觉语言模型,专为复杂视觉识别任务设计。
PLM在训练过程中结合了海量合成数据与公开视觉语言数据集,刻意规避了外部专有模型提炼的知识。
鉴于现有视频理解数据的局限性,FAIR团队汇集了250万个全新人工标注样本,重点聚焦于精细化视频问答与时空描述任务。Meta宣称这是"迄今同类数据集中规模最大者"。
PLM提供10亿、30亿和80亿参数版本,以满足学术研究对完全透明的需求。
除模型外,Meta同步发布专为测试现有基准常忽略能力而设计的新基准——PLM-VideoBench,重点考察"精细化活动理解与时空关联推理"能力。
Meta希望通过开放模型、海量数据集和高难度基准测试,推动开源社区发展。
Meta Locate 3D:赋予机器人情境感知能力
Meta Locate 3D 致力于实现语言指令与物理动作的衔接。该端到端模型旨在使机器人能够根据开放式自然语言查询,在三维空间中精确定位物体。
Meta Locate 3D直接处理来自RGB-D传感器(如某些机器人或深度感知相机)的3D点云数据。当接收到"电视柜附近的鲜花花瓶"等文本指令时,系统会分析空间关系与上下文,精准识别目标实例——例如区分"桌子上的花瓶"与"电视柜旁的花瓶"。
该系统包含三大核心组件:预处理阶段将二维特征转换为三维特征化点云;3D-JEPA编码器(预训练模型,构建语境化三维世界表征);以及Locate 3D解码器,通过三维表征与语言查询生成目标物体的边界框和遮罩。
除模型外,Meta同步发布了基于指代表达的物体定位大型新数据集。该数据集整合了ARKitScenes、ScanNet及ScanNet++三大数据集中的1346个场景,共计13万条语言注释,使该领域现有标注数据量实现翻倍增长。
Meta认为这项技术对开发更强大的机器人系统至关重要,包括其自主研发的PARTNR机器人项目,将促进更自然的人机交互与协作。
动态字节潜在变换器:高效稳健的语言建模
继2024年末发表研究成果后,Meta现正式发布其80亿参数动态字节潜在转换器的模型权重。
该架构突破传统基于分词的语言模型,直接在字节层面运作。Meta宣称此方法在规模化应用中能实现同等性能,同时显著提升推理效率与鲁棒性。
传统大型语言模型将文本分割为"词元",易受拼写错误、新词汇或对抗性输入影响。字节级模型直接处理原始字节,有望提供更强韧性。
Meta报告称,动态字节潜在转换器"在多项任务中超越基于标记化模型,平均鲁棒性优势达+7分(基于扰动HellaSwag数据集),在CUTE标记理解基准测试任务中最高优势达+55分"。
Meta在公开权重参数的同时也分享了代码库,以此鼓励研究界探索这种语言建模的替代方案。
协作推理器:推动社交智能AI代理发展
最终发布的协作推理器致力于解决创建能与人类或其他AI高效协作的智能体这一复杂挑战。
Meta指出人类协作往往能产生更优结果,因此致力于赋予AI类似能力以完成作业辅导或求职面试准备等任务。
此类协作不仅需要解决问题,还需具备沟通、共情、反馈及理解他人视角(心理理论)等社交技能,通常需通过多次对话迭代实现。
当前大型语言模型(LLM)的训练与评估方法往往忽视这些社交协作维度。此外,收集相关对话数据成本高昂且充满挑战。
协作推理器提供了一个评估和提升这些技能的框架。它包含需要两个智能体通过对话实现多步推理的目标导向任务。该框架测试了建设性分歧、说服和达成互利解决方案等能力。
Meta的评估表明,现有模型往往无法持续利用协作来改善结果。为解决此问题,他们提出了一种基于合成交互数据的自我改进技术,让LLM智能体与自身进行协作。
名为Matrix的新型高性能模型服务引擎实现了该数据的大规模生成。据称在数学、科学及社会推理任务中应用此方法,相较单一LLM采用标准"思维链"方法的性能,提升幅度最高达29.4%。
通过开源数据生成与建模管道,Meta旨在加速研发真正"能与人类及其他智能体协作的社交智能体"。
这五项发布共同彰显了Meta在基础人工智能研究领域的持续投入,尤其致力于构建能够以更类人方式感知、理解并交互世界的机器基础组件。
另请参阅:Meta将使用欧盟用户数据训练AI模型
想向行业领袖学习人工智能与大数据知识?欢迎参加在阿姆斯特丹、加州和伦敦举办的人工智能与大数据博览会。这场综合性盛会将与智能自动化大会、BlockX区块链大会、数字化转型周及网络安全与云计算博览会同期举行。
探索更多由TechForge主办的企业技术活动与网络研讨会,请点击此处。
相关文章
华纳音乐收购AI归因初创公司Sureel AI
华纳音乐集团(WMG)于周三确认,其正在收购Sureel AI,一家专注于人工智能归因的初创公司。Sureel的专有技术为音乐曲目生成“AI DNA”,将其分解为各个组成部分,以追踪人工智能模型如何利用这些元素。通过此次收购,WMG旨在增强其监控其艺术家和词曲创作者的作品在人工智能生成内容中被使用或用于训练人工智能模型的能力。“将Sureel整合到WMG中,增强了我们的保护、控制和变现能力,确保创意社区保留对其知识产权、姓名、肖像、形象和声音的控制权,”WMG首席执行官Robert Kync
亚马逊推出“Alexa for Shopping”,同时将Rufus边缘化
亚马逊推出了“Alexa for Shopping”,将 Rufus 购物聊天机器人 Alexa+ 整合到应用程序、网站和 Echo Show 设备中。该助手回答产品查询、比较商品、跟踪价格,并支持购物提醒。它还处理计划中的购物操作和符合条件的自动购买。据该公司称,“Alexa for Shopping”将 Rufus 的产品专业知识与 Alexa+ 的个性化助手上下文相结合。亚马逊表示,Rufus 在 2025 年协助了超过 3 亿客户进行产品研究、比较和购买。GeekWire 报道称,
微软、Azure 和人工智能技术共同应对加利福尼亚州野火风险
微软投资于人工智能驱动的山火监测技术,其首席副总裁兼首席数据科学家胡安·拉维斯塔·费雷斯(Juan Lavista Ferres)探讨了减轻环境损害的策略。据美国国家航空航天局(NASA)称,气候变化影响着地球上的每个人,其表现为气温上升、降雨模式改变以及海平面上升。NASA指出,有确凿证据表明地球正以史无前例的速度变暖,而人类活动是其主要驱动因素。随着全球气温上升,野火构成的威胁日益加剧。 在美
相关专题推荐
评论 (1)
0/500
So these advancements focus on perception and reasoning, huh? As someone who deals with automation at work, I find the 'AMI' goal both exciting and a bit unsettling. It feels like we're closing the loop between what a machine 'sees' and what it 'understands', which could revolutionize everything from logistics to creative tools. But honestly, I hope the focus stays on augmenting human ability rather than just chasing benchmarks that sound cool in research papers. The ethics of human-like perception need to be front and center. 🧠
Meta的基础人工智能研究(FAIR)团队近日公布了五项新项目,旨在推动其在先进机器智能(AMI)领域的研究进展。
这些最新成果聚焦于提升人工智能感知能力——即机器如何处理感官输入——同时在语言模型、机器人技术和协作式人工智能代理领域取得进展。
Meta阐明其目标是打造"能够获取、处理并解读来自现实世界的感官数据,进而运用这些信息以类人智能和速度作出决策"的机器。
五项新计划构成了一系列相互关联的努力,共同致力于实现这一宏伟目标。
感知编码器:提升人工智能的视觉智能
感知编码器作为核心成果,是一款针对多样化图像与视频任务设计的大规模视觉编码器。
视觉编码器相当于人工智能系统的"眼睛",使其能够理解视觉信息。
Meta指出,为高级人工智能创建编码器正变得越来越困难,这些编码器需要将视觉与语言联系起来,熟练处理图像和视频,并在包括对抗性攻击在内的恶劣条件下保持可靠性。
据Meta描述,理想的编码器应能识别广泛概念的同时捕捉精细细节——例如发现"藏于海底的鳐鱼"、"辨识图像背景中的小金翅雀"或"在夜视野生动物摄像机中检测快速移动的赤尾鼠"。
Meta宣称该感知编码器在零样本图像与视频分类检索任务中表现卓越,性能超越所有现有开源及专有模型。
此外,其感知能力据称还能提升语言任务的处理效能。
当与大型语言模型(LLM)结合使用时,该编码器在视觉问答(VQA)、图像描述生成、文档理解及文本-图像关联(grounding)等领域表现优于其他视觉编码器。 据报道,该编码器还能提升LLM在典型弱项任务中的表现,例如理解空间关系(如"某物体位于另一物体后方")或物体相对于摄像机的运动状态。
Meta评论道:"随着感知编码器逐步应用于新场景,我们期待其先进视觉能力如何驱动更复杂的人工智能系统。"
感知语言模型(PLM):推动开放式视觉语言研究
与编码器协同工作的感知语言模型(PLM)是一款开放且可复现的视觉语言模型,专为复杂视觉识别任务设计。
PLM在训练过程中结合了海量合成数据与公开视觉语言数据集,刻意规避了外部专有模型提炼的知识。
鉴于现有视频理解数据的局限性,FAIR团队汇集了250万个全新人工标注样本,重点聚焦于精细化视频问答与时空描述任务。Meta宣称这是"迄今同类数据集中规模最大者"。
PLM提供10亿、30亿和80亿参数版本,以满足学术研究对完全透明的需求。
除模型外,Meta同步发布专为测试现有基准常忽略能力而设计的新基准——PLM-VideoBench,重点考察"精细化活动理解与时空关联推理"能力。
Meta希望通过开放模型、海量数据集和高难度基准测试,推动开源社区发展。
Meta Locate 3D:赋予机器人情境感知能力
Meta Locate 3D 致力于实现语言指令与物理动作的衔接。该端到端模型旨在使机器人能够根据开放式自然语言查询,在三维空间中精确定位物体。
Meta Locate 3D直接处理来自RGB-D传感器(如某些机器人或深度感知相机)的3D点云数据。当接收到"电视柜附近的鲜花花瓶"等文本指令时,系统会分析空间关系与上下文,精准识别目标实例——例如区分"桌子上的花瓶"与"电视柜旁的花瓶"。
该系统包含三大核心组件:预处理阶段将二维特征转换为三维特征化点云;3D-JEPA编码器(预训练模型,构建语境化三维世界表征);以及Locate 3D解码器,通过三维表征与语言查询生成目标物体的边界框和遮罩。
除模型外,Meta同步发布了基于指代表达的物体定位大型新数据集。该数据集整合了ARKitScenes、ScanNet及ScanNet++三大数据集中的1346个场景,共计13万条语言注释,使该领域现有标注数据量实现翻倍增长。
Meta认为这项技术对开发更强大的机器人系统至关重要,包括其自主研发的PARTNR机器人项目,将促进更自然的人机交互与协作。
动态字节潜在变换器:高效稳健的语言建模
继2024年末发表研究成果后,Meta现正式发布其80亿参数动态字节潜在转换器的模型权重。
该架构突破传统基于分词的语言模型,直接在字节层面运作。Meta宣称此方法在规模化应用中能实现同等性能,同时显著提升推理效率与鲁棒性。
传统大型语言模型将文本分割为"词元",易受拼写错误、新词汇或对抗性输入影响。字节级模型直接处理原始字节,有望提供更强韧性。
Meta报告称,动态字节潜在转换器"在多项任务中超越基于标记化模型,平均鲁棒性优势达+7分(基于扰动HellaSwag数据集),在CUTE标记理解基准测试任务中最高优势达+55分"。
Meta在公开权重参数的同时也分享了代码库,以此鼓励研究界探索这种语言建模的替代方案。
协作推理器:推动社交智能AI代理发展
最终发布的协作推理器致力于解决创建能与人类或其他AI高效协作的智能体这一复杂挑战。
Meta指出人类协作往往能产生更优结果,因此致力于赋予AI类似能力以完成作业辅导或求职面试准备等任务。
此类协作不仅需要解决问题,还需具备沟通、共情、反馈及理解他人视角(心理理论)等社交技能,通常需通过多次对话迭代实现。
当前大型语言模型(LLM)的训练与评估方法往往忽视这些社交协作维度。此外,收集相关对话数据成本高昂且充满挑战。
协作推理器提供了一个评估和提升这些技能的框架。它包含需要两个智能体通过对话实现多步推理的目标导向任务。该框架测试了建设性分歧、说服和达成互利解决方案等能力。
Meta的评估表明,现有模型往往无法持续利用协作来改善结果。为解决此问题,他们提出了一种基于合成交互数据的自我改进技术,让LLM智能体与自身进行协作。
名为Matrix的新型高性能模型服务引擎实现了该数据的大规模生成。据称在数学、科学及社会推理任务中应用此方法,相较单一LLM采用标准"思维链"方法的性能,提升幅度最高达29.4%。
通过开源数据生成与建模管道,Meta旨在加速研发真正"能与人类及其他智能体协作的社交智能体"。
这五项发布共同彰显了Meta在基础人工智能研究领域的持续投入,尤其致力于构建能够以更类人方式感知、理解并交互世界的机器基础组件。
另请参阅:Meta将使用欧盟用户数据训练AI模型
想向行业领袖学习人工智能与大数据知识?欢迎参加在阿姆斯特丹、加州和伦敦举办的人工智能与大数据博览会。这场综合性盛会将与智能自动化大会、BlockX区块链大会、数字化转型周及网络安全与云计算博览会同期举行。
探索更多由TechForge主办的企业技术活动与网络研讨会,请点击此处。
华纳音乐收购AI归因初创公司Sureel AI
华纳音乐集团(WMG)于周三确认,其正在收购Sureel AI,一家专注于人工智能归因的初创公司。Sureel的专有技术为音乐曲目生成“AI DNA”,将其分解为各个组成部分,以追踪人工智能模型如何利用这些元素。通过此次收购,WMG旨在增强其监控其艺术家和词曲创作者的作品在人工智能生成内容中被使用或用于训练人工智能模型的能力。“将Sureel整合到WMG中,增强了我们的保护、控制和变现能力,确保创意社区保留对其知识产权、姓名、肖像、形象和声音的控制权,”WMG首席执行官Robert Kync
微软、Azure 和人工智能技术共同应对加利福尼亚州野火风险
微软投资于人工智能驱动的山火监测技术,其首席副总裁兼首席数据科学家胡安·拉维斯塔·费雷斯(Juan Lavista Ferres)探讨了减轻环境损害的策略。据美国国家航空航天局(NASA)称,气候变化影响着地球上的每个人,其表现为气温上升、降雨模式改变以及海平面上升。NASA指出,有确凿证据表明地球正以史无前例的速度变暖,而人类活动是其主要驱动因素。随着全球气温上升,野火构成的威胁日益加剧。 在美
So these advancements focus on perception and reasoning, huh? As someone who deals with automation at work, I find the 'AMI' goal both exciting and a bit unsettling. It feels like we're closing the loop between what a machine 'sees' and what it 'understands', which could revolutionize everything from logistics to creative tools. But honestly, I hope the focus stays on augmenting human ability rather than just chasing benchmarks that sound cool in research papers. The ethics of human-like perception need to be front and center. 🧠





首页






