Deep Cogito的LLMS使用IDA优于类似大小的模型
Deep Cogito,一家总部位于旧金山的公司,以其最新发布的开源大型语言模型(LLMs)在AI社区中掀起了波澜。这些模型拥有从30亿到700亿个参数的多种规模,不仅仅是另一组AI工具;它们是公司所称的“通用超智能”的大胆一步。Deep Cogito声称,其每个模型在大多数标准基准测试中都超越了同等规模的领先开源模型,包括来自LLAMA、DeepSeek和Qwen的模型。这是一个相当大胆的声明,但更令人印象深刻的是,他们的700亿参数模型据报道超过了最近发布的Llama 4 109亿参数混合专家(MoE)模型。
迭代蒸馏与放大(IDA)
Deep Cogito突破的核心是一种他们称之为迭代蒸馏与放大(IDA)的新训练方法。这种方法被描述为“一种通过迭代自我改进实现通用超智能的可扩展且高效的Alignment策略”。它旨在突破传统LLM训练的限制,在传统训练中,模型的智能往往受到更大“监督者”模型或人类策展者的上限限制。
IDA过程围绕两个关键步骤反复进行:
- 放大:这一步骤利用更多的计算能力帮助模型提出更好的解决方案或能力,类似于高级推理技术。
- 蒸馏:在此,模型内化这些改进的能力,优化其参数。
Deep Cogito认为,这创造了一个“正反馈循环”,使模型的智能能够更直接地随计算资源和IDA过程本身的效率而增长,而不是受限于监督者的智能。
公司指出像AlphaGo这样的历史成功案例,强调“高级推理和迭代自我改进”至关重要。他们声称IDA将这些元素引入了LLM训练。他们还强调了IDA的效率,指出他们的小团队仅用大约75天就开发出了这些模型。与其他方法如基于人类反馈的强化学习(RLHF)或从更大模型的标准蒸馏相比,IDA据说提供了更好的可扩展性。
作为证明,Deep Cogito强调他们的700亿参数模型在性能上超过了Llama 3.3 700亿(从4050亿模型蒸馏)和Llama 4 Scout 109亿(从2万亿参数模型蒸馏)。
Deep Cogito模型的能力与性能
新的Cogito模型基于Llama和Qwen检查点,专为编码、函数调用和代理应用量身定制。一个突出特点是它们的双重功能:“每个模型都可以直接回答(标准LLM),或在回答前进行自我反思(类似推理模型)。”这与Claude 3.5等模型的功能相似。然而,Deep Cogito提到他们并未专注于非常长的推理链,优先考虑更快的回答和蒸馏较短链的效率。
公司分享了广泛的基准测试结果,将他们的Cogito模型与同等规模的先进开源模型在直接和推理模式下进行比较。在MMLU、MMLU-Pro、ARC、GSM8K和MATH等一系列基准测试中,以及在不同模型规模(30亿、80亿、140亿、320亿、700亿)中,Cogito模型通常显示出显著的性能提升。例如,Cogito 700亿模型在标准模式下MMLU得分91.73%,比Llama 3.3 700亿提高了+6.40%,在思考模式下得分91.00%,比Deepseek R1 Distill 700亿提高了+4.40%。Livebench得分也反映了这些提升。
以下是140亿模型的基准测试,用于中等规模的比较:

虽然Deep Cogito承认基准测试无法完全反映现实世界的实用性,但他们对其模型的实际性能仍充满信心。此次发布被视为预览,公司表示他们“仍处于这一扩展曲线的早期阶段”。他们计划在未来几周和几个月内发布当前规模的改进检查点,并推出更大的MoE模型(1090亿、4000亿、6710亿)。所有未来模型也将是开源的。
相关文章
华纳音乐收购AI归因初创公司Sureel AI
华纳音乐集团(WMG)于周三确认,其正在收购Sureel AI,一家专注于人工智能归因的初创公司。Sureel的专有技术为音乐曲目生成“AI DNA”,将其分解为各个组成部分,以追踪人工智能模型如何利用这些元素。通过此次收购,WMG旨在增强其监控其艺术家和词曲创作者的作品在人工智能生成内容中被使用或用于训练人工智能模型的能力。“将Sureel整合到WMG中,增强了我们的保护、控制和变现能力,确保创意社区保留对其知识产权、姓名、肖像、形象和声音的控制权,”WMG首席执行官Robert Kync
亚马逊推出“Alexa for Shopping”,同时将Rufus边缘化
亚马逊推出了“Alexa for Shopping”,将 Rufus 购物聊天机器人 Alexa+ 整合到应用程序、网站和 Echo Show 设备中。该助手回答产品查询、比较商品、跟踪价格,并支持购物提醒。它还处理计划中的购物操作和符合条件的自动购买。据该公司称,“Alexa for Shopping”将 Rufus 的产品专业知识与 Alexa+ 的个性化助手上下文相结合。亚马逊表示,Rufus 在 2025 年协助了超过 3 亿客户进行产品研究、比较和购买。GeekWire 报道称,
微软、Azure 和人工智能技术共同应对加利福尼亚州野火风险
微软投资于人工智能驱动的山火监测技术,其首席副总裁兼首席数据科学家胡安·拉维斯塔·费雷斯(Juan Lavista Ferres)探讨了减轻环境损害的策略。据美国国家航空航天局(NASA)称,气候变化影响着地球上的每个人,其表现为气温上升、降雨模式改变以及海平面上升。NASA指出,有确凿证据表明地球正以史无前例的速度变暖,而人类活动是其主要驱动因素。随着全球气温上升,野火构成的威胁日益加剧。 在美
相关专题推荐
评论 (29)
0/500
看起来这家叫做Deep Cogito的新公司有点门道。IDA架构?之前没听说过这个技术,好奇跟MoE比怎么样。要是能出个小点的模型让大家体验一下就好了,毕竟现在动辄几十B参数量,普通开发者根本玩不起。希望别只是实验室数据漂亮,实际应用打折扣。
Deep Cogito's LLMs sound like a game-changer! Outperforming models of similar size with IDA is no small feat. Curious to see how these stack up in real-world tasks. 🚀
Super cool to see Deep Cogito pushing the boundaries with their LLMs! 😎 Those parameter sizes are wild—wonder how they stack up in real-world tasks?
LLM от Deep Cogito впечатляют, но приложение могло бы иметь лучший UI. Навигация по разным размерам моделей немного неуклюжая. Тем не менее, производительность на высшем уровне, особенно с технологией IDA. Обязательно стоит посмотреть, если вы интересуетесь ИИ и хотите увидеть, что возможно с большими языковыми моделями! 🤖💡
Deep Cogito,一家总部位于旧金山的公司,以其最新发布的开源大型语言模型(LLMs)在AI社区中掀起了波澜。这些模型拥有从30亿到700亿个参数的多种规模,不仅仅是另一组AI工具;它们是公司所称的“通用超智能”的大胆一步。Deep Cogito声称,其每个模型在大多数标准基准测试中都超越了同等规模的领先开源模型,包括来自LLAMA、DeepSeek和Qwen的模型。这是一个相当大胆的声明,但更令人印象深刻的是,他们的700亿参数模型据报道超过了最近发布的Llama 4 109亿参数混合专家(MoE)模型。
迭代蒸馏与放大(IDA)
Deep Cogito突破的核心是一种他们称之为迭代蒸馏与放大(IDA)的新训练方法。这种方法被描述为“一种通过迭代自我改进实现通用超智能的可扩展且高效的Alignment策略”。它旨在突破传统LLM训练的限制,在传统训练中,模型的智能往往受到更大“监督者”模型或人类策展者的上限限制。
IDA过程围绕两个关键步骤反复进行:
- 放大:这一步骤利用更多的计算能力帮助模型提出更好的解决方案或能力,类似于高级推理技术。
- 蒸馏:在此,模型内化这些改进的能力,优化其参数。
Deep Cogito认为,这创造了一个“正反馈循环”,使模型的智能能够更直接地随计算资源和IDA过程本身的效率而增长,而不是受限于监督者的智能。
公司指出像AlphaGo这样的历史成功案例,强调“高级推理和迭代自我改进”至关重要。他们声称IDA将这些元素引入了LLM训练。他们还强调了IDA的效率,指出他们的小团队仅用大约75天就开发出了这些模型。与其他方法如基于人类反馈的强化学习(RLHF)或从更大模型的标准蒸馏相比,IDA据说提供了更好的可扩展性。
作为证明,Deep Cogito强调他们的700亿参数模型在性能上超过了Llama 3.3 700亿(从4050亿模型蒸馏)和Llama 4 Scout 109亿(从2万亿参数模型蒸馏)。
Deep Cogito模型的能力与性能
新的Cogito模型基于Llama和Qwen检查点,专为编码、函数调用和代理应用量身定制。一个突出特点是它们的双重功能:“每个模型都可以直接回答(标准LLM),或在回答前进行自我反思(类似推理模型)。”这与Claude 3.5等模型的功能相似。然而,Deep Cogito提到他们并未专注于非常长的推理链,优先考虑更快的回答和蒸馏较短链的效率。
公司分享了广泛的基准测试结果,将他们的Cogito模型与同等规模的先进开源模型在直接和推理模式下进行比较。在MMLU、MMLU-Pro、ARC、GSM8K和MATH等一系列基准测试中,以及在不同模型规模(30亿、80亿、140亿、320亿、700亿)中,Cogito模型通常显示出显著的性能提升。例如,Cogito 700亿模型在标准模式下MMLU得分91.73%,比Llama 3.3 700亿提高了+6.40%,在思考模式下得分91.00%,比Deepseek R1 Distill 700亿提高了+4.40%。Livebench得分也反映了这些提升。
以下是140亿模型的基准测试,用于中等规模的比较:

虽然Deep Cogito承认基准测试无法完全反映现实世界的实用性,但他们对其模型的实际性能仍充满信心。此次发布被视为预览,公司表示他们“仍处于这一扩展曲线的早期阶段”。他们计划在未来几周和几个月内发布当前规模的改进检查点,并推出更大的MoE模型(1090亿、4000亿、6710亿)。所有未来模型也将是开源的。
华纳音乐收购AI归因初创公司Sureel AI
华纳音乐集团(WMG)于周三确认,其正在收购Sureel AI,一家专注于人工智能归因的初创公司。Sureel的专有技术为音乐曲目生成“AI DNA”,将其分解为各个组成部分,以追踪人工智能模型如何利用这些元素。通过此次收购,WMG旨在增强其监控其艺术家和词曲创作者的作品在人工智能生成内容中被使用或用于训练人工智能模型的能力。“将Sureel整合到WMG中,增强了我们的保护、控制和变现能力,确保创意社区保留对其知识产权、姓名、肖像、形象和声音的控制权,”WMG首席执行官Robert Kync
微软、Azure 和人工智能技术共同应对加利福尼亚州野火风险
微软投资于人工智能驱动的山火监测技术,其首席副总裁兼首席数据科学家胡安·拉维斯塔·费雷斯(Juan Lavista Ferres)探讨了减轻环境损害的策略。据美国国家航空航天局(NASA)称,气候变化影响着地球上的每个人,其表现为气温上升、降雨模式改变以及海平面上升。NASA指出,有确凿证据表明地球正以史无前例的速度变暖,而人类活动是其主要驱动因素。随着全球气温上升,野火构成的威胁日益加剧。 在美
看起来这家叫做Deep Cogito的新公司有点门道。IDA架构?之前没听说过这个技术,好奇跟MoE比怎么样。要是能出个小点的模型让大家体验一下就好了,毕竟现在动辄几十B参数量,普通开发者根本玩不起。希望别只是实验室数据漂亮,实际应用打折扣。
Deep Cogito's LLMs sound like a game-changer! Outperforming models of similar size with IDA is no small feat. Curious to see how these stack up in real-world tasks. 🚀
Super cool to see Deep Cogito pushing the boundaries with their LLMs! 😎 Those parameter sizes are wild—wonder how they stack up in real-world tasks?
LLM от Deep Cogito впечатляют, но приложение могло бы иметь лучший UI. Навигация по разным размерам моделей немного неуклюжая. Тем не менее, производительность на высшем уровне, особенно с технологией IDA. Обязательно стоит посмотреть, если вы интересуетесь ИИ и хотите увидеть, что возможно с большими языковыми моделями! 🤖💡





首页






