奔腾4的复兴:这款已有20年历史的CPU能够运行Meta Llama 3大型模型

最近,YouTube技术频道Fully Buffered进行了一项令人印象深刻且极具挑战性的实验:他们成功地在2006年推出的Pentium 4 641处理器上运行了Meta最新的Llama 3.2 3B大型模型。
这项测试迫使现代人工智能技术与二十年前的硬件设备进行了碰撞,不仅揭示了大语言模型的基本兼容性限制,还引发了众多观众的思考:在人工智能时代,摩尔定律是如何以这种不同寻常的方式实现跨代际应用的。
硬件考古学:将2006年的组件推向极限
为了完成这项测试,Fully Buffered团队重新构建了一台2006年典型的爱好者组装电脑的硬件配置:
核心处理器:英特尔Pentium 4 641(3.2GHz,单核处理器,2MB L2缓存)。
内存配置:华硕P5WDH Deluxe主板搭配四块2GB DDR2-800内存条,总容量为8GB。
软件环境:团队专门配置了一种无AVX模式的推理环境,以弥补这种老旧架构中缺乏AVX2指令的问题。
极慢的推理速度:每秒0.21个token
在测试过程中,当系统被问到“什么是Pentium 4?”时,这款二十年前的单核处理器立即进入了满负荷运行状态。
输出速度:该处理器的生成速度最低仅为每秒0.21个token。
所需时间:为了生成一个完整的答案,Pentium 4需要以最大负荷运行近33分钟。
在当今人工智能应用要求毫秒级响应的时代,33分钟的等待时间简直是一场灾难。但对于这款NetBurst时代的单核芯片来说,这却是人工智能原理在老旧硅片上运行的20年漫长历程。
超出实用范围:测试人工智能的兼容性边界
为什么要在如此古老的硬件上运行人工智能呢?测试团队解释说,他们的目的并非为了实际应用,而是要探究两个关键的极限问题:
无AVX指令集的可行性:现代大型模型几乎总是依赖AVX指令集来运行,但通过特定的推理模式,人工智能仍然可以在没有这些指令的情况下进行运算。
内存作为基础:这个拥有30亿个参数的模型勉强能够适应8GB的DDR2内存容量,这一事实证明,即使计算能力极其有限,单核CPU也同样可以支持现代的大语言模型,而无需依赖高端GPU的性能。
结语:NetBurst架构的最后篇章
早在2006年,英特尔的Pentium 4还在通过NetBurst架构追求更高的时钟频率,当时人们更注重处理器的频率而非能效。当时的工程师们或许预见到了未来强大处理器的时代,但他们肯定没有想到,他们的这种架构会在二十年后被用来仔细回顾和诠释自己的历史。
这项实验为人工智能硬件生态系统提供了一个极端的参考点:计算能力决定了响应速度,但指令集的兼容性和内存容量才是运行大型模型的真正关键因素。当Pentium 4最终在屏幕上输出了自己的描述时,这不仅仅是一次成功的推理测试——更是计算机历史上一段富有诗意的告别。
相关文章
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有
加利福尼亚州自动驾驶合规:罚单、地理围栏和100万英里的新时代
Guident公司在南佛罗里达州运营一辆AuveTech自动驾驶班车,利用其远程监控技术管理西棕榈滩的一条4英里路线和博卡拉顿的一条1英里路线。| 图片来源:Guident加利福尼亚州正在重新定义无人驾驶车辆的监管格局,正逐渐摆脱科技行业“快速行动,打破常规”的思维模式,转向严格的问责制和严苛的行驶里程要求。Guident执行董事长兼首席执行官哈罗德·布劳恩(Harold Braun)在《机器人报
相关专题推荐
评论 (0)
0/500

最近,YouTube技术频道Fully Buffered进行了一项令人印象深刻且极具挑战性的实验:他们成功地在2006年推出的Pentium 4 641处理器上运行了Meta最新的Llama 3.2 3B大型模型。
这项测试迫使现代人工智能技术与二十年前的硬件设备进行了碰撞,不仅揭示了大语言模型的基本兼容性限制,还引发了众多观众的思考:在人工智能时代,摩尔定律是如何以这种不同寻常的方式实现跨代际应用的。
硬件考古学:将2006年的组件推向极限
为了完成这项测试,Fully Buffered团队重新构建了一台2006年典型的爱好者组装电脑的硬件配置:
核心处理器:英特尔Pentium 4 641(3.2GHz,单核处理器,2MB L2缓存)。
内存配置:华硕P5WDH Deluxe主板搭配四块2GB DDR2-800内存条,总容量为8GB。
软件环境:团队专门配置了一种无AVX模式的推理环境,以弥补这种老旧架构中缺乏AVX2指令的问题。
极慢的推理速度:每秒0.21个token
在测试过程中,当系统被问到“什么是Pentium 4?”时,这款二十年前的单核处理器立即进入了满负荷运行状态。
输出速度:该处理器的生成速度最低仅为每秒0.21个token。
所需时间:为了生成一个完整的答案,Pentium 4需要以最大负荷运行近33分钟。
在当今人工智能应用要求毫秒级响应的时代,33分钟的等待时间简直是一场灾难。但对于这款NetBurst时代的单核芯片来说,这却是人工智能原理在老旧硅片上运行的20年漫长历程。
超出实用范围:测试人工智能的兼容性边界
为什么要在如此古老的硬件上运行人工智能呢?测试团队解释说,他们的目的并非为了实际应用,而是要探究两个关键的极限问题:
无AVX指令集的可行性:现代大型模型几乎总是依赖AVX指令集来运行,但通过特定的推理模式,人工智能仍然可以在没有这些指令的情况下进行运算。
内存作为基础:这个拥有30亿个参数的模型勉强能够适应8GB的DDR2内存容量,这一事实证明,即使计算能力极其有限,单核CPU也同样可以支持现代的大语言模型,而无需依赖高端GPU的性能。
结语:NetBurst架构的最后篇章
早在2006年,英特尔的Pentium 4还在通过NetBurst架构追求更高的时钟频率,当时人们更注重处理器的频率而非能效。当时的工程师们或许预见到了未来强大处理器的时代,但他们肯定没有想到,他们的这种架构会在二十年后被用来仔细回顾和诠释自己的历史。
这项实验为人工智能硬件生态系统提供了一个极端的参考点:计算能力决定了响应速度,但指令集的兼容性和内存容量才是运行大型模型的真正关键因素。当Pentium 4最终在屏幕上输出了自己的描述时,这不仅仅是一次成功的推理测试——更是计算机历史上一段富有诗意的告别。
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有





首页






