選項
首頁
新聞
Meta的Llama 3.1是AI代的進步

Meta的Llama 3.1是AI代的進步

2025-04-15
244

Meta的Llama 3.1是AI代的進步

週二,Meta揭開了其Llama大型語言模型(LLMs)家族最新成員的面紗,推出了Llama 3.1。該公司自豪地宣稱Llama 3.1是首個開源的「前沿模型」,這個術語通常用於描述最先進的AI模型。

Llama 3.1有多種規模,但真正引人注目的還是其龐大的「405B」版本。憑藉驚人的4050億個神經「權重」或參數,它超越了其他知名的開源模型,如Nvidia的Nemotron 4、Google的Gemma 2和Mixtral。更引人入勝的是Meta團隊在打造這個巨型模型時做出的三個關鍵決策。

這些決策堪稱神經網絡工程的典範,構成了Llama 3.1 405B建構與訓練的支柱。它們也延續了Meta在Llama 2中展示的效率提升,顯示出降低深度學習總體計算預算的潛力。

首先,Llama 3.1 405B放棄了Google在其閉源Gemini 1.5和Mistral在其Mixtral中使用的「專家混合」方法。這種方法涉及創建不同的神經權重組合,其中一些可以關閉以簡化預測。相反,Meta的研究人員堅持使用自Google於2017年引入的經典「僅解碼器Transformer模型架構」。他們聲稱這一選擇帶來更穩定的訓練過程。

其次,為了提升這種簡單Transformer模型的性能,Meta的團隊提出了一種巧妙的多階段訓練方法。我們都知道,平衡訓練數據量和計算資源會顯著影響預測質量。但傳統的「規模法則」,即根據模型大小和數據預測性能的規則,並不一定能反映模型在「下游」任務(如推理測試)中的表現。

因此,Meta開發了自己的規模法則。他們增加了訓練數據和計算資源,通過多次迭代測試不同組合,觀察所得模型在關鍵下游任務中的表現。這一細緻的過程幫助他們找到最佳平衡點,最終選擇了4050億個參數作為旗艦模型。最終訓練由Meta的Grand Teton AI伺服器上的16,000個Nvidia H100 GPU晶片提供動力,並採用複雜的系統並行運行數據和權重。

第三項創新在於訓練後階段。每次訓練後,Llama 3.1都會經過嚴格的人類反饋引導過程,類似於OpenAI和其他公司用來優化模型輸出的方法。這包括「監督微調」,模型根據人類偏好學習區分理想與非理想的輸出。

Meta隨後引入了一個新變化,採用「直接偏好優化」(DPO),這是今年由Stanford University AI學者開創的更高效的人類反饋強化學習版本。他們還訓練Llama 3.1使用「工具」,如外部搜尋引擎,通過展示使用API調用解決的提示範例,提升其「零次學習」工具使用能力。

為了對抗「幻覺」,團隊精心挑選特定訓練數據並創建原始問答對,微調模型以僅回答其確知的內容,拒絕回答不確定的問題。

在整個開發過程中,Meta研究人員強調簡單性,指出高質量數據、規模和直接方法始終帶來最佳結果。儘管他們探索了更複雜的架構和訓練配方,但發現增加的複雜性並不能證明其效益。

Llama 3.1 405B的規模對於開源模型來說是一個里程碑,通常被商業閉源模型所壓倒。Meta的首席執行官Mark Zuckerberg強調了經濟優勢,指出開發者運行Llama 3.1 405B的推理成本僅為使用GPT-4o等模型的一半。

Zuckerberg還支持開源AI作為軟體的自然進展,將其比作Unix從專有到更先進、安全且更廣泛的生態系統的演變,這得益於開源開發。

然而,正如ZDNET的Steven Vaughan-Nichols指出,Meta在Hugging Face上發布的程式碼缺少一些細節,且程式碼許可證比典型的開源許可證更具限制性。因此,雖然Llama 3.1算是開源,但並未完全符合標準。然而,其訓練過程的詳細公開是一個令人振奮的變化,特別是當OpenAI和Google等巨頭對其閉源模型越來越守口如瓶時。

相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。 DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。 Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額 儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額 儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代 加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代 Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
聊天機器人 用於語言練習、面試準備和日常流利度的最佳 AI 角色扮演聊天應用
用於語言練習、面試準備和日常流利度的最佳 AI 角色扮演聊天應用

2026 年最新最佳頂級評分 AI 角色扮演聊天應用,用於語言練習、面試準備和日常流利度!XIX.AI 精心策劃了一個強大的變革性合集,提供免費與付費對比、真實世界測試以及每週更新的排名。這些必試工具可幫助您提升寫作技能,克服流利度挑戰,並提高所有日常場景下的溝通效率。立即探索,發現您語言成長的完美工具!

10 個工具
xix.ai
音樂創作 用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具
用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具

2026年最新、最優秀且評分最高的AI音軌分離工具彙總,專為混音製作、取樣準備以及卡拉OK音訊處理而設計。這些功能強大的創新工具經過實際測試,能夠實現精準的音訊分離,顯著提升工作效率。XIX.AI每週都會更新免費的付費產品對比指南,幫助您找到最適合自身需求的工具。立即探索,發揮您的AI優勢。

8 個工具
xix.ai
數據分析 用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手
用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手

2026年最新最優秀的AI SQL輔助工具排名揭曉!XIX.AI精心挑選了一系列功能強大的工具,這些工具會定期更新,並透過真實的場景測試來驗證其效能。使用這些值得嘗試的工具,您可以快速生成精準的收入分析報表、分析銷售流程,並追蹤產品各項指標,從而大幅提升工作效率。立即探索,找到最適合您的資料驅動決策工具!238個字元

9 個工具
xix.ai
音樂創作 最佳用於歌曲草稿的 AI 旋律創作工具
最佳用於歌曲草稿的 AI 旋律創作工具

2026 年最新最佳頂級評分 AI 旋律創作工具,助力歌曲草稿創作!XIX.AI 精心策劃了一套極具影響力且經過嚴格真實世界測試的變革性合集,旨在提供最佳的創作體驗。您可以找到詳細的免費與付費版對比、精準的排名以及必試選項,這些工具旨在幫助您輕鬆創作出令人驚豔的歌曲草稿,並顯著提升您的創意生產力。立即探索,發現您的完美工具!

8 個工具
xix.ai
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
評論 (27)
0/500
DavidRodriguez
DavidRodriguez 2025-08-31 00:30:32

Interessant, dass Meta Llama 3.1 als erstes Open-Source-Modell bezeichnet. Aber wer kann so ein riesiges Modell eigentlich sinnvoll nutzen? Für kleine Unternehmen bestimmt zu teuer im Betrieb. 🧐

ThomasBaker
ThomasBaker 2025-07-31 09:41:20

Wow, Llama 3.1 sounds like a game-changer! Open-source and frontier-level? That’s huge for AI devs. Curious how it stacks up against closed models like GPT-4. 😎

AlbertThomas
AlbertThomas 2025-04-22 23:18:49

O Llama 3.1 é incrível! Adoro que seja de código aberto, é como ter um superpoder no meu arsenal de programação. No começo pode ser um pouco confuso, mas vale a pena experimentar se você gosta de IA! 🚀

GaryGonzalez
GaryGonzalez 2025-04-22 16:13:48

ラマ3.1は本当にすごい!オープンソースで使えるのが最高です。最初は少し圧倒されましたが、慣れると便利です。AIに興味があるなら、ぜひ試してみてください!🚀

AnthonyPerez
AnthonyPerez 2025-04-22 15:26:53

¡Llama 3.1 es una bestia! Me encanta que sea de código abierto, es como tener un superpoder en mi arsenal de programación. Al principio puede ser un poco abrumador, pero definitivamente vale la pena probarlo si te interesa la IA! 🚀

JustinAnderson
JustinAnderson 2025-04-21 05:42:32

¡Llama 3.1 de Meta es una maravilla! Me sorprende cómo están empujando los límites con la IA de código abierto. El rendimiento es genial, pero desearía que hubiera más documentación para principiantes. De todas formas, ¡es una herramienta que hay que probar! 💪

OR