選項
首頁
新聞
Meta捍衛Llama 4版本,引用Bug作為混合質量報告的原因

Meta捍衛Llama 4版本,引用Bug作為混合質量報告的原因

2025-04-23
223

週末期間,擁有Facebook、Instagram、WhatsApp和Quest VR的強大企業Meta,出人意料地推出了其最新的AI語言模型Llama 4。不僅僅是一個版本,而是推出了三個新版本,每個版本都因採用了“專家混合”架構和一種名為MetaP的新穎訓練方法(涉及固定超參數)而具備增強的功能。更重要的是,這三個模型都擁有廣泛的上下文窗口,使它們能夠在單次互動中處理更多資訊。

儘管發布令人興奮,但AI社群的反應充其量只能說是冷淡。週六,Meta將其中兩個模型Llama 4 Scout和Llama 4 Maverick開放供下載和使用,但反響遠非熱烈。

Llama 4引發AI使用者的困惑與批評

在北美流行的中文社群論壇1point3acres上的一則未經證實的帖子,傳到了Reddit的r/LocalLlama子版塊。該帖子據稱來自Meta的GenAI組織的一名研究人員,聲稱Llama 4在內部第三方基準測試中表現不佳。帖子暗示,Meta的領導層通過在後訓練階段混合測試集來操縱結果,以滿足各種指標並呈現有利結果。該說法的真實性受到質疑,Meta尚未回應VentureBeat的詢問。

然而,對Llama 4性能的質疑並未止於此。在X上,用戶@cto_junior對該模型的表現表示難以置信,引用了一項獨立測試,顯示Llama 4 Maverick在測試編碼任務的aider polyglot基準測試中僅得分16%。這一得分遠低於DeepSeek V3和Claude 3.7 Sonnet等同等規模的舊模型。

AI博士兼作者Andriy Burkov也在X上質疑Llama 4 Scout宣稱的1000萬token上下文窗口,指出這是“虛擬的”,因為該模型未在超過256k token的提示上進行訓練。他警告說,發送更長的提示可能會導致低品質的輸出。

在r/LocalLlama子版塊上,用戶Dr_Karminski對Llama 4表示失望,比較其在模擬七邊形內球體運動等任務上的表現與DeepSeek的非推理V3模型相比表現不佳。

前Meta研究員、現為AI2高級研究科學家的Nathan Lambert,在其Interconnects Substack博客上批評了Meta的基準比較。他指出,Meta宣傳材料中使用的Llama 4 Maverick模型與公開發布的模型不同,後者被優化為更具對話性。Lambert指出這一差異,說道:“狡猾。下面展示的結果是假的,對Meta的社群來說,不發布他們用於主要行銷推廣的模型是一大侮辱。”他補充說,雖然宣傳模型“因其幼稚的特性而損害了發布的技術聲譽”,但在其他平台上可用的實際模型“相當聰明且語氣合理”。

Meta回應,否認“在測試集上訓練”並歸咎於快速推出導致的實現錯誤

針對批評和指控,Meta的副總裁兼GenAI負責人Ahmad Al-Dahle在X上回應了這些擔憂。他對社群與Llama 4的互動表示熱情,但承認不同服務的品質報告不一致。他將這些問題歸因於快速推出以及公開實現穩定所需的時間。Al-Dahle堅決否認在測試集上訓練的指控,強調品質變化的原因是實現錯誤,而非任何不當行為。他重申Meta對Llama 4模型重大進展的信心,以及與社群合作實現其潛力的承諾。

然而,這一回應並未平息社群的挫折感,許多人仍報告性能不佳,並要求提供更多關於模型訓練過程的技術文件。這次發布比之前的Llama版本面臨更多問題,引發了關於其開發和推出的疑問。

此次發布的時機引人注目,因為它是在Meta研究副總裁Joelle Pineau宣佈離職之後。Joelle Pineau上週在LinkedIn上表達了對公司在職期間的感恩,並於週末推廣了Llama 4模型系列。

隨著Llama 4繼續被其他推理提供者採用,結果喜憂參半,顯然這次初步發布並未如Meta所希望的那樣成功。即將於4月29日舉行的首屆Meta LlamaCon,將是模型系列第三方開發者的首次聚會,預計將成為討論和爭論的熱點。我們將密切關注進展,請持續關注。

相關文章
Frontier AI Labs 拒絕透露針對失控模型的管控策略 Frontier AI Labs 拒絕透露針對失控模型的管控策略 近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
馬克·扎克伯格真的相信人工智慧是面向每個人的嗎? 馬克·扎克伯格真的相信人工智慧是面向每個人的嗎? 正在載入播放器…Meta 本週推出了 Glimmer,這是一個開源權重的 AI 模型,任何人都可以下載並在個人硬體上執行——這與該公司更強大的模型 Muse Spark 形成了鮮明對比,後者仍鎖定在其自有 API 之後。此次釋出伴隨著馬克·扎克伯格(Mark Zuckerberg)的一封公開信,他在信中主張人工智慧應向所有人開放,而非由少數幾家實驗室控制。但正如 Equity 節目主持人所指出的那樣,這一願景附帶了幾個重要的限制條件。在本期 TechCrunch 的 Equity 播客中,K
Facebook 推出專為內容創作者設計的 AI 輔助應用程式 Facebook 推出專為內容創作者設計的 AI 輔助應用程式 Facebook 於週三透露,將把「創作者工作室」(Creator Studio)轉型為一款專用的 AI 輔助應用程式,協助創作者在平台上擴大影響力。透過提供這項由人工智慧驅動的工具,Meta 旨在面對 TikTok 和 YouTube 的激烈競爭,仍能留住 Facebook 上的創作者。該公司亦預期此應用程式能減少對 ChatGPT 等外部工具在內容構思與表現分析方面的依賴。目前該新應用程式正針
相關專題推薦
視頻創作 適用於 Reels、Shorts 及產品上市活動的 AI 短影片吸睛開場生成器
適用於 Reels、Shorts 及產品上市活動的 AI 短影片吸睛開場生成器

2026 年最新最佳 AI 短影片開場白生成器,適用於 Reels、Shorts 及產品上市活動!XIX.AI 嚴選備受好評、功能強大且能顛覆遊戲規則的工具,這些工具皆經過實際測試,能帶來絕對值得一試的成果。本頁面每週更新,提供免費與付費版本的比較排行榜,助您找到提升內容創意與生產力的完美解決方案。 立即探索,釋放您的 AI 競爭優勢!

11 個工具
xix.ai
寫作 適用於長篇寫作的 AI 文章大綱工具
適用於長篇寫作的 AI 文章大綱工具

2026 年最新、最受好評的長文寫作 AI 大綱工具!這份精選清單收錄了強大且具顛覆性的工具,能透過實際測試生成精準、結構化的大綱,大幅提升寫作效率。XIX.AI 正是這份菁英名單中的一員。 獲取免費版與付費版的比較指南,助您挑選最合適的工具。立即探索,釋放您的 AI 優勢!

9 個工具
xix.ai
聊天機器人 用於語言練習、面試準備和日常流利度的最佳 AI 角色扮演聊天應用
用於語言練習、面試準備和日常流利度的最佳 AI 角色扮演聊天應用

2026 年最新最佳頂級評分 AI 角色扮演聊天應用,用於語言練習、面試準備和日常流利度!XIX.AI 精心策劃了一個強大的變革性合集,提供免費與付費對比、真實世界測試以及每週更新的排名。這些必試工具可幫助您提升寫作技能,克服流利度挑戰,並提高所有日常場景下的溝通效率。立即探索,發現您語言成長的完美工具!

10 個工具
xix.ai
音樂創作 用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具
用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具

2026年最新、最優秀且評分最高的AI音軌分離工具彙總,專為混音製作、取樣準備以及卡拉OK音訊處理而設計。這些功能強大的創新工具經過實際測試,能夠實現精準的音訊分離,顯著提升工作效率。XIX.AI每週都會更新免費的付費產品對比指南,幫助您找到最適合自身需求的工具。立即探索,發揮您的AI優勢。

8 個工具
xix.ai
數據分析 用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手
用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手

2026年最新最優秀的AI SQL輔助工具排名揭曉!XIX.AI精心挑選了一系列功能強大的工具,這些工具會定期更新,並透過真實的場景測試來驗證其效能。使用這些值得嘗試的工具,您可以快速生成精準的收入分析報表、分析銷售流程,並追蹤產品各項指標,從而大幅提升工作效率。立即探索,找到最適合您的資料驅動決策工具!238個字元

9 個工具
xix.ai
音樂創作 最佳用於歌曲草稿的 AI 旋律創作工具
最佳用於歌曲草稿的 AI 旋律創作工具

2026 年最新最佳頂級評分 AI 旋律創作工具,助力歌曲草稿創作!XIX.AI 精心策劃了一套極具影響力且經過嚴格真實世界測試的變革性合集,旨在提供最佳的創作體驗。您可以找到詳細的免費與付費版對比、精準的排名以及必試選項,這些工具旨在幫助您輕鬆創作出令人驚豔的歌曲草稿,並顯著提升您的創意生產力。立即探索,發現您的完美工具!

8 個工具
xix.ai
評論 (11)
0/500
PaulGonzalez
PaulGonzalez 2026-05-06 10:00:47

Meta hat mal wieder die AI-Welt aufgemischt! Llama 4 klingt nach einem riesigen Schritt, aber die Meldungen über gemischte Qualität wegen Bugs sind irgendwie enttäuschend. 🤔 Finde es trotzdem cool, dass sie so transparent sind und die Probleme direkt ansprechen – das ist bei Tech-Giganten nicht immer selbstverständlich. Hoffentlich kriegen sie die Fehler schnell in den Griff, sonst könnte das Vertrauen in die Modelle leiden. Die MoE-Architektur an sich ist ja mega spannend!

WalterHarris
WalterHarris 2025-12-30 00:30:49

Hmm, Meta's Llama 4-Release sorgt also für gemischte Qualitätsberichte und sie schieben es auf Bugs? Interessant. Kann es nicht einfach sein, dass das MoE-Design in der Praxis schwieriger zu beherrschen ist, als in der Theorie versprochen? Die Eile, mit der die großen Tech-Konzerne KI pushen, macht mich nachdenklich. Kommen diese 'Verbesserungen' überhaupt bei den normalen Anwendern an, wo es wirklich zählt? Irgendwie ein klassisches 'Release jetzt, Patch später'-Szenario... 🤔

HenryBrown
HenryBrown 2025-10-04 08:30:32

Meta qui sort encore un modèle en catimini avec des bugs... Original cette stratégie de 'test en production' sur des millions d'utilisateurs 🙄 Ça me rappelle les mises à jour foireuses d'Instagram ! #BetaTestGéant

JohnWilson
JohnWilson 2025-08-26 09:01:18

Meta's Llama 4 drop was wild! Three versions with that fancy Mixture-of-Experts setup? Sounds powerful, but those bugs they mentioned make me wonder if it’s ready for prime time. Anyone tried it yet? 🧐

HarryRoberts
HarryRoberts 2025-08-22 05:01:34

Wow, Llama 4 sounds like a beast with that Mixture-of-Experts setup! But bugs causing mixed quality? Kinda feels like Meta rushed this out to beat the competition. Hope they patch it up soon! 🦙

ArthurJones
ArthurJones 2025-08-12 19:00:59

Wow, Llama 4 sounds like a beast with that Mixture-of-Experts setup! But bugs causing mixed quality? That’s a bit concerning for a big player like Meta. Hope they iron it out soon, I’m curious to see how it stacks up against other models! 🦙

OR