3つの方法メタのllama3.1はGen AIの進歩です

火曜日に、Metaは大規模言語モデル(LLM)のLlamaファミリーの最新作であるLlama 3.1を発表しました。同社はLlama 3.1を、通常最も先進的なAIモデルに使われる「フロンティアモデル」として、初のオープンソースモデルであると誇らしげに宣伝しています。
Llama 3.1にはさまざまなサイズがありますが、特に注目を集めているのは「405B」という巨大なモデルです。驚異的な4050億のニューラル「ウェイト」、つまりパラメータを持つこのモデルは、NvidiaのNemotron 4、GoogleのGemma 2、Mixtralといった他の著名なオープンソースモデルを凌駕します。さらに興味深いのは、Metaチームがこの巨大モデルを構築する際に下した3つの重要な決定です。
これらの決定は、ニューラルネットワークエンジニアリングのマスタークラスとも言えるもので、Llama 3.1 405Bの構築とトレーニングの基盤を形成しています。また、MetaがLlama 2で示した効率性の向上を基盤としており、ディープラーニングの全体的な計算コストを削減する有望な方法を示しました。
まず、Llama 3.1 405Bは、GoogleがクローズドソースのGemini 1.5やMistralがMixtralで使用している「エキスパートの混合」アプローチを採用していません。この方法では、異なるニューラルウェイトの組み合わせを作成し、一部をオフにすることで予測を効率化します。代わりに、Metaの研究者は、Googleが2017年に導入して以来の定番である「デコーダー専用トランスフォーマーモデルアーキテクチャ」にこだわりました。この選択により、トレーニングプロセスがより安定すると彼らは主張しています。
次に、この単純なトランスフォーマーベースのモデル性能を向上させるため、Metaのチームは巧妙な多段階トレーニングアプローチを考案しました。トレーニングデータと計算量のバランスが予測の品質に大きく影響することは誰もが知っています。しかし、モデルのサイズとデータに基づいて性能を予測する従来の「スケーリング法則」は、推論テストのような「下流」のタスクでの性能を必ずしも反映しません。
そこで、Metaは独自のスケーリング法則を開発しました。彼らはトレーニングデータと計算量を増やし、複数の反復でさまざまな組み合わせをテストして、結果として得られるモデルが重要な下流タスクでどれだけ優れているかを確認しました。この綿密なプロセスにより、最適なポイントを見極め、主力モデルとして4050億のパラメータを選択しました。最終トレーニングは、MetaのGrand Teton AIサーバー上の16,000個のNvidia H100 GPUチップによって駆動され、データとウェイトを並列で実行する複雑なシステムを使用しました。
3つ目の革新は、トレーニング後のフェーズにあります。各トレーニングラウンド後、Llama 3.1は、OpenAIや他の企業がモデルの出力を洗練させるために行うような、人間のフィードバックに基づく厳格なプロセスを経ます。これには「教師あり微調整」が含まれ、モデルが人間の好みに基づいて望ましい出力と望ましくない出力を区別することを学びます。
Metaはさらに、スタンフォード大学のAI研究者たちが今年開拓した、人間のフィードバックからの強化学習のより効率的なバージョンである「直接選好最適化」(DPO)を導入しています。また、Llama 3.1に外部検索エンジンなどの「ツール」を使用するトレーニングを行い、API呼び出しで解決されたプロンプトの例を示すことで、「ゼロショット」ツール使用能力を高めています。
「幻覚」を防ぐため、チームは特定のトレーニングデータを厳選し、オリジナルの質問と回答のペアを作成し、モデルが知っていることだけを答え、不確かなことには答えないように微調整しました。
開発全体を通じて、Metaの研究者はシンプルさを強調し、高品質なデータ、スケール、そして単純なアプローチが一貫して最良の結果をもたらすと述べました。より複雑なアーキテクチャやトレーニングレシピを模索したにもかかわらず、追加の複雑さがその利点を正当化しないことがわかりました。
Llama 3.1 405Bの規模は、通常商用クローズドソースモデルに比べて小さくなるオープンソースモデルにとって画期的なものです。MetaのCEO、Mark Zuckerbergは、経済的な利点を強調し、開発者がLlama 3.1 405Bで推論を実行するコストが、GPT-4oのようなモデルを使用するコストの半分であると述べました。
Zuckerbergはまた、オープンソースAIをソフトウェアの自然な進化として支持し、Unixが独自仕様からオープンソース開発によってより進んだ、安全で、幅広いエコシステムへと進化したことに例えました。
しかし、ZDNETのSteven Vaughan-Nicholsが指摘するように、MetaのHugging Faceへのコード投稿にはいくつかの詳細が欠けており、コードライセンスは典型的なオープンソースライセンスよりも制限的です。そのため、Llama 3.1は一種のオープンソースではありますが、完全にはそうではありません。それでも、トレーニングプロセスの詳細の豊富さは、OpenAIやGoogleのような巨人がクローズドソースモデルについてますます口を閉ざしている中で、さわやかな変化です。
関連記事
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン
カリフォルニア州の自動運転車規制:違反切符、ジオフェンス、そして100万マイルという新たな時代
Guident社は南フロリダでAuveTechのシャトルを運行しており、同社の遠隔監視技術を活用して、ウェストパームビーチでの4マイルのルートとボカラトンでの1マイルのルートを管理している。 | 提供:Guidentカリフォルニア州は、自動運転車の規制環境を再定義しつつあり、テクノロジー業界の「迅速に動き、失敗を恐れない」という考え方から、厳格な説明責任と厳しい走行距離要件へと移行している。Gui
関連特集おすすめ
コメント (27)
0/500
Interessant, dass Meta Llama 3.1 als erstes Open-Source-Modell bezeichnet. Aber wer kann so ein riesiges Modell eigentlich sinnvoll nutzen? Für kleine Unternehmen bestimmt zu teuer im Betrieb. 🧐
Wow, Llama 3.1 sounds like a game-changer! Open-source and frontier-level? That’s huge for AI devs. Curious how it stacks up against closed models like GPT-4. 😎
O Llama 3.1 é incrível! Adoro que seja de código aberto, é como ter um superpoder no meu arsenal de programação. No começo pode ser um pouco confuso, mas vale a pena experimentar se você gosta de IA! 🚀
¡Llama 3.1 es una bestia! Me encanta que sea de código abierto, es como tener un superpoder en mi arsenal de programación. Al principio puede ser un poco abrumador, pero definitivamente vale la pena probarlo si te interesa la IA! 🚀

火曜日に、Metaは大規模言語モデル(LLM)のLlamaファミリーの最新作であるLlama 3.1を発表しました。同社はLlama 3.1を、通常最も先進的なAIモデルに使われる「フロンティアモデル」として、初のオープンソースモデルであると誇らしげに宣伝しています。
Llama 3.1にはさまざまなサイズがありますが、特に注目を集めているのは「405B」という巨大なモデルです。驚異的な4050億のニューラル「ウェイト」、つまりパラメータを持つこのモデルは、NvidiaのNemotron 4、GoogleのGemma 2、Mixtralといった他の著名なオープンソースモデルを凌駕します。さらに興味深いのは、Metaチームがこの巨大モデルを構築する際に下した3つの重要な決定です。
これらの決定は、ニューラルネットワークエンジニアリングのマスタークラスとも言えるもので、Llama 3.1 405Bの構築とトレーニングの基盤を形成しています。また、MetaがLlama 2で示した効率性の向上を基盤としており、ディープラーニングの全体的な計算コストを削減する有望な方法を示しました。
まず、Llama 3.1 405Bは、GoogleがクローズドソースのGemini 1.5やMistralがMixtralで使用している「エキスパートの混合」アプローチを採用していません。この方法では、異なるニューラルウェイトの組み合わせを作成し、一部をオフにすることで予測を効率化します。代わりに、Metaの研究者は、Googleが2017年に導入して以来の定番である「デコーダー専用トランスフォーマーモデルアーキテクチャ」にこだわりました。この選択により、トレーニングプロセスがより安定すると彼らは主張しています。
次に、この単純なトランスフォーマーベースのモデル性能を向上させるため、Metaのチームは巧妙な多段階トレーニングアプローチを考案しました。トレーニングデータと計算量のバランスが予測の品質に大きく影響することは誰もが知っています。しかし、モデルのサイズとデータに基づいて性能を予測する従来の「スケーリング法則」は、推論テストのような「下流」のタスクでの性能を必ずしも反映しません。
そこで、Metaは独自のスケーリング法則を開発しました。彼らはトレーニングデータと計算量を増やし、複数の反復でさまざまな組み合わせをテストして、結果として得られるモデルが重要な下流タスクでどれだけ優れているかを確認しました。この綿密なプロセスにより、最適なポイントを見極め、主力モデルとして4050億のパラメータを選択しました。最終トレーニングは、MetaのGrand Teton AIサーバー上の16,000個のNvidia H100 GPUチップによって駆動され、データとウェイトを並列で実行する複雑なシステムを使用しました。
3つ目の革新は、トレーニング後のフェーズにあります。各トレーニングラウンド後、Llama 3.1は、OpenAIや他の企業がモデルの出力を洗練させるために行うような、人間のフィードバックに基づく厳格なプロセスを経ます。これには「教師あり微調整」が含まれ、モデルが人間の好みに基づいて望ましい出力と望ましくない出力を区別することを学びます。
Metaはさらに、スタンフォード大学のAI研究者たちが今年開拓した、人間のフィードバックからの強化学習のより効率的なバージョンである「直接選好最適化」(DPO)を導入しています。また、Llama 3.1に外部検索エンジンなどの「ツール」を使用するトレーニングを行い、API呼び出しで解決されたプロンプトの例を示すことで、「ゼロショット」ツール使用能力を高めています。
「幻覚」を防ぐため、チームは特定のトレーニングデータを厳選し、オリジナルの質問と回答のペアを作成し、モデルが知っていることだけを答え、不確かなことには答えないように微調整しました。
開発全体を通じて、Metaの研究者はシンプルさを強調し、高品質なデータ、スケール、そして単純なアプローチが一貫して最良の結果をもたらすと述べました。より複雑なアーキテクチャやトレーニングレシピを模索したにもかかわらず、追加の複雑さがその利点を正当化しないことがわかりました。
Llama 3.1 405Bの規模は、通常商用クローズドソースモデルに比べて小さくなるオープンソースモデルにとって画期的なものです。MetaのCEO、Mark Zuckerbergは、経済的な利点を強調し、開発者がLlama 3.1 405Bで推論を実行するコストが、GPT-4oのようなモデルを使用するコストの半分であると述べました。
Zuckerbergはまた、オープンソースAIをソフトウェアの自然な進化として支持し、Unixが独自仕様からオープンソース開発によってより進んだ、安全で、幅広いエコシステムへと進化したことに例えました。
しかし、ZDNETのSteven Vaughan-Nicholsが指摘するように、MetaのHugging Faceへのコード投稿にはいくつかの詳細が欠けており、コードライセンスは典型的なオープンソースライセンスよりも制限的です。そのため、Llama 3.1は一種のオープンソースではありますが、完全にはそうではありません。それでも、トレーニングプロセスの詳細の豊富さは、OpenAIやGoogleのような巨人がクローズドソースモデルについてますます口を閉ざしている中で、さわやかな変化です。
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン
Interessant, dass Meta Llama 3.1 als erstes Open-Source-Modell bezeichnet. Aber wer kann so ein riesiges Modell eigentlich sinnvoll nutzen? Für kleine Unternehmen bestimmt zu teuer im Betrieb. 🧐
Wow, Llama 3.1 sounds like a game-changer! Open-source and frontier-level? That’s huge for AI devs. Curious how it stacks up against closed models like GPT-4. 😎
O Llama 3.1 é incrível! Adoro que seja de código aberto, é como ter um superpoder no meu arsenal de programação. No começo pode ser um pouco confuso, mas vale a pena experimentar se você gosta de IA! 🚀
¡Llama 3.1 es una bestia! Me encanta que sea de código abierto, es como tener un superpoder en mi arsenal de programación. Al principio puede ser un poco abrumador, pero definitivamente vale la pena probarlo si te interesa la IA! 🚀





家






