4,050億のパラメータ！Metaは、7月23日に今までで最も強力なLlama 3モデルを発表する可能性があります

不到两周后，我们可能就会见到迄今为止最强大的开源Llama 3模型。

美东时间7月12日周五，媒体援引一名$Meta Platforms (META.US)$的员工消息称，Meta计划7月23日发布旗下第三代大语言模型（LLM）Llama 3的最大版本。这一最新版模型将拥有4050亿参数，也将是多模态模型，这意味着它将能够理解和生成图像和文本。该媒体未透露这一最强版本是否开源。

Meta公司拒绝对上述消息置评。Meta周五收跌2.7%。

去年7月Meta发布的Llama 2有三个版本，最大版本70B的参数规模为700亿。今年4月，Meta发布Llama 3Meta，称它为“迄今为止能力最强的开源LLM”。当时推出的Llama 3有8B和70B两个版本。

Meta CEO扎克伯格当时称，大版本的Llama 3将有超过4000亿参数。Meta并未透露会不会将4000亿参数规模的Llama 3开源，当时它还在接受训练。

对比前代，Llama 3有了质的飞跃。Llama 2使用2万亿个 token进行训练，而训练Llama 3大版本的token超过15 万亿。

Meta称，由于预训练和训练后的改进，其预训练和指令调优的模型是目前8B和70B两个参数规模的最佳模型。在训练后程序得到改进后，模型的错误拒绝率（FRR）大幅下降，一致性提高，模型响应的多样性增加。在推理、代码生成和指令跟踪等功能方面，Llama 3相比Llama 2有极大改进，使Llama 3更易于操控。

4月Meta展示，8B和70B版本的Llama 3指令调优模型在大规模多任务语言理解数据集（MMLU）、研究生水平专家推理（GPQA）、数学评测集（GSM8K）、编程多语言测试（HumanEval）等方面的测评得分都高于Mistral、谷歌的Gemma和Gemini和Anthropic的Claude 3。8B和70B版本的预训练Llama 3多种性能测评优于Mistral、Gemma、Gemini和Mixtral。

当时社交媒体的网友评论称，根据基准测试，当前的Llama 3模型不完全是 GPT-4 级别的，但仍在训练中的较大尺寸的模型将达到 GPT-4 级别。

英伟达高级科学家Jim Fan认为，Llama 3的推出已经脱离了技术层面的进步，更是开源模型与顶尖闭源模型可分庭抗礼的象征。

从Jim Fan分享的基准测试可以看出，Llama 3 400B 的实力几乎媲美 Claude“超大杯”以及新版 GPT-4 Turbo，将成为“分水岭”，相信它将释放巨大的研究潜力，推动整个生态系统的发展，开源社区或将能用上GPT-4级别的模型。

此后有消息称，研究人员尚未开始对Llama 3进行微调，还未决定Llama 3是否将是多模态模型；正式版的Llama 3将会在今年7月正式推出。

不同于OpenAI等开发商，Meta致力于开源LLM，不过，这个赛道也越来越拥挤。谷歌、特斯拉CEO马斯克旗下的xAI和Mistral 等竞争对手也发布了免费的AI模型。

Llama 3问世后，同在4月亮相的4800亿参数模型Arctic击败Llama 3、Mixtra，刷新了全球最大开源模型的纪录。

Arctic基于全新的Dense-MoE架构设计，由一个10B的稠密Tranformer模型和128×3.66B的MoE MLP组成，并在3.5万亿个token上进行了训练。相比Llama 3 8B和Llama 2 70B，Arctic所用的训练计算资源不到它们的一半，评估指标却取得了相当的分数。

编辑/Jeffrey

迄今最も強力なオープンソースLlama 3モデルを2週間以内に見ることができるかもしれません。

アメリカ東海岸時間7月12日金曜日、メディアは従業員の情報源を引用して、Metaが7月23日に第3世代の大規模言語モデル（LLM）Llama 3をリリースする計画だと報じました。この最新版モデルは、4050億のパラメータを持ち、マルチモーダルモデルでもあるため、画像とテキストを理解して生成することができます。この最も強力なバージョンがオープンソースかどうかは明らかにされていません。$メタプラットフォームズ A (META.US)$メタ社は上記情報に関してコメントを拒否しました。Metaは金曜日に2.7％下落しました。

メタ社は上記のニュースについてコメントを拒否しました。Metaは金曜日に2.7％下落しました。

去年7月、MetaがリリースしたLlama 2には3つのバージョンがあり、最大バージョンの70Bのパラメータースケールは700億です。今年4月、MetaはLlama 3Metaをリリースし、これを「迄今までに最も強力なオープンソースLLM」と呼んでいます。当時、リリースされたLlama 3には8Bと70Bの2つのバージョンがありました。

MetaのCEO、ザッカーバーグ氏は、大規模なLlama 3のバージョンには4000億を超えるパラメーターがあると述べました。Metaは、4000億のパラメータースケールを持つLlama 3をオープンソースにするかどうかは明らかにしていませんが、その時点でトレーニングを受けています。

Llama 3は、前世代と比較すると質的飛躍を遂げました。 Llama 2は20兆個のトークンを使用してトレーニングされましたが、Llama 3の大規模バージョンのトークンは15兆を超えます。

Metaは、事前トレーニングとトレーニング後の改善により、事前トレーニングと指示の調整によるモデルが現在の8Bと70Bの2つのパラメータースケールの最高のモデルであると述べています。トレーニング後にプログラムが改善された場合、モデルの誤り拒否率（FRR）が大幅に低下し、一貫性が向上し、モデルが反応する多様性が増加します。推論、コード生成、および指令トレースの機能において、Llama 3はLlama 2に比べて非常に改善され、操作が容易になります。

4月にMetaが発表したところによると、8Bおよび70BバージョンのLlama 3指示調整モデルは、大規模マルチタスク言語理解データセット（MMLU）、大学院レベルの専門家推論（GPQA）、数学評価セット（GSM8K）、およびプログラミング多言語テスト（HumanEval）において、Mistral、GoogleのGemmaおよびGemini、およびAnthropicのClaude 3よりも高い評価を獲得しています。8Bおよび70Bバージョンの事前トレーニングLlama 3は、Mistral、Gemma、Gemini、およびMixtralよりも優れたパフォーマンス評価を獲得しています。

当時のソーシャルメディアのユーザーは、基準テストによると、現行のLlama 3モデルが完全にGPT-4レベルではないとコメントしましたが、まだ導入前の大きなサイズのモデルはGPT-4レベルに達すると信じられています。

英伟达のシニアサイエンティスト、Jim Fan氏は、Llama 3の発表が技術的進歩から脱却し、オープンソースモデルとトップクラスのクローズドモデルが肩を並べる象徴となっていると考えています。

Jim Fan氏が共有したベンチマークテストによれば、Llama 3 400Bは実質的にClaude“Big Cup”および新しいバージョンのGPT-4 Turboに匹敵し、分水嶺となるでしょう。Llama 3のリリースは、大きな研究潜在能力を解放し、生態系全体の発展を促進し、オープンソースコミュニティがGPT-4レベルのモデルを利用できるようになると信じられています。

その後、研究者はLlama 3を微調整することを決定しておらず、Llama 3がマルチモーダルモデルであるかどうかもまだ決定していません。正式版のLlama 3は、今年7月に正式に発表される予定です。

オープンAIなどの開発者とは異なり、MetaはLLMをオープンソースにすることを目指していますが、この競争はますます激しくなっています。 Google、Tesla CEO MuskのxAI、Mistralなどの競合他社も無料のAIモデルをリリースしています。

Llama 3の発表後、同じ4月に現れた4800億のパラメーターモデルArcticはLlama 3、Mixtraを破り、世界最大のオープンソースモデルの記録を更新しました。

Arcticは、完全に新しいDense-MoEアーキテクチャに基づいて設計されており、10Bの密なトランスフォーマーモデルと128×3.66BのMoE MLPで構成されています。15兆個のトークンでトレーニングされました。 Llama 3 8BおよびLlama 2 70Bに比べ、Arcticが使用したトレーニング計算リソースは半分以下であり、評価指標は相当なスコアを獲得しています。

編集/Jeffrey

これらの内容は、情報提供及び投資家教育のためのものであり、いかなる個別株や投資方法を推奨するものではありません。更に詳しい情報

4050亿参数！Meta或于7月23日发布迄今最强大Llama 3模型

4,050億のパラメータ！Metaは、7月23日に今までで最も強力なLlama 3モデルを発表する可能性があります

リスク免責事項

ご利用明細