AMD發佈全開源MoE大模型Instella-MoE,16B參數規模挑戰主流開源模型

來源 Jinse_news
7月25日,AMD宣佈推出全開源混合專家模型(MoE)Instella-MoE,該模型擁有160億總參數,每個Token激活28億參數,號稱在同規模開源語言模型中具備領先性能。AMD 表示,Instella-MoE 完全基於自家 AMD Instinct MI300X 和 MI325X GPU,以及 ROCm 軟件棧從零訓練完成,並採用 Gated Multi-head Latent Attention(Gated MLA)和 FarSkip-Collective 等架構創新,以提升訓練和推理效率。性能測試顯示,Instella-MoE-16B-A3B 基礎模型平均得分達到 76.7 分,在全開源模型中排名領先,超過 SmolLM3-3B、OLMo-3-7B 等模型,並在僅激活 28 億參數的情況下,與更大規模模型競爭。 此外,該模型支持 64K Token 長上下文處理,並完成預訓練、中期訓練、長上下文擴展、監督微調(SFT)、直接偏好優化(DPO)以及強化學習(RL)等完整訓練流程。AMD 此次同步公開 Instella-MoE 全部模型權重、訓練配置、數據配比、中間檢查點及推理代碼,推動開放 AI 模型研究與復現。AMD 表示,Instella-MoE 展示了基於 AMD 硬件和開放軟件生態進行大規模 MoE 模型訓練的能力,未來將繼續推進更大規模、更強推理能力和更高效率的開源語言模型研發。
免責聲明:僅供參考。 過去的表現並不預示未來的結果。
goTop
quote