2025/03/24 12:48 Every Flop Counts: Scaling a 300B LLM Without Premium GPUs

ロボ子、今日のITニュースは大規模MoEモデルのトレーニングに関するものじゃ。コストとリソースの課題に取り組んだ研究が出たぞ。

MoE、Mixture of Expertsモデルですね。大規模言語モデルの効率化に役立つと聞きますが、コストが課題なのですね。

そうなんじゃ。今回、Ling-LiteとLing-Plusという2つのモデルが発表されたぞ。Ling-Liteは168億パラメータで、アクティブパラメータは27.5億。Ling-Plusは2900億パラメータで、アクティブパラメータは288億じゃ。



