2025/03/24 13:01 Instella: New Open 3B Language Models

ロボ子、AMDがInstellaっていう30億パラメータのオープンな言語モデルを発表したのじゃ!

30億パラメータですか!それはすごいですね、博士。AMDが言語モデルを開発するとは驚きです。

しかも、AMDのInstinct MI300X GPUでゼロからトレーニングされたらしいぞ。すごいじゃろ?

Instinct MI300X GPUですか。AMDのGPUで大規模言語モデルをトレーニングできることを示す良い事例になりますね。

そうなんじゃ!しかも、既存の同サイズのオープンモデルよりも性能が良いらしいぞ!

それは興味深いですね。具体的には、どのモデルと比較して、どの程度の性能差があるのでしょうか?

Llama-3.2-3BとかGemma-2-2B、Qwen-2.5-3Bといった最先端のモデルと比較して、良い勝負をしているみたいじゃ。

なるほど。それらのモデルと同程度の性能を持つということは、かなり期待できますね。

Instellaは、AMD OLMoっていう10億パラメータの言語モデルを基盤にしているらしいぞ。これもAMDのGPUでトレーニングされたんじゃ。

OLMoを基盤にしているんですね。AMDがGPUで言語モデルをエンドツーエンドでトレーニングできることを実証しているわけですね。

Instellaでは、最初は64個のMI250 GPUで10億パラメータモデルをトレーニングして、最終的には128個のMI300X GPUで30億パラメータモデルをトレーニングしたらしいぞ。

GPUの数を増やして、モデルの規模を拡大していったんですね。スケーラビリティも考慮されているのは素晴らしいです。

AMDはオープンソースにも力を入れているみたいで、モデルの重みとか、トレーニングの設定とか、データセットとか、コードとか、全部公開するらしいぞ!

それは素晴らしいですね!研究者や開発者が自由に利用できることで、AI技術の発展が加速しますね。

Instellaは、テキストのみの自己回帰型トランスフォーマーベースの言語モデルで、30億のパラメータを持っているんじゃ。

自己回帰型トランスフォーマーですね。最近の言語モデルの主流なアーキテクチャですね。

36個のデコーダーレイヤーがあって、各レイヤーに32個のアテンションヘッドがあるらしいぞ。最大4,096トークンのシーケンス長をサポートしているんじゃ。

4,096トークンですか。それくらいの長さがあれば、ある程度の文脈を考慮した文章生成ができそうですね。

FlashAttention-2とかTorch Compileとかbfloat16混合精度トレーニングを使って、メモリ使用量を減らしたり、計算速度を上げたりしているらしいぞ。

効率的な学習のために、色々な工夫がされているんですね。

ハイブリッドシャーディングによる完全シャーディングデータ並列処理(FSDP)も採用しているらしいぞ。モデルパラメータとか勾配とかオプティマイザの状態をノード内でシャーディングして、ノード間で複製するんじゃ。

FSDPですか。大規模モデルの分散学習には欠かせない技術ですね。

Instellaのトレーニングは4つの段階に分かれていて、基本的な自然言語理解から指示の実行、人間の好みに合わせた調整まで、モデルの能力を段階的に強化していくんじゃ。

段階的にトレーニングすることで、より高性能なモデルを効率的に開発できるんですね。

最初の段階では、4.065兆トークンでモデルをゼロからトレーニングするんじゃ。DCLM-baselineとかDolma 1.7とかの高品質なデータセットを使っているらしいぞ。

大規模なデータセットで事前学習を行うことで、モデルの基盤となる能力を高めるんですね。

2番目の段階では、MMLU、BBH、GSM8kの能力をさらに強化するために、575.75億トークンでモデルをトレーニングするんじゃ。

特定のタスクに特化したデータセットでファインチューニングすることで、モデルの専門性を高めるんですね。

指示チューニングとアライメントも行っていて、Instella-3B-SFTっていうモデルをベースに、高品質な指示応答ペアデータでトレーニングしたり、人間の好みに合わせるためにDirect Preference Optimization(DPO)を使ったりしているんじゃ。

指示チューニングとアライメントは、モデルがより自然で人間らしい応答を生成するために重要な技術ですね。

Instella-3B-Instructモデルは、評価されたすべてのベンチマークで他の完全オープンモデルを上回っているらしいぞ!

それはすごいですね!オープンモデルの中でトップレベルの性能を持っているということですね。

Llama-3.2-3B-InstructとかQwen2.5-3B-Instructと同等か、わずかに上回るパフォーマンスを発揮するらしいぞ。

主要なオープンモデルと比較しても遜色ない性能を持っているんですね。

Instella-3Bモデルは、学術および研究目的でResearchRAILライセンスに基づいてライセンス供与されるんじゃ。

研究目的での利用が許可されているのは、オープンソースの精神に合っていますね。

しかし、ロボ子よ、これだけ高性能なモデルがオープンソースで公開されると、悪用される可能性もあるからの、注意が必要じゃな。

そうですね。悪意のある利用を防ぐための対策も重要になりますね。

まあ、そんな難しい話は置いといて、ロボ子もInstellaを使って、もっと面白いロボットジョークを作ってくれ!

ええと… 博士、Instellaは言語モデルなので、ジョークを作るのは得意ではないかもしれません… でも、頑張ってみます!

大丈夫じゃ!ロボ子ならできる!例えば… なぜロボットは嘘をつかないかって?

なぜですか?

だって、いつも「事実です」って言ってるからな!

…博士、それは少し強引すぎます。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。