Litmus — 話題のニュースを、深く読み解く。 RSS
AI

ELYZAの日本語LLM2種、仕上げの人の手は1〜2人日

KDDI傘下のELYZAが、商用利用できる日本語特化の大規模言語モデルを2種類、無料で公開した。学習から評価までの人間の作業は1〜2人日に抑えられている。2つのモデルの違いと中身を確かめた。

赤いケーブルが連なるデータセンターのサーバーラック

イメージ写真 記事の内容を撮影したものではありません。Photo by Brett Sayles on Pexels

この記事には Amazon アソシエイトのリンクを含みます。

日本語に強い大規模言語モデルを試したいが、海外製は細かい言い回しで物足りない。かといって商用で使うには、ライセンス費用がネックになる。そんな事情を抱えている開発者は少なくない。2026年10月2日、KDDI傘下のELYZAが、商用利用できる日本語特化の大規模言語モデルを2種類、無料で公開した。ダウンロードすればすぐに試せる状態にある。しかもこの2つのモデルは、学習から性能評価までの作業のほとんどをAI自身が担い、人間が関わったのはわずか1〜2人日だったという。何が手に入り、どうやってここまで人の作業を減らせたのかを確かめる。

商用利用できる国産LLMが増えた

今回公開されたのは何で、誰でも使えるのか。ELYZAは2026年10月2日、2つのモデルをHugging Faceで公開した。「ELYZA-Thinking-1.0-llm-jp-4-33b」と「ELYZA-Thinking-1.0-llm-jp-4-32b-a3b」である。ELYZAの発表によると、どちらも商用利用を含めて自由に使える「Apache 2.0」ライセンスで配布されている。

2つのモデルは、どちらも国立情報学研究所(NII)が開発した国産の基盤モデル「LLM-jp-4」シリーズを土台にしている。NIIは2026年4月のニュースリリースで、約12兆トークンの学習データを使ってこのシリーズをオープンソースライセンスで公開した。ELYZAはその上に、日本語の処理性能を高める学習を重ねている。

この発表は、ELYZAが「ELYZA RSI Research」という研究組織を新設したタイミングで行われた。組織名のRSIは、AIが自分自身の開発プロセスを改善していく「再帰的自己改善」の頭文字で、詳しい中身は後半で扱う。33bと32b-a3bという型番は、単なるバージョン表記の違いではない。

33bと32b-a3bの違い

名前が似ている2つのモデルは、どこがどう違うのか。33bは「Dense」と呼ばれる作りで、約330億のパラメータすべてが、文章を1つ生成するたびに計算へ使われる。世の中に出回っているLLMの多くがこの作りで、パラメータが多いほど表現力は上がるが、そのぶん計算量もそのまま増える。

一方の32b-a3bは「MoE(Mixture of Experts、専門家の混合)」と呼ばれる別の作りを採っている。型番の末尾にある「A3B」は、この作りと関係がある。仕組みの中身は次の節で扱うとして、まずは性能を比べておく。ELYZAが公開したモデルカードには、数学・知識・コードの複数のベンチマークで測った実測値が並んでいる。

ベンチマーク33b(Dense)32b-a3b(MoE)
MATH-500(英語の数学)96.0095.20
JMATH-500(日本語の数学)90.0088.20
MMLU-Pro(英語の知識)77.5373.14
JMMLU(日本語の知識)84.6981.05
LiveCodeBench v6(英語のコード)60.2353.66
JHumanEval(日本語のコード)95.7395.37

どの指標でも33bがわずかに上回るが、差はおおむね数ポイント以内に収まっている。パラメータの規模で見ると33bが約330億、32b-a3bは約320億とほぼ同じなのに、なぜ性能がここまで近いのか。その答えが、32b-a3bのMoEという作りにある。

32b-a3bが効率的な理由

性能がほぼ同じなら、32b-a3bを選ぶ理由はどこにあるのか。

050100150200250300億パラメータ33b(Dense) 330億32b-a3b(MoE) 38億32b-a3b(MoE) 282億330億38億282億33b(Dense)32b-a3b(MoE)

このグラフが示すのは、33bと32b-a3bの差だ。33bは約330億のパラメータを毎回すべて動かす。32b-a3bは約320億という近い規模を持ちながら、実際に動くのはそのうち約38億だけになる。

NIIの発表によると、32b-a3bのベースとなったモデルは、内部に128個の「エキスパート」と呼ばれる専門家ユニットを持つ。1回の計算では、入力の内容に応じてそのうち8個だけを動かす仕組みになっている。

型番の「A3B」は、この仕組みで実際に働くパラメータがおよそ3B(約38億)であることを指す。

33bが330億パラメータすべてを毎回動かすのに対し、32b-a3bは必要な専門家だけを呼び出すことで、ほぼ同じ性能を8分の1程度の計算量で出す。この効率の良さは、開発にかかった手間にも表れている。

開発にかかった人の手間

これだけの性能を持つモデルを、ELYZAはどうやって短期間で仕上げたのか。

ELYZAは今回の発表にあわせて、「ELYZA RSI Research」というAIによるAI開発を専門とする研究組織を設立した。RSIは再帰的自己改善(Recursive Self-Improvement)の略で、AI自身が自分の開発プロセスを改善しながら次のモデルを作っていく取り組みを指す。発表文には、次のように書かれている。

「人間が介在する作業を1〜2人日程度に抑えながら、Mid-training、Post-trainingから評価までの一連のプロセスを実行」

自分はこの1文を読んで二度見した。LLMの事後学習や性能評価は、数週間から数カ月かけてチームで取り組む作業だとイメージしていたからだ。その工程を、ELYZAは人間の作業量にして1〜2人日まで圧縮した。

ここで言う1〜2人日が指すのは、NIIが公開したベースモデルを土台にした中間学習・事後学習・評価の工程である。約12兆トークンを使った事前学習そのものを、人間抜きでゼロから終えたという意味ではない。土台となるLLM-jp-4シリーズの構築には、NIIのLLM-jpコミュニティが相応の期間と人手をかけている。ELYZAが圧縮したのは、そこから先の仕上げ作業にあたる。

人手を抑えてここまでの性能を出せるとわかったところで、自分で試すにはどうすればいいのか。

試すにはどうすればいいか

実際に手元で動かすには、何を見ればいいのか。

  • 入手先: Hugging Faceの各モデルページ(33b、32b-a3b)からダウンロードできる
  • ライセンス: Apache 2.0で、商用利用も含めて制限なく使える
  • 推奨環境: モデルカードではvLLMでの起動が推奨されており、温度0.6・top_p 0.95が標準設定として示されている
  • 計算量の目安: 33bは約330億パラメータすべてを動かす必要があるのに対し、32b-a3bは実質的に約38億パラメータ相当の計算量で動くため、手元のGPUで試すハードルは32b-a3bのほうが低い

高い精度を優先するなら33b、手元の計算資源を抑えたいなら32b-a3b、という選び方になる。

まとめ

KDDI傘下のELYZAは、商用利用できる日本語特化の大規模言語モデルを2種類、Apache 2.0ライセンスで無料公開した。33bは約330億パラメータすべてが動くDense構造、32b-a3bは約320億パラメータのうち約38億だけが動くMoE構造である。ベンチマーク上の性能は、ほぼ同等だった。そしてこの2つのモデルは、ベースモデルを仕上げる学習から評価までの工程を、人間の作業量にして1〜2人日に抑えて作られている。日本語の商用LLMを探している人には、ライセンス費用なしで試せる選択肢が1つ増えた。

この記事の先を読む本を探す

特定の本を勧めるものではありません。検索結果から、いまの版と目次を確かめて選んでください。

コメント

気づきや感想をどうぞ

記事への補足や、読んで考えたことをお寄せください。個人情報や、他の人を傷つける内容の投稿はお控えください。

コメントを読み込んでいます…

    ほかの記事

    最新の記事 →