ELYZAは10月2日、日本語LLMの2モデルを公開しました。公開したのは「ELYZA-Thinking-1.0-llm-jp-4-33b」と「ELYZA-Thinking-1.0-llm-jp-4-32b-a3b」です。AIモデル共有サイト「Hugging Face」から無料でダウンロードでき、ライセンスは商用利用も可能なApache 2.0です。土台にしたのは、国立情報学研究所(NII)が主宰するLLM-jpがゼロから学習(フルスクラッチ学習)させた「LLM-jp-4」です。129
この記事でわかること
- ELYZAが2025年に出したモデルは、中国アリババグループのQwen2.5が土台でした
- 33bモデルが比較した7モデルで最も高いスコアだったのは、日本語のJEMHopQAとJFBenchの2つです
- ファイルサイズは2モデルとも60GB台で、動かすにはそれより大きいメモリのGPUが要ります
この記事の目次(5節)
公開された2モデルの違い
どちらも、回答の前に考える過程を出力する「思考型(Thinking)モデル」です。日本語と英語を扱え、ツール呼び出しにも対応します。23
| 項目 | 33bモデル | 32b-a3bモデル |
|---|---|---|
| ベースモデル | llm-jp-4-33b-base | llm-jp-4-32b-a3b-base |
| 構造 | Dense(約332億のパラメータを、回答のたびに全部使う) | MoE(約320億のパラメータのうち、一部だけを使う) |
| ファイルサイズ | 66.5GB | 64.3GB |
| 20種類のベンチマークの平均スコア | 61.69 | 58.46 |
32b-a3bモデルは、MoE(Mixture of Experts)という構造を採っています。ベースのLLM-jp-4 32B-A3Bでは、約320億のパラメータのうち、実際に使うパラメータ(アクティブパラメータ)は約38億です。総パラメータ数が33bモデルと同程度なので、ファイルサイズはほとんど変わりません。4567
ベースをQwenから国産モデルに切り替え
ELYZAが2025年に公開した思考型モデル「ELYZA-Thinking-1.0-Qwen-32B」は、中国アリババグループの「Qwen2.5-32B-Instruct」を土台にしていました。8 今回の2モデルは、LLM-jpのモデルを土台に、ELYZAが中間学習と事後学習(事前学習を終えたモデルに、答え方などを身につけさせる学習)を施したものです。2
LLM-jp-4は、NIIが4月から順次公開しているモデルです。インターネット上の公開データや、政府・国会の文書などからなる学習コーパスで学習させています。ELYZAの発表に先立つ9月28日には、NIIがLLM-jp-4の事後学習を改善した「LLM-jp-4.1」を公開しました。ELYZAの2モデルの土台は、LLM-jp-4.1ではなくLLM-jp-4です。267
ELYZAの33bモデル、LLM-jp-4.1を上回るもQwen3.5・Gemma 4に及ばず
スコアはいずれもELYZAが自社で測った値です。 知識、数学、日本語の質問応答、指示追従(指示どおりに答える力)、翻訳、コーディング、ツール呼び出しの7分野・20種類のベンチマークで、国内外のモデルと比べています。23
33bモデルの平均スコアは61.69で、LLM-jp-4.1-33b(60.64)をわずかに上回りました。ただし、日本語で幅広い知識を問うJMMLUなどでは、LLM-jp-4.1-33bのほうが高いスコアです。Qwen3.5-27B(68.18)とGemma 4 31B(70.54)とは、平均で6〜9ポイントほどの差があります。2
得意分野と苦手分野
ELYZAが力を入れた日本語の課題では、高いスコアを記録しました。日本語の質問応答のベンチマーク「JEMHopQA」は73.85、日本語の指示追従のベンチマーク「JFBench」は39.02です。どちらも比較した7モデル中で最高でした。2
一方、ツール呼び出しやコーディングのLiveCodeBenchでは、Qwen3.5とGemma 4を大きく下回ります。英語のツール呼び出し(BFCL v4)では、33bモデルは38.73で、Qwen3.5-27B(69.37)の6割弱にとどまります。この測定は、ELYZAの形式が対応していない並列の呼び出しを、全モデルで除いた条件です。2 社内のほかのシステムをAIに操作させる用途には、まだ向かないとみられます。
社外秘の文書を扱う会社にとっては
学習済みのモデル本体(重み)が公開されているので、自社のサーバー(オンプレミス)で動かせます。 入力した文書を、社外のAIサービスに送らずに済みます。ライセンス料もかかりません。12
例えば、取引先の図面や見積書を社外のAIサービスに入力できない工務店なら、自社のサーバーで動かす選択肢になります。社内文書をもとに答えさせるなら、検索拡張生成(RAG)と組み合わせる方法があります。RAGの考え方は、院内マニュアルをAIに読ませる記事で解説しています。
ただし、ChatGPTのように開けばすぐ使える画面はありません。ELYZAは、モデルを動かすソフト「vLLM」での利用を勧めています。2 サーバーの用意と運用は、社内の担当者かシステム開発会社が担うことになります。
導入を検討する前に確かめたい3点
2モデルの公開は、10月3日のAIニュースのまとめでも短く伝えました。
GPUのメモリに収まるか
ファイルサイズは、33bモデルが66.5GB、32b-a3bモデルが64.3GBです。45 動かすGPUのメモリには、これより大きい容量が要ります。長い文書を読ませるほど、KVキャッシュ(入力の計算結果を保存する領域)に使うメモリも増えます。見積もり方は、ローカルLLMのメモリを扱った技術トレンドの記事で紹介しています。
NIIのLLM-jp-4.1のAPIは企業も使えるか
NIIは、ELYZAのモデルではなくLLM-jp-4.1について、APIとチャットサービスを試験的に提供します。東京大学の「mdx-MaaS」を通じたもので、主な対象は研究者です。募集は10月中旬ごろから段階的に始まる予定です。7 企業が使えるかどうかは、募集の条件を見て判断することになります。
自社の文書で正しく答えるか
ベンチマークのスコアが高くても、自社の文書で正しく答えるとは限りません。この記事では試していません。自社で確かめるなら、次の方法があります。社内文書から質問を10個作り、RAGと組み合わせたこのモデルと、いま使っているAIに同じ質問をします。正しく答えた件数と、根拠の文書を示せた件数を数えます。
自社のサーバーで動かす場合でも、入力してよい文書の範囲は先に決めておきましょう。決め方は、IPAが挙げる5つの対策を職場で点検する記事が参考になります。
判断の目安は次のとおりです。
- 社外のAIサービスに入力してよい文書だけを扱うなら、いま使っているAIのままで構いません
- 社外秘の文書をAIに読ませたいなら、まずシステム開発会社にGPUサーバーの見積もりを頼みましょう
- 見積もりが予算に合わなければ、文書の範囲を絞って社外のAIサービスで使う案と、費用を比べましょう
出典
- ELYZA「ELYZA RSI Research」設立のお知らせ(2026年10月2日)(参照 2026-10-04)
- Hugging Face「elyza/ELYZA-Thinking-1.0-llm-jp-4-33b」モデルカード(参照 2026-10-04)
- Hugging Face「elyza/ELYZA-Thinking-1.0-llm-jp-4-32b-a3b」モデルカード(参照 2026-10-04)
- Hugging Face「ELYZA-Thinking-1.0-llm-jp-4-33b」ファイルの一覧(参照 2026-10-04)
- Hugging Face「ELYZA-Thinking-1.0-llm-jp-4-32b-a3b」ファイルの一覧(参照 2026-10-04)
- 国立情報学研究所「LLM-jp-4」の公開(2026年4月3日)(参照 2026-10-04)
- LLM-jp「LLM-jp-4.1」シリーズの公開(2026年9月28日)(参照 2026-10-04)
- Hugging Face「elyza/ELYZA-Thinking-1.0-Qwen-32B」モデルカード(参照 2026-10-04)
- ITmedia AI+「国産AI『LLM-jp-4』ベースのAIモデル、KDDI傘下のELYZAが無料公開」(2026年10月2日)(参照 2026-10-04)

