ELYZAは10月2日、日本語LLMの2モデルを公開しました。公開したのは「ELYZA-Thinking-1.0-llm-jp-4-33b」と「ELYZA-Thinking-1.0-llm-jp-4-32b-a3b」です。AIモデル共有サイト「Hugging Face」から無料でダウンロードでき、ライセンスは商用利用も可能なApache 2.0です。土台にしたのは、国立情報学研究所(NII)が主宰するLLM-jpがゼロから学習(フルスクラッチ学習)させた「LLM-jp-4」です。129

この記事でわかること

  • ELYZAが2025年に出したモデルは、中国アリババグループのQwen2.5が土台でした
  • 33bモデルが比較した7モデルで最も高いスコアだったのは、日本語のJEMHopQAとJFBenchの2つです
  • ファイルサイズは2モデルとも60GB台で、動かすにはそれより大きいメモリのGPUが要ります
この記事の目次(5節)
  1. 公開された2モデルの違い
  2. ベースをQwenから国産モデルに切り替え
  3. ELYZAの33bモデル、LLM-jp-4.1を上回るもQwen3.5・Gemma 4に及ばず
  4. 社外秘の文書を扱う会社にとっては
  5. 導入を検討する前に確かめたい3点

公開された2モデルの違い

どちらも、回答の前に考える過程を出力する「思考型(Thinking)モデル」です。日本語と英語を扱え、ツール呼び出しにも対応します。23

項目33bモデル32b-a3bモデル
ベースモデルllm-jp-4-33b-basellm-jp-4-32b-a3b-base
構造Dense(約332億のパラメータを、回答のたびに全部使う)MoE(約320億のパラメータのうち、一部だけを使う)
ファイルサイズ66.5GB64.3GB
20種類のベンチマークの平均スコア61.6958.46

32b-a3bモデルは、MoE(Mixture of Experts)という構造を採っています。ベースのLLM-jp-4 32B-A3Bでは、約320億のパラメータのうち、実際に使うパラメータ(アクティブパラメータ)は約38億です。総パラメータ数が33bモデルと同程度なので、ファイルサイズはほとんど変わりません。4567

ベースをQwenから国産モデルに切り替え

ELYZAが2025年に公開した思考型モデル「ELYZA-Thinking-1.0-Qwen-32B」は、中国アリババグループの「Qwen2.5-32B-Instruct」を土台にしていました。8 今回の2モデルは、LLM-jpのモデルを土台に、ELYZAが中間学習と事後学習(事前学習を終えたモデルに、答え方などを身につけさせる学習)を施したものです。2

LLM-jp-4は、NIIが4月から順次公開しているモデルです。インターネット上の公開データや、政府・国会の文書などからなる学習コーパスで学習させています。ELYZAの発表に先立つ9月28日には、NIIがLLM-jp-4の事後学習を改善した「LLM-jp-4.1」を公開しました。ELYZAの2モデルの土台は、LLM-jp-4.1ではなくLLM-jp-4です。267

ELYZAの33bモデル、LLM-jp-4.1を上回るもQwen3.5・Gemma 4に及ばず

スコアはいずれもELYZAが自社で測った値です。 知識、数学、日本語の質問応答、指示追従(指示どおりに答える力)、翻訳、コーディング、ツール呼び出しの7分野・20種類のベンチマークで、国内外のモデルと比べています。23

20種類のベンチマークの平均スコア(ELYZA調べ) Gemma 4 31B 70.54 Qwen3.5-27B 68.18 ELYZA-Thinking-33b 61.69 LLM-jp-4.1-33b 60.64 Qwen3-32B 58.11 LLM-jp-4-33b-thinking 51.50 OLMo 3.1 32B 50.71 Denseモデル7つ。7分野それぞれの平均を、さらに平均した値
約300億パラメータ級のDenseモデル7つの、20種類のベンチマークの平均スコア(ELYZA調べ)。ELYZA-Thinking-33bはLLM-jp-4.1-33bをわずかに上回るが、Qwen3.5とGemma 4には及ばない。

33bモデルの平均スコアは61.69で、LLM-jp-4.1-33b(60.64)をわずかに上回りました。ただし、日本語で幅広い知識を問うJMMLUなどでは、LLM-jp-4.1-33bのほうが高いスコアです。Qwen3.5-27B(68.18)とGemma 4 31B(70.54)とは、平均で6〜9ポイントほどの差があります。2

得意分野と苦手分野

ELYZAが力を入れた日本語の課題では、高いスコアを記録しました。日本語の質問応答のベンチマーク「JEMHopQA」は73.85、日本語の指示追従のベンチマーク「JFBench」は39.02です。どちらも比較した7モデル中で最高でした。2

一方、ツール呼び出しやコーディングのLiveCodeBenchでは、Qwen3.5とGemma 4を大きく下回ります。英語のツール呼び出し(BFCL v4)では、33bモデルは38.73で、Qwen3.5-27B(69.37)の6割弱にとどまります。この測定は、ELYZAの形式が対応していない並列の呼び出しを、全モデルで除いた条件です。2 社内のほかのシステムをAIに操作させる用途には、まだ向かないとみられます。

社外秘の文書を扱う会社にとっては

学習済みのモデル本体(重み)が公開されているので、自社のサーバー(オンプレミス)で動かせます。 入力した文書を、社外のAIサービスに送らずに済みます。ライセンス料もかかりません。12

例えば、取引先の図面や見積書を社外のAIサービスに入力できない工務店なら、自社のサーバーで動かす選択肢になります。社内文書をもとに答えさせるなら、検索拡張生成(RAG)と組み合わせる方法があります。RAGの考え方は、院内マニュアルをAIに読ませる記事で解説しています。

ただし、ChatGPTのように開けばすぐ使える画面はありません。ELYZAは、モデルを動かすソフト「vLLM」での利用を勧めています。2 サーバーの用意と運用は、社内の担当者かシステム開発会社が担うことになります。

導入を検討する前に確かめたい3点

2モデルの公開は、10月3日のAIニュースのまとめでも短く伝えました。

GPUのメモリに収まるか

ファイルサイズは、33bモデルが66.5GB、32b-a3bモデルが64.3GBです。45 動かすGPUのメモリには、これより大きい容量が要ります。長い文書を読ませるほど、KVキャッシュ(入力の計算結果を保存する領域)に使うメモリも増えます。見積もり方は、ローカルLLMのメモリを扱った技術トレンドの記事で紹介しています。

NIIのLLM-jp-4.1のAPIは企業も使えるか

NIIは、ELYZAのモデルではなくLLM-jp-4.1について、APIとチャットサービスを試験的に提供します。東京大学の「mdx-MaaS」を通じたもので、主な対象は研究者です。募集は10月中旬ごろから段階的に始まる予定です。7 企業が使えるかどうかは、募集の条件を見て判断することになります。

自社の文書で正しく答えるか

ベンチマークのスコアが高くても、自社の文書で正しく答えるとは限りません。この記事では試していません。自社で確かめるなら、次の方法があります。社内文書から質問を10個作り、RAGと組み合わせたこのモデルと、いま使っているAIに同じ質問をします。正しく答えた件数と、根拠の文書を示せた件数を数えます。

自社のサーバーで動かす場合でも、入力してよい文書の範囲は先に決めておきましょう。決め方は、IPAが挙げる5つの対策を職場で点検する記事が参考になります。

判断の目安は次のとおりです。

  • 社外のAIサービスに入力してよい文書だけを扱うなら、いま使っているAIのままで構いません
  • 社外秘の文書をAIに読ませたいなら、まずシステム開発会社にGPUサーバーの見積もりを頼みましょう
  • 見積もりが予算に合わなければ、文書の範囲を絞って社外のAIサービスで使う案と、費用を比べましょう

出典

  1. ELYZA「ELYZA RSI Research」設立のお知らせ(2026年10月2日)(参照 2026-10-04)
  2. Hugging Face「elyza/ELYZA-Thinking-1.0-llm-jp-4-33b」モデルカード(参照 2026-10-04)
  3. Hugging Face「elyza/ELYZA-Thinking-1.0-llm-jp-4-32b-a3b」モデルカード(参照 2026-10-04)
  4. Hugging Face「ELYZA-Thinking-1.0-llm-jp-4-33b」ファイルの一覧(参照 2026-10-04)
  5. Hugging Face「ELYZA-Thinking-1.0-llm-jp-4-32b-a3b」ファイルの一覧(参照 2026-10-04)
  6. 国立情報学研究所「LLM-jp-4」の公開(2026年4月3日)(参照 2026-10-04)
  7. LLM-jp「LLM-jp-4.1」シリーズの公開(2026年9月28日)(参照 2026-10-04)
  8. Hugging Face「elyza/ELYZA-Thinking-1.0-Qwen-32B」モデルカード(参照 2026-10-04)
  9. ITmedia AI+「国産AI『LLM-jp-4』ベースのAIモデル、KDDI傘下のELYZAが無料公開」(2026年10月2日)(参照 2026-10-04)

任せる

AI秘書に任せる

問い合わせの受付から請求書の作成までの業務を、AIで自動化します。

できることを見る 相談する(初回無料・30分)