日本語の思考モデル LLM-jp-4.1 33B Thinking を追加しました
llm-jp-4.1-33b-thinking を追加しました。国立情報学研究所(NII)が主宰する LLM-jp が 2026 年 9 月 28 日に公開した、日本語向けの思考モデル LLM-jp-4.1 33B Thinking です。単価は入力 ¥55 / 出力 ¥125(1M tok・税込表示)で、これまで提供していた LLM-jp-4-VL 9B と同額です。
llm-jp-4-vl-9b はこのモデルへ置き換わります。料金ページとモデル一覧からは外れますが、2026-10-14 までは同じ ID で送ったリクエストを llm-jp-4.1-33b-thinking として処理します。レスポンスの model と利用明細は新しい ID になります。画像入力には対応しません。
LLM-jp-4.1 は、2026 年 4 月以降に公開された LLM-jp-4 の事後学習をやり直したシリーズです。STEM 分野の学習データを増やし、ツール呼び出し用のデータも加えています。強化学習は使っておらず、SFT と DPO だけです。
特徴
33B の日本語思考モデル
64 層、隠れ次元 5,120、コンテキスト長 65,536 の dense モデルです。パラメータ数は 33,219,548,160 です。モデルカードは Hugging Face(Apache 2.0)、学習と評価の詳細は LLM-jp のブログにあります。
回答を短くする事後学習
LLM-jp-4 は、聞かれたこと以外まで書く傾向がありました。LLM-jp-4.1 では、SFT データの回答を作るときに「聞かれたことだけを書く」指示を入れ、最終回答のトークン数を前世代の半分程度まで落としています。STEM 系のタスクにはこの指示を掛けていません。
テキスト専用
入力はテキストのみです。画像・動画・ファイルには対応しません。
ベンチマーク(LLM-jp 公表値)
LLM-jp はブログで、llm-jp-judge による 4 指標を公表しています。評価モデルは gpt-5.4-2026-03-05、reasoning_effort は medium、3 回の推論と評価の平均です。
| 指標 | LLM-jp-4.1 33B | LLM-jp-4 33B | gpt-oss-20b |
|---|---|---|---|
| MT-Bench (JA) | 7.76 | 8.00 | 7.33 |
| MT-Bench (EN) | 7.98 | 8.24 | 7.85 |
| AnswerCarefully | 4.08 | 3.79 | 3.55 |
| llm-jp-instructions | 3.83 | 3.79 | 3.16 |
MT-Bench は前世代を下回ります。LLM-jp は、情報量の多い回答が高く評価される指標で、今回の「回答を短くする」学習がスコアを下げたと見ています。一方、日本語の安全性(AnswerCarefully)と日本語の質問応答(llm-jp-instructions)は前世代を上回ります。llm-jp-instructions の内訳では、情報量は下がり、正確性は上がっています。
同じブログでは、swallow-evaluation-instruct のカテゴリ平均でも LLM-jp-4.1 33B が LLM-jp-4 33B を上回り、Olmo-3.1-32B-Think と Qwen3-32B を超えて gpt-oss-120b とほぼ同じ平均になった、と報告しています。数学と科学は Qwen3.8-27B、Gemma 4 31B、Muse-Glimmer-30B に届いていません。カテゴリ平均の数値そのものは図表のみで、本文には転記されていません。
いずれのスコアも LLM-jp 自身による測定で、第三者の独立評価ではありません。
使い方
model に llm-jp-4.1-33b-thinking を指定します。
curl https://hai-api.hcloud.ltd/v1/chat/completions \
-H "Authorization: Bearer hai_..." \
-H "Content-Type: application/json" \
-d '{
"model": "llm-jp-4.1-33b-thinking",
"messages": [{"role":"user","content":"この契約書の解除条項を3点にまとめてください"}]
}'
思考の長さは reasoning_effort で指定できます。none / minimal / low / medium / high / xhigh を受け付けます。
注意点
- 画像入力には対応していません。
llm-jp-4-vl-9bへ画像を送っていたリクエストは、読み替え後に失敗するか、画像を見ない応答になります。画像が必要な場合はgemma-4-31b-itを使ってください - 思考と回答が 1 つの
contentに入ります。 応答は<|channel|>analysisで始まり、回答本文は最後の<|channel|>final<|message|>より後ろです。reasoning_contentは空です。クライアントがこの区切りを分けない場合、思考過程が本文に混ざります - ツール呼び出し(
tools/function calling)は使えません。 モデルはツール呼び出しの形で出力しますが、API のtool_callsにはなりません。contentに生のテキストとして入ります。エージェント用途には他のモデルを使ってください response_formatは無視されます。 JSON schema を渡しても構造化されず、通常の応答が返ります- コンテキストは 64K(65,536)トークンです。 入力と出力の合計がこの範囲に収まる必要があり、実際に入力へ使えるのは出力上限 16,384 トークンを差し引いた 49,152 トークンまでです。長文が必要な場合は
gemma-4-31b-it(256K)やdeepseek-v4-flash(1M)を使ってください - 旧 ID
llm-jp-4-vl-9bは 2026-12-29 以降のリリースで受け付けを終了します。それまでは新しい ID へ読み替えます