リリース

日本語の思考モデル LLM-jp-4.1 33B Thinking を追加しました

llm-jp-4.1-33b-thinking を追加しました。国立情報学研究所(NII)が主宰する LLM-jp が 2026 年 9 月 28 日に公開した、日本語向けの思考モデル LLM-jp-4.1 33B Thinking です。単価は入力 ¥55 / 出力 ¥125(1M tok・税込表示)で、これまで提供していた LLM-jp-4-VL 9B と同額です。

llm-jp-4-vl-9b はこのモデルへ置き換わります。料金ページとモデル一覧からは外れますが、2026-10-14 までは同じ ID で送ったリクエストを llm-jp-4.1-33b-thinking として処理します。レスポンスの model と利用明細は新しい ID になります。画像入力には対応しません。

LLM-jp-4.1 は、2026 年 4 月以降に公開された LLM-jp-4 の事後学習をやり直したシリーズです。STEM 分野の学習データを増やし、ツール呼び出し用のデータも加えています。強化学習は使っておらず、SFT と DPO だけです。

特徴

33B の日本語思考モデル

64 層、隠れ次元 5,120、コンテキスト長 65,536 の dense モデルです。パラメータ数は 33,219,548,160 です。モデルカードは Hugging Face(Apache 2.0)、学習と評価の詳細は LLM-jp のブログにあります。

回答を短くする事後学習

LLM-jp-4 は、聞かれたこと以外まで書く傾向がありました。LLM-jp-4.1 では、SFT データの回答を作るときに「聞かれたことだけを書く」指示を入れ、最終回答のトークン数を前世代の半分程度まで落としています。STEM 系のタスクにはこの指示を掛けていません。

テキスト専用

入力はテキストのみです。画像・動画・ファイルには対応しません。

ベンチマーク(LLM-jp 公表値)

LLM-jp はブログで、llm-jp-judge による 4 指標を公表しています。評価モデルは gpt-5.4-2026-03-05、reasoning_effort は medium、3 回の推論と評価の平均です。

LLM-jp-4.1 33B Thinking と LLM-jp-4 33B Thinking の llm-jp-judge 比較。MT-Bench (JA) が 7.76 対 8.00、MT-Bench (EN) が 7.98 対 8.24、AnswerCarefully が 4.08 対 3.79、llm-jp-instructions が 3.83 対 3.79

指標LLM-jp-4.1 33BLLM-jp-4 33Bgpt-oss-20b
MT-Bench (JA)7.768.007.33
MT-Bench (EN)7.988.247.85
AnswerCarefully4.083.793.55
llm-jp-instructions3.833.793.16

MT-Bench は前世代を下回ります。LLM-jp は、情報量の多い回答が高く評価される指標で、今回の「回答を短くする」学習がスコアを下げたと見ています。一方、日本語の安全性(AnswerCarefully)と日本語の質問応答(llm-jp-instructions)は前世代を上回ります。llm-jp-instructions の内訳では、情報量は下がり、正確性は上がっています。

同じブログでは、swallow-evaluation-instruct のカテゴリ平均でも LLM-jp-4.1 33B が LLM-jp-4 33B を上回り、Olmo-3.1-32B-Think と Qwen3-32B を超えて gpt-oss-120b とほぼ同じ平均になった、と報告しています。数学と科学は Qwen3.8-27B、Gemma 4 31B、Muse-Glimmer-30B に届いていません。カテゴリ平均の数値そのものは図表のみで、本文には転記されていません。

いずれのスコアも LLM-jp 自身による測定で、第三者の独立評価ではありません。

使い方

model に llm-jp-4.1-33b-thinking を指定します。

curl https://hai-api.hcloud.ltd/v1/chat/completions \
  -H "Authorization: Bearer hai_..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llm-jp-4.1-33b-thinking",
    "messages": [{"role":"user","content":"この契約書の解除条項を3点にまとめてください"}]
  }'

思考の長さは reasoning_effort で指定できます。none / minimal / low / medium / high / xhigh を受け付けます。

注意点

単価とモデル一覧は料金ページ、モデル ID とセットアップ手順はドキュメントに掲載しています。

← 新着情報一覧へ

今日から、baseURL を差し替えるだけ。

コンソールを開く