リリース

動画入力に対応した Gemma 4 31B を追加しました

gemma-4-31b-it を追加しました。Google DeepMind が 2026-04-02 に公開した、30.7B の密なマルチモーダルモデルです。単価は入力 ¥60 / 出力 ¥145(1M tok・税込表示)で、画像を扱えるモデルとしては HAI で最も安価です。

Gemma 系では初めて思考モードを備えた世代で、重みは Apache 2.0 で公開されています。HAI では初めて動画入力に対応するモデルなので、画像・動画の理解や、分類・抽出のような大量処理に向きます。

特徴

動画入力に対応

動画をフレーム列として解釈します。HAI で動画を渡せるのはこのモデルだけです。

Google のモデルカードによる上限は、1 fps 換算で 60 秒までです。10 秒の mp4 を投げた実測では入力 2,419 トークンを消費しました。入力単価に換算すると 1 本あたり約 ¥0.15 で、動画が長くなるとこの入力課金が伸びます。

思考を ON にできる

既定では思考しません。reasoning_effort"low" または "high" を渡すと思考が有効になり、思考内容は message.reasoning_content に返ります。"none" を渡した場合と未指定の場合はいずれも OFF です。

Kimi K2.6 が既定で思考 ON なのに対し、こちらは既定 OFF です。思考トークンは出力として課金されるため(思考パラメータのお知らせ)、既定のままだと単純な用途では実費が小さく収まります。

31B の密なアーキテクチャ

Mixture-of-Experts ではなく密なモデルで、総パラメータ 30.7B・60 層です(スライディングウィンドウ 1,024 トークン、語彙 262K、ビジョンエンコーダ約 550M)。重みは Hugging Face で Apache 2.0 ライセンスとして公開されています。HAI が提供する量子化は FP8 です。

同世代には 26B A4B(アクティブ 3.8B の MoE)や、より小さい E2B / E4B / 12B もありますが、HAI が扱うのは 31B のみです。

ベンチマーク(Google 公表値)

Google はモデルカード技術レポートでスコアを公表しています。前世代の Gemma 3 27B からの伸びが大きく、AIME 2026 は 20.8 から 89.2、LiveCodeBench v6 は 29.1 から 80.0 になりました。

Gemma 4 31B と前世代 Gemma 3 27B のベンチマーク比較。AIME 2026 が 89.2 対 20.8、MMLU Pro が 85.2 対 67.6、GPQA Diamond が 84.3 対 42.4、LiveCodeBench v6 が 80.0 対 29.1、MMMU Pro(画像) が 76.9 対 49.7、BigBench Extra Hard が 74.4 対 19.3

ベンチマーク Gemma 4 31B Gemma 3 27B
AIME 2026(ツールなし) 89.2 20.8
MMLU Pro 85.2 67.6
GPQA Diamond 84.3 42.4
LiveCodeBench v6 80.0 29.1
MMMU Pro(画像) 76.9 49.7
BigBench Extra Hard 74.4 19.3
MMMLU 88.4 70.7
MATH-Vision(画像) 85.6 46.0
Tau2(3 種平均) 76.9 16.2
MRCR v2(8 針・128K) 66.4 13.5
Codeforces ELO 2150 110
HLE(ツールなし) 19.5 -

Gemma 3 27B に対しては全項目で上回っています。ただし絶対値で見ると弱い領域もあり、ツールなしの HLE は 19.5、長文検索の MRCR v2 は 66.4 にとどまります。エージェント的な長時間タスクの指標である Terminal Bench Hard も 36.0 で、この規模のモデルとしては高い一方、コーディングエージェントの主力に据えられる水準ではありません。

測定条件は、Gemma 4 31B が思考モード有効、比較対象の Gemma 3 27B が思考なしです。画像系は最大解像度(1,120 ビジョントークン)での測定値です。いずれのスコアも Google 自身による測定で、第三者の独立評価ではありません。

HAI の他モデルとの比較

技術レポートの Table 4 は、LMArena の人間によるブラインド比較の Elo を載せています(2026-06-19 時点)。この表には HAI が提供している他モデルも含まれています。

モデル Elo 種別
Kimi K2.6 1460 ± 5 MoE 1T / 32B
Gemma 4 31B 1451 ± 8 Dense 31B
DeepSeek V4 Flash Thinking 1436 ± 5 MoE 284B / 13B
Gemma 3 27B 1366 ± 4 Dense 27B

Gemma 4 31B は密なオープンモデルとしては首位です。Kimi K2.6 との差は 9 ポイントですが信頼区間が一部重なるため、明確な優劣とは読めません。測定自体は第三者である LMArena のものですが、この表は Google の技術レポートからの引用です。

ベンダー公表値どうしを並べると、重なるベンチマークでは Kimi K2.6 が上です。

ベンチマーク Gemma 4 31B Kimi K2.6
AIME 2026 89.2 96.4
GPQA Diamond 84.3 90.5
LiveCodeBench v6 80.0 89.6
MMMU Pro(画像) 76.9 79.4

この 2 列は出典が Google と Moonshot AI に分かれており、測定条件も揃っていません。そのままモデルの実力差として読まないでください。単価は Gemma 4 31B が入力で Kimi K2.6 の約 3.4 分の 1、出力で約 6.3 分の 1 です。スコアを優先するなら Kimi K2.6、画像や動画を安く大量に処理したいなら Gemma 4 31B が向きます。

使い方

modelgemma-4-31b-it を指定します。

curl https://hai-api.hcloud.ltd/v1/chat/completions \
  -H "Authorization: Bearer hai_..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemma-4-31b-it",
    "messages": [{"role":"user","content":"この請求書から日付と金額を JSON で抜き出してください"}]
  }'

動画は video_url で渡します。

curl https://hai-api.hcloud.ltd/v1/chat/completions \
  -H "Authorization: Bearer hai_..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemma-4-31b-it",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "video_url", "video_url": {"url": "https://example.com/clip.mp4"}},
        {"type": "text", "text": "この動画の内容を 1 文で説明してください"}
      ]
    }]
  }'

思考を有効にする場合は reasoning_effort"low" を渡します。

curl https://hai-api.hcloud.ltd/v1/chat/completions \
  -H "Authorization: Bearer hai_..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemma-4-31b-it",
    "messages": [{"role":"user","content":"次の条件を満たす組み合わせを数えてください: ..."}],
    "reasoning_effort": "low"
  }'

Google が推奨するサンプリング設定は temperature = 1.0 / top_p = 0.95 / top_k = 64 です。

注意点

単価とモデル一覧は料金ページ、モデル ID とセットアップ手順はドキュメントに掲載しています。

← 新着情報一覧へ

今日から、baseURL を差し替えるだけ。

コンソールを開く