動画入力に対応した Gemma 4 31B を追加しました
gemma-4-31b-it を追加しました。Google DeepMind が 2026-04-02 に公開した、30.7B の密なマルチモーダルモデルです。単価は入力 ¥60 / 出力 ¥145(1M tok・税込表示)で、画像を扱えるモデルとしては HAI で最も安価です。
Gemma 系では初めて思考モードを備えた世代で、重みは Apache 2.0 で公開されています。HAI では初めて動画入力に対応するモデルなので、画像・動画の理解や、分類・抽出のような大量処理に向きます。
特徴
動画入力に対応
動画をフレーム列として解釈します。HAI で動画を渡せるのはこのモデルだけです。
Google のモデルカードによる上限は、1 fps 換算で 60 秒までです。10 秒の mp4 を投げた実測では入力 2,419 トークンを消費しました。入力単価に換算すると 1 本あたり約 ¥0.15 で、動画が長くなるとこの入力課金が伸びます。
思考を ON にできる
既定では思考しません。reasoning_effort に "low" または "high" を渡すと思考が有効になり、思考内容は message.reasoning_content に返ります。"none" を渡した場合と未指定の場合はいずれも OFF です。
Kimi K2.6 が既定で思考 ON なのに対し、こちらは既定 OFF です。思考トークンは出力として課金されるため(思考パラメータのお知らせ)、既定のままだと単純な用途では実費が小さく収まります。
31B の密なアーキテクチャ
Mixture-of-Experts ではなく密なモデルで、総パラメータ 30.7B・60 層です(スライディングウィンドウ 1,024 トークン、語彙 262K、ビジョンエンコーダ約 550M)。重みは Hugging Face で Apache 2.0 ライセンスとして公開されています。HAI が提供する量子化は FP8 です。
同世代には 26B A4B(アクティブ 3.8B の MoE)や、より小さい E2B / E4B / 12B もありますが、HAI が扱うのは 31B のみです。
ベンチマーク(Google 公表値)
Google はモデルカードと技術レポートでスコアを公表しています。前世代の Gemma 3 27B からの伸びが大きく、AIME 2026 は 20.8 から 89.2、LiveCodeBench v6 は 29.1 から 80.0 になりました。
| ベンチマーク | Gemma 4 31B | Gemma 3 27B |
|---|---|---|
| AIME 2026(ツールなし) | 89.2 | 20.8 |
| MMLU Pro | 85.2 | 67.6 |
| GPQA Diamond | 84.3 | 42.4 |
| LiveCodeBench v6 | 80.0 | 29.1 |
| MMMU Pro(画像) | 76.9 | 49.7 |
| BigBench Extra Hard | 74.4 | 19.3 |
| MMMLU | 88.4 | 70.7 |
| MATH-Vision(画像) | 85.6 | 46.0 |
| Tau2(3 種平均) | 76.9 | 16.2 |
| MRCR v2(8 針・128K) | 66.4 | 13.5 |
| Codeforces ELO | 2150 | 110 |
| HLE(ツールなし) | 19.5 | - |
Gemma 3 27B に対しては全項目で上回っています。ただし絶対値で見ると弱い領域もあり、ツールなしの HLE は 19.5、長文検索の MRCR v2 は 66.4 にとどまります。エージェント的な長時間タスクの指標である Terminal Bench Hard も 36.0 で、この規模のモデルとしては高い一方、コーディングエージェントの主力に据えられる水準ではありません。
測定条件は、Gemma 4 31B が思考モード有効、比較対象の Gemma 3 27B が思考なしです。画像系は最大解像度(1,120 ビジョントークン)での測定値です。いずれのスコアも Google 自身による測定で、第三者の独立評価ではありません。
HAI の他モデルとの比較
技術レポートの Table 4 は、LMArena の人間によるブラインド比較の Elo を載せています(2026-06-19 時点)。この表には HAI が提供している他モデルも含まれています。
| モデル | Elo | 種別 |
|---|---|---|
| Kimi K2.6 | 1460 ± 5 | MoE 1T / 32B |
| Gemma 4 31B | 1451 ± 8 | Dense 31B |
| DeepSeek V4 Flash Thinking | 1436 ± 5 | MoE 284B / 13B |
| Gemma 3 27B | 1366 ± 4 | Dense 27B |
Gemma 4 31B は密なオープンモデルとしては首位です。Kimi K2.6 との差は 9 ポイントですが信頼区間が一部重なるため、明確な優劣とは読めません。測定自体は第三者である LMArena のものですが、この表は Google の技術レポートからの引用です。
ベンダー公表値どうしを並べると、重なるベンチマークでは Kimi K2.6 が上です。
| ベンチマーク | Gemma 4 31B | Kimi K2.6 |
|---|---|---|
| AIME 2026 | 89.2 | 96.4 |
| GPQA Diamond | 84.3 | 90.5 |
| LiveCodeBench v6 | 80.0 | 89.6 |
| MMMU Pro(画像) | 76.9 | 79.4 |
この 2 列は出典が Google と Moonshot AI に分かれており、測定条件も揃っていません。そのままモデルの実力差として読まないでください。単価は Gemma 4 31B が入力で Kimi K2.6 の約 3.4 分の 1、出力で約 6.3 分の 1 です。スコアを優先するなら Kimi K2.6、画像や動画を安く大量に処理したいなら Gemma 4 31B が向きます。
使い方
model に gemma-4-31b-it を指定します。
curl https://hai-api.hcloud.ltd/v1/chat/completions \
-H "Authorization: Bearer hai_..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemma-4-31b-it",
"messages": [{"role":"user","content":"この請求書から日付と金額を JSON で抜き出してください"}]
}'
動画は video_url で渡します。
curl https://hai-api.hcloud.ltd/v1/chat/completions \
-H "Authorization: Bearer hai_..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemma-4-31b-it",
"messages": [{
"role": "user",
"content": [
{"type": "video_url", "video_url": {"url": "https://example.com/clip.mp4"}},
{"type": "text", "text": "この動画の内容を 1 文で説明してください"}
]
}]
}'
思考を有効にする場合は reasoning_effort に "low" を渡します。
curl https://hai-api.hcloud.ltd/v1/chat/completions \
-H "Authorization: Bearer hai_..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemma-4-31b-it",
"messages": [{"role":"user","content":"次の条件を満たす組み合わせを数えてください: ..."}],
"reasoning_effort": "low"
}'
Google が推奨するサンプリング設定は temperature = 1.0 / top_p = 0.95 / top_k = 64 です。
注意点
- コンテキストは 256K(262,144)トークンです。 1M が必要な場合は Kimi K3 か DeepSeek V4 Flash を使ってください
- 動画は 1 fps 換算で 60 秒までです。 10 秒のクリップで入力 2,419 トークンを消費した実測があり、長い動画は入力課金が伸びます
- 動画・画像を渡す URL は
video/mp4やimage/pngのように正しい Content-Type で配信されている必要があります。 - 音声入力には対応しません。Gemma 4 で音声を扱えるのは E2B / E4B / 12B で、HAI が提供する 31B には音声エンコーダがありません
- 出力はテキストのみです