動画入力に対応。低コストなマルチモーダル
| 入力単価 | ¥55 / 1M tok |
|---|---|
| キャッシュ読取単価 | — |
| 出力単価 | ¥125 / 1M tok |
| コンテキスト長 | 262,144 |
| 最大出力トークン | 262,141 |
| 対応入力 | テキスト / 画像 / 動画 |
| 精度 | Q8 |
| 重み | unsloth/gemma-4-31B-it-GGUF |
| reasoning_effort | none / minimal / low / medium / high / xhigh |
| 基盤 | 自社DC |
| 評価 | Gemma 4 31B | Claude | GPT | Gemini |
|---|---|---|---|---|
| Terminal-Bench v4.0 エージェント的なコーディングとターミナル操作 | 0 | 55 | 60 | 20 |
| SciCode 科学計算のコーディング | 45 | 61 | 56 | 57 |
| Humanity's Last Exam 推論と知識 | 24 | 59 | 55 | 48 |
| IFBench 指示追従 | 76 | — | — | — |
| AA-LCR v1.1 長文脈の推論 | 70 | 83 | 80 | 81 |
出典 Artificial Analysis(2026-09-15 採取)。比較行は Anthropic / OpenAI / Google の最高性能設定。
72 時間の稼働率。1 時間ごとに、障害の無かった時間を緑で示します。
TTFT と出力速度はストリーミング応答(出力 50 トークン以上)の中央値、E2E レイテンシはすべての成功応答の中央値です。1 時間ごとに集計し、リクエストが無かった時間は線を描きません。稼働率は障害の有無で判定し、リクエストの有無には依りません。
from openai import OpenAI
client = OpenAI(
base_url="https://hai-api.hcloud.ltd/v1",
api_key="hai_...",
)
resp = client.chat.completions.create(
model="gemma-4-31b-it",
messages=[{"role": "user", "content": "Hello"}],
)
print(resp.choices[0].message.content)curl https://hai-api.hcloud.ltd/v1/chat/completions \
-H "Authorization: Bearer hai_..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemma-4-31b-it",
"messages": [{"role":"user","content":"こんにちは"}]
}'