リリース

1M コンテキストのマルチモーダルモデル GLM-5.3-Flash を追加しました

glm-5.3-flash を追加しました。Z.ai が 2026-08-26 に公開した、GLM-5 系列で初めて native マルチモーダルとして設計されたモデルです。単価は入力 ¥30 / 出力 ¥100(1M tok・税込表示)で、入力はカタログで最も安く、出力は DeepSeek V4 Flash の ¥75 に次ぐ 2 番目です。

1M トークンのコンテキストと画像・動画入力を同時に備えるモデルは、HAI ではこれが初めてです。コンテキストが 1M のモデルは Kimi K3 と DeepSeek V4 Flash にもありますが、前者は画像まで、後者はテキストのみです。

特徴

320B/18B の MoE を 45 層で構成

総パラメータ 320B・アクティブ 18B の Mixture-of-Experts です(288 エキスパートから 8 + 共有 1 を選択)。Z.ai は GLM-4.5(355B/32B・92 層)と比べて層数をほぼ半分の 45 に減らしたとしています。重みは Hugging Face で MIT ライセンスとして公開されています。

sparse attention と linear attention のハイブリッド

GLM 系列で初めて、linear attention と sparse attention を組み合わせたハイブリッド構成を採っています。45 層のうち 34 層が linear attention で、linear 3 層のあとに sparse 1 層という周期です。Z.ai はフラッグシップの GLM-5.3 と比べて、アテンション計算量が 3.01 倍、KV キャッシュが 4.44 倍削減されたとしています。1M トークンの長文では、indexer key を重み付き平均で 1 本に圧縮する IndexPool という機構を併用しています。

画像と動画の入力に対応

30T トークンのマルチモーダルコーパスで事前学習されており、画像と動画をそのまま入力できます。HAI 経由の実リクエストで、画像(64×64 PNG)・動画(4 秒の mp4)とも応答することを確認済みです。HAI で動画を扱えるのは Gemma 4 31BQwen3.8 27BQwen3.6 35B-A3B とこのモデルの 4 つです。

ベンチマーク(Z.ai 公表値)

Z.ai は告知ページでスコアを公表しています。前世代の GLM-5.2 とはコーディング・エージェント系の 7 種すべてで差がつき、伸びが最も大きい AutomationBench は 26.2 から 48.8 へ 86.3% 改善しています。

GLM-5.3-Flash と GLM-5.2 のベンチマーク比較。Terminal Bench 2.1 が 84.3 対 81.0、DeepSWE (v1.1) が 63.4 対 46.2、NL2Repo が 56.3 対 48.9、Toolathlon Verified が 78.4 対 59.9、AutomationBench (v1.0.6) が 48.8 対 26.2、Agents' Last Exam が 26.3 対 20.4、HLE w/ Tools が 55.3 対 54.7

ベンチマーク GLM-5.3-Flash GLM-5.2 GPT-5.6 Terra Claude Opus 4.8
Terminal Bench 2.1 84.3 81.0 87.4 85.0
DeepSWE (v1.1) 63.4 46.2 69.6 58.0
NL2Repo 56.3 48.9 69.7
Toolathlon Verified 78.4 59.9 74.9 76.2
AutomationBench (v1.0.6) 48.8 26.2 37.2 41.0
Agents' Last Exam 26.3 20.4 28.0 27.0
HLE w/ Tools 55.3 54.7 57.9

ツール実行を伴う Toolathlon Verified と AutomationBench では、GPT-5.6 Terra と Claude Opus 4.8 の両方を上回っています。一方で Terminal Bench 2.1 と Agents' Last Exam は、どちらにも届いていません。DeepSWE は Claude Opus 4.8 の 58.0 を上回るものの、GPT-5.6 Terra の 69.6 には届いていません。HLE w/ Tools は Claude Opus 4.8 の 57.9 に届いておらず、NL2Repo も同 69.7 に対して 56.3 と差が大きい指標です(この 2 つは GPT-5.6 Terra のスコアが公表されていません)。全面的に上位というわけではありません。

測定条件はベンチマークごとに異なります。Terminal Bench 2.1 は Claude Code 2.1.207・temperature = 1.0 / top_p = 1・65,536 トークン出力、DeepSWE は mini-swe-agent・400K コンテキスト、Agents' Last Exam は Claude Code harness・reasoning_effort = max・1M コンテキストです。Toolathlon Verified は公式評価サービスでの pass@1 を 3 回平均した値です。いずれも Z.ai 自身による測定で、第三者の独立評価ではありません。

使い方

modelglm-5.3-flash を指定します。

curl https://hai-api.hcloud.ltd/v1/chat/completions \
  -H "Authorization: Bearer hai_..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{"role":"user","content":"このスクリーンショットの UI を再現してください"}]
  }'

Claude Code から使う場合は環境変数を差し替えてください。

export ANTHROPIC_BASE_URL=https://hai-api.hcloud.ltd
export ANTHROPIC_AUTH_TOKEN=hai_...
export ANTHROPIC_MODEL=glm-5.3-flash
export ANTHROPIC_SMALL_FAST_MODEL=deepseek-v4-flash
claude

バックグラウンドタスク用の ANTHROPIC_SMALL_FAST_MODEL は、これまでどおり低価格の deepseek-v4-flash を推奨します。

注意点

単価とモデル一覧は料金ページ、モデル ID とセットアップ手順はドキュメントに掲載しています。

← 新着情報一覧へ

今日から、baseURL を差し替えるだけ。

コンソールを開く