1M コンテキストのマルチモーダルモデル GLM-5.3-Flash を追加しました
glm-5.3-flash を追加しました。Z.ai が 2026-08-26 に公開した、GLM-5 系列で初めて native マルチモーダルとして設計されたモデルです。単価は入力 ¥30 / 出力 ¥100(1M tok・税込表示)で、入力はカタログで最も安く、出力は DeepSeek V4 Flash の ¥75 に次ぐ 2 番目です。
1M トークンのコンテキストと画像・動画入力を同時に備えるモデルは、HAI ではこれが初めてです。コンテキストが 1M のモデルは Kimi K3 と DeepSeek V4 Flash にもありますが、前者は画像まで、後者はテキストのみです。
特徴
320B/18B の MoE を 45 層で構成
総パラメータ 320B・アクティブ 18B の Mixture-of-Experts です(288 エキスパートから 8 + 共有 1 を選択)。Z.ai は GLM-4.5(355B/32B・92 層)と比べて層数をほぼ半分の 45 に減らしたとしています。重みは Hugging Face で MIT ライセンスとして公開されています。
sparse attention と linear attention のハイブリッド
GLM 系列で初めて、linear attention と sparse attention を組み合わせたハイブリッド構成を採っています。45 層のうち 34 層が linear attention で、linear 3 層のあとに sparse 1 層という周期です。Z.ai はフラッグシップの GLM-5.3 と比べて、アテンション計算量が 3.01 倍、KV キャッシュが 4.44 倍削減されたとしています。1M トークンの長文では、indexer key を重み付き平均で 1 本に圧縮する IndexPool という機構を併用しています。
画像と動画の入力に対応
30T トークンのマルチモーダルコーパスで事前学習されており、画像と動画をそのまま入力できます。HAI 経由の実リクエストで、画像(64×64 PNG)・動画(4 秒の mp4)とも応答することを確認済みです。HAI で動画を扱えるのは Gemma 4 31B・Qwen3.8 27B・Qwen3.6 35B-A3B とこのモデルの 4 つです。
ベンチマーク(Z.ai 公表値)
Z.ai は告知ページでスコアを公表しています。前世代の GLM-5.2 とはコーディング・エージェント系の 7 種すべてで差がつき、伸びが最も大きい AutomationBench は 26.2 から 48.8 へ 86.3% 改善しています。
| ベンチマーク | GLM-5.3-Flash | GLM-5.2 | GPT-5.6 Terra | Claude Opus 4.8 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 84.3 | 81.0 | 87.4 | 85.0 |
| DeepSWE (v1.1) | 63.4 | 46.2 | 69.6 | 58.0 |
| NL2Repo | 56.3 | 48.9 | — | 69.7 |
| Toolathlon Verified | 78.4 | 59.9 | 74.9 | 76.2 |
| AutomationBench (v1.0.6) | 48.8 | 26.2 | 37.2 | 41.0 |
| Agents' Last Exam | 26.3 | 20.4 | 28.0 | 27.0 |
| HLE w/ Tools | 55.3 | 54.7 | — | 57.9 |
ツール実行を伴う Toolathlon Verified と AutomationBench では、GPT-5.6 Terra と Claude Opus 4.8 の両方を上回っています。一方で Terminal Bench 2.1 と Agents' Last Exam は、どちらにも届いていません。DeepSWE は Claude Opus 4.8 の 58.0 を上回るものの、GPT-5.6 Terra の 69.6 には届いていません。HLE w/ Tools は Claude Opus 4.8 の 57.9 に届いておらず、NL2Repo も同 69.7 に対して 56.3 と差が大きい指標です(この 2 つは GPT-5.6 Terra のスコアが公表されていません)。全面的に上位というわけではありません。
測定条件はベンチマークごとに異なります。Terminal Bench 2.1 は Claude Code 2.1.207・temperature = 1.0 / top_p = 1・65,536 トークン出力、DeepSWE は mini-swe-agent・400K コンテキスト、Agents' Last Exam は Claude Code harness・reasoning_effort = max・1M コンテキストです。Toolathlon Verified は公式評価サービスでの pass@1 を 3 回平均した値です。いずれも Z.ai 自身による測定で、第三者の独立評価ではありません。
使い方
model に glm-5.3-flash を指定します。
curl https://hai-api.hcloud.ltd/v1/chat/completions \
-H "Authorization: Bearer hai_..." \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{"role":"user","content":"このスクリーンショットの UI を再現してください"}]
}'
Claude Code から使う場合は環境変数を差し替えてください。
export ANTHROPIC_BASE_URL=https://hai-api.hcloud.ltd
export ANTHROPIC_AUTH_TOKEN=hai_...
export ANTHROPIC_MODEL=glm-5.3-flash
export ANTHROPIC_SMALL_FAST_MODEL=deepseek-v4-flash
claude
バックグラウンドタスク用の ANTHROPIC_SMALL_FAST_MODEL は、これまでどおり低価格の deepseek-v4-flash を推奨します。
注意点
- 思考は常時 ON で、無効化できません。
reasoning_effortにnoneを指定するとエラーになります。思考トークンは出力として課金されるため(思考パラメータのお知らせ)、単純な問い合わせでも出力トークンが増えます。強度を下げたい場合はreasoning_effortにlowを指定してください(既定はmaxです) - 出力はテキストのみです。画像・動画は入力にのみ使えます
- 動画は
video_url形式で渡します。image_urlに動画を入れても解釈されません