GLM-5.3 の無検閲派生 GLM-5.3 Uncensored を追加しました
glm-5.3-uncensored を追加しました。Z.ai のフラッグシップ GLM-5.3(glm-5.3)をベースに、拒否応答を取り除いた派生モデルです。単価は入力 ¥600 / 出力 ¥1,000(1M tok・税込表示)で、カタログでは最上位の価格帯になります(Kimi K3 が入力 ¥585 / 出力 ¥2,910)。
無検閲モデルは Qwen3.8 27B Uncensored(qwen3.8-27b-uncensored)に続く 2 本目です。27B dense の Qwen と違い、こちらは 753B の MoE フラッグシップで、難度の高いコーディングやエージェント実行を拒否応答なしで回したい場面を想定しています。通常のモデルが応答を断る依頼にも回答するため、利用者側で用途の適法性を判断したうえでご利用ください(利用規約 第 5 条)。
特徴
ベース重みは GLM-5.3-FP8
Z.ai が 2026-08-14 に公開した GLM-5.3(総パラメータ 753B・アクティブ 40B の Mixture-of-Experts、78 層、DeepSeek Sparse Attention)を FP8 に量子化した重みに対して、拒否方向を取り除く重み編集を施したモデルです。追加学習・LoRA・実行時のフックやプロンプトの細工ではなく、残差ストリームに書き込む bf16 テンソルを直接編集したもので、ルーティングされる FP8 エキスパートは変更されていません。重みは Hugging Face で MIT ライセンスとして公開されています。HAI がホスティングしているのはこの FP8 重みで、料金表の精度列の表記と一致します。
拒否応答を返さない
作者の公表する HarmBench(320 行動)の測定では、v2 で HARD_REFUSE が 0 件、著作権系を除いた 240 行動での直接回答率が 91.7%(reasoning_effort OFF 相当)です。v1 で約 2% のプロンプトに出ていた推論ループによる出力崩壊も v2 で 0 件になったとしています。いずれも作者自身の測定で、第三者の独立評価ではありません。出力の適法性・妥当性の判断は利用者側に委ねられます。
1M トークンのコンテキストとプレフィックスキャッシュ
コンテキストは 1,000,000 トークンです(ベースの glm-5.3 は 1,048,576。このモデルは 10 進の 1M で提供します)。出力は最大 128,000 トークンで、glm-5.3 と揃えています。同一プレフィックスの再送時に、キャッシュから読み出された入力トークンは ¥80(1M tok・税込表示)で課金されます。仕組みはプレフィックスキャッシュのお知らせに記載しています。
ベンチマーク(Z.ai 公表値)
このモデル自体のタスク性能ベンチマークは公表されていません。以下は Z.ai が GLM-5.3 の告知ページとモデルカードで公表しているスコアで、無検閲化する前・FP8 量子化する前のベース重みを Z.ai が測定したものです。HAI が提供する派生モデルで同じスコアが出ることを示すものではありません。
| ベンチマーク | GLM-5.3 | GLM-5.2 | Kimi K3 | Claude Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | 21.1 | 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 58.0 | 72.7 |
| AutomationBench | 48.2 | 26.2 | 46.7 | 41.0 | 45.8 |
| Toolathlon Verified | 73.0 | 59.9 | 76.5 | 76.2 | 74.9 |
| CyberGym | 84.5 | 77.2 | 80.0 | 78.1 | 83.6 |
ベースの GLM-5.3 は、AutomationBench と CyberGym で表に挙げた 4 モデルすべてを上回ります。一方で Toolathlon Verified は Kimi K3・Claude Opus 4.8・GPT-5.6 Sol のいずれにも届いておらず、Terminal Bench 3.0 と DeepSWE v1.1 は GPT-5.6 Sol との差が大きく、全面的に上位というわけではありません。
測定条件はベンチマークごとに異なり、Terminal Bench 3.0 は Claude Code・reasoning_effort = max・400K コンテキストの 3 回平均、DeepSWE は mini-swe-agent・temperature = 0.95・400K コンテキストです。いずれも Z.ai 自身による測定で、第三者の独立評価ではありません。
無検閲化による能力の変化について、作者は MMLU の 1,026 問サンプルでベース 85.58% に対し v2 が 87.43% と公表しています(作者自身の測定)。
使い方
model に glm-5.3-uncensored を指定します。
curl https://hai-api.hcloud.ltd/v1/chat/completions \
-H "Authorization: Bearer hai_..." \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-uncensored",
"messages": [{"role":"user","content":"このリポジトリのテストを通してください"}]
}'
Claude Code から使う場合は環境変数を差し替えてください。
export ANTHROPIC_BASE_URL=https://hai-api.hcloud.ltd
export ANTHROPIC_AUTH_TOKEN=hai_...
export ANTHROPIC_MODEL=glm-5.3-uncensored
export ANTHROPIC_SMALL_FAST_MODEL=deepseek-v4-flash
claude
バックグラウンドタスク用の ANTHROPIC_SMALL_FAST_MODEL は、これまでどおり低価格の deepseek-v4-flash を推奨します。
注意点
- 思考は常時 ON で、無効化できません。
reasoning_effortはnone/minimal/low/medium/high/xhighの 6 値を受け付けますが、実際の思考量は low / high / max の 3 段階に丸められます(none/minimal/low→ low、medium/high→ high、xhigh→ max)。noneを指定しても思考は止まらず、low で思考して思考本文を返さないだけです。思考トークンは出力として課金されるため(思考パラメータのお知らせ)、単純な問い合わせでも出力トークンが増えます。思考量を抑えるにはlowを指定してください chat_template_kwargsは使えません。qwen3.8-27b-uncensoredで案内しているenable_thinking: falseをこのモデルに送ると 400 エラーになりますtemperatureは 0〜1 の範囲だけ受け付けます。 1 を超える値を送ると 400 エラーになります- 拒否応答を返しません。 通常のモデルが断る依頼にも回答するため、出力の取り扱いと用途の適法性は利用者の責任になります。生成結果を第三者に提供・公開する場合は、内容の確認やフィルタリングを利用者側で行ってください
- 入力はテキストのみです。画像を送ると 400 エラーになります。画像・動画を扱う場合は GLM-5.3-Flash や Gemma 4 31B をご利用ください
- 出力はテキストのみです
- プレフィックスキャッシュのヒットはベストエフォートです。同じプレフィックスを送っても毎回キャッシュから供給されるとは限らず、割引は
usageにcached_tokensとして報告された分にだけ適用されます - HAI Go / HAI Go Plus の定額対象には含まれません。従量課金(クレジット)でのご利用になります