リリース

GLM-5.3 の無検閲派生 GLM-5.3 Uncensored を追加しました

glm-5.3-uncensored を追加しました。Z.ai のフラッグシップ GLM-5.3(glm-5.3)をベースに、拒否応答を取り除いた派生モデルです。単価は入力 ¥600 / 出力 ¥1,000(1M tok・税込表示)で、カタログでは最上位の価格帯になります(Kimi K3 が入力 ¥585 / 出力 ¥2,910)。

無検閲モデルは Qwen3.8 27B Uncensored(qwen3.8-27b-uncensored)に続く 2 本目です。27B dense の Qwen と違い、こちらは 753B の MoE フラッグシップで、難度の高いコーディングやエージェント実行を拒否応答なしで回したい場面を想定しています。通常のモデルが応答を断る依頼にも回答するため、利用者側で用途の適法性を判断したうえでご利用ください(利用規約 第 5 条)。

特徴

ベース重みは GLM-5.3-FP8

Z.ai が 2026-08-14 に公開した GLM-5.3(総パラメータ 753B・アクティブ 40B の Mixture-of-Experts、78 層、DeepSeek Sparse Attention)を FP8 に量子化した重みに対して、拒否方向を取り除く重み編集を施したモデルです。追加学習・LoRA・実行時のフックやプロンプトの細工ではなく、残差ストリームに書き込む bf16 テンソルを直接編集したもので、ルーティングされる FP8 エキスパートは変更されていません。重みは Hugging Face で MIT ライセンスとして公開されています。HAI がホスティングしているのはこの FP8 重みで、料金表の精度列の表記と一致します。

拒否応答を返さない

作者の公表する HarmBench(320 行動)の測定では、v2 で HARD_REFUSE が 0 件、著作権系を除いた 240 行動での直接回答率が 91.7%(reasoning_effort OFF 相当)です。v1 で約 2% のプロンプトに出ていた推論ループによる出力崩壊も v2 で 0 件になったとしています。いずれも作者自身の測定で、第三者の独立評価ではありません。出力の適法性・妥当性の判断は利用者側に委ねられます。

1M トークンのコンテキストとプレフィックスキャッシュ

コンテキストは 1,000,000 トークンです(ベースの glm-5.3 は 1,048,576。このモデルは 10 進の 1M で提供します)。出力は最大 128,000 トークンで、glm-5.3 と揃えています。同一プレフィックスの再送時に、キャッシュから読み出された入力トークンは ¥80(1M tok・税込表示)で課金されます。仕組みはプレフィックスキャッシュのお知らせに記載しています。

ベンチマーク(Z.ai 公表値)

このモデル自体のタスク性能ベンチマークは公表されていません。以下は Z.ai が GLM-5.3 の告知ページとモデルカードで公表しているスコアで、無検閲化する前・FP8 量子化する前のベース重みを Z.ai が測定したものです。HAI が提供する派生モデルで同じスコアが出ることを示すものではありません。

ベース GLM-5.3 と GLM-5.2 のベンチマーク比較。Terminal Bench 3.0 が 28.3 対 4.6、DeepSWE v1.1 が 66.9 対 46.2、AutomationBench が 48.2 対 26.2、Toolathlon Verified が 73.0 対 59.9、CyberGym が 84.5 対 77.2

ベンチマークGLM-5.3GLM-5.2Kimi K3Claude Opus 4.8GPT-5.6 Sol
Terminal Bench 3.028.34.617.421.134.6
DeepSWE v1.166.946.267.558.072.7
AutomationBench48.226.246.741.045.8
Toolathlon Verified73.059.976.576.274.9
CyberGym84.577.280.078.183.6

ベースの GLM-5.3 は、AutomationBench と CyberGym で表に挙げた 4 モデルすべてを上回ります。一方で Toolathlon Verified は Kimi K3・Claude Opus 4.8・GPT-5.6 Sol のいずれにも届いておらず、Terminal Bench 3.0 と DeepSWE v1.1 は GPT-5.6 Sol との差が大きく、全面的に上位というわけではありません。

測定条件はベンチマークごとに異なり、Terminal Bench 3.0 は Claude Code・reasoning_effort = max・400K コンテキストの 3 回平均、DeepSWE は mini-swe-agent・temperature = 0.95・400K コンテキストです。いずれも Z.ai 自身による測定で、第三者の独立評価ではありません。

無検閲化による能力の変化について、作者は MMLU の 1,026 問サンプルでベース 85.58% に対し v2 が 87.43% と公表しています(作者自身の測定)。

使い方

model に glm-5.3-uncensored を指定します。

curl https://hai-api.hcloud.ltd/v1/chat/completions \
  -H "Authorization: Bearer hai_..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-uncensored",
    "messages": [{"role":"user","content":"このリポジトリのテストを通してください"}]
  }'

Claude Code から使う場合は環境変数を差し替えてください。

export ANTHROPIC_BASE_URL=https://hai-api.hcloud.ltd
export ANTHROPIC_AUTH_TOKEN=hai_...
export ANTHROPIC_MODEL=glm-5.3-uncensored
export ANTHROPIC_SMALL_FAST_MODEL=deepseek-v4-flash
claude

バックグラウンドタスク用の ANTHROPIC_SMALL_FAST_MODEL は、これまでどおり低価格の deepseek-v4-flash を推奨します。

注意点

単価とモデル一覧は料金ページ、モデル ID とセットアップ手順はドキュメントに掲載しています。

← 新着情報一覧へ

今日から、baseURL を差し替えるだけ。

コンソールを開く