GLM-5.3-Flash の無検閲派生 GLM-5.3 Flash Uncensored を追加しました
glm-5.3-flash-uncensored を追加しました。Z.ai のマルチモーダルモデル GLM-5.3-Flash(glm-5.3-flash)をベースに、拒否応答を抑えた派生モデルです。単価は入力 ¥400 / 出力 ¥800(1M tok・税込表示)で、GLM-5.3 Uncensored(入力 ¥600 / 出力 ¥1,000)より安い価格帯です。
テキスト生成の無検閲モデルは qwen3.8-27b-uncensored と glm-5.3-uncensored に続く 3 本目で、画像と動画の両方を入力できるのはこのモデルが初めてです。スクリーンショットや動画を含む依頼を、拒否応答に阻まれずに処理したい場面を想定しています。通常のモデルが応答を断る依頼にも回答するため、利用者側で用途の適法性を判断したうえでご利用ください(利用規約 第 5 条)。
特徴
ベース重みは GLM-5.3-Flash の公式 FP8 チェックポイント
Z.ai が公開した GLM-5.3-Flash(総パラメータ 320B・アクティブ 18B の Mixture-of-Experts、45 層)の公式 block-FP8 チェックポイントに対して、拒否方向を取り除く重み編集を施したモデルです。追加学習ではなく、残差ストリームへ書き込む行列から拒否方向を射影で除いたもので、テンソルの名前・型・形状はベースのチェックポイントと一致すると作者は公表しています。重みは Hugging Face で MIT ライセンスとして公開されています。
拒否応答を大幅に抑える
作者の公表する HarmBench(standard、150 件)の測定では、有害なプロンプトへの拒否率がベースの 93.3% から 18.0% に下がっています。JailbreakBench(100 件)では 93.0% から 12.0% です。無害なのに有害に見えるプロンプトを誤って断る率(XSTest-safe、250 件)も 2.4% から 0.4% に下がったとしています。拒否はしなくても冒頭に注意書きを添えて回答したものが、HarmBench で 42.0% あったとしています。
拒否はゼロにはなりません。作者は、一部の内容カテゴリはこの手法で取り除いた方向とは別の仕組みで拒否されていて、ベースに近い率で拒否が残ると説明しています。拒否の判定は応答冒頭の定型句によるルールベースの分類で、作者自身も目安の数値としています。いずれも作者自身の測定で、第三者の独立評価ではありません。出力の適法性・妥当性の判断は利用者側に委ねられます。
画像と動画の入力に対応
ベースの GLM-5.3-Flash と同じく、画像と動画をそのまま入力できます。提供環境への実リクエストで、数字を描いた画像の読み取りと、表示される数字が途中で切り替わる 4 秒の動画の読み取りに正答することを確認済みです。コンテキストは 1,000,000 トークンです(ベースの glm-5.3-flash は 1,048,576)。
ベンチマーク(作者公表値)
無検閲化による能力の変化について、作者はモデルカードでベースと同じスクリプト・同じ設定で測ったスコアを公表しています。
| ベンチマーク | GLM-5.3 Flash Uncensored | GLM-5.3-Flash(ベース) |
|---|---|---|
| MMLU | 82.7 | 83.3 |
| MMLU-Pro | 45.3 | 43.8 |
| GSM8K (CoT) | 94.0 | 94.7 |
| CMMLU | 86.0 | 85.4 |
差はいずれも ±1.5 ポイント以内で、作者は上がった 2 つも標本の揺らぎによるもので、表全体を変化なしと読むべきだとしています。測定は 150〜500 問のサンプルです。選択式の 3 つ(MMLU / MMLU-Pro / CMMLU)は解答を生成させず選択肢の記号の確率で採点しているため、MMLU-Pro は思考を経て解答させる測り方より低く出ます(両モデルとも同じ条件です)。比較はベースとの差で読み、他の方法で測ったスコアとは比べないでください。いずれも作者自身の環境での測定で、第三者の独立評価ではなく、HAI 経由の応答で同じスコアが出ることを示すものでもありません。
ベースの GLM-5.3-Flash のコーディング・エージェント系のスコアは GLM-5.3-Flash 追加のお知らせに掲載しています。派生モデルで同じスコアが出ることを示すものではありません。
使い方
model に glm-5.3-flash-uncensored を指定します。
curl https://hai-api.hcloud.ltd/v1/chat/completions \
-H "Authorization: Bearer hai_..." \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash-uncensored",
"messages": [{"role":"user","content":"このスクリーンショットの内容を説明してください"}]
}'
Claude Code から使う場合は環境変数を差し替えてください。
export ANTHROPIC_BASE_URL=https://hai-api.hcloud.ltd
export ANTHROPIC_AUTH_TOKEN=hai_...
export ANTHROPIC_MODEL=glm-5.3-flash-uncensored
export ANTHROPIC_SMALL_FAST_MODEL=deepseek-v4-flash
claude
バックグラウンドタスク用の ANTHROPIC_SMALL_FAST_MODEL は、これまでどおり低価格の deepseek-v4-flash を推奨します。
注意点
- 思考は無効化できません。
reasoning_effortはnone/minimal/low/medium/high/xhighの 6 値を受け付けますが、noneを指定しても思考は止まらず、思考の内容が回答本文に混ざることがあります。reasoning_effortを省略した場合はlow相当で処理します。思考量を抑えたい場合もnoneではなくlowを指定してください。思考トークンは出力として課金されます(思考パラメータのお知らせ) - 1 リクエストあたりの出力上限は 32,768 トークンです。
glm-5.3-uncensored(128,000)より小さいため、長い出力が必要な場合は分割してください - 拒否応答は大幅に減りますが、ゼロにはなりません。 通常のモデルが断る依頼にも回答するため、出力の取り扱いと用途の適法性は利用者の責任になります。生成結果を第三者に提供・公開する場合は、内容の確認やフィルタリングを利用者側で行ってください
- プレフィックスキャッシュの割引はありません。同じプレフィックスを送っても、入力は通常の単価で課金されます
chat_template_kwargsは使えません。送るとエラーになります。思考量の調整はreasoning_effortで行ってください- 出力はテキストのみです。画像・動画は入力にのみ使えます
- HAI Go / HAI Go Plus / HAI Go Max / HAI Go Uncensored の定額対象には含まれません。従量課金(クレジット)でのご利用になります(追記 2026-10-06: HAI Go Uncensored の定額対象になりました。詳細はお知らせ)